TGI

T

HuggingFace开源的文本生成推理服务,专为生产环境设计,支持流式输出、批处理与多模型部署。

TGIHuggingFace推理服务需翻墙
访问官网 ↗

一、项目简介

TGI(Text Generation Inference)是HuggingFace开源的生产级文本生成推理服务,专为大模型生产部署设计。TGI提供流式输出、动态批处理、模型并行、量化推理等功能,并支持HuggingFace生态的无缝集成,是快速部署Llama、Mistral等模型的常用服务框架。

二、核心特性

生产级设计:高并发、低延迟推理服务。

流式输出:支持Token级流式响应。

动态批处理:请求合并提升吞吐。

HF生态集成:一键加载HuggingFace模型。

三、典型应用

大模型生产部署、AI服务、API服务、企业应用。。

四、获取方式

项目开源在GitHub(huggingface/text-generation-inference)。。

信息加载中
相关工具
O
OpenLLM
BentoML开源的LLM部署平台,一条命令将Llama、Qwen等模型部署为服务,支持微调、量化与云端发布。
OpenLLMBentoML部署
S
SGLang
斯坦福/UC伯克利开源的LLM推理框架,采用RadixAttention前缀缓存,实现高吞吐、低成本的大模型服务。
SGLang推理服务
T
Triton Inference Server
NVIDIA开源的生产级推理服务器,支持多框架、多模型、动态批处理,GPU推理标准方案。
TritonNVIDIA推理服务
K
KoboldCpp
一键式本地LLM运行工具,整合llama.cpp与Stable Diffusion,支持角色扮演、AI小说与API调用。
KoboldCpp本地推理
M
MLC-LLM
开源通用LLM部署引擎,支持在Web、iOS、Android、GPU等全平台原生运行大模型,端侧AI利器。
MLC-LLM编译端侧
L
LMDeploy
书生·浦语开源的LLM压缩与部署工具箱,TurboMind引擎高吞吐推理,支持量化、服务化部署。
LMDeployInternLM部署
D
DeepSpeed
微软开源的大模型训练优化库,ZeRO技术实现万亿参数训练,推理优化兼顾性能与成本。
DeepSpeed微软优化
T
TensorRT-LLM
NVIDIA开源的LLM推理加速引擎,针对NVIDIA GPU深度优化,提供高吞吐、低延迟的部署方案。
TensorRT-LLMNVIDIA推理
v
vLLM
加州伯克利开源的高性能LLM推理引擎,PagedAttention显存管理技术,吞吐量领先,大模型服务主流方案。
vLLM推理高吞吐
O
Ollama
最流行的本地大模型运行工具,一条命令下载运行Llama、Qwen、DeepSeek等开源模型,开箱即用。
Ollama本地部署
l
llama.cpp
用C/C++实现的高效LLM推理引擎,支持CPU/GPU运行Llama系列模型,量化优化,端侧部署利器。
llama.cpp量化CPU
MeituHub
MeituHub 新
MeituHub是美图于2025年7月15日发布、8月5日正式上线的美图AI影像生产线,系统性组织美图AI影像能力,面向开发者与企业的影像AI一站式服务平台。
MeituHub