TGI
T
HuggingFace开源的文本生成推理服务,专为生产环境设计,支持流式输出、批处理与多模型部署。
访问官网 ↗一、项目简介
TGI(Text Generation Inference)是HuggingFace开源的生产级文本生成推理服务,专为大模型生产部署设计。TGI提供流式输出、动态批处理、模型并行、量化推理等功能,并支持HuggingFace生态的无缝集成,是快速部署Llama、Mistral等模型的常用服务框架。
二、核心特性
生产级设计:高并发、低延迟推理服务。
流式输出:支持Token级流式响应。
动态批处理:请求合并提升吞吐。
HF生态集成:一键加载HuggingFace模型。
三、典型应用
大模型生产部署、AI服务、API服务、企业应用。。
四、获取方式
项目开源在GitHub(huggingface/text-generation-inference)。。
相关工具
O
OpenLLM
BentoML开源的LLM部署平台,一条命令将Llama、Qwen等模型部署为服务,支持微调、量化与云端发布。
S
SGLang
斯坦福/UC伯克利开源的LLM推理框架,采用RadixAttention前缀缓存,实现高吞吐、低成本的大模型服务。
T
Triton Inference Server
NVIDIA开源的生产级推理服务器,支持多框架、多模型、动态批处理,GPU推理标准方案。
K
KoboldCpp
一键式本地LLM运行工具,整合llama.cpp与Stable Diffusion,支持角色扮演、AI小说与API调用。
M
MLC-LLM
开源通用LLM部署引擎,支持在Web、iOS、Android、GPU等全平台原生运行大模型,端侧AI利器。
L
LMDeploy
书生·浦语开源的LLM压缩与部署工具箱,TurboMind引擎高吞吐推理,支持量化、服务化部署。
D
DeepSpeed
微软开源的大模型训练优化库,ZeRO技术实现万亿参数训练,推理优化兼顾性能与成本。
T
TensorRT-LLM
NVIDIA开源的LLM推理加速引擎,针对NVIDIA GPU深度优化,提供高吞吐、低延迟的部署方案。
v
vLLM
加州伯克利开源的高性能LLM推理引擎,PagedAttention显存管理技术,吞吐量领先,大模型服务主流方案。
O
Ollama
最流行的本地大模型运行工具,一条命令下载运行Llama、Qwen、DeepSeek等开源模型,开箱即用。
l
llama.cpp
用C/C++实现的高效LLM推理引擎,支持CPU/GPU运行Llama系列模型,量化优化,端侧部署利器。

MeituHub 新
MeituHub是美图于2025年7月15日发布、8月5日正式上线的美图AI影像生产线,系统性组织美图AI影像能力,面向开发者与企业的影像AI一站式服务平台。