vLLM

v

加州伯克利开源的高性能LLM推理引擎,PagedAttention显存管理技术,吞吐量领先,大模型服务主流方案。

vLLM推理高吞吐部署需翻墙
访问官网 ↗

一、项目简介

vLLM是加州大学伯克利分校开源的高性能大语言模型推理与服务引擎,其核心创新PagedAttention技术借鉴操作系统虚拟内存分页思想,高效管理KV Cache显存,大幅提升推理吞吐量并支持连续批处理。vLLM提供OpenAI兼容API与量化支持,已成为生产环境部署Llama、Qwen等大模型的主流方案之一。

二、核心特性

1. PagedAttention:显存管理创新,吞吐量较传统方案提升数倍。

2. 高吞吐服务:连续批处理与动态调度,最大化GPU利用率。

3. OpenAI兼容API:无缝接入现有应用生态。

4. 量化与多模型:支持AWQ/GPTQ量化与主流开源模型。

三、典型应用

大模型在线服务、API平台、多轮对话应用、企业AI基础设施。

四、获取方式

项目开源在GitHub(vllm-project/vllm),pip安装即可使用。

信息加载中
相关工具
O
OpenLLM
BentoML开源的LLM部署平台,一条命令将Llama、Qwen等模型部署为服务,支持微调、量化与云端发布。
OpenLLMBentoML部署
S
SGLang
斯坦福/UC伯克利开源的LLM推理框架,采用RadixAttention前缀缓存,实现高吞吐、低成本的大模型服务。
SGLang推理服务
T
Triton Inference Server
NVIDIA开源的生产级推理服务器,支持多框架、多模型、动态批处理,GPU推理标准方案。
TritonNVIDIA推理服务
K
KoboldCpp
一键式本地LLM运行工具,整合llama.cpp与Stable Diffusion,支持角色扮演、AI小说与API调用。
KoboldCpp本地推理
M
MLC-LLM
开源通用LLM部署引擎,支持在Web、iOS、Android、GPU等全平台原生运行大模型,端侧AI利器。
MLC-LLM编译端侧
L
LMDeploy
书生·浦语开源的LLM压缩与部署工具箱,TurboMind引擎高吞吐推理,支持量化、服务化部署。
LMDeployInternLM部署
D
DeepSpeed
微软开源的大模型训练优化库,ZeRO技术实现万亿参数训练,推理优化兼顾性能与成本。
DeepSpeed微软优化
T
TGI
HuggingFace开源的文本生成推理服务,专为生产环境设计,支持流式输出、批处理与多模型部署。
TGIHuggingFace推理
T
TensorRT-LLM
NVIDIA开源的LLM推理加速引擎,针对NVIDIA GPU深度优化,提供高吞吐、低延迟的部署方案。
TensorRT-LLMNVIDIA推理
O
Ollama
最流行的本地大模型运行工具,一条命令下载运行Llama、Qwen、DeepSeek等开源模型,开箱即用。
Ollama本地部署
l
llama.cpp
用C/C++实现的高效LLM推理引擎,支持CPU/GPU运行Llama系列模型,量化优化,端侧部署利器。
llama.cpp量化CPU
MeituHub
MeituHub 新
MeituHub是美图于2025年7月15日发布、8月5日正式上线的美图AI影像生产线,系统性组织美图AI影像能力,面向开发者与企业的影像AI一站式服务平台。
MeituHub