📁 开源多模态模型工具 (12 个工具)
M
Molmo
开源多模态模型
AI2 开源的开创性视觉语言模型,强调真实世界指向理解。
N
NExT-GPT
开源多模态模型
开源任意到任意多模态大模型,统一处理文本/图像/音频/视频。
J
Janus
开源多模态模型
深度求索开源的统一多模态理解与生成模型。
L
Llama 3.2 Vision
开源多模态模型
Meta 在 Llama 3.2 中推出的视觉版本,支持图像推理。
I
IDEFICS
开源多模态模型
HuggingFace 开源的图文模型,可遵循指令完成多模态任务。
D
DeepSeek-VL
开源多模态模型
深度求索开源的视觉语言模型,兼顾通用与对话。
M
MiniGPT-4
开源多模态模型
轻量视觉语言模型,用单投影层对齐视觉与 LLM。
C
CogVLM
开源多模态模型
智谱开源的视觉语言模型,保持语言能力强的同时理解图像。
I
InternVL
开源多模态模型
上海AI实验室开源的通用视觉大模型系列,性能对标商用。
Q
Qwen2-VL
开源多模态模型
Qwen-VL 升级版,支持动态分辨率与长视频理解。
Q
Qwen-VL
开源多模态模型
通义千问开源的视觉语言模型,支持图文对话与定位。
L
LLaVA
开源多模态模型
开源视觉语言模型,将视觉编码器与 LLM 对齐实现图文理解。
