Gemma

G

Gemma是Google推出的轻量级开源大语言模型,专为本地部署和端侧设备设计,支持文本生成、代码编写和多语言理解。

AI模型开源私有化部署AI编程AI设计
访问官网 ↗

模型概览

Gemma是谷歌DeepMind基于其旗舰级闭源模型Gemini的研发技术和架构,打造的一系列开放权重(Open-weights)的先进轻量级模型-2-5-9。其名字源自拉丁语,意为“宝石”-9-10。与仅能通过云端API访问的Gemini不同,Gemma模型权重公开,支持开发者在本地硬件(如笔记本电脑、台式机甚至部分移动设备)上自由部署、微调及商用-2-9-12。截至2026年7月,该系列模型的累计下载量已超过4亿次,社区衍生模型变体超过10万个-5-12

核心技术:Gemma 4

新一代Gemma 4于2026年3月31日正式发布,是谷歌迄今为止“在逐字节比较下性能最强的”开放模型,其在多项基准测试中的表现可与规模更大的前沿开源模型相媲美-5-12-1

关键能力与架构创新

  1. 原生多模态与长上下文:全系列模型支持文本与图像输入,小尺寸模型(E2B、E4B)额外原生支持音频输入,可用于语音识别与翻译-1-8-10。E2B/E4B支持128K token上下文,而12B、26B-A4B、31B模型支持高达256K token的上下文窗口-8-10。训练数据覆盖超过140种语言,知识截止日期为2025年1月-2-8-10

  2. 可配置的“思考模式”:内置推理能力,可在生成最终回答前输出完整的推理过程(reasoning traces),提升了复杂任务的逻辑严谨性与可解释性-1-8-10

  3. 原生智能体能力:原生支持函数调用(Function Calling)结构化输出,使其能自主调用工具、执行多步规划,非常适合构建能够自动完成任务的AI智能体(Agent)-4-8-11

  4. 灵活高效的架构:提供稠密(Dense) 和混合专家(MoE) 两种架构,参数规模覆盖2.3B至31B,适配从移动设备到工作站的各类硬件-1-8-10

模型版本与规格-5-8-10

  • E2B:有效参数约23亿(含嵌入层约51亿),稠密架构,支持文本、图像、音频。上下文128K,专为移动与边缘设备设计-8-10-12

  • E4B:有效参数约45亿(含嵌入层约80亿),稠密架构,支持文本、图像、音频。上下文128K,性能与效率的平衡选择-8-10-12

  • 12B统一模型:参数约120亿,稠密架构,支持文本、图像、音频。采用创新的无独立编码器(encoder-free) 架构,直接将原始图像块与音频波形映射到语言模型空间,为业界首个开源的原生端到端多模态语言模型-1-7-10

  • 26B-A4B MoE:总参数约252亿,活跃参数约38亿的混合专家模型。包含128个专家,推理时仅激活8个,速度接近40亿参数模型,但性能远超,适合对速度要求高的场景-8-10-12

  • 31B:参数约307亿,稠密架构,支持文本、图像。追求最高输出质量的旗舰级模型-8-10-12

性能表现

根据官方公布的基准测试结果,Gemma 4在数学、代码、推理、多模态理解等任务上实现了显著跃升-1-8

  • 数学与推理:31B模型在AIME 2026数学测试中得分89.2%,在GPQA Diamond测试中得分84.3%-8

  • 代码生成:31B模型在LiveCodeBench v6编程测试中得分80.0%,Codeforces ELO达到2150分-8-12

  • 多模态理解:31B模型在MMMU Pro视觉理解测试中得分76.9%,在MATH-Vision数学视觉测试中得分85.6%-8

开源协议与生态系统

这是Gemma系列最重要的战略转变——Gemma 4采用Apache 2.0许可证,取代了此前版本具有限制性的自定义条款-10-12。这意味着企业可以自由地部署、修改模型并将其用于商业项目,无需担忧法律风险,极大地促进了社区创新与商业应用-12

谷歌为Gemma 4构建了全面的生态支持-11-12

  • 开发与运行框架:已集成至Hugging Face、Kaggle、Ollama、vLLM、SGLang、llama.cpp等主流平台与推理框架-8-12

  • 硬件优化:与高通(Qualcomm) 及联发科(MediaTek) 合作,对移动端芯片进行硬件级优化。在Raspberry Pi 5等物联网设备上,通过NPU加速可实现优秀性能-11-12

  • 开发工具:提供Google AI Edge工具链(包括Gallery展示应用、Eloquent语音应用、LiteRT-LM命令行工具),方便开发者在移动端、桌面端和物联网设备上构建本地AI应用-4-6-11

应用场景

Gemma尤其适合对数据隐私、低延迟、离线运行和成本控制有高要求的场景-4-7-11

  • 本地智能编程助手:在Android Studio中集成,可在本地完成代码生成、补全、重构和bug修复,保障代码安全-4

  • 本地数据分析与创作:通过Google AI Edge Gallery等应用,在本地利用自然语言生成Python代码进行数据可视化,或进行语音驱动的文本编辑-6-7

  • 边缘与移动端智能体:在手机、IoT设备上运行,执行多步推理、调用工具,实现自主任务处理-11

  • 企业级本地部署:满足金融、医疗等对数据不能离开本地环境的行业需求,构建安全的企业级AI应用-7-12

信息加载中
相关工具
阿里巴巴M6
阿里巴巴M6
阿里M6是阿里巴巴达摩院推出的多模态大模型,支持文本、图像等多模态理解与生成,是国产大模型的重要里程碑。
AI模型中文优化多模态
O
OpenBMB
OpenBMB是清华团队发起的大模型开源社区,提供训练、微调、推理全链路工具,致力于让大模型飞入千家万户。
AI模型模型微调开源
Scale AI
Scale AI
Scale AI是企业级AI数据平台,提供高质量数据标注、模型评估和RLHF服务,为AI模型训练提供数据基础设施。
AI模型数据标注
悟道
悟道
悟道是北京智源人工智能研究院推出的超大规模预训练模型系列,涵盖文本、图像和多模态,推动国产大模型发展。
AI模型中文优化多模态
Lobe
Lobe
Lobe Chat是开源的AI聊天框架,支持多种大语言模型、插件系统和多模态交互,可一键部署私有化AI助手。
AI模型AI对话开源
Gen-2
Gen-2
Gen-2是Runway推出的AI视频生成模型,支持文生视频、图生视频和视频风格迁移,开创AI视频创作新时代。
AI模型视频生成AI写作
DeepSpeed
DeepSpeed
DeepSpeed是微软推出的深度学习优化库,专为大规模模型训练设计,支持ZeRO优化、混合精度训练和分布式推理。
AI模型AI教育AI设计
Watsonx.ai
Watsonx.ai
Watsonx.ai是IBM推出的企业级AI开发平台,集成大模型训练、部署和治理功能,专为企业级AI应用打造。
AI模型AI编程
Cohere
Cohere
Cohere是企业级AI平台,提供Command大模型、RAG检索增强和嵌入模型,专注数据隐私和多语言企业AI解决方案。
AI模型AI搜索RAG
讯飞星辰MaaS
讯飞星辰MaaS
讯飞星辰MaaS是科大讯飞推出的一站式大模型精调平台,支持50+模型零代码微调,覆盖数据管理到推理部署全流程。
AI模型低代码开发模型微调
Nano Banana
Nano Banana
Nano Banana是Google推出的高性能图像生成模型,支持4K超清输出和多种宽高比,在光影质感和文本渲染方面表现卓越。
AI模型
Evidently AI
Evidently AI
Evidently AI是机器学习模型监控平台,提供数据漂移检测、模型性能评估和AI质量保障,帮助企业维护ML系统健康。
AI模型AI检测AI教育