Gemma
Gemma是Google推出的轻量级开源大语言模型,专为本地部署和端侧设备设计,支持文本生成、代码编写和多语言理解。
访问官网 ↗模型概览
Gemma是谷歌DeepMind基于其旗舰级闭源模型Gemini的研发技术和架构,打造的一系列开放权重(Open-weights)的先进轻量级模型-2-5-9。其名字源自拉丁语,意为“宝石”-9-10。与仅能通过云端API访问的Gemini不同,Gemma模型权重公开,支持开发者在本地硬件(如笔记本电脑、台式机甚至部分移动设备)上自由部署、微调及商用-2-9-12。截至2026年7月,该系列模型的累计下载量已超过4亿次,社区衍生模型变体超过10万个-5-12。
核心技术:Gemma 4
新一代Gemma 4于2026年3月31日正式发布,是谷歌迄今为止“在逐字节比较下性能最强的”开放模型,其在多项基准测试中的表现可与规模更大的前沿开源模型相媲美-5-12-1。
关键能力与架构创新
-
原生多模态与长上下文:全系列模型支持文本与图像输入,小尺寸模型(E2B、E4B)额外原生支持音频输入,可用于语音识别与翻译-1-8-10。E2B/E4B支持128K token上下文,而12B、26B-A4B、31B模型支持高达256K token的上下文窗口-8-10。训练数据覆盖超过140种语言,知识截止日期为2025年1月-2-8-10。
-
可配置的“思考模式”:内置推理能力,可在生成最终回答前输出完整的推理过程(reasoning traces),提升了复杂任务的逻辑严谨性与可解释性-1-8-10。
-
原生智能体能力:原生支持函数调用(Function Calling)与结构化输出,使其能自主调用工具、执行多步规划,非常适合构建能够自动完成任务的AI智能体(Agent)-4-8-11。
-
灵活高效的架构:提供稠密(Dense) 和混合专家(MoE) 两种架构,参数规模覆盖2.3B至31B,适配从移动设备到工作站的各类硬件-1-8-10。
模型版本与规格-5-8-10
-
E2B:有效参数约23亿(含嵌入层约51亿),稠密架构,支持文本、图像、音频。上下文128K,专为移动与边缘设备设计-8-10-12。
-
E4B:有效参数约45亿(含嵌入层约80亿),稠密架构,支持文本、图像、音频。上下文128K,性能与效率的平衡选择-8-10-12。
-
12B统一模型:参数约120亿,稠密架构,支持文本、图像、音频。采用创新的无独立编码器(encoder-free) 架构,直接将原始图像块与音频波形映射到语言模型空间,为业界首个开源的原生端到端多模态语言模型-1-7-10。
-
26B-A4B MoE:总参数约252亿,活跃参数约38亿的混合专家模型。包含128个专家,推理时仅激活8个,速度接近40亿参数模型,但性能远超,适合对速度要求高的场景-8-10-12。
性能表现
根据官方公布的基准测试结果,Gemma 4在数学、代码、推理、多模态理解等任务上实现了显著跃升-1-8。
-
数学与推理:31B模型在AIME 2026数学测试中得分89.2%,在GPQA Diamond测试中得分84.3%-8。
-
代码生成:31B模型在LiveCodeBench v6编程测试中得分80.0%,Codeforces ELO达到2150分-8-12。
-
多模态理解:31B模型在MMMU Pro视觉理解测试中得分76.9%,在MATH-Vision数学视觉测试中得分85.6%-8。
开源协议与生态系统
这是Gemma系列最重要的战略转变——Gemma 4采用Apache 2.0许可证,取代了此前版本具有限制性的自定义条款-10-12。这意味着企业可以自由地部署、修改模型并将其用于商业项目,无需担忧法律风险,极大地促进了社区创新与商业应用-12。
-
开发与运行框架:已集成至Hugging Face、Kaggle、Ollama、vLLM、SGLang、llama.cpp等主流平台与推理框架-8-12。
-
硬件优化:与高通(Qualcomm) 及联发科(MediaTek) 合作,对移动端芯片进行硬件级优化。在Raspberry Pi 5等物联网设备上,通过NPU加速可实现优秀性能-11-12。
-
开发工具:提供Google AI Edge工具链(包括Gallery展示应用、Eloquent语音应用、LiteRT-LM命令行工具),方便开发者在移动端、桌面端和物联网设备上构建本地AI应用-4-6-11。
应用场景










