💡 Gemma 是什么?
模型概览
Gemma是谷歌DeepMind基于其旗舰级闭源模型Gemini的研发技术和架构,打造的一系列开放权重(Open-weights)的先进轻量级模型-2-5-9。其名字源自拉丁语,意为“宝石”-9-10。与仅能通过云端API访问的Gemini不同,Gemma模型权重公开,支持开发者在本地硬件(如笔记本电脑、台式机甚至部分移动设备)上自由部署、微调及商用-2-9-12。截至2026年7月,该系列模型的累计下载量已超过4亿次,社区衍生模型变体超过10万个-5-12。
核心技术:Gemma 4
新一代Gemma 4于2026年3月31日正式发布,是谷歌迄今为止“在逐字节比较下性能最强的”开放模型,其在多项基准测试中的表现可与规模更大的前沿开源模型相媲美-5-12-1。
关键能力与架构创新
-
原生多模态与长上下文:全系列模型支持文本与图像输入,小尺寸模型(E2B、E4B)额外原生支持音频输入,可用于语音识别与翻译-1-8-10。E2B/E4B支持128K token上下文,而12B、26B-A4B、31B模型支持高达256K token的上下文窗口-8-10。训练数据覆盖超过140种语言,知识截止日期为2025年1月-2-8-10。
-
可配置的“思考模式”:内置推理能力,可在生成最终回答前输出完整的推理过程(reasoning traces),提升了复杂任务的逻辑严谨性与可解释性-1-8-10。
-
原生智能体能力:原生支持函数调用(Function Calling)与结构化输出,使其能自主调用工具、执行多步规划,非常适合构建能够自动完成任务的AI智能体(Agent)-4-8-11。
-
灵活高效的架构:提供稠密(Dense) 和混合专家(MoE) 两种架构,参数规模覆盖2.3B至31B,适配从移动设备到工作站的各类硬件-1-8-10。
模型版本与规格-5-8-10
-
E2B:有效参数约23亿(含嵌入层约51亿),稠密架构,支持文本、图像、音频。上下文128K,专为移动与边缘设备设计-8-10-12。
-
E4B:有效参数约45亿(含嵌入层约80亿),稠密架构,支持文本、图像、音频。上下文128K,性能与效率的平衡选择-8-10-12。
-
12B统一模型:参数约120亿,稠密架构,支持文本、图像、音频。采用创新的无独立编码器(encoder-free) 架构,直接将原始图像块与音频波形映射到语言模型空间,为业界首个开源的原生端到端多模态语言模型-1-7-10。
-
26B-A4B MoE:总参数约252亿,活跃参数约38亿的混合专家模型。包含128个专家,推理时仅激活8个,速度接近40亿参数模型,但性能远超,适合对速度要求高的场景-8-10-12。
性能表现
根据官方公布的基准测试结果,Gemma 4在数学、代码、推理、多模态理解等任务上实现了显著跃升-1-8。
-
数学与推理:31B模型在AIME 2026数学测试中得分89.2%,在GPQA Diamond测试中得分84.3%-8。
-
代码生成:31B模型在LiveCodeBench v6编程测试中得分80.0%,Codeforces ELO达到2150分-8-12。
-
多模态理解:31B模型在MMMU Pro视觉理解测试中得分76.9%,在MATH-Vision数学视觉测试中得分85.6%-8。
开源协议与生态系统
这是Gemma系列最重要的战略转变——Gemma 4采用Apache 2.0许可证,取代了此前版本具有限制性的自定义条款-10-12。这意味着企业可以自由地部署、修改模型并将其用于商业项目,无需担忧法律风险,极大地促进了社区创新与商业应用-12。
-
开发与运行框架:已集成至Hugging Face、Kaggle、Ollama、vLLM、SGLang、llama.cpp等主流平台与推理框架-8-12。
-
硬件优化:与高通(Qualcomm) 及联发科(MediaTek) 合作,对移动端芯片进行硬件级优化。在Raspberry Pi 5等物联网设备上,通过NPU加速可实现优秀性能-11-12。
-
开发工具:提供Google AI Edge工具链(包括Gallery展示应用、Eloquent语音应用、LiteRT-LM命令行工具),方便开发者在移动端、桌面端和物联网设备上构建本地AI应用-4-6-11。
应用场景
本站提供的信息都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由本站实际控制,内容如出现违规,可以直接联系网站管理员进行删除。
致力于优质、实用的网络站点资源收集与分享!
点击下方按钮,立即访问 Gemma 的官方站点
⚡ 相关工具 20

全球领先的AI数据标注与数据引擎平台,为AI模型训练提供高质量数据服务。

北京智源研究院发起的大规模预训练模型项目,探索通用人工智能,悟道2.0参数规模达1.75万亿。
OpenBMB是清华团队发起的大模型开源社区,提供训练、微调、推理全链路工具,致力于让大模型飞入千家万户。

加拿大AI公司,专注企业级NLP模型与RAG解决方案,提供Command系列模型与API。

Runway推出的多模态AI视频生成模型,文本/图像生成视频,电影级效果,视频生成先驱。

AI模型云推理平台,一行代码调用数千个开源模型,按需付费,模型部署云服务。

开源AI桌面客户端,聚合多模型对话、知识库、翻译等能力,本地化AI助手工具。

微软开源的大模型训练优化库,ZeRO技术实现万亿参数训练,推理优化兼顾性能与成本。

科大讯飞推出的星火大模型MaaS平台,提供模型API、专属模型定制与行业解决方案。
全球最大的AI模型社区与平台,提供模型托管、数据集、推理API与Transformers库,AI基础设施。

Ollama是开源本地大模型运行工具,支持一键下载运行Llama、DeepSeek等50+模型,提供OpenAI兼容API和跨平台支持。

Google开源的Gemini图像模型优化版,专为图像生成与编辑优化,高质量视觉创作。

Stability AI开源的语言模型系列,覆盖3B-12B参数,开源可商用,轻量高效。

序列猴子是出门问问推出的多模态大模型,支持文本生成、语音合成和图像创作,为创作者提供一站式CoPilot产品矩阵。

阿里达摩院提出的超大规模多模态预训练模型,统一语言与视觉,万亿参数级。

开源机器学习模型训练与部署工具,可视化界面拖拽式构建模型,无代码AI训练。

HuggingFace开源的机器学习演示工具,几行代码为模型构建Web界面,快速分享AI应用。

IBM推出的企业级AI与数据平台,提供大模型训练、调优、部署与AI治理能力,面向企业AI落地。

开源机器学习模型监控与评估平台,检测数据漂移、模型退化,保障ML系统稳定。

Google DeepMind推出的文生图模型,文本生成超写实图像,图像质量业界领先。
💬 用户评论
快来发表第一条评论吧!
