云知声U2大模型发布:以10B激活参数杀入国产大模型第一梯队

大模型📰综合整理📅2026-06-13 34 阅读

大模型赛道正在经历一场静悄悄的范式转移。过去三年,整个行业几乎被同一套逻辑绑架:参数规模越大越好,推理链越长越聪明,算力投入越高越能打。从千亿到万亿,各家厂商你追我赶,仿佛堆砌参数就是通往AGI的唯一路径。然而,当模型能力逐渐逼近天花板,推理成本日益成为企业部署的隐形门槛,一个根本性的问题浮出水面:下一个阶段,AI的核心竞争力究竟是什么?

2025年6月8日,云知声在港股上市满一周年之际给出了自己的答案。这家从语音识别赛道起家的AI公司,正式发布了自研新一代基座大模型U2,一款定位为原生智能体的大语言模型。U2没有走参数膨胀的老路,而是提出了一个被业内称为“反内卷”的技术路线——智能密度乘以Token价值

所谓智能密度,衡量的是单位参数里承载了多少有效知识和推理能力;Token价值则关注每一个生成的Token是否真正转化为业务结果。云知声创始人黄伟的表述更加直白:“我不需要一个中国科学院院士来开滴滴,很多任务场景不需要最高智能,硕士博士水平就够了。”

架构层面的突破是U2的根基。U2采用了快慢思考融合的MoE混合专家架构,总参数量近3000亿,但每次推理仅激活约百亿级别的参数。这意味着模型在推理时只调动完成当前任务所需的专家网络,而非全部参数参与计算。知识存储与知识调用被有效解耦,使U2在更小的激活规模下维持了顶级任务能力。据云知声披露的数据,同等性能下U2的推理成本仅为传统稠密大模型的约十分之一。

更值得关注的是U2的隐式思考机制。当前主流推理模型普遍存在一个问题:为了得出正确答案,会生成极长的思维链,大量Token消耗在中间推理过程而非最终结果上。U2则能够在连续隐空间中完成大量中间推理,仅在关键决策节点切换回显式推理进行验证。云知声大模型事业部总经理刘升平博士以医疗场景举例:一份病历生成任务,传统模型通常需要输出2000至3000个Token,而U2通过隐式思考技术可将输出压缩到1000个Token以内,同时保持结果质量不变。

评测数据为这套技术路线提供了有力佐证。6月10日,海外权威AI模型评测平台LLM Stats更新的榜单显示,云知声U2在综合能力榜单中进入模型总榜前30,按厂商最佳模型成绩位列全球第九。在LongBench-V2长文本评测中,U2以54.4%的准确率超越了Claude Opus 4.7的53.9%,仅落后GPT-5.4的55.6%约1.2个百分点,排名全球第二。此外,在AA-LCR长上下文评测中U2获得70分,位居对比模型首位。

但云知声真正想讲的故事,不是跑分,而是落地。U2从设计之初就锚定了“为执行而生”而非“为生成而生”。传统大模型本质上是“嘴强王者”,能回答问题、能写文章,但让它去完成一个复杂的多步骤任务,就得在外面包一层厚厚的应用壳。U2则将工具调用、状态管理、多步规划训练为模型原生能力,可自主理解目标、拆解任务、调用工具、执行验收。

这种能力的核心在于“Agent加Harness协同演进”机制。云知声将模型原生Agent能力的提升与任务执行脚手架的迭代优化纳入同一训练闭环,形成双向强化的协同演进。模型利用Harness返回的高质量轨迹数据,持续强化多步规划、工具调用、过程纠错与结果验收能力;而Harness则根据模型能力边界持续迭代,提供更精准的任务环境与反馈接口。刘升平将这一思路概括为八个字:“大模型做厚,Harness做薄。”

从商业层面看,云知声的底气来自十三年的行业深耕。过去十余年,云知声在医疗、交通、IoT等领域沉淀了大量真实业务数据和行业知识。截至2025年末,公司已累计与全国近450家医院合作,全国综合排名A++及以上医院覆盖率接近35%;在物联网领域合作伙伴超过2万家,端侧AI芯片出货量突破1亿颗。这些数据资产构成了云知声独特的“双模型飞轮”:一端是通用大模型负责推理和Agent执行,另一端是行业模型持续沉淀垂直领域知识,两者相互强化形成正向循环。

商业化数据已经开始验证这一战略。云知声2025年年报显示,全年总营收12.11亿元,同比增长29.0%。其中大模型相关业务收入从2024年的5187万元跃升至6.1亿元,增幅超过10倍,占整体营收比重攀升至50%以上。2026年5月,Token调用收入对应的ARR环比增长约600%,预计6月有望提升至1500万美元。

黄伟将过去三年定义为“热身赛”,2026年才是“正赛”的开端。当大模型的竞争焦点从“谁更强”转向“谁能以更低成本、更稳定方式交付足够强的能力”,云知声凭借数据壁垒、工程化能力和商业化验证,已经走到了第一梯队的门口。U2的发布,本质上是在回答一个行业级命题:当参数竞赛走向终结,智能密度与Token价值将成为衡量AI公司真正实力的新标尺。

标签:云知声U2大模型MoE智能体Agent

相关阅读

72小时五款旗舰混战:GPT-6 Astra宣告AGI时代来临

72小时五款旗舰混战:GPT-6 Astra宣告AGI时代来临

9月初OpenAI发布GPT-6 Astra并宣告AGI时代来临,72小时内五家头部厂商密集迭代旗舰模型,编程与Agent能力成为竞争焦点;RSI递归自我改进机制登场,最强模型的保质期正以「周」为单位计算。

2026-09-06 8
2026大模型API价格剧烈分化:DeepSeek低价突围,行业从价格战转向智能战

2026大模型API价格剧烈分化:DeepSeek低价突围,行业从价格战转向智能战

2026年大模型API价格剧烈分化,DeepSeek低价突围、多家涨价,行业从价格战转向智能战与生态卡位。

2026-08-20 51
2026国产大模型诸神之战:Qwen3.8-Max开源、DeepSeek V4与Kimi K3如何重划Agent时代

2026国产大模型诸神之战:Qwen3.8-Max开源、DeepSeek V4与Kimi K3如何重划Agent时代

从聊天模型到智能体模型,2026年国产大模型在参数、开源与Agent能力三维全面突围,格局生变。

2026-08-15 127
万亿权重开源潮:Qwen3.8如何重划2026年大模型格局

万亿权重开源潮:Qwen3.8如何重划2026年大模型格局

2026年8月,国产大模型迎来密集发布窗口:DeepSeek V4-Pro正式版静默上线并强化Agent能力,阿里首次开放Qwen-Max级别权重推出总参数达2.4T的混合专家模型,此前Kimi K3已以三万亿级参数规模落地开源。海外方面,Grok新版本与谷歌轻量旗舰同期更新,价格战持续。过去万亿级MoE旗舰权重基本闭源锁死,中小团队与政企难以本地部署;如今顶级底座陆续开放,意味着全行业都能基于其做私有化二次开发。本文梳理这轮开源潮的技术特征、许可证变化与选型策略。

2026-08-14 69
开源双响炮:2026国产大模型集体突围

开源双响炮:2026国产大模型集体突围

2026年8月,DeepSeek V4 Pro正式上线、阿里首次开源Qwen3.8旗舰权重,国产大模型迎来开源双响炮。本文盘点Kimi K3、GLM-5.2等国产开源模型的密集迭代,分析开源模型如何以Agent能力与极致性价比挤压闭源阵营,并解读'小而精'端侧路线与开放权重博弈。

2026-08-13 77
英伟达发布Nemotron 3.5 Lightning:300亿参数开源MoE大模型,本地GPU即可运行

英伟达发布Nemotron 3.5 Lightning:300亿参数开源MoE大模型,本地GPU即可运行

英伟达近日发布开源大模型Nemotron 3.5 Lightning,采用300亿参数(30B)混合专家(MoE)架构,权重完全开放。该模型既能在配备英伟达显卡的本地设备直接运行,也可平滑扩展到数据中心与云端,将开源大模型的「本地部署加弹性扩展」能力推向新高度,对企业私有化AI与端侧智能具有重要参考价值。

2026-08-12 77
GPT-5.2 对阵 Claude 4:2026 顶级大模型实测,谁更懂中文长文?

GPT-5.2 对阵 Claude 4:2026 顶级大模型实测,谁更懂中文长文?

我们横向测评了 GPT-5.2 与 Claude 4 在中文长文档理解、代码生成、多轮对话三项任务上的表现,并给出不同场景下的选型建议。

2026-08-07 76
国产大模型八周连发五款 开源生态重划定全球AI价格体系

国产大模型八周连发五款 开源生态重划定全球AI价格体系

2026年8月,智谱GLM-5.2、月之暗面Kimi K3、字节Seedance 2.5、DeepSeek V4 Flash、阿里Qwen3.8-Max在八周内密集发布。国产开源模型以不到美国同类20%的均价,在OpenRouter全球调用量榜单包揽前六,正在系统性瓦解硅谷定价权。

2026-08-06 111
2

2026年7月大模型“混战”:Claude Opus 5、GPT-5.6、Grok 4.5、DeepSeek V4集中发布,价格战同步打响

2026年7月成为全球大模型发布的“最繁忙月份”之一:Anthropic发布Claude Opus 5,OpenAI将GPT-5.6全面开放并大幅降价,xAI推出Grok 4.5,DeepSeek上线V4 Flash(0731版),阿里通义Qwen3.8预览。前沿模型不仅能力逼近,价格也进入下行通道。

2026-08-04 73
2

《2026中国AI大模型竞争力TOP20》发布:字节豆包登顶,阿里通义第二,国产模型进入第一梯队

中国数据研究中心2026年7月28日正式发布《2026中国AI大模型竞争力TOP20》研究报告,首次从技术能力、商业落地、生态建设、发展潜力四个维度对国产大模型进行全面评估。字节跳动豆包/Seed以96.2分排名第一,阿里巴巴通义千问Qwen3.7+以94.8分位列第二,百度文心一言、腾讯混元、DeepSeek等表现亮眼。国产大模型综合能力已跻身全球第一梯队。

2026-07-31 524