云知声U2大模型发布:以10B激活参数杀入国产大模型第一梯队
大模型赛道正在经历一场静悄悄的范式转移。过去三年,整个行业几乎被同一套逻辑绑架:参数规模越大越好,推理链越长越聪明,算力投入越高越能打。从千亿到万亿,各家厂商你追我赶,仿佛堆砌参数就是通往AGI的唯一路径。然而,当模型能力逐渐逼近天花板,推理成本日益成为企业部署的隐形门槛,一个根本性的问题浮出水面:下一个阶段,AI的核心竞争力究竟是什么?
2025年6月8日,云知声在港股上市满一周年之际给出了自己的答案。这家从语音识别赛道起家的AI公司,正式发布了自研新一代基座大模型U2,一款定位为原生智能体的大语言模型。U2没有走参数膨胀的老路,而是提出了一个被业内称为“反内卷”的技术路线——智能密度乘以Token价值。
所谓智能密度,衡量的是单位参数里承载了多少有效知识和推理能力;Token价值则关注每一个生成的Token是否真正转化为业务结果。云知声创始人黄伟的表述更加直白:“我不需要一个中国科学院院士来开滴滴,很多任务场景不需要最高智能,硕士博士水平就够了。”
架构层面的突破是U2的根基。U2采用了快慢思考融合的MoE混合专家架构,总参数量近3000亿,但每次推理仅激活约百亿级别的参数。这意味着模型在推理时只调动完成当前任务所需的专家网络,而非全部参数参与计算。知识存储与知识调用被有效解耦,使U2在更小的激活规模下维持了顶级任务能力。据云知声披露的数据,同等性能下U2的推理成本仅为传统稠密大模型的约十分之一。
更值得关注的是U2的隐式思考机制。当前主流推理模型普遍存在一个问题:为了得出正确答案,会生成极长的思维链,大量Token消耗在中间推理过程而非最终结果上。U2则能够在连续隐空间中完成大量中间推理,仅在关键决策节点切换回显式推理进行验证。云知声大模型事业部总经理刘升平博士以医疗场景举例:一份病历生成任务,传统模型通常需要输出2000至3000个Token,而U2通过隐式思考技术可将输出压缩到1000个Token以内,同时保持结果质量不变。
评测数据为这套技术路线提供了有力佐证。6月10日,海外权威AI模型评测平台LLM Stats更新的榜单显示,云知声U2在综合能力榜单中进入模型总榜前30,按厂商最佳模型成绩位列全球第九。在LongBench-V2长文本评测中,U2以54.4%的准确率超越了Claude Opus 4.7的53.9%,仅落后GPT-5.4的55.6%约1.2个百分点,排名全球第二。此外,在AA-LCR长上下文评测中U2获得70分,位居对比模型首位。
但云知声真正想讲的故事,不是跑分,而是落地。U2从设计之初就锚定了“为执行而生”而非“为生成而生”。传统大模型本质上是“嘴强王者”,能回答问题、能写文章,但让它去完成一个复杂的多步骤任务,就得在外面包一层厚厚的应用壳。U2则将工具调用、状态管理、多步规划训练为模型原生能力,可自主理解目标、拆解任务、调用工具、执行验收。
这种能力的核心在于“Agent加Harness协同演进”机制。云知声将模型原生Agent能力的提升与任务执行脚手架的迭代优化纳入同一训练闭环,形成双向强化的协同演进。模型利用Harness返回的高质量轨迹数据,持续强化多步规划、工具调用、过程纠错与结果验收能力;而Harness则根据模型能力边界持续迭代,提供更精准的任务环境与反馈接口。刘升平将这一思路概括为八个字:“大模型做厚,Harness做薄。”
从商业层面看,云知声的底气来自十三年的行业深耕。过去十余年,云知声在医疗、交通、IoT等领域沉淀了大量真实业务数据和行业知识。截至2025年末,公司已累计与全国近450家医院合作,全国综合排名A++及以上医院覆盖率接近35%;在物联网领域合作伙伴超过2万家,端侧AI芯片出货量突破1亿颗。这些数据资产构成了云知声独特的“双模型飞轮”:一端是通用大模型负责推理和Agent执行,另一端是行业模型持续沉淀垂直领域知识,两者相互强化形成正向循环。
商业化数据已经开始验证这一战略。云知声2025年年报显示,全年总营收12.11亿元,同比增长29.0%。其中大模型相关业务收入从2024年的5187万元跃升至6.1亿元,增幅超过10倍,占整体营收比重攀升至50%以上。2026年5月,Token调用收入对应的ARR环比增长约600%,预计6月有望提升至1500万美元。
黄伟将过去三年定义为“热身赛”,2026年才是“正赛”的开端。当大模型的竞争焦点从“谁更强”转向“谁能以更低成本、更稳定方式交付足够强的能力”,云知声凭借数据壁垒、工程化能力和商业化验证,已经走到了第一梯队的门口。U2的发布,本质上是在回答一个行业级命题:当参数竞赛走向终结,智能密度与Token价值将成为衡量AI公司真正实力的新标尺。