72小时五款旗舰混战:GPT-6 Astra宣告AGI时代来临
9月初的大模型行业,迎来史无前例的密集发布窗口。当地时间9月3日,OpenAI正式推出新一代旗舰模型GPT-6 Astra,官方称其实现了「代际跃迁」。据披露,Astra使用超过10万块GPU在得州Stargate基地完成训练,在计算机操作、浏览器自主使用、软件工程、网络安全、科学研究及通用专业工作六大领域均达到全球最先进水平,可直接进入软件环境,自主完成编程、金融建模、制作演示文稿和电子表格等长周期、多步骤任务。
更引人注目的是安全层面的突破:Astra成为OpenAI首个达到内部「关键」网络安全能力门槛的模型,公司称其已能在较少人工干预下发现未知软件漏洞并开发利用方式,内部测试中甚至发现并利用了两个零日漏洞,因此最先进的网络安全能力暂不全面开放。OpenAI总裁布罗克曼在发布会上直言,人们未来可能将「这个时间、这个模型」视为AGI到来的节点,并以「欢迎进入AGI时代」作为收尾。商业化方面,Astra API定价为每百万输入Token 10美元、输出Token 50美元,约为前代GPT-5.6 Sol的2.5倍,即日起向有限组织开放,未来几天覆盖ChatGPT全线付费用户。
Astra并非孤例。9月1日,Anthropic推出Claude Fable 5.1与Mythos 5.1,定位「面向编程和知识工作的最强模型」,编程跑分直接翻倍;9月2日,谷歌连发Gemini 3.8 Flash与专攻网络安全的Gemini 3.8 Flash Cyber,距上一代3.7 Flash更新仅隔三周;同日Meta更新Muse Spark 1.3,重点提升长周期Agent任务能力,阿里也升级了Qwen家族最强的Qwen3.8-Max。再往前,腾讯混元Hy4 preview于8月28日发布,智谱GLM-5.3在8月中旬亮相,强调「专为编程而生」,7月的Kimi K3更是一度因编程测评超越Fable 5而爆火。
短短72小时内,五家海外头部厂商先后迭代旗舰,行业观察者用「周抛时代」形容当下的发布节奏——最强模型从登顶榜单到被超越,往往撑不过一周。值得注意的是,OpenAI和谷歌都重点提及RSI(递归式自我改进)机制的飞跃:AI开始深度参与乃至改进自身的研发流程,Astra正是第一款由前代模型深度参与训练监督的旗舰产品,谷歌DeepMind的研究员也称Gemini 3.8 Flash对RSI是一次巨大飞跃。这意味着模型迭代周期还将被进一步压缩,「周抛」或许很快又会成为过去式。
发布会的另一条线索是形态延伸。奥特曼在Astra发布同期首次明确表示,OpenAI「一定会做人形机器人」,并将开发面向数据中心等场景的其他形态机器人;公司今年6月已启动机器人团队招聘,世界模拟研究项目也已演变为OpenAI Robotics。与此同时,Anthropic据称正接近敲定150亿美元的上市前信贷安排,由摩根士丹利牵头,IPO筹备进入深水区;沙特胡迈因公司则宣布推出基于MiniMax M3打造、拥有4280亿参数的阿拉伯语大模型humain-m3,中国模型正式服务中东市场。
竞争焦点的变化同样清晰:各家不再单纯比拼基准测试分数,而是聚焦编程、办公与Agent自主工作能力——既落地到最日常的使用场景,也上升到最高价值的科研场景。价格层面则在向相对平均的水准收敛,中国厂商的性价比模型在提价,美国顶尖模型的订阅花费反而有所下降。大模型竞争正从「造神运动」走向标准化流水线,而真正的分水岭,或许在于谁能先把智能体送进千行百业的真实业务流。









