72小时五款旗舰混战:GPT-6 Astra宣告AGI时代来临

大模型📰综合整理📅2026-09-06 44 阅读

9月初的大模型行业,迎来史无前例的密集发布窗口。当地时间9月3日,OpenAI正式推出新一代旗舰模型GPT-6 Astra,官方称其实现了「代际跃迁」。据披露,Astra使用超过10万块GPU在得州Stargate基地完成训练,在计算机操作、浏览器自主使用、软件工程、网络安全、科学研究及通用专业工作六大领域均达到全球最先进水平,可直接进入软件环境,自主完成编程、金融建模、制作演示文稿和电子表格等长周期、多步骤任务。

更引人注目的是安全层面的突破:Astra成为OpenAI首个达到内部「关键」网络安全能力门槛的模型,公司称其已能在较少人工干预下发现未知软件漏洞并开发利用方式,内部测试中甚至发现并利用了两个零日漏洞,因此最先进的网络安全能力暂不全面开放。OpenAI总裁布罗克曼在发布会上直言,人们未来可能将「这个时间、这个模型」视为AGI到来的节点,并以「欢迎进入AGI时代」作为收尾。商业化方面,Astra API定价为每百万输入Token 10美元、输出Token 50美元,约为前代GPT-5.6 Sol的2.5倍,即日起向有限组织开放,未来几天覆盖ChatGPT全线付费用户。

Astra并非孤例。9月1日,Anthropic推出Claude Fable 5.1与Mythos 5.1,定位「面向编程和知识工作的最强模型」,编程跑分直接翻倍;9月2日,谷歌连发Gemini 3.8 Flash与专攻网络安全的Gemini 3.8 Flash Cyber,距上一代3.7 Flash更新仅隔三周;同日Meta更新Muse Spark 1.3,重点提升长周期Agent任务能力,阿里也升级了Qwen家族最强的Qwen3.8-Max。再往前,腾讯混元Hy4 preview于8月28日发布,智谱GLM-5.3在8月中旬亮相,强调「专为编程而生」,7月的Kimi K3更是一度因编程测评超越Fable 5而爆火。

短短72小时内,五家海外头部厂商先后迭代旗舰,行业观察者用「周抛时代」形容当下的发布节奏——最强模型从登顶榜单到被超越,往往撑不过一周。值得注意的是,OpenAI和谷歌都重点提及RSI(递归式自我改进)机制的飞跃:AI开始深度参与乃至改进自身的研发流程,Astra正是第一款由前代模型深度参与训练监督的旗舰产品,谷歌DeepMind的研究员也称Gemini 3.8 Flash对RSI是一次巨大飞跃。这意味着模型迭代周期还将被进一步压缩,「周抛」或许很快又会成为过去式。

发布会的另一条线索是形态延伸。奥特曼在Astra发布同期首次明确表示,OpenAI「一定会做人形机器人」,并将开发面向数据中心等场景的其他形态机器人;公司今年6月已启动机器人团队招聘,世界模拟研究项目也已演变为OpenAI Robotics。与此同时,Anthropic据称正接近敲定150亿美元的上市前信贷安排,由摩根士丹利牵头,IPO筹备进入深水区;沙特胡迈因公司则宣布推出基于MiniMax M3打造、拥有4280亿参数的阿拉伯语大模型humain-m3,中国模型正式服务中东市场。

竞争焦点的变化同样清晰:各家不再单纯比拼基准测试分数,而是聚焦编程、办公与Agent自主工作能力——既落地到最日常的使用场景,也上升到最高价值的科研场景。价格层面则在向相对平均的水准收敛,中国厂商的性价比模型在提价,美国顶尖模型的订阅花费反而有所下降。大模型竞争正从「造神运动」走向标准化流水线,而真正的分水岭,或许在于谁能先把智能体送进千行百业的真实业务流。

标签:AI大模型GPT-6OpenAIAGI

相关阅读

一周之内五家巨头轮番出手:9月的大模型市场,为什么突然卷成这样

一周之内五家巨头轮番出手:9月的大模型市场,为什么突然卷成这样

OpenAI、Anthropic、谷歌、Muse、DeepSeek、Kimi、阶跃星辰在9月上旬密集发布新模型,全球大模型迭代进入白热化。从旗舰到轻量,各家在推理、编程、智能体等赛道上贴身肉搏。

2026-09-20 1
GPT-6 Astra正式发布:把报税表填完、把数学难题解完,OpenAI这代旗舰冲着'干活'去的

GPT-6 Astra正式发布:把报税表填完、把数学难题解完,OpenAI这代旗舰冲着'干活'去的

9月4日凌晨,OpenAI发布新一代旗舰大模型GPT-6 Astra,号称迄今最智能、对齐程度最高的模型。它在数学、网络安全、计算机操作与自动化任务上实现代际跃升,能独立完成填税表、更新CRM、搭网站等复杂工作。

2026-09-20 2
9月大模型混战十天连发四款旗舰:GPT-6 Astra灰度放量,DeepSeek V4.1 Flash卷性价比

9月大模型混战十天连发四款旗舰:GPT-6 Astra灰度放量,DeepSeek V4.1 Flash卷性价比

9月1日至10日,Claude 5.1、Gemini 3.8 Flash、GPT-6 Astra与DeepSeek V4.1 Flash接连发布,大模型竞争从参数比拼转向Agent执行、语音交互与性价比的多维战场,开发者选型逻辑正在重写。

2026-09-12 25
2026大模型API价格剧烈分化:DeepSeek低价突围,行业从价格战转向智能战

2026大模型API价格剧烈分化:DeepSeek低价突围,行业从价格战转向智能战

2026年大模型API价格剧烈分化,DeepSeek低价突围、多家涨价,行业从价格战转向智能战与生态卡位。

2026-08-20 80
2026国产大模型诸神之战:Qwen3.8-Max开源、DeepSeek V4与Kimi K3如何重划Agent时代

2026国产大模型诸神之战:Qwen3.8-Max开源、DeepSeek V4与Kimi K3如何重划Agent时代

从聊天模型到智能体模型,2026年国产大模型在参数、开源与Agent能力三维全面突围,格局生变。

2026-08-15 157
万亿权重开源潮:Qwen3.8如何重划2026年大模型格局

万亿权重开源潮:Qwen3.8如何重划2026年大模型格局

2026年8月,国产大模型迎来密集发布窗口:DeepSeek V4-Pro正式版静默上线并强化Agent能力,阿里首次开放Qwen-Max级别权重推出总参数达2.4T的混合专家模型,此前Kimi K3已以三万亿级参数规模落地开源。海外方面,Grok新版本与谷歌轻量旗舰同期更新,价格战持续。过去万亿级MoE旗舰权重基本闭源锁死,中小团队与政企难以本地部署;如今顶级底座陆续开放,意味着全行业都能基于其做私有化二次开发。本文梳理这轮开源潮的技术特征、许可证变化与选型策略。

2026-08-14 88
开源双响炮:2026国产大模型集体突围

开源双响炮:2026国产大模型集体突围

2026年8月,DeepSeek V4 Pro正式上线、阿里首次开源Qwen3.8旗舰权重,国产大模型迎来开源双响炮。本文盘点Kimi K3、GLM-5.2等国产开源模型的密集迭代,分析开源模型如何以Agent能力与极致性价比挤压闭源阵营,并解读'小而精'端侧路线与开放权重博弈。

2026-08-13 93
英伟达发布Nemotron 3.5 Lightning:300亿参数开源MoE大模型,本地GPU即可运行

英伟达发布Nemotron 3.5 Lightning:300亿参数开源MoE大模型,本地GPU即可运行

英伟达近日发布开源大模型Nemotron 3.5 Lightning,采用300亿参数(30B)混合专家(MoE)架构,权重完全开放。该模型既能在配备英伟达显卡的本地设备直接运行,也可平滑扩展到数据中心与云端,将开源大模型的「本地部署加弹性扩展」能力推向新高度,对企业私有化AI与端侧智能具有重要参考价值。

2026-08-12 98
GPT-5.2 对阵 Claude 4:2026 顶级大模型实测,谁更懂中文长文?

GPT-5.2 对阵 Claude 4:2026 顶级大模型实测,谁更懂中文长文?

我们横向测评了 GPT-5.2 与 Claude 4 在中文长文档理解、代码生成、多轮对话三项任务上的表现,并给出不同场景下的选型建议。

2026-08-07 88
国产大模型八周连发五款 开源生态重划定全球AI价格体系

国产大模型八周连发五款 开源生态重划定全球AI价格体系

2026年8月,智谱GLM-5.2、月之暗面Kimi K3、字节Seedance 2.5、DeepSeek V4 Flash、阿里Qwen3.8-Max在八周内密集发布。国产开源模型以不到美国同类20%的均价,在OpenRouter全球调用量榜单包揽前六,正在系统性瓦解硅谷定价权。

2026-08-06 129