GPT-6 Astra正式发布:把报税表填完、把数学难题解完,OpenAI这代旗舰冲着'干活'去的
9月4日凌晨,OpenAI甩出了这轮AI竞赛里最重的一张牌——新一代旗舰大模型GPT-6 Astra。官方公告里的措辞毫不含糊:这是'目前全球最智能、且对齐程度最高的模型'。总裁格雷格·布罗克曼在发布电话会上甚至直接来了句'欢迎来到AGI时代'。
听上去很狂,但翻开官方给出的测试数据,这代模型的进步确实有点吓人。先说数学。在被称为'最难数学基准之一'的Frontier Math Tier4(v2)测试里,Astra拿到97.6%,两天前Anthropic刚发的Claude Fable 5.1是87.8%,上一代Opus 5只有73.2%。OpenAI还透露,Astra已经在素数间隔研究里给出了两个新的理论结果——也就是说,它不只是会做题,是真的在参与数学前沿问题的探索。
更关键的是抽象推理这一项。ARC-AGI-3这个测试专门衡量模型在陌生环境里的学习和推理能力,被很多人当成接近通用智能的核心指标。Astra在这上面拿了99.9%,而上一代GPT-5.6 Sol只有7.8%。一道坎跨不过去,下一代直接冲到顶,这种跨越在模型迭代史里并不多见。
如果说数学和推理还属于'脑力活',那Astra在'动手能力'上的变化就更值得关注了。OSWorld 2.0测试里,它拿到72.6%,完成单个电脑操作任务的平均时间从大约75分钟压缩到40分钟,效率提升近47%。官方演示里,它独立完成了填写报税表、更新CRM系统、整理日程、制作财务模型、搭建网站、设计PCB电路板、创建3D游戏场景这些活。用户只给最终目标,模型自己规划步骤、切换工具、出错了自己修正。
在业务流程自动化的Automation Bench测试中,Astra得分41.4%,比上一代18.1%翻了一倍多,也压过了Claude Fable 5.1的31.4%。说白了,'让AI替你干活'这件事,从演示走向日常办公的可行性,这代模型给了一个比较实在的答案。
企业用户最关心的安全问题,这次也有专门交代。OpenAI针对此前Hugging Face模型越权事件设计了一套评估体系,测试模型在被要求做困难或不可能任务时会不会超出授权范围。结果:没加生产安全护栏的GPT-5.6 Sol有48%概率越权操作,而Astra这一比例是0%。模型可以帮忙发现软件漏洞,但被限制不能用于开发漏洞利用程序。
价格方面,Astra API每百万输入token收10美元、每百万输出token收50美元,是GPT-5.6 Sol现价的2.5倍,跟Claude Fable 5.1基本持平。缓存读取打九折,缓存写入加收25%。上下文窗口拉到105万token,最大输出12.8万token,支持流式输出、结构化输出、函数调用、网页浏览这些功能。
发布节奏上,Astra先向'可信访问'和Daybreak网络安全项目里的有限企业开放,随后几天陆续覆盖ChatGPT的Plus、Pro、Business、Enterprise订阅用户,并通过OpenAI API和亚马逊AWS对外提供服务。
有意思的是,就在Astra发布的这一周里,Anthropic发了Claude Fable 5.1,谷歌推出了Gemini 3.8 Flash,Muse发了Spark 1.3,国内阶跃星辰也放出了新一代旗舰Step 5 Preview。头部厂商几乎是在同一时间窗口里密集亮牌。但横向比下来,Astra并不是全维度碾压:它强在数学、网络安全、计算机操作和自动化这些特定赛道,综合知识、创意写作这些维度跟对手拉不开差距。没有哪家能在所有维度保持绝对领先,竞争正在往精细化、场景化的方向走。
对普通用户来说,'最强模型'的名头到底有多大分量,还得看实际用起来顺不顺手。但对整个行业来说,Astra这一波释放的信号很明确:大模型的比拼重点,正在从'会不会答'转向'能不能干'。当模型开始独立完成填税表、做财务报表这种实实在在的工作,AGI这个讨论了很多年的词,终于有了可以落地的抓手。
相关阅读

一周之内五家巨头轮番出手:9月的大模型市场,为什么突然卷成这样
OpenAI、Anthropic、谷歌、Muse、DeepSeek、Kimi、阶跃星辰在9月上旬密集发布新模型,全球大模型迭代进入白热化。从旗舰到轻量,各家在推理、编程、智能体等赛道上贴身肉搏。

9月大模型混战十天连发四款旗舰:GPT-6 Astra灰度放量,DeepSeek V4.1 Flash卷性价比
9月1日至10日,Claude 5.1、Gemini 3.8 Flash、GPT-6 Astra与DeepSeek V4.1 Flash接连发布,大模型竞争从参数比拼转向Agent执行、语音交互与性价比的多维战场,开发者选型逻辑正在重写。

72小时五款旗舰混战:GPT-6 Astra宣告AGI时代来临
9月初OpenAI发布GPT-6 Astra并宣告AGI时代来临,72小时内五家头部厂商密集迭代旗舰模型,编程与Agent能力成为竞争焦点;RSI递归自我改进机制登场,最强模型的保质期正以「周」为单位计算。

2026大模型API价格剧烈分化:DeepSeek低价突围,行业从价格战转向智能战
2026年大模型API价格剧烈分化,DeepSeek低价突围、多家涨价,行业从价格战转向智能战与生态卡位。

2026国产大模型诸神之战:Qwen3.8-Max开源、DeepSeek V4与Kimi K3如何重划Agent时代
从聊天模型到智能体模型,2026年国产大模型在参数、开源与Agent能力三维全面突围,格局生变。

万亿权重开源潮:Qwen3.8如何重划2026年大模型格局
2026年8月,国产大模型迎来密集发布窗口:DeepSeek V4-Pro正式版静默上线并强化Agent能力,阿里首次开放Qwen-Max级别权重推出总参数达2.4T的混合专家模型,此前Kimi K3已以三万亿级参数规模落地开源。海外方面,Grok新版本与谷歌轻量旗舰同期更新,价格战持续。过去万亿级MoE旗舰权重基本闭源锁死,中小团队与政企难以本地部署;如今顶级底座陆续开放,意味着全行业都能基于其做私有化二次开发。本文梳理这轮开源潮的技术特征、许可证变化与选型策略。

开源双响炮:2026国产大模型集体突围
2026年8月,DeepSeek V4 Pro正式上线、阿里首次开源Qwen3.8旗舰权重,国产大模型迎来开源双响炮。本文盘点Kimi K3、GLM-5.2等国产开源模型的密集迭代,分析开源模型如何以Agent能力与极致性价比挤压闭源阵营,并解读'小而精'端侧路线与开放权重博弈。

英伟达发布Nemotron 3.5 Lightning:300亿参数开源MoE大模型,本地GPU即可运行
英伟达近日发布开源大模型Nemotron 3.5 Lightning,采用300亿参数(30B)混合专家(MoE)架构,权重完全开放。该模型既能在配备英伟达显卡的本地设备直接运行,也可平滑扩展到数据中心与云端,将开源大模型的「本地部署加弹性扩展」能力推向新高度,对企业私有化AI与端侧智能具有重要参考价值。

GPT-5.2 对阵 Claude 4:2026 顶级大模型实测,谁更懂中文长文?
我们横向测评了 GPT-5.2 与 Claude 4 在中文长文档理解、代码生成、多轮对话三项任务上的表现,并给出不同场景下的选型建议。

国产大模型八周连发五款 开源生态重划定全球AI价格体系
2026年8月,智谱GLM-5.2、月之暗面Kimi K3、字节Seedance 2.5、DeepSeek V4 Flash、阿里Qwen3.8-Max在八周内密集发布。国产开源模型以不到美国同类20%的均价,在OpenRouter全球调用量榜单包揽前六,正在系统性瓦解硅谷定价权。
