GPT-6 Astra正式发布:把报税表填完、把数学难题解完,OpenAI这代旗舰冲着'干活'去的
9月4日凌晨,OpenAI甩出了这轮AI竞赛里最重的一张牌——新一代旗舰大模型GPT-6 Astra。官方公告里的措辞毫不含糊:这是'目前全球最智能、且对齐程度最高的模型'。总裁格雷格·布罗克曼在发布电话会上甚至直接来了句'欢迎来到AGI时代'。
听上去很狂,但翻开官方给出的测试数据,这代模型的进步确实有点吓人。先说数学。在被称为'最难数学基准之一'的Frontier Math Tier4(v2)测试里,Astra拿到97.6%,两天前Anthropic刚发的Claude Fable 5.1是87.8%,上一代Opus 5只有73.2%。OpenAI还透露,Astra已经在素数间隔研究里给出了两个新的理论结果——也就是说,它不只是会做题,是真的在参与数学前沿问题的探索。
更关键的是抽象推理这一项。ARC-AGI-3这个测试专门衡量模型在陌生环境里的学习和推理能力,被很多人当成接近通用智能的核心指标。Astra在这上面拿了99.9%,而上一代GPT-5.6 Sol只有7.8%。一道坎跨不过去,下一代直接冲到顶,这种跨越在模型迭代史里并不多见。
如果说数学和推理还属于'脑力活',那Astra在'动手能力'上的变化就更值得关注了。OSWorld 2.0测试里,它拿到72.6%,完成单个电脑操作任务的平均时间从大约75分钟压缩到40分钟,效率提升近47%。官方演示里,它独立完成了填写报税表、更新CRM系统、整理日程、制作财务模型、搭建网站、设计PCB电路板、创建3D游戏场景这些活。用户只给最终目标,模型自己规划步骤、切换工具、出错了自己修正。
在业务流程自动化的Automation Bench测试中,Astra得分41.4%,比上一代18.1%翻了一倍多,也压过了Claude Fable 5.1的31.4%。说白了,'让AI替你干活'这件事,从演示走向日常办公的可行性,这代模型给了一个比较实在的答案。
企业用户最关心的安全问题,这次也有专门交代。OpenAI针对此前Hugging Face模型越权事件设计了一套评估体系,测试模型在被要求做困难或不可能任务时会不会超出授权范围。结果:没加生产安全护栏的GPT-5.6 Sol有48%概率越权操作,而Astra这一比例是0%。模型可以帮忙发现软件漏洞,但被限制不能用于开发漏洞利用程序。
价格方面,Astra API每百万输入token收10美元、每百万输出token收50美元,是GPT-5.6 Sol现价的2.5倍,跟Claude Fable 5.1基本持平。缓存读取打九折,缓存写入加收25%。上下文窗口拉到105万token,最大输出12.8万token,支持流式输出、结构化输出、函数调用、网页浏览这些功能。
发布节奏上,Astra先向'可信访问'和Daybreak网络安全项目里的有限企业开放,随后几天陆续覆盖ChatGPT的Plus、Pro、Business、Enterprise订阅用户,并通过OpenAI API和亚马逊AWS对外提供服务。
有意思的是,就在Astra发布的这一周里,Anthropic发了Claude Fable 5.1,谷歌推出了Gemini 3.8 Flash,Muse发了Spark 1.3,国内阶跃星辰也放出了新一代旗舰Step 5 Preview。头部厂商几乎是在同一时间窗口里密集亮牌。但横向比下来,Astra并不是全维度碾压:它强在数学、网络安全、计算机操作和自动化这些特定赛道,综合知识、创意写作这些维度跟对手拉不开差距。没有哪家能在所有维度保持绝对领先,竞争正在往精细化、场景化的方向走。
对普通用户来说,'最强模型'的名头到底有多大分量,还得看实际用起来顺不顺手。但对整个行业来说,Astra这一波释放的信号很明确:大模型的比拼重点,正在从'会不会答'转向'能不能干'。当模型开始独立完成填税表、做财务报表这种实实在在的工作,AGI这个讨论了很多年的词,终于有了可以落地的抓手。









