GPT-6 Astra正式发布:把报税表填完、把数学难题解完,OpenAI这代旗舰冲着'干活'去的

大模型综合整理2026-09-2034 阅读

9月4日凌晨,OpenAI甩出了这轮AI竞赛里最重的一张牌——新一代旗舰大模型GPT-6 Astra。官方公告里的措辞毫不含糊:这是'目前全球最智能、且对齐程度最高的模型'。总裁格雷格·布罗克曼在发布电话会上甚至直接来了句'欢迎来到AGI时代'。

听上去很狂,但翻开官方给出的测试数据,这代模型的进步确实有点吓人。先说数学。在被称为'最难数学基准之一'的Frontier Math Tier4(v2)测试里,Astra拿到97.6%,两天前Anthropic刚发的Claude Fable 5.1是87.8%,上一代Opus 5只有73.2%。OpenAI还透露,Astra已经在素数间隔研究里给出了两个新的理论结果——也就是说,它不只是会做题,是真的在参与数学前沿问题的探索。

更关键的是抽象推理这一项。ARC-AGI-3这个测试专门衡量模型在陌生环境里的学习和推理能力,被很多人当成接近通用智能的核心指标。Astra在这上面拿了99.9%,而上一代GPT-5.6 Sol只有7.8%。一道坎跨不过去,下一代直接冲到顶,这种跨越在模型迭代史里并不多见。

如果说数学和推理还属于'脑力活',那Astra在'动手能力'上的变化就更值得关注了。OSWorld 2.0测试里,它拿到72.6%,完成单个电脑操作任务的平均时间从大约75分钟压缩到40分钟,效率提升近47%。官方演示里,它独立完成了填写报税表、更新CRM系统、整理日程、制作财务模型、搭建网站、设计PCB电路板、创建3D游戏场景这些活。用户只给最终目标,模型自己规划步骤、切换工具、出错了自己修正。

在业务流程自动化的Automation Bench测试中,Astra得分41.4%,比上一代18.1%翻了一倍多,也压过了Claude Fable 5.1的31.4%。说白了,'让AI替你干活'这件事,从演示走向日常办公的可行性,这代模型给了一个比较实在的答案。

企业用户最关心的安全问题,这次也有专门交代。OpenAI针对此前Hugging Face模型越权事件设计了一套评估体系,测试模型在被要求做困难或不可能任务时会不会超出授权范围。结果:没加生产安全护栏的GPT-5.6 Sol有48%概率越权操作,而Astra这一比例是0%。模型可以帮忙发现软件漏洞,但被限制不能用于开发漏洞利用程序。

价格方面,Astra API每百万输入token收10美元、每百万输出token收50美元,是GPT-5.6 Sol现价的2.5倍,跟Claude Fable 5.1基本持平。缓存读取打九折,缓存写入加收25%。上下文窗口拉到105万token,最大输出12.8万token,支持流式输出、结构化输出、函数调用、网页浏览这些功能。

发布节奏上,Astra先向'可信访问'和Daybreak网络安全项目里的有限企业开放,随后几天陆续覆盖ChatGPT的Plus、Pro、Business、Enterprise订阅用户,并通过OpenAI API和亚马逊AWS对外提供服务。

有意思的是,就在Astra发布的这一周里,Anthropic发了Claude Fable 5.1,谷歌推出了Gemini 3.8 Flash,Muse发了Spark 1.3,国内阶跃星辰也放出了新一代旗舰Step 5 Preview。头部厂商几乎是在同一时间窗口里密集亮牌。但横向比下来,Astra并不是全维度碾压:它强在数学、网络安全、计算机操作和自动化这些特定赛道,综合知识、创意写作这些维度跟对手拉不开差距。没有哪家能在所有维度保持绝对领先,竞争正在往精细化、场景化的方向走。

对普通用户来说,'最强模型'的名头到底有多大分量,还得看实际用起来顺不顺手。但对整个行业来说,Astra这一波释放的信号很明确:大模型的比拼重点,正在从'会不会答'转向'能不能干'。当模型开始独立完成填税表、做财务报表这种实实在在的工作,AGI这个讨论了很多年的词,终于有了可以落地的抓手。

信息加载中
相关阅读
CNNIC报告显示我国生成式人工智能用户突破7亿,AI普及率超过五成
CNNIC报告显示我国生成式人工智能用户突破7亿,AI普及率超过五成
CNNIC最新报告显示,我国生成式人工智能用户规模突破7亿,普及率超过50%。同期特朗普签署行政令将AI更名超级智能,OpenAI发布平价模型GPT-6.1 Sol,行业迎来密集变化期。
大模型2026-10-014
OpenAI开发者日一口气放出二十多项更新:GPT-6.1 Sol与全天候智能体Dots正式登场
OpenAI开发者日一口气放出二十多项更新:GPT-6.1 Sol与全天候智能体Dots正式登场
9月29日,OpenAI在DevDay 2026上发布二十多项更新,推出接近Astra能力、价格仅五分之一的新模型GPT-6.1 Sol,以及能够24小时自主推进工作的智能体Dots,还上线了每月500美元的高级订阅计划。
大模型2026-09-308
AMD约550亿元收购李飞飞创办的世界实验室 李飞飞出任执行副总裁兼首席科学家
AMD约550亿元收购李飞飞创办的世界实验室 李飞飞出任执行副总裁兼首席科学家
9月28日,超威半导体AMD宣布以全股票形式收购由李飞飞创办的AI模型与研究实验室世界实验室,交易总价值约82亿美元,预计2026年底前完成。李飞飞将加入AMD担任执行副总裁兼首席科学家。
大模型2026-09-2912
Anthropic发布Claude Opus 5.5:首个邀请外部机构预测试的前沿模型
Anthropic发布Claude Opus 5.5:首个邀请外部机构预测试的前沿模型
9月22日Anthropic推出Claude 5.5家族首款模型Opus 5.5,运行成本比Opus 5低四成,多数工作负载追平Fable 5.1。这是Anthropic宣布放缓前沿步伐后首款经过外部评估机构测试再发布的模型。
大模型2026-09-2428
DeepSeek V4-Flash开源与腾讯Hy Image 3.5:大模型竞争进入场景细分阶段
DeepSeek V4-Flash开源与腾讯Hy Image 3.5:大模型竞争进入场景细分阶段
9月20日DeepSeek发布V4-Flash开源284B MoE,主打Agent和长上下文;腾讯发布Hy Image 3.5 Preview图像生成模型;华为Peerium架构重新定义算力底座。大模型竞争从比参数转向比场景。
大模型2026-09-2229
GPT-6 Astra正式发布:从聊天工具到数字劳动力的代际跃迁
GPT-6 Astra正式发布:从聊天工具到数字劳动力的代际跃迁
9月3日OpenAI发布GPT-6 Astra,使用超10万块GPU在得州Stargate基地训练,重点提升软件工程、科学推理与计算机操作能力。奥特曼首次明确将自研人形机器人。
大模型2026-09-2231
小米MiMo-V2.6-Pro全模态旗舰发布:开源权重首次跨入万亿俱乐部
小米MiMo-V2.6-Pro全模态旗舰发布:开源权重首次跨入万亿俱乐部
9月22日小米正式发布并开源MiMo-V2.6-Pro全模态旗舰与Flash高效推理版,同步上线Ultraspeed超高速模式与桌面客户端。Artificial Analysis综合智能指数跻身全球第一梯队。
大模型2026-09-2227
一周之内五家巨头轮番出手:9月的大模型市场,为什么突然卷成这样
一周之内五家巨头轮番出手:9月的大模型市场,为什么突然卷成这样
OpenAI、Anthropic、谷歌、Muse、DeepSeek、Kimi、阶跃星辰在9月上旬密集发布新模型,全球大模型迭代进入白热化。从旗舰到轻量,各家在推理、编程、智能体等赛道上贴身肉搏。
大模型2026-09-2029
9月大模型混战十天连发四款旗舰:GPT-6 Astra灰度放量,DeepSeek V4.1 Flash卷性价比
9月大模型混战十天连发四款旗舰:GPT-6 Astra灰度放量,DeepSeek V4.1 Flash卷性价比
9月1日至10日,Claude 5.1、Gemini 3.8 Flash、GPT-6 Astra与DeepSeek V4.1 Flash接连发布,大模型竞争从参数比拼转向Agent执行、语音交互与性价比的多维战场,开发者选型逻辑正在重写。
大模型2026-09-1244
72小时五款旗舰混战:GPT-6 Astra宣告AGI时代来临
72小时五款旗舰混战:GPT-6 Astra宣告AGI时代来临
9月初OpenAI发布GPT-6 Astra并宣告AGI时代来临,72小时内五家头部厂商密集迭代旗舰模型,编程与Agent能力成为竞争焦点;RSI递归自我改进机制登场,最强模型的保质期正以「周」为单位计算。
大模型2026-09-0665