OpenAI;GPT-6 Astra;AGI时代

OpenAI最强模型GPT-6 Astra发布,公司总裁称AGI时代到来

短短一周内,除了OpenAI,Anthropic、谷歌等头部厂商密集发布新品。
OpenAI;GPT-6 Astra;AGI时代

图片来源:视觉中国

9月4日凌晨,OpenAI正式发布新一代旗舰大模型GPT-6 Astra,公司在开发者社区公告中将其定义为“目前全球最智能、且对齐程度最高的模型”。这是继GPT-5系列之后OpenAI最具分量的一次旗舰更新,也是OpenAI首次将“Astra”作为旗舰模型的后缀命名。OpenAI 联合创始人兼总裁格雷格・布罗克曼在发布电话会议上直言“欢迎来到AGI时代”。

按照官方披露的滚动计划,Astra即日起先向“可信访问”(Trusted Access)和Daybreak网络安全项目中的有限企业组织开放,未来几天内陆续覆盖ChatGPT Plus、Pro、Business、Enterprise订阅用户,并通过OpenAI API和亚马逊AWS对外提供服务。

与OpenAI上一代GPT-5.6Sol相比,Astra在数学推理、网络安全、计算机操作和科学研究等领域实现了代际式跃升。根据OpenAI官网发布的技术文档,GPT-6 Astra整合了数年来在预训练、强化学习和对齐领域的研究积累,核心突破集中在智能体执行能力和深度推理两个维度。

官方测试数据显示,在衡量自主科学研究能力的Terminal-BenchScience0.1基准上,Astra得分达到64.6%,显著高于两天前Anthropic发布的Claude Fable5.1的52.6%,且完成同等任务的估计API成本低约31%。在更低成本设置下,Astra仍能拿到61.1%的分数,远超GPT-5.6Sol最佳表现的22.4%,同时成本低约27%。在考察终端编程能力的Terminal-Bench4.0测试中,Astra得分57.9%,同样高于Claude Fable5.1的55.8%和GPT-5.6Sol的37.3%。

Frontier Math Tier4(v2)测试

在被称为“最难数学基准之一”的Frontier Math Tier4(v2)测试中,Astra取得了97.6%的高分,而Claude Fable5.1和Claude Fable5并列在87.8%,上一代Opus5仅为73.2%。

OpenAI官方表示,Astra已经帮助解决了数学领域长期存在的开放性问题,包括在素数间隔研究中取得了两个新的理论结果。尤其是ARC-AGI-3测试,这套测试是衡量模型在陌生环境中的抽象推理和学习能力,被视为接近通用智能的核心指标,Astra在此项测试中拿到99.9%的接近满分成绩,而GPT-5.6Sol仅为7.8%,短短一代模型实现了十余倍的提升。

计算机操作与任务自动化能力的提升,则让Astra真正具备了“替代人完成工作”的潜力。在OSWorld2.0测试中,Astra得分72.6%,高于GPT-5.6Sol的65.7%;完成单项任务的平均时间从约75分钟大幅缩短至40分钟,效率提升近47%。此前模型虽然也能完成不少电脑任务,但速度慢到用户宁可自己动手,40分钟的完成时间意味着AI操作电脑开始具备实际的生产效率。

OSWorld2.0测试

在考察业务流程自动化的Automation Bench测试中,Astra得分41.4%,较GPT-5.6Sol的18.1%翻倍有余,也高于Claude Fable5.1的31.4%。官方演示视频显示,Astra可以独立完成填写报税表、更新CRM系统、整理日程安排、制作财务模型、分析科研数据、搭建网站、设计PCB电路板、创建3D游戏场景等复杂工作,用户只需给出最终目标,模型会自行规划步骤、切换工具、修正错误,整个过程无需人工分步指令。

Automation Bench测试

定价方面,GPT-6Astra的API调用价格每百万输入Token为10美元、每百万输出Token为50美元,是GPT-5.6Sol当前价格的2.5倍,与Claude Fable5.1的定价基本持平。缓存读取享受90%折扣,缓存写入加收25%溢价。模型支持五级推理强度调节,从low到max,用户可以根据任务难度灵活权衡成本与深度。上下文窗口方面,Astra总上下文长度为105万Token,最大输出长度为12.8万Token,知识截止时间为2026年4月30日,略晚于Claude Fable5.1的2026年6月。支持的功能包括流式输出、结构化输出、函数调用、文件搜索、网页浏览和提示缓存等。

OpenAI称Astra是公司“有史以来对齐程度最高的模型”,在理解用户意图和行为边界方面有实质性改进。对此,OpenAI专门基于此前Hugging Face模型越权事件设计了一套评估体系,测试模型在面对困难或不可能任务时是否会超出授权范围。结果显示,未加生产安全护栏的GPT-5.6Sol有48%的概率会越权操作,而GPT-6Astra这一比例为0%。这一改进对于企业级应用至关重要。当模型被授权访问内部系统和数据时,能否严格守住权限边界直接关系到企业的信息安全。OpenAI表示,Astra在网络安全领域的能力提升伴随着严格的护栏设计,模型可以用于发现软件漏洞,但不能用于开发漏洞利用程序。

短短一周内,除了OpenAI,Anthropic发布Claude Fable5.1、谷歌推出Gemini 3.8 Flash、Muse发布Spark 1.3,头部厂商密集发布新品,迭代速度持续加快。从各维度对比来看,Astra并非全面碾压对手。Astra的优势集中在数学、网络安全、计算机操作和自动化等特定领域,而在综合知识、创意写作等维度并未拉开差距。可以看出,没有任何一家厂商能够在所有维度保持绝对领先,各家在不同赛道各有千秋,竞争正在向精细化、场景化方向深化。

来源:界面新闻

广告等商务合作,请点击这里

未经正式授权严禁转载本文,侵权必究。

打开界面新闻APP,查看原文
界面新闻
打开界面新闻,查看更多专业报道

热门评论

打开APP,查看全部评论,抢神评席位

热门推荐

    下载界面APP 订阅更多品牌栏目
      界面新闻
      界面新闻
      只服务于独立思考的人群
      打开