9月3日,OpenAI宣布发布GPT‑6 Astra,重点提升电脑操作、软件开发和复杂工作任务的处理能力。新模型先向部分机构开放,再逐步扩展至ChatGPT付费用户和API渠道,并非发布当天所有用户都能使用。
对用户来说,这次更新最值得关注的问题是:面对一项需要查资料、处理文件、操作软件的工作,AI能否持续做下去,并减少出错后的人工返工?
在OpenAI基于OSWorld 2.0离线子集进行的延迟模拟中,Astra的得分达到72.6%,高于GPT‑5.6 Sol的65.7%,单项任务模拟耗时减少约47%。数据来自特定测试环境,不代表日常办公都能节省近一半时间。
电脑操作能力的价值,不只在于模型会不会点击按钮。
把一项工作交给AI之后,用户还要花多少时间检查结果?遇到错误时,它能不能发现问题、继续修正?如果每隔几步就需要人接手,即便单次操作更快,整项工作的效率也未必更高。
因此,这次提速值得关注,但最终仍要看真实任务中的完成质量。
Astra的另一项更新,是任务执行过程中的协作方式。
官方开发文档介绍,它支持异步工具调用:等待某个工具返回结果时,可以继续处理不依赖该结果的其他工作。开发者也能通过相应接口,在任务进行中补充或修改要求,让模型利用已经完成的工作继续执行。
例如,一项资料整理任务做到一半,用户发现需要调整研究范围。理想的处理方式是保留仍然有用的材料,修改后续步骤,而不是全部推倒重来。这是上述功能希望改善的协作场景,实际效果取决于应用如何接入。
不过,协作能力提升不意味着模型会更少提问。官方指南也指出,Astra可能更倾向于追问会影响结果的关键信息,有时会因此暂停工作。
规格方面,Astra支持约百万Token的上下文,可接收文本和图片、输出文本;模型本身不直接支持音频、视频输入。
长上下文提供了容纳大量材料的空间,但“装得下”不等于“每处细节都能准确使用”。处理长文档和大型代码库时,仍需检查它有没有遗漏关键要求。
OpenAI公布的成绩中,Astra在Terminal-Bench 4.0上达到57.9%,高于GPT‑5.6 Sol的37.3%;在FrontierMath Tier 4(v2)数学测试中达到97.6%。
这些成绩显示,Astra在部分任务上取得了明显进展,但不能据此认定它在所有指标上领先。官方列出的Artificial Analysis Intelligence Index v4.1.1成绩中,Astra仍低于Claude Fable 5.1。
OpenAI也注明,评测采用不同推理强度下的最高成绩,研究环境与实际产品的配置可能存在差异。
对开发团队来说,比榜单位置更实用的判断标准是:放进自己的代码库后,修改是否准确、验证是否充分、最终是否真的减少了返工。
与产品公告同时发布的安全说明,披露了一个不能略过的变化:Astra成为OpenAI首个在其风险框架下达到网络安全能力“Critical”等级的模型。
这是OpenAI自己的能力分级,不是第三方安全认证。公司表示,在具备合适工具和访问条件时,模型能够发现未知漏洞并开发利用方法,因此加强了部署防护。
与此同时,OpenAI承认,Astra的推理过程比GPT‑5.6 Sol更难监测。在刻意诱导模型规避监测的对抗测试中,它有时能够避开内部监测机制。
这不等于模型在日常使用中会主动实施破坏。官方报告同时指出,Astra整体上更少违反安全限制,但可监测性下降仍是需要解决的问题。
对拥有文件、账号和系统操作权限的AI来说,能完成多少工作与能否守住授权边界,同样重要。
Astra的API标准基础价格为每百万输入Token 10美元、输出Token 50美元,均为GPT‑5.6 Sol对应基础价格的2.5倍。超长输入、缓存及工具调用等另有计费规则。
OpenAI称,在部分评测中,Astra通过减少输出Token,降低了单项任务的估算API成本。但这是特定测试结果,不能直接推导出所有用户使用它都会更便宜。
是否值得升级,需要把调用费用、执行时间和人工审核放在一起计算。单价更高的模型,如果能明显减少重试,可能值得使用;简单任务若没有相应收益,也未必需要更换。
Astra已经交出一份更强的能力成绩单。接下来要验证的是,这些提升进入真实工作后,能否变成更少的错误、更少的人工接管,以及一份真正可用的结果。
免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。