当地时间9月6日,英伟达创始人兼CEO黄仁勋在社交平台X上祝贺OpenAI发布GPT-6 Astra。他在帖子中回顾了从ChatGPT到o1、再到Astra的四年演进,随后直接写道:
AGI has arrived.
这句话迅速引发讨论。但它并不意味着行业已经就AGI达成共识。
图片来源:X平台
除了宣布“AGI已经到来”,黄仁勋还在帖子中提到了训练Astra所使用的算力。
他称,GPT-6 Astra的训练使用了超过10万块英伟达Grace Blackwell GPU,并以NVLink72架构组成计算集群;下一阶段还将有40万块GPU上线。
黄仁勋并非第一次表达类似观点。
在英伟达8月26日举行的财报电话会议上,他曾表示,对于很多任务而言,可以认为行业已经实现了AGI。但紧接着,他又说,围绕AGI划定里程碑的讨论已经没有太大意义。
黄仁勋真正关心的是三个问题:AI能不能完成有用的工作,能不能创造可以量化的经济价值,以及更多算力能不能带来更多有效产出。
这是一套偏向任务能力和商业价值的AGI标准。
按照这套标准,如果AI已经能够编写软件、操作电脑、调用工具、处理专业文件,并在较少人工干预的情况下完成较长的工作流程,那么它确实已经具备一部分过去只存在于AGI设想中的能力。
OpenAI官方开发者文档将GPT-6 Astra描述为公司目前能力最强的模型,可用于复杂推理、代码开发、计算机操作、研究和文档制作,并能跨代码、浏览器和专业软件执行多步骤任务。
不过,OpenAI目前的官方模型页面并没有直接将Astra标注为AGI,而是称其为“能力最强的模型”。
“能力最强”与“实现AGI”,显然不是同一个结论。
围绕Astra是否达到AGI,ARC Prize公布的结果很有代表性。
在ARC-AGI-3测试中,Astra使用OpenAI提供的专用适配环境时,最高得分达到99.95%;在所有模型使用相同基础接口的标准环境中,其最高得分为62.71%。
简化来看,就是同一个模型可以得到62.7%和99.9%两种差异明显的成绩。
造成差距的关键不是模型权重发生了变化,而是外围运行环境不同。
在OpenAI的适配环境中,系统可以保留模型的推理状态,并通过上下文压缩帮助模型延续此前的信息。标准环境则给不同厂商的模型提供统一、相对基础的接口,让模型自己决定保留哪些记录。
这说明,今天评测的往往不再是一个孤立模型,而是模型、工具、记忆机制和运行框架组成的完整系统。
从产品角度看,这种完整系统更接近用户实际使用的AI。但从模型比较角度看,如果不同系统获得的工具和上下文管理条件不同,成绩就不能直接放在一起比较。
ARC Prize在官方分析中明确表示,Astra是通用能力上的重要进步,但该机构没有据此宣称AGI已经实现。
原因也很清楚:ARC-AGI-3仍然是一个范围有限、规则确定的测试环境,无法代表现实世界的全部复杂性。
行业争议的根源,并不只是大家对Astra能力的评价不同,更在于各方对AGI的定义本来就不一致。
有人认为,只要AI能够在大量知识工作中达到或超过普通人,并且创造稳定的经济价值,就可以视为AGI。
另一种标准则更加严格:AI需要像人一样跨领域学习,能够在没有明确规则的环境中形成目标、理解因果关系,并持续从真实世界的经验中学习。
还有观点认为,AGI不应只是某个模型的能力,而应该包括模型、工具、记忆、感知和行动系统共同构成的整体能力。
按照第一种定义,黄仁勋的说法并非毫无依据。按照后两种定义,目前的模型仍有不少能力缺口。
例如,模型在不同任务上的稳定性并不一致;面对不完整信息和开放环境时,仍可能出现判断错误;长时间执行任务通常还需要人工检查;模型也没有表现出与人类完全相同的持续学习能力。
这使得“AGI是否已经到来”很难变成一个简单的判断题。
黄仁勋的帖子还有一个值得注意的地方。
他在宣布AGI到来的同时,特意提到了训练Astra所使用的10万多块GPU,以及下一阶段计划上线的40万块GPU。
这意味着,他讨论的不只是智能水平,也在讨论实现这种智能需要多少基础设施。
英伟达是全球AI算力扩张最直接的受益者之一。模型训练规模越大,推理任务越多,对GPU、网络、存储和数据中心的需求也就越高。
在英伟达财报电话会议上,黄仁勋曾把AI能够完成生产性工作和创造可盈利的计算需求,视为行业当前最重要的变化。他还表示,如果市场拥有更多算力,就可以生成更多具有经济价值的AI任务。英伟达财报电话会议记录
因此,“AGI已经到来”和“更多GPU即将上线”出现在同一条帖子里,并非偶然。
这不代表黄仁勋的判断一定错误,但读者需要把他的商业位置考虑在内:他既是AI行业的重要参与者,也是算力扩张的直接受益者。
对于普通用户和企业来说,模型是否被称为AGI,短期内并不会直接改变使用方式。
真正影响使用价值的,是一些更加具体的问题:
模型能否完成一项复杂工作?结果是否稳定?出现错误时能否及时发现?操作过程能否追踪?完成任务所需的成本和人工检查时间是多少?
如果这些问题还没有稳定答案,那么“AGI已经到来”更适合被视为一种产业判断,而不是一项可以直接验收的技术结论。
Astra在代码、计算机操作、研究和复杂任务执行方面的进步是真实的。ARC Prize的测试也显示,它已经能够在陌生环境中识别规则、规划行动,并借助工具完成复杂任务。
但现实世界比基准测试更开放。
模型需要面对模糊目标、不完整信息、不断变化的环境,以及错误可能造成的真实损失。一次测试接近满分,无法覆盖所有这些问题。
黄仁勋确实说了“AGI已经到来”,这条新闻本身没有问题。
需要纠正的是,不能把这句话写成行业已经确认GPT-6 Astra实现了AGI。
更准确的说法是:黄仁勋认为,以完成实际工作和创造经济价值为标准,当前AI已经可以被视为进入AGI阶段;但在研究界和评测机构看来,现有证据仍不足以证明通用人工智能已经实现。
模型能力正在快速逼近过去设想中的AGI,这一点越来越明显。可“AGI”究竟是一种模型能力、一套完整系统,还是一个需要在开放世界中长期验证的智能标准,行业仍没有共同答案。
黄仁勋给出了自己的答案。
争论才刚刚开始。
免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。