OpenAI发布GPT-6 Astra 测试近满分引发AGI热议

据 ai987.cn 于 2026 年 9 月 8 日收到的消息 ‣ OpenAI 于 9 月 3 日正式发布 GPT-6 Astra。据 Axios 报道,OpenAI 总裁 Greg Brockman 在媒体简报会上宣告“欢迎来到 AGI 时代”。英伟达创始人黄仁勋随即在社交平台 X 上祝贺并表示“AGI 已经到来”。此前,马斯克在讨论 Astra 内部版本科研能力时也曾感叹“欢迎来到奇点”。负责 ARC 系列评测的 ARC Prize 机构亦给出高度评价,认为 Astra 表现出前沿模型能力的明显跃升。

OpenAI发布GPT-6 Astra 测试近满分引发AGI热议 - Image 1

此次引发广泛关注的核心,在于 Astra 在 ARC-AGI-3 测试中取得的成绩。该测试类似一组没有说明书的陌生小游戏,要求系统自主试错、摸清规则并完成目标,重点考察“碰到新东西能不能自己学会”的能力。在支持保留内部推理状态的厂商适配环境下,Astra 取得了 99.9% 的接近满分成绩;而在仅允许保留笔记的标准运行环境中,其最佳成绩为 62.7%。这一差异表明,评价 AI 能力需将模型与运行方式结合考量。

关于 AGI(通用人工智能)的定义,业界目前有多种视角。OpenAI 侧重工作能力,定义为在大多数有经济价值的工作上超越人类;Google DeepMind 强调能力的广度与深度;ARC 提出者 François Chollet 则关注学习效率,即面对新问题所需经验的多寡。Astra 的突出表现主要回应了后者,展示了更强的“现场学习”能力。

然而,ARC Prize 明确指出,刷满测试不等于实现 AGI。测试环境规则与目标相对封闭,而现实任务往往涉及冲突约束、模糊目标及长周期记忆。能否在复杂多变的实际工作中持续减少人工介入并交付可靠结果,仍需进一步验证。

观察人士认为,Astra 让“在陌生环境里学着办事”有了更强的证据支撑,足以解释业界的高度评价。但按广泛工作能力尺度看,目前证据尚不足以确认其已实现 AGI。建议实际应用者通过具体任务测试,记录错误率、介入次数及时间成本,以更扎实地判断通用人工智能的到来程度。

综合自 Axios 及微信公众号 @算力时代 等网络信息


吉ICP备2020006555号

ai987.cn

⌜ 免 责 声 明 ⌝
本站仅为个人学习AI(人工智能)知识的相关日志,网页内容(如有图片或视频亦包括在内)短期缓存均无商业目的。
遇有侵害您合法权益之处欲申诉删改,可联络处理(删/改)!