跳到主内容
@wquguru
精选92上海证券报模型发布/更新多源精选 ×5

OpenAI发布GPT-6 Astra,黄仁勋称AGI已来

OpenAI重磅发布,黄仁勋:AGI已来

原文
发到 X
推荐理由

GPT-6 Astra作为全新旗舰模型发布,且伴随黄仁勋与布罗克曼关于AGI落地的重磅表态,直接重塑行业对通用人工智能的认知边界,值得所有从业者关注。

AGI的争论尚未平息,OpenAI最新旗舰大模型GPT-6 Astra已在全新3D空间推理基准测试中再下一城。

北京时间9月4日凌晨,OpenAI正式发布全新大模型GPT-6 Astra并迅速引发全球科技圈关注。

值得一提的是,英伟达CEO黄仁勋此后更是公开发声,认定OpenAI已成为全球首个实现AGI的团队。这一论断也迅速引发行业关于“AGI究竟如何定义”的深层讨论。

空间推理登顶MazeBench

伴随新模型的发布,GPT-6 Astra迎来了密集测评。北京时间9月8日,最新3D空间推理基准MazeBench公布评测结果。

结果显示,GPT-6 Astra经过60多个小时的运算,在满分100分的测试中拿下14分,成为首个在该项测试中取得两位数得分的AI模型,超越此前所有智能体。

相比之下,上一代旗舰GPT-5.6 Sol在开启Python辅助的情况下仅获13分,Claude Fable 5为11%,Gemini Opus 5为9%。而在不借助Python的条件下,此前所有模型得分均不足1%,Astra直接提升至14%。

公开资料显示,MazeBench是由Jonathan Pappas和David Pappas于2026年7月底推出的3D空间推理测试环境,包含200多个房间、100颗宝石及大量推箱子式谜题。模型需要面对电梯砖、可开关墙体、冰面滑行等多重机制,且只有11个可用动作(4个移动、4个视角旋转,外加撤销、重置和传送),每道题往往需要规划100步以上。

值得一提的是,考虑到如今市场对Token应用效率日益关注,评测团队还要求模型采用“批量出招”模式以减少Token消耗。Astra将原本预估的30亿Token压缩至3.5亿,同时每次能前瞻10至20步。

不过,此次评测也暴露出Astra在3D空间理解上的局限性。它更倾向于使用俯视视角观察关卡,导致部分仅在3D视角下可见的墙体被误判为“空气墙”。

尽管存在短板,Astra在实际应用场景中展现出的三维空间构建能力已令开发者惊叹。有开发者仅凭一段4分钟的视频,让Astra通过计算机使用功能自主操作Fusion 360完成全参数化建模,设计出严丝合缝的地漏清理部件,并直接导入3D打印。

“AGI已来”还是“赛道切换”

值得注意的是,就在GPT-6 Astra发布后,英伟达CEO黄仁勋公开表示,OpenAI已成为全球首个实现AGI的团队,这一表态令资本市场高度关注。

OpenAI总裁格雷格·布罗克曼在9月4日的发布会上亦直言:“欢迎来到AGI时代”,并称个人认为公司“可能已经到达AGI了”。

所谓AGI,即通用人工智能,在此前的认知中,它通常被定义为:在所有经济价值任务上达到或超越人类水平。而在此前一系列围绕大模型的测试中,空间认知能力已然成为大模型“最后需要攀登的高峰”。

不过,若以此标准审视,Astra在MazeBench等空间推理任务中虽然取得突破,但与人类的空间认知和操作能力相比仍有差距。而这一差距,也引发学术界对现行AGI评测体系有效性的审视。

在此次测评结果发布后,有业内人士就指出,AGI不应被理解为“在所有维度同时超越人类”的静态终点,而更应视作智能体具备跨领域迁移和自主进化的能力阈值。

记者注意到,布罗克曼在发布会后曾进一步阐释其对AGI的理解:“未来回望时,人们或许会把GPT-6 Astra视为AGI时代开启的标志性模型。但真正重要的是,AI已经能够自我加速——它写代码、训练下一代模型,甚至以研究实习生身份入职。”

有意思的是,据相关媒体报道,OpenAI下一代模型“Bel”及Anthropic神秘“Model 2”已在酝酿中。不少业内人士指出,围绕对于AGI时刻的定义,眼下行业头部厂商的竞争正从“谁先抵达AGI”向“谁能让智能实现自我递归进化”切换。

作者:罗茂林

作者: 上海证券报

查看原文 →

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →