跳到主内容
精选80华尔街见闻(RSS)产品发布/更新多源精选 ×2

OpenAI高管:ChatGPT与Codex将融合为个人AGI,推理提速60%

OpenAI高管预判:Codex与ChatGPT终将“消失”,未来将只留一个“个人AGI”

原文
推荐理由

做Agent和关注OpenAI产品战略的同学必看,高管亲述产品融合终局与推理提速数据,信息密度高,值得收藏。

OpenAI正在推动一场深层次的产品整合——不只是把两款应用合二为一,而是要让"ChatGPT"与"Codex"这两个概念本身彻底消失,最终收敛为一个长期理解用户、自主完成任务的个人通用智能(Personal AGI)。

OpenAI Codex负责人Tibo Sottiaux近日接受科技博主Matthew Berman专访时明确表示,Codex已深度并入ChatGPT产品体系,原本面向开发者的编程能力正逐步向全体用户开放。但他强调,这只是第一步。Tibo 描绘的终局极为震撼:未来,所有复杂的底层架构都将被彻底隐藏。最终只剩下一个极其极简、深度理解你、并能瞬间调动海量云端算力的“个人通用智能”(Personal AGI)。

访谈中,Tibo还披露了一系列具有市场参考价值的数据与判断:Codex用户量已达约2000万;OpenAI普通推理速度在过去三个月提升约60%;Ultra Fast极速模式目前最高可实现14倍生成加速,Tibo预测1至2年内这一速度将接近行业默认水准;此外,OpenAI已通过强大模型优化底层推理架构,令旗下Luna模型运行成本下降约80%,Tibo将这一过程明确定性为递归自我改进(Recursive Self-Improvement)的早期形态。

以下为访谈核心观点:

Codex 已经并入 ChatGPT,但这只是第一步。 OpenAI 的终极目标,是让 “ChatGPT” 和 “Codex” 等产品边界继续淡化,最后演变为一个长期理解你的个人通用智能(Personal AGI)。

下一代模型将颠覆现有的智能体系统(Agent Harness)。 今天大家费时费力去手动维护技能(Skills)、记忆(Memory)、子智能体(Sub-agent),在 OpenAI 看来都还属于非常早期的笨拙形态。

笔记本电脑(Laptop)很快会成为 AI 能力的物理瓶颈。 未来模型可能同时并发处理 100 个应用,大量高负载任务必然全面转向云端智能体(Cloud Agent)。

Ultra Fast(极速模式)在 1~2 年后可能接近默认体验。 在不计算极速模式的前提下,OpenAI 的普通推理速度在过去三个月内也已经提升了约 60%。

模型已经开始反向优化自身的推理基础设施。 Tibo 明确表示,利用强大模型来重写底层系统和 CUDA 内核,已经是递归自我改进(Recursive Self-Improvement)的早期形态。

Codex 用户量已达 2000 万。 程序员只是第一批尝鲜者,未来“写代码”将成为所有知识工作者(产品、设计、销售)都能无感调用的底层能力。

边界消解,走向单一AI

Tibo在访谈中首先厘清了一个普遍的误解——Codex与ChatGPT的整合并非未来规划,而是已经发生的现实。

他将这一融合的必然性归结于模型能力本身的演进逻辑:未来的模型天然具备编程、搜索、调研、工具调用、语音与视觉理解等能力,这些功能最终将构建在同一套智能体框架(Agent Harness)之上。在此背景下,人为区分"程序员用Codex"与"普通用户用ChatGPT"将失去意义。

Tibo描述的终局是一个Personal AGI:程序员、设计师、产品经理、销售人员乃至完全不懂编程的普通用户,调用的是同一套底层AI。系统根据用户身份、所连接的工作工具及权限,自动呈现差异化的交互界面——程序员看到的是深度定制的开发环境,销售看到的是邮件与客户数据仪表盘,普通用户看到的依然是简洁的对话框。

他的表述清晰指向OpenAI的产品战略取向:不是构建多个垂直AI应用,而是打造一个AI,让它根据用户是谁自动适配。

Agent架构重构:复杂性下沉,界面趋简

Tibo对下一代智能体系统的判断是此次访谈中信息密度最高的部分之一。

他指出,当前许多高级Codex用户手动维护技能配置文件(Skills)、记忆上下文(Memory)与子智能体(Sub-agent)编排网络,在OpenAI看来仍属极早期的过渡形态。技能文件日积月累难以维护,记忆频繁丢失上下文,多个Sub-agent协同工作时的调度问题更容易打断用户体验。

Tibo的核心判断是:模型能力越强,用户就越不应该直接介入管理Agent本身。理想的Agent应长期、深度理解用户——知晓其目标、日常工作流、个人习惯乃至团队进度,并自主决定调用何种技能、保留何种关键信息、是否在后台启动其他Agent。

这一演进方向的本质是:底层架构可以极度复杂,但暴露给用户的界面必须持续趋简。

算力瓶颈:笔记本将让位于云端集群

Tibo提出了一个反直觉的判断:未来制约Agent能力发挥的瓶颈,将是用户手边的个人电脑。

他的论据是,现有PC的硬件设计完全以人类工作速度为基准——人一次只能操作有限数量的窗口与应用,处理速度存在明显的生理上限。但模型不受这些限制约束。他举例称,未来一个云端模型可能同时并发处理100个应用,在同一时间内探索多套解决方案、编写测试用例、编译代码、验证假设,并并行调度多个子Agent工作。

在这一并发量级下,即便是顶配MacBook也无法承载对应的工作负载。Tibo因此明确表示,云端智能体(Cloud Agent)将成为主流范式:用户终端只是轻量交互入口,真正执行任务的是背后的云端计算集群。这意味着Agent的终局不是"本地更强的软件",而是"云端随时待命的算力团队"。

速度跃迁:Ultra Fast或成两年内行业基准

在推理速度方面,Tibo给出了一个颇为激进的预测。

Ultra Fast模式目前最高可实现约14倍的生成速度提升。Tibo预计,大约1至2年内,这一速度将逐渐接近行业默认体验。他同时补充了重要的适用边界:对于纯代码或文本生成任务,加速效果显著;若工作流中包含大量外部工具调用(Tool calls)及网络I/O操作,受制于网络与架构延迟,实际感知加速比约为3至4倍。

更值得关注的是速度提升背后的驱动因素。Tibo表示,OpenAI的提速并非单纯依赖堆叠GPU,模型本身的效率也在持续优化。Sol模型相比此前的Terra模型效率已大幅提升,下一代模型将在Token利用效率上进一步跃升。即便不开启Ultra Fast,OpenAI普通基准推理速度在过去约三个月内也已提升约60%。

工作范式变革:速度平权带来协作升级

Tibo指出,当AI响应速度趋近甚至超越人类思考与表达速度,人机关系将发生质变。

他观察到,当前许多重度Agent用户的工作模式是同时开启10至15个Agent窗口,将任务依次投入后轮流巡查进度,实际上成了疲于奔命的"AI项目经理"。这一模式的核心问题在于频繁的注意力切换。

Tibo表示,OpenAI目前高度重视对用户注意力的保护与管理。他描述了Ultra Fast与语音交互叠加后的理想场景:用户随口说出构思,AI瞬间生成原型;用户扫一眼后以语音指令调整,AI毫秒级完成修改;全程保持心流(In the flow)状态,无需任何上下文切换。一旦AI速度与人类思考速度对齐,人机协作将从单向的"派发任务"升级为真正的实时协同。

递归自我改进:已在底层代码中悄然发生

访谈中最具技术深度的讨论,指向了AI系统的自我优化能力。

Tibo透露,OpenAI已在利用先进模型分析和优化现有模型的服务架构。他具体提到,Sol模型参与优化Luna模型的推理架构后,Luna的运行成本下降了约80%。模型正深度参与重写CUDA内核、优化推理栈、重新设计系统架构等底层基建工作。

当主持人追问这是否构成"递归自我改进"(Recursive Self-Improvement)时,Tibo的回答是肯定的——"算,这就是早期形态"。

他同时校正了外界对这一概念的常见误判:公众惯常想象的递归自我改进是某一代模型突然自主写出下一代,但现实演进更为务实。模型变强后先协助工程师优化底层运行系统;系统因此提速降本;算力成本下降后模型能够承担更海量的工作,进而继续优化更复杂的架构。Tibo将其概括为"一个完整的闭环大系统"。

这意味着,外界长期等待的"AI开始自主迭代"时间节点,可能永远不会以戏剧化的方式出现——它已经在枯燥的底层架构优化中持续发生。

2000万用户背后:编程将成底层通用能力

Tibo在访谈中披露,Codex用户量已达约2000万,与ChatGPT的深度融合是近期增长提速的主要驱动力之一。

这一数据背后指向一个结构性趋势:Codex的编程能力并入ChatGPT后,产品经理、设计师、财务与市场人员均可在无感知的状态下调用。以数据分析为例,用户请求ChatGPT处理5000条数据记录,系统在后台可能自动生成并运行Python脚本,最终将图表结果呈现给用户,全程无需用户具备任何编程知识。

Tibo的判断是,代码在未来将成为AI操作数字世界的底层机器语言。所谓"Coding Agent",最终服务的远不止编程场景本身。程序员只是这套底层能力革命最早的体验群体。

以下为访谈原文:

Tibo:

只要我想,只要我觉得时机合适,我随时都可以按下那个(额度重置)按钮。我其实不太去盯竞品在做什么,我更看重的是:我们能把什么做得独一无二?我们的价值观是什么?以及我们如何最大限度地全速朝那个方向推进?也许再过一两年,这种极速推理速度即便不能成为行业默认标准,也会非常接近默认状态。你看 Luna 模型的成本对吧?简直惊人地便宜。技术总有办法随着时间推移变得极其高效。我们非常专注于让尽可能多的人能够使用它,并直接优化用户从中获得的实际效用。

Matthew Berman:

我听说你们现在真的做出了一个实体的物理重置按钮?

Tibo:

是的,确实有。等会儿我拿给你看,真的非常酷。

Matthew Berman:Tibo,

非常感谢你能来做客。

Tibo:

不客气,很高兴来到这里。

Matthew Berman:

能和你交流我感到非常兴奋。我想先从你在 Google 的那段经历聊起。你之前在 DeepMind 团队,在 ChatGPT 问世之前,Google 内部其实做过一个叫“LM Chat”的东西。你曾发推特说,Google 当时因为太过顾虑而不敢发布它,DeepMind 也被限制发布可能颠覆 Google 现有业务的产品。我对这件事思考了很多。在那个远远早于 ChatGPT 改变世界的时期,你在研发这些产品时心里是怎么想的?

Tibo:

是的,那是一段非常令人兴奋的时光。DeepMind 是一个极富创造力的地方。我当时主要专注于加速前沿研究所需的基础设施与产品架构。那时团队内部显然有一个小组在攻坚大语言模型并探索模型规模的扩展。当他们取得了相当出色的成果后,大家很自然就会去想:“嘿,能不能把它做成一个可以与之对话、并能用于各种任务的工具?”于是,类似“LM Chat”这样的想法便顺理成章地诞生了。它最初只是内部原型,但随后大家产生了将其打造成面向公众开放工具的雄心。

Matthew Berman:

那是哪一年?

Tibo:

大概是在 ChatGPT 发布的整整一年前左右。

Matthew Berman:

明白了。

Tibo:

不过当时我们还在做很多其他项目,这里就不展开说了。那里确实非常有创造力,但 DeepMind 本身的设计初衷并不是为了去发布消费级产品的。而从这个角度来说,OpenAI 是一个截然不同的地方。在 OpenAI,研究团队与产品团队的合作极其紧密。我们一起构思方案,协同设计许多东西。我们有着极强的“发布偏好”,而且非常渴望将产品推向公众使用,这一点我非常喜欢。这也是吸引我来到这里的原因——使命感、优秀的伙伴、极高的人才密度,OpenAI 真的有很多非常棒的特质。

Matthew Berman:

你在参与 LM Chat 项目时,就意识到它非常特别,或者将来会成为极其非凡的存在了吗?

Tibo:

确实感觉非常特别。因为那算是你第一次意识到大模型能够输出连贯、有逻辑且真正有用的文本。最开始它可能搞笑成分多于实用价值,但渐渐地,它变得越来越有用。

Matthew Berman:

你说你经常会反思那段经历,我很理解。我认为在很多层面上,Google 是自己绊倒了自己。你在那里学到了哪些经验教训,并带到了 OpenAI?

Tibo:

是的,正因如此我常思考这些。我会从团队文化以及 OpenAI 自身文化的角度去审视:哪些优秀的特质需要保留,哪些错误绝不能犯。OpenAI 拥有一种非常自下而上、充分赋权的文化。大家可以自由提出各种创意,聚在一起迅速把产品发布出去。在推动新产品想法时,几乎没有任何“阻碍能量”(官僚阻力),这种氛围既让人振奋又充满乐趣,一切的核心都是为了对世界产生积极影响。因此,保持这种文化对我来说至关重要。另一方面同样重要的是避免把产品搞得一团糟。你肯定不希望产品变成一个没有整体方向感和一致性的功能大杂烩。所以我们用追求极致的“极简”以及对产品品质的自豪感来与之平衡。我认为 ChatGPT 的 iOS 应用是市面上体验最好的 App 之一,我们希望保持这一点。我们在令人愉悦的体验、卓越性能、高效率和极简设计上投入了巨大精力。在坚守这些核心原则的同时,依然鼓励每个人勇于尝试新事物并迅速推向市场。

Matthew Berman:

如果要给初创企业创始人提建议,指导他们如何建立这种文化,OpenAI 内部有哪些具体、可落地的做法或机制可以供他们参考?

Tibo:

首先是要拥有坚定的信念;其次是想尽办法尽早获得真实用户,并根据用户反馈进行极其敏捷的迭代;最后则是必须具备“敢于自我颠覆”的意愿。这一点对早期初创公司可能感受不深,但对于像 OpenAI 这样规模的公司至关重要。我们不断涌现出新的研究成果和创意,能够准确判断何时是重金投入的最佳时机——哪怕这意味着必须从当前的核心主力业务中抽调资源——这虽然极其困难,但却至关重要。

Matthew Berman:

没错,这正是你刚才描述 Google 时提到的问题,他们当时就无法做到自我颠覆。

Tibo:

平心而论,Google 内部有他们自己的规划,一切都属于某个宏大战略的一部分。但对我个人而言,那并不是适合做这件事的地方。

Matthew Berman:

在 OpenAI 或任何一家逐渐走向成熟的公司,要维持这种快速发布产品和勇于自我颠覆的文化,是不是会变得越来越难?特别是当你手里已经有了一只疯狂盈利的“现金牛”业务,而旁边又出现了一个可能极具创新颠覆性的新事物时?

Tibo:

我们是一家极其前瞻性的公司。AI 的未来形态以及人类将如何从中受益,根本不会停下来等待你在接下来一个月或三个月内所守住的既得成果。所以必须全力以赴,保持清醒敏锐的眼光审视未来的技术走向,并找准自己的定位以精准顺应浪潮。即便是对 OpenAI 自身而言,也是在训练出模型后才逐步挖掘出其真正能力的——标准基准测试无法说明一切,我们必须亲自深度体验和测试模型,才会恍然大悟:“原来我们还可以通过这种独特的方式来发挥它的价值”,或者“哇,它居然能做到这个!”这时你对产品的理解就会发生质的飞跃。例如,我们刚刚推出的新版高级语音模式,与之对话体验极其愉悦、非常自然,而且它现在还具备了直接调用工具的能力。

Matthew Berman:

是的。

Tibo:

这彻底改变了使用方式。我现在花大量时间直接跟它说话。另一项我每天都在用的功能是语音听写,因为听写质量实在太高了,效率远超手动输入提示词。每天早上我坐在那里拿着手机直接口述:“噼里啪啦……给 ChatGPT 交代几件今天要处理的事情”,然后它直接调用我的各种工具去执行。

Matthew Berman:

确实。

Tibo:

在拥有高水平语音模型之前,这一切都是不可想象的。这会彻底颠覆你对产品形态的固有认知。

Matthew Berman:

我们继续聊聊新模型与新的运行框架(Harness)。几周前你在推特上发了一条非常轰动的推文:“Codex 在两到三个月内就会显得很原始,我们即将经历下一场重大演进,下一代模型需要的算力与环境远超你的笔记本电脑所能承载的极限。”我们先从 Harness 谈起,随着模型能力变强,运行框架还有哪些领域充满创新的空间?

Tibo:

实在太多了。除了刚才提到的语音交互,如果你是 Codex 或其他代码智能体的高级用户,你会发现自己其实已经对现阶段的一些笨拙之处习以为常了。比如,你必须手动维护技能规则文件来教导它,但很多人已经意识到这在长期维护中非常繁琐;记忆系统虽有雏形,但并不能完全记住上下文;如果你构建了子智能体协作网络,你还得去操心子智能体的调度,这在交互中常常会打破那种“流畅伙伴”的沉浸感。而用户真正想要的,是一个能够深刻理解你、理解你的目标与日常习惯、甚至了解你团队最新进展的伙伴;它不仅能被动响应,还能主动提出建议,在日常中辅助你,且永远不会破坏那种如同“完美专属搭档”般的沉浸感,这就是我们正在努力的方向。另外,当你拥有极其强大的模型时,你会发现笔记本电脑本身变成了一个物理瓶颈。笔记本电脑是专为人类设计的,它的设计初衷是为了适配人类的打字速度、思维节奏以及同时开启的应用窗口数量——这些都是人类生理能力的局限。但模型没有这些限制,未来模型完全可以游刃有余地并发处理上百个打开的应用程序。因此在资源调度方面,未来的模型必然需要获取远超笔记本电脑硬件能力的云端计算环境。

Matthew Berman:

我猜你指的是云端智能体。当我们拥有像“极速模式”这样将 Token 生成速率提升 10 到 14 倍的技术时,系统瓶颈就转移了——CPU、工具调用、网络输入输出等整个技术栈中的开销变成了新的制约瓶颈。

Tibo:

但你可以通过全并发执行多项任务来进行补偿。你可以让模型在探索解决方案的同时,并行编写测试用例、编译代码以及验证新假设,所有事情一并进行。这样你就转移了瓶颈,通过高度并发赋予系统更强的处理能力,而模型则可以在极短时间内高效完成深度推理。

Matthew Berman:

在以往的推理速度下,我常常不得不并行启动 10 到 15 个智能体,而不断切换上下文会带来巨大的认知负荷,因为发出指令后往往需要等上 30 到 45 分钟才能拿到结果。有了极速推理后,这种工作流发生了剧烈变化,我不再需要同时开 10 到 15 个,而是精简到 3 到 4 个。你如何看待独立开发者工作流的演进?

Tibo:

保护并友好地管理开发者的注意力,是我们非常重视的事。归根结底,我们的目标是为人赋能,这要求系统必须围绕人类的多任务处理习惯和注意力管理来构建——比如判断某件事是该立刻向你汇报,还是 30 分钟后再提醒更合适。当极速生成与语音输入相结合时,AI 的响应速度甚至超过了你的思维节奏。你能够始终保持在专注心流中,实时构思方案、查看原型演练、生成即时报告,这种体验非常顺畅。你立刻就会意识到,过去那种在 10 个智能体之间来回切换的疲劳状态,你再也不想倒退回去了。

Matthew Berman:

是的。

Tibo:

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近