AI Agent时代云基础设施:Agent Runtime完整飞轮解析
AI Agent时代的云基础设施是怎样的?你需要理解“Agent Runtime完整飞轮”
本文是AI基础设施领域里程碑级的深度分析,系统梳理了Agent Runtime架构的五大核心技术要求和商业价值飞轮,对关注AI投资、云计算和SaaS赛道的从业者极具参考价值。建议研读原文,重点关注模型路由、成本控制与可观测性等关键环节。
在智能体(Agent)从实验室走向大规模商业落地的历史拐点上,AI云基础设施正经历一场从“无状态模型托管”向“智能体运行期(Agent Runtime)”的底层架构重塑,这不仅是技术的演进,更是决定企业AI应用单位经济学(Unit Economics)生死的关键战役。
在近期举办的Nebius Inflection 2026峰会上,一场关于AI基础设施真正走向商业化深水区的讨论引发了市场的强烈关注。Nebius联合创始人Roman Chernin提出了一个让全场技术人员与企业CIO产生共鸣的核心观点:“当智能体走向大规模生产时,传统的、无状态的模型服务架构将彻底崩溃,行业必须全面转向‘智能体运行期’基础设施。”
“客户希望智能体完成任务的成本,能让产品在经济上可行。”Roman Chernin 直言,“Token将成为下一个基础设施层,未来的付费模式将基于结果(Outcomes),而不是Token。”
当前,市场对AI的关注点已从单纯的“模型参数战”转向了真实的ROI(投资回报率)和云端算力消耗的经济账。正如Nebius CEO Arkady Volozh在会上透露,公司正朝着年底实现 800兆瓦至1吉瓦的运行电力迈进,并已锁定总计4吉瓦的算力容量,这意味着数十万乃至数百万张GPU的惊人规模。然而,支撑这种百亿美元级别扩产逻辑的核心,不再是卖基础算力,而是为企业解决“Token乱烧却不出活”的痛点。
规模化下的“恐怖放大器”:无状态推理为何失效?
在第一波AI浪潮中,市场的核心商业模式是“售卖Token”。开发模式极为线性:用户输入 →→ 经过API调用模型 →→ 模型返回Token →→ 结束。这是一种“无状态”的单次请求。
但Agent的行为逻辑完全不同。Roman Chernin指出:
“Agent不仅仅是一次优化的模型调用,它是一个循环(Loop)。它需要规划、调用工具和模型、观察结果、重试,直到任务完成。”
在资本市场眼中,这种循环一旦失去控制,就是一场财务灾难。Roman 一针见血地指出了规模化下的恐怖放大器效应:
“如今,构建一个智能体原型很容易……但在规模化下,小小的错误会累积。表面看起来很美好的95%单次调用成功率,换算下来就是彻底的失败。一个糟糕的规划可能消耗十倍于我们预算的 Token。”
从微观概率来看:如果一个模型单次 API 调用的成功率是 95%,但当一个 Agent 为了完成某项复杂任务,需要在 Loop 中连续调用该模型及各类工具 15 次时,该 Agent 任务的终极成功率将暴跌至:(0.95)15≈46.3%。
这意味着超过一半的概率,Agent会在中间某个环节“死锁”或彻底跑偏(Over-scoping)。“一个糟糕的计划可能会烧掉比我们预算多10倍的Token。”Roman警告道。
Chernin在峰会上提出了一个被他称为"下一个循环"的概念,这也是整个Agent Runtime体系中最具商业想象空间的部分:
"每个智能体在运行时,都会产生大量数据——规划、追踪、成本和结果。当我们捕获了所有这些数据,我们就可以开始系统性地、持续地改进智能体。就像今天我们优化推理端点一样,我们可以优化路由,改进提示词和工具调用,降低成本。"
这意味着云平台的角色发生了本质转变:
"云平台变成了不仅仅是智能体运行的地方,它变成了让智能体可度量且持续变得更好的系统。"
Chernin指出了另一个常被忽视的结构性变化:
"云平台是为人类用户构建的——开发者阅读文档,在控制台点击,手动部署和调试服务。智能体需要不同的云接口——API优先、可编程且可观测。"
CEO Arkady Volozh在随后的演讲中补充了规模数据:Nebius目前运营超过200兆瓦算力,年底目标达到800兆瓦至1吉瓦,已签约预留容量超过3吉瓦,年底目标突破4吉瓦。
商业落地的硬性指标:Agent Runtime的五大核心技术要求
为了在生产环境中稳定、低成本、安全地运行成百上千个Agent,底层基础设施必须具备以下五大硬性指标:
① 确定性流式编排与多模型路由(Deterministic Orchestration & Routing)
- 市场痛点: 纯靠LLM自主决定下一步调用什么工具,极易导致“幻觉”或死循环。大企业在财务、合规等高风险场景下,要求过程必须可控。
- 技术解法: 平台必须提供能将确定性代码与LLM柔性推理结合的框架,并支持动态模型路由。在Agent循环中,将最关键的决策路由给最聪明、最贵的模型(如GPT-5);而把海量的脏活累活,自动路由给便宜10倍、快10倍的开源模型(如DeepSeek-V4、Nemotron)。Nebius生态战略副总裁Devang Sachdev在演示中提到,仅通过将GPT-5.5替换为开源大模型,成本瞬间下降了95%。
② 长周期状态管理与持久化执行(Durable Execution)
- 市场痛点: Cognition(Devin)的CEO Scott在访谈中提到,Agent的运行时间正在从几分钟拉长到数小时甚至数天。“我们已经看到人们让Devin连续运行几周来完成整个实习生级别的项目。”
- 技术解法: 基础设施必须提供Agent运行期的状态持久化。当遇到网络波动、工具超时或硬件微观故障时,系统需自动捕获上下文,实现“无缝断点续传”,而不是重新从第一步开始燃烧昂贵的Token。
③ 面向机器而非人类的高吞吐数据访问层(Grounding Data Layer)
- 市场痛点: Pinecone创始人Ash Ashutosh在圆桌论坛上披露了一个惊人的拐点:“去年9月,我们有史以来第一次看到一类新的用户,他们发起API调用的数量超过了人类,这就是Agent。” 如果直接把人类阅读的长篇网页丢给Agent,单次任务轻松烧掉几百万Token,单位经济学(Unit Economics)直接破产。
- 技术解法: Tavily创始人Rotem Weiss指出,互联网正走向分化,一层为人类优化,另一层为机器优化。基建需要集成智能体联网检索,返回高度精炼、结构化、带语义上下文的JSON数据,这能将Token消耗暴降,并保证企业内不同Agent认知的一致性。
④ 全Trace异步可观测性(Observability & Tracing)
- 市场痛点: “当100个Agent跑起来时,最先崩溃的是什么?是可见性。你将一无所知,那将是一场混乱(Chaos)。” LangChain的Julia Schottenstein直言。当企业的算力账单翻了5倍,根本不知道在包含数万次调用的“智能体风暴”里,是哪只Agent在哪一步出了错。
- 技术解法: 平台必须标配全链路异步追踪,清晰记录规划、工具调用、Token消耗及失败节点,让复杂的非确定性AI行为像传统软件的Debug日志一样可审计。
⑤ 严苛的安全沙箱与成本兜底(Sandbox & Cost Caps)
- 市场痛点: 一个写错逻辑的Agent企图自我纠错,可能在几分钟内烧光几千美元预算(Shadow AI的爆发)。更危险的是,越权操作可能带来合规灾难。
- 技术解法: 必须在Runtime层设定“硬性成本墙(Cost Caps)”和完全隔离的安全沙箱。Guardrails AI的Shree Rajpal强调,必须通过事前仿真(Simulation)来拦截Agent可能导致的越权、注入攻击或“越狱”。
从“调模型”到“控系统”:极致的ROI飞轮
用Nebius生态策略副总裁Devang Sachdev演示的医疗合规Agent演进案例,可以最直观地概括上述基建变革的商业价值:
最初用基础模型直接跑,单次合规审计任务耗时半小时,耗费657美元,且存在严重的数据陈旧和发散问题。 而在建立起包含“开源大模型专有推理 + Tavily联网检索 + Pinecone结构化向量库 + Guardrails护栏沙箱 + LangSmith链路监控”的Agent Runtime完整飞轮后,成本瞬间暴跌至24美元(下降超96%),运行时间缩短至13分钟,且具备完美的商业可审计性。
“下一代AI的篇章不会由模型能做什么来定义。”Mark Boroditsky最后总结道,“它将由组织能够部署什么、企业能够信任什么、用户每天能够依赖什么来定义。”
这正是云基础设施向Agent Runtime演进的核心底层逻辑——用极其硬核、纵向集成的工程系统,把脆弱的AI模型包裹成企业可以百分之百信赖的现代生产力生产线。
值得注意的是,峰会圆桌讨论揭示了市场层面的真实压力。科技媒体The Information执行主编Amir Ifrati点出了一个正在发酵的叙事转折:
"我们正处于一个与10-15年前公共云早期非常相似的时刻——客户突然说,等等,我今年比预期多花了2000万美元。"
DataRobot首席产品官Venky对此直接表态:"当AI账单从每用户30美元的订阅变成数百万美元的行项目,每个人都开始追问ROI。"
Cognition(Devin)CEO Scott则从结果侧给出了模型路由的实践逻辑:
"绝对最难的任务,你仍然需要最聪明的模型。但对于那另外80%-90%的任务,有性价比高出10倍、速度快10倍的开源模型完全可以胜任。模型路由正在成为越来越重要的一环。"
Nebius Inflection 2026峰会全文实录如下(由AI辅助翻译)
旁白
当AI遇见真实世界,会发生什么?
技术是基石。每一场革命都会到达一个拐点。这就是我们的拐点。正是你们的好奇心、你们的远见、你们的决心,以及你们对突破边界的不懈追求,才让这一切成为现实。我们正处于AI的黄金时代,这一切源于你们的雄心壮志——让AI在我们赖以生存的各行各业中蓬勃发展。
我们正在共同定义AI的下一个阶段。
请欢迎Nebius首席营收官Marc Boroditsky登台。
Marc Boroditsky — 首席营收官,Nebius
大家下午好,感谢各位的到来。正如刚才"上帝之声"所介绍的,我是Marc Boroditsky,Nebius的首席营收官。我非常荣幸地欢迎大家来到我们的首届Nebius Inflection大会。
好了,我不打算用又一场AI主题演讲来烦扰大家——那种声称整个世界将因AI而改变、AI让一切以前所未有的速度推进、眼前机遇无比巨大的演讲。
事实上,每周我们都会听到关于新模型、新基准、新智能体框架的发布公告。有时候,这些公告甚至在同一天,乃至同一个小时内接连出现。
我们其实正处于一个有趣的节点。我想在座各位都清楚:AI正在从一个工具,转变为能够做出令人惊叹之事、足以颠覆整个行业的存在。 但在座的每一个人都知道,我们需要的不是另一场关于机遇规模有多大的演讲。
我们需要一场更诚实的对话——关于当下地面上究竟正在发生什么。
因为有很多事情是在奏效的,但同样也有很多事情并不奏效,而且很多事情依然比人们在台上做主题演讲时愿意承认的要混乱得多。这种状况必须改变——如果AI要从实验阶段走向人们可以依赖的系统,我们就必须迈上新的台阶。
这正是我们创办Inflection的原因。
不是为了举办另一场会议,不是为了制造另一个产品发布时刻,也不是为了成为另一个发布行业公告的场合。我们创办它,是为了那些真正在做事的人。 运营者、创始人、研究人员、基础设施团队、投资者、企业领导者和建设者——那些正在将AI从可能性推向生产落地的人。
因为在当今的企业内部,AI的发展已经超前于针对它所做出的决策。 各团队正在构建智能体、多智能体自动化系统以及令人惊叹的全新工作流——有些经过了审批,有些属于"影子AI",但所有这些都指向同一件事:人们不在等待。
而这正是工作变得真实的地方。
Demo跑通了,智能体看起来令人印象深刻,第一次模型调用感觉像魔法一样。然后它触碰到了真实世界——工作流、内部数据、延迟、SLA、治理,还有财务团队质问为什么账单突然翻了一倍。这时候,真正的代价才浮出水面。
我说的不是那张发票,我说的是AI规模化运行的代价。
因为一旦AI从试点阶段进入真实使用阶段,问题就变了。不再是"模型能不能做到",而变成了:系统能不能可靠地做到?够不够快?够不够安全?成本是否合理?当某些事情发生变化时,我们能评估它吗?出了问题,我们能看到发生了什么吗?我们能治理一个多智能体集群,防止它造成危害吗?我们能证明其价值大于成本吗?
各组织对这些问题的回答,正是将定义这个十年的公司与其他公司区分开来的关键所在。
第一波浪潮追求的是规模——Token最大化,更多提示词,更多上下文,更多推理步骤,更多循环。但现实改变了衡量标准。接下来要走的路,不应该是关于更多Token,而应该是让每一个Token都物有所值—— 在数学上算得通的成本、用户信任的质量、能够改变业务的速度。
赢得下一个篇章的团队,不会是消耗算力最多的团队,而是将算力转化为成果的团队。
想想看:价值最大化,而非Token最大化。 在规模上创造价值的生产级AI,是摆在我们面前的下一个伟大拐点。
但技术本身不会创造拐点,人才会。 未来不会靠预言而诞生。
在Nebius,我们的使命很简单:帮助那些真正去构建未来的人。 而这些人,就在这个房间里——研究人员与运营者,创始人与企业领导者,基础设施与应用创新者,每个人都为一个更宏大的生态系统贡献着不可或缺的一块拼图。
我们相信,没有任何一家公司能够独自将AI的全部潜力带给这个世界。 这正是像今天这样的聚会如此重要的原因。
在今天的议程中,你们将听到AI领域最具洞察力、最具影响力的思想者们分享他们的观点。你们将了解技术的走向,哪些挑战仍有待解决,以及从实验走向规模化生产需要什么。我们希望这些对话能够挑战固有假设、锐化思维视角、激发新的想法。也希望你们充分利用今天汇聚于此的这群非凡之人。
Nebius团队的许多成员也在现场,他们来这里不仅仅是为了演讲,更是为了倾听、学习和协作。
随着今天议程的推进,我鼓励大家充分投入——提问、分享经验、挑战传统思维,把握与这群聚集于此的杰出领导者们建立连接的机会。
感谢大家成为其中的一部分。
在我们正式开始之前,我想分享一件对我们Nebius而言意义深重的事。Nvidia与Nebius从Nebius创立之初便携手同行、共同构建。 在此,我想播放一段来自Jensen Wang(黄仁勋) 的特别致辞。
来自黄仁勋的特别致辞
我的朋友们,周年纪念快乐,恭喜你们。Nebius,你们正在构建的东西非同寻常。数据中心正在成为AI工厂。它们将能源转化为tokens,再将tokens转化为智能。AI工厂是这个时代新的基础设施。 它们必须建在人们生活、工作和创造的地方——一个地区接一个地区,一个社区接一个社区,基础设施必须建在需求所在的地方。这正是Nebius正在构建的。
你们从深厚的云工程基因起步,然后为AI时代重建了你们的平台,仅用两年时间就从一个数据中心扩展到了吉瓦级规模的AI工厂。 Nvidia带来了加速计算、网络系统和推理软件。Nebius为开发者、初创公司、研究人员和企业构建了全栈AI平台。我们共同证明,世界各地都需要AI基础设施,而在本地构建是让它真正运转的唯一方式。
建设才刚刚开始。 Nvidia很自豪能与Nebius合作,共同构建AI时代的基础设施。恭喜你们,希望这次inflection大会圆满成功。
旁白
请欢迎Nebius联合创始人Roman Chernin登台。
Roman Chernin — Nebius联合创始人
好的,我以为Mark会来介绍我,但他们直到最后一刻才改变,把所有控制权都交给了机器人。还有Jensen,但我们都知道Jensen掌控着一切。好了,感谢大家的到来。
也感谢这个机会,让我来讲讲我们在Nebius构建了什么,我们认为我们已经交付了什么,以及我们下一步的方向。我们的行业显然正处于过去几年的拐点。我们展示了——实际上是你们展示了——AI能做什么。但现在我们需要共同证明,AI能够创造真实的经济价值。 要实现AI真正的承诺,我们需要为组织和人类创造真实的价值。实际上,我们需要建立健康的业务,拥有健康的利润率,而不仅仅是展示漂亮的营收数字和大规模融资。这是千载难逢的机会,我们需要兑现。
坏消息是,要兑现,你需要去搞清楚那些枯燥的基础设施细节。这是脏活,是不性感的工作。
有一个漂亮的原型是一回事。哦,好主意。但克服真实生产和规模化的复杂性是另一回事——关键产品要像原型展示的那样漂亮,但还要可靠。从Anthropic起步的公司需要转向开源模型,以满足单位经济性并真正发展壮大。在原型中运行良好的智能体,一旦扩展到规模,问题就会不断叠加,最终崩溃。从大型超大规模云厂商辞职、带着绝妙想法去构建自己实验室的优秀研究人员,需要的是能直接运转的基础设施。这就是我们开发Nebius的原因。我们希望在构建者扩展规模时帮助他们。
当我们审视市场时,我们看到了一个虚假的选择。一方面是老牌超大规模云厂商,拥有大量服务和全球覆盖,但看起来它们是在上一个Cloudera时代设计和构建的。它们没有针对AI工作负载和AI开发者进行优化。 它们在遗留基础设施上构建AI服务。它们的模式,说白了,始终是通过复杂的计费将开发者锁定在封闭服务中,更不用说它们存在永久性的利益冲突——它们可以为内部使用分配更多容量,而给云客户的反而更少。
另一方面是所谓的"新云"。我说了很多次,我很讨厌这个词——这是一个新的裸金属提供商类别,为AI工作负载而构建,但往往不可靠。说实话,构建者体验很差。构建它的人更像是系统集成商,他们不是真正的开发者。所以我们认为,这两种选择都有真实的局限性。
我们相信存在第三条路,一个新的产品类别——面向AI的规模化云(Scaled Cloud for AI)。从第一性原理出发构建:
第一,AI专属。 我们只为机器学习而构建和优化。我们不做任何其他事情。
第二,全栈,为客户提供最佳的总拥有成本,因为我们从底层做起。我们构建和运营数据中心,我们自己组装机架和服务器,我们构建全栈软件平台。
第三,以构建者体验为先。 我们称之为"Meet Builder"——开发者在哪里,我们就在哪里。我们让开发者专注于他们需要做的和需要控制的事情,并抽象掉大部分复杂性。
第四,开放性。 实际上,我们太小了,无法尝试将人们锁定在封闭的生态系统中。所以不做厂商锁定,依赖开放标准,给予选择。
最后同样重要的是,人很重要。 客户支持体验,工程师对工程师的关系。我们也从第一天起就自己使用我们的平台(dog fooding)。
直到现在,我们把Nebius建成了一家不同类型的公司,服务于不同类型的用户。你知道这句话:"没有人因为选择AWS而被开除。"所以我们的客户也可以选择AWS,但他们选择在Nebius上构建,因为它快速、高效,而且实际上可以与拥有世界上最苛刻AI工作负载的团队共同工程化。我们将超级计算机的规模、可靠性与性能结合在一起。 这就是我们的模式。
让我分享一些我们如何与四类客户共同构建的例子。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力