Galaxy万字研报:推理资本市场与AI算力金融化全景
Galaxy 又造新概念“推理资本市场”, 万字研报瞄准 AI 算力金融化
Galaxy Digital的万字研报系统梳理了推理资本市场这一新兴赛道,涵盖GPU期货、代币化推理、算力金融化等前沿方向,对加密与AI交叉领域的从业者具有重要参考价值。建议关注ICE/CME的GPU期货进展及Venice等项目的代币经济模型。
作者: Lucas Tcheyan(Galaxy Digital 研究副总裁)
编译: 深潮 TechFlow
深潮导读: Galaxy Digital 最新研报梳理了「推理资本市场」的完整版图——从 ICE 和 CME 即将上线的 GPU 期货合约,到 Venice 把推理访问权变成可交易的永续资产(DIEM),再到 Pearl、Ambient 用「有用工作量证明」补贴推理成本,以及 USD.AI 用稳定币存款为 GPU 硬件放贷。推理正在取代训练成为 GPU 需求的主导力量,围绕它的金融层才刚刚开始成型。
引言
「链上推理资本市场」描述的是一套正在成型的系统:一组网络、协议、基础设施和应用,它们把 AI 模型推理(inference)从 OpenAI、Anthropic 等前沿实验室和超大规模云服务商控制的中心化 API 中解放出来,在链上完成协调和结算,并在此之上构建金融层。用户可以把提示词发送给由加密代币激励协调的 GPU 运营商网络,在某些配置下还能获得关于输出正确性和隐私的密码学或经济担保。
这个类别在 2026 年引起了越来越多的关注。推理——用训练好的 AI 模型处理新数据并生成输出——已经超越训练,成为全球 GPU 需求的主导份额。与此同时,自主代理(autonomous agents)作为一类新的推理消费者出现了:它们以编程方式付费,运行时不需要人类介入。
过去几年,去中心化 GPU 市场、推理协议、支付通道、代币化、资本形成工具、链上流动性各自经历了自己的高光时刻。新变化在于,这些原语正在融合成一个单一的集成系统——一个推理资本市场。随着推理越来越多地被用于所有工作,这个市场预计将找到不断增长的需求。链上的实验正围绕真正具有生产力和经济意义的活动展开,需求不仅来自加密领域。
图注:推理资本市场的完整版图
推动这一融合的力量有几个。GPU 使用正在从训练向推理决定性地转移,而开源权重模型在「够用就好」的任务层级上正在追赶前沿模型。这让原本昂贵的任务可以被路由到最便宜的服务方——无论是否走加密通道。推理需求的增长也在推动用户创造性地寻找算力来源。Citadel 最近发布了一份报告,显示以 Silicon Data LLM 指数衡量的 token 支出正在下降,反映出用户正在转向更便宜的模型。(AI token——AI 公司用来给服务定价的单位——不要与加密代币混淆。)
图注:Silicon Data LLM 指数追踪的 token 支出趋势
Coinbase、微软、AirBnB 等公司最近也开始转向使用开源模型,其中以中国模型为主。OpenRouter 最近的融资也证明了市场对多元化模型接入的需求在增长,这能让推理更经济。这部分是供给约束的结果——芯片短缺使得边际推理成本更高。
图注:推理供给约束示意
第二股力量是金融化。AI 的普及和它作为几乎所有任务输入的智能,正在创造对其商品化和金融化的需求。越来越多的团队在思考如何把 AI 算力变成一种可交易资产,纳入更广泛的金融层。推理资本市场的早期框架正在浮现,将 AI 硬件和产能金融化,目标是把它们组装成一个完整的市场。
GPU 指数与期货市场
在深入链上推理资本市场之前,必须先了解链下正在开发的更大市场——GPU 期货。
AI 基建投入的规模估算差异很大。摩根士丹利预测到 2028 年全球数据中心资本支出约 2.9 万亿美元(不含电力投资),其中约 2.5 万亿美元与 AI 相关。麦肯锡估计到 2030 年数据中心需要 6.7 万亿美元全球资本支出,其中 5.2 万亿美元用于 AI 处理设施,1.5 万亿美元用于传统 IT;其 AI 场景范围从受限需求的 3.7 万亿到加速需求的 7.9 万亿。高盛估计 2026 至 2031 年间 AI 基础设施资本支出约 7.6 万亿美元,涵盖算力、数据中心和电力。不管确切数字是多少,这些预测一致显示:算力/硬件是最大的支出类别,占比从 55% 到 67% 不等。
这些预测之所以难做,是因为供需两端都有未知数。一个是需求弹性——如果更便宜的算力被重新投入更大的模型和更广泛的部署,而不是作为节省被收入囊中,那么效率提升将扩大使用量而非缩减账单。另一个是芯片的有效寿命,折旧估算从 3 年到 7 年不等。虽然每年都有性能更强的芯片发布,按理说应该推动旧芯片走向淘汰,但那些「遗物」持续保有价值。严重的供给约束使得旧硬件仍有用武之地,它们也可以用来服务低层级模型。结果就是大量资本持续流入一个波动性资产——这恰恰是定价、对冲和融资市场开始形成的条件。
「采购算力的工作被比作毒品市场——你有一个'人',需要货的时候就打电话。」
某种意义上这些市场已经存在,只是没有标准化形式。大买家已经在私下锁定未来算力——从按小时租用到多年期预留合同(GPU 版的承购协议),到供应商与最大客户之间的双边交易,通常以不透明、关系驱动的谈判定价。前沿实验室如 OpenAI 批量出售 token,超大规模云服务商相互预留产能,新型云服务商(neocloud)从云和经纪商那里前向购买,因为供不应求。全球最大的推理运营商之一 Baseten 把今天的算力采购比作毒品市场——你有一个「人」,需要货的时候就打电话。那些从不透明中获利的公司——经纪商和大持有者——没什么理由放弃它换取透明屏幕和几个基点的效率提升。类似的既得利益阻力帮助扼杀了十年来建立液化天然气交易所的尝试。GPU 期货正在这个碎片化的基础上作为标准化层出现,用于转移价格风险,但还不是产能配置方式的替代品。
期货市场要运作,需要一个准确的指数作为合约参考。对算力来说,这比标准化大宗商品更难。一个「GPU 小时」如果不指定芯片型号、内存和网络配置、区域、是按需还是预留,就没有意义。电力、带宽和液化天然气在成为流动市场之前也存在类似的底层商品差异。解决方式如出一辙:定义等级和参考价格,而不是要求每个单位都完全相同。原油以 WTI 和布伦特为基准定价,天然气以 Henry Hub 为基准。
图注:GPU 指数与大宗商品基准的类比
GPU 正在向类似的结构趋同。Ornn(Galaxy 投资组合公司)发布了基于实时交易数据的算力价格指数。Silicon Data 在彭博终端上每日发布 H100、A100 和 B200 租赁指数,将不同配置、供应商和区域的定价数据归一化为单一基准。Compute Desk 也在朝同一方向建设。用 Ornn 的框架来说,这些指数更像 SOFR(有担保隔夜融资利率),而不是它臭名昭著的前任 LIBOR。每个指数都基于市场上广泛的实际交易数据构建,而不是专家组的估算,追踪的不是单个 GPU,而是一组已定义算力的市场价格。
这种基于真实世界交易的锚定使异质性变得可管理。指数不需要任何两个 GPU 小时完全相同,只需要足够多的真实交易来计算出一个有代表性的价格。但它面临原油没有的问题:一桶标准 WTI 不会变,而 GPU 基准会随着芯片从 H100 迭代到 H200、B200、GB200 再到 Rubin 而衰减,迫使参考标准每代重写。碎片化加剧了这个问题——AMD、Google TPU、Amazon Trainium、超大规模自研芯片、主权芯片把需求分散在互不兼容的硅片上。持久的基准变得更难维持。
第二个争议点是结算方式。对冲算力预算的实验室或做方向性交易的交易台可能只想要纯价格敞口,对它们来说,一个根据指数支付差价的合约就是全部目的。但需要真正芯片来服务客户的新型云服务商,需要的是产能本身。目前推出的期货是现金结算的,因为价格对冲需求最容易标准化——大多数大宗商品期货以现金结算,原因相同。实物交割虽然可能,但更难提供,因为它需要更进一步的标准化和特异性。也有一种观点认为这个顺序是反的——在少数卖家控制供给的情况下,基于薄弱指数的现金结算容易被操纵,大宗商品通常需要实物交割或可运作的期现转换机制,才能让价格首先收敛于现实。
市场还需要双方都有真正交易理由的参与者,而不只是做方向性投注的投机者。天然的买方是那些成本与算力挂钩并希望锁定成本的公司——AI 实验室、应用公司、已向下游承诺产能并需要保障输入的新型云服务商。天然的卖方是持有 GPU 库存但未来用途不确定的公司——超大规模云服务商、大型 GPU 持有者和经纪商。为 GPU 采购提供融资的放贷方需要同样的参考价格,因为以贬值硬件为担保的债务必须有一个标价基准。投机者和自营交易公司则在上面增加流动性。目前市场的主要结构性张力在于:大多数卖家想卖长期合约,而买家想买短期合约——卖家想锁定收入,买家想要灵活性。
尽管面临这些挑战,一个更成熟的 GPU 市场的早期迹象已经开始出现。预测市场平台 Kalshi 已经推出了特定 GPU 价格的市场。纽交所母公司 ICE(与 Ornn 合作)和 CME(与 Silicon Data 合作)已宣布计划在未来一年上线 GPU 期货。「算力即商品」即将成为现实。
链上推理资本市场
模型和推理供应商本质上是 token 工厂。它们接受原始输入——GPU,把它精炼成 token 形式的输出。GPU 小时通过 GPU 指数正在越来越标准化,但上面的 token 层远没有发展起来,一个模型的 token 和另一个模型的 token 定价完全不同。不过这一层正在成型。中国三大国有电信运营商已经开始把推理作为计量公用事业零售,销售标准化的月度 token 套餐,很像手机数据套餐。亚马逊据报道将开始按消耗的 token 而非之前承诺的计算小时数向 Anthropic 付费。上海期货交易所据说正在早期设计 AI token 期货,作为 CME 和 ICE 在输入端构建的 GPU 合约的对应物。
加密领域正在构建自己的版本。这些链上推理资本市场建立在已有的加密-AI 原语之上,如 GPU 供应商和去中心化模型开发者,同时纳入了新兴的垂直领域,如代理支付标准和代币化推理市场。生态系统已经跨越多条链和执行环境,但开发特别集中在 Base 和 Solana 上,得益于它们成熟的开发者和用户基础。
图注:链上推理资本市场生态图谱
核心是推理供应商和网络——把提示词变成输出的项目。围绕它们的是让推理变得有用、可获取、可金融化的层:模型开发者、GPU 和算力供应商、路由器和市场、代理和应用、支付通道、资本形成基础设施。这些周边层很重要,因为它们要么创造推理需求,要么供给推理输入,要么把推理使用转化为可以付费、融资、路由或拥有的东西。
这些产品中有许多并非加密独有,都有链下对应物。在堆栈顶部,Hermes 和 Ironclaw 等代理框架可以从前沿实验室或 Venice 等链上供应商交替获取推理服务。Nous Research 等去中心化开发者的模型可以在 OpenRouter 上访问。GPU 供应商是超大规模云和数据中心的无许可、开源对应物,通常规模小得多。x402 和 MPP 等代理支付协议可以同样方便地为 OpenAI 或 Anthropic 订阅付费,也可以为 Venice 付费。程序化结算正在成为标准而非加密独有优势——OpenAI 和 Visa 最近也宣布了自己的代理支付基础设施。
独特的组件出现在金融化一侧,加密改变了推理被拥有、定价和融资的方式。金融化推理吸引了一系列链上项目,它们使用区块链支付通道和代币化,把推理活动变成可交易资产。这分为三种形式:
推理服务供应商如 Venice 和 Morpheus 代币化推理访问权,把对未来推理的索取权变成可以持有、定价和转售的东西。
有用工作量证明项目如 Pearl 和 Ambient 代币化推理生产,为服务推理的工作支付代币。
信贷供应商如 USD.AI 做的事不同。它们不是代币化推理本身,而是为推理运行所需的硬件提供融资,用稳定币存款为底层的 GPU 和数据中心提供资金。
这些组件共同构成了链上推理资本市场。
推理供应商
推理供应商层是整个堆栈的核心。这是去中心化推理最直接类似于传统 AI API 市场的地方。用户或开发者选择模型、发送提示词、按 token 或按请求或通过订阅付费,然后收到输出。最简单的版本看起来就像使用 OpenRouter、Together AI、Fireworks 或前沿实验室的 API。区别在于加密原生供应商可能从去中心化 GPU 网络获取产能,接受稳定币或代币付款,提供开放或无审查模型的访问,包含隐私保证,或把代币化的访问权附加到使用上。
图注:推理供应商格局
OpenRouter 是链上推理最有利的场所之一。那里的需求按 token 定价,用户可以在任何请求上自由切换供应商——这正是更便宜或更快的供应商应该夺取份额的环境。过去三个月,链上供应商处理的 token 占 OpenRouter 日处理总量的 0.5%-1%,而同期 OpenRouter 处理的总 token 量持续爆发式增长。这展示了一些在加密原生社区之外的初始牵引力,但仍然只是总使用量的很小一部分,说明这些供应商还无法与成熟的中心化产品竞争,无论是因为分发不足、相对成本还是其他因素。
但 OpenRouter 只代表了总 token 使用量的一部分。比如 Venice 报告称 6 月 23 日其所有接入点共处理了 1000 亿个 token,是它在 OpenRouter 上处理量的 10 倍。仅看 OpenRouter 使用量无法反映各项目层面的总体牵引力,链上推理供应商正在尝试用各种方法建立稳定的客户群。有些是特定功能——Venice 积极推广隐私作为差异化特征,让用户在使用推理时不必担心供应商保留、检查、泄露、审查或被迫披露敏感信息。Chutes 和 AkashML 让任何人都可以把 GPU 接入其网络并将闲置算力变现,试图降低成本。虽然这些功能可能帮助供应商赢得一些份额,但它们在很大程度上可以被中心化供应商复制,可能不足以获得有意义的市场份额。
链上产品能真正建立差异化的地方,是那些金融化推理的机制——把访问权变成买方可以拥有、持有和转售的资产,而不是只能消费的订阅。
Venice:代币化推理所有权
Venice 由加密行业老兵、连续创业者 Erik Voorhees 创立,在把推理访问权变成可拥有资产方面走得最远。它运行一个双代币系统——VVV 和 DIEM,把对未来推理的索取权包装成持有者可以铸造、拥有和转售的东西。
VVV 充当项目的「资本资产」。它不代表 Venice 平台的所有权——Venice 有自己独立的股权(6 月,Venice 完成了 6500 万美元的 A 轮融资,估值达独角兽水平),但持有者理论上可以从项目的成功中受益。最直接的方式是,Venice 收入的一部分用于回购并销毁 VVV。回购销毁有两种方式:从一般收入中资助的自由裁量销毁,以及将每笔新订阅的固定比例路由到回购销毁的程序化销毁。迄今为止,42% 的 VVV 已被销毁。
VVV 还有实用功能。任何数量都可以质押以获得年度 VVV 排放,或者质押 100 VVV 来解锁 Pro 订阅。但它最有趣的用途是与 DIEM 的关系——Venice 的「算力资产」。持有者锁定已质押的 VVV 来铸造 DIEM,每个 DIEM 永久授予 1 美元的 Venice 推理积分。持有 100 DIEM 就有 100 美元的 API 积分,适用于 Venice 平台上的所有模型,永久有效(或者至少在 Venice 还在运营的情况下)。
每个 DIEM 所需的已质押 VVV 遵循 Venice 设定的曲线,随着 DIEM 供应量接近 Venice 控制的目标而指数级上升,因为每个 DIEM 都是 Venice 账簿上的一项永续的每日一美元负债。供应量现在接近该目标,所以费率已经从推出时的大约 90 VVV/DIEM 攀升到现在的数百。这抑制了发行,意味着早期铸造者以远低于任何人现在能获得的 VVV 价格获得了 DIEM。VVV 被锁定来支撑 DIEM 期间,质押者只保留常规 VVV 质押收益的 80%,另外 20% 流向 Venice。锁定只能通过销毁 DIEM 来释放,所以已经出售 DIEM 的铸造者必须在市场上重新获取 DIEM 才能赎回 VVV——如果价格上涨了就会亏损。
图注:VVV 与 DIEM 的双代币机制
这两个代币相互增强。DIEM 只能通过锁定已质押的 VVV 来铸造,所以 DIEM 需求上升会把 VVV 从流通供应中抽走,赋予它超越投机的用途。反过来,DIEM 受益于 Venice 的增长。平台越有用、使用越广泛,对其每日访问权的可转让索取权就越有价值。DIEM 持有者不只是拥有可转售的推理——他们持有的是与 Venice 成功挂钩的头寸。
更广泛的产品即使在用户从未接触加密的情况下也在推动代币经济。Venice 团队说大多数用户不是加密原生的,很多人不关心代币。但当他们订阅、购买积分或使用平台时,这些活动仍然驱动 VVV 回购销毁和对 Venice 推理的需求。代币经济位于产品下游,而不是替代产品。Venice 不是一个寻找 AI 用例的加密代币,而是一个把部分使用和访问权路由到代币化推理市场的 AI 产品。
图注:Venice 推理使用增长趋势
Venice 的 DIEM 独特之处在于所有权。它让用户拥有他们消费的推理,而不是租用它。
DIEM 是关于如何代币化和交付推理访问的一次实验。它的独特之处在于所有权——让用户拥有他们消费的推理,而不是租用它。按请求付费的买家在推理用完后什么都得不到,而代币化访问权的持有者拥有一项可以保留、转让或出售的资产。这打开了几个用例:
因为索取权是可交易的,需求不均匀的持有者可以保留基线访问权,把不需要的天数卖掉或出租,收回按请求付费模式下直接损失的成本。代理可以直接持有 DIEM,赋予它一个无许可、可拥有的推理余额。交易可以通过 Aerodrome 做即时出售,或通过 Surplus、UsePod、AntSeed、CarpeDiem 等市场做固定期限的租赁。
Venice 团队经常举的另一个例子:用户买入 DIEM,用它做一天推理,第二天卖出。如果价格持平,推理实际上是免费的。如果价格上涨,用户还赚了。反过来也一样——如果价格下跌,持有者的损失可能远超直接购买推理的成本。对一些用户来说,这意味着他们可以在消费推理的同时投机推理价格。
DIEM 还能提供成本确定性。一个有稳定可预测需求的企业或代理可以用 DIEM 锁定其算力成本——逻辑和多年期云预留合同相同。它不知道两年后 1 美元的推理能买到什么,但现在可以锁定。按 7 月 7 日 DIEM 价格 1270 美元计算,一个 DIEM 大约是四年的每日一美元积分,所以买家预付了大约三年半的永续现金流。问题是,购买这种确定性意味着持有一个波动的、以美元计价的永续资产——这恰恰与买家想要的确定性背道而驰。按永续承诺定价,DIEM 隐含了对 Venice 持续服务能力的两位数折现率,而这个索取权的价值完全取决于 Venice 能持续服务多久。
这个机制还很早期,有实实在在的缺陷:
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力