光通信助力存储池化,提升利用率与系统规模
光通信助力存储池化,提升利用率、扩大系统规模
上篇文章讲到光通信助力AI 计算ASIC 化,大幅提升token 效率。 这篇文章讲讲光通信如何助力存储池化
以H200为例,FP8推理性能达1,979 TFLOPS,训练场景完美——但推理时,光权重文件就上百GB,加上每轮对话膨胀的KV Cache,141GB HBM根本装不下一个标准推理实例。于是你得再买一张卡——不是因为这颗卡算不动,而是需要它旁边多出来的那点内存。
一个GPU 卡上的内存不够用,多个GPU卡的内存相互共享才能充分的发挥系统内存的最大能效,所以CXL诞生了,CXL(Compute Express Link)的核心思想简单而有力:打破"内存绑死在单台机器上"的传统模式,让数据中心所有内存变成可动态调度的共享资源: 内存池化。
内存池化有三步演进曲:
具体的方式是CPU 和GPU 通过CXL 交换机访问统一编址的内存:
注意:这里DDR 和 HBM 可以混用,部分高速数据访问的使用HBM,低速的比如历史对话信息,使用DDR。
内存池化,不会替代HBM,它会大幅提升HBM的使用效率,它让"小显存跑大模型"成为可能——业界已有的方案已证明,配合内存池化,消费级RTX 4090 24GB即可运行百亿甚至千亿参数模型,硬件成本降低60%以上。
在内存池化思路上,HW也靠自研光互联把多卡/多节点的 CPU/NPU 内存拼成一个全局共享池。
384 颗910C 组成 Atlas 384 超节点,统一内存池 PB 级,硬件级缓存一致性,所有加速器看到统一内存视图,无需软件层数据同步。灵衢 UB(UnifiedBus)2.0 —— 下一代更狠,2026 MWC 发布的 Atlas 950 SuperPoD:单柜 64 颗昇腾 950DT,最大扩展到 8192 卡无收敛全互联,跨柜往返时延 7μs → 3μs,统一共享内存池 1152TB,是主流同类平台 15 倍。
这里的灵魂就是内存统一编址:把所有 NPU/CPU 内存整成百 TB 级全局共享池,任意芯片像访问本地一样 LD/ST 远端内存,AI 多轮对话历史上下文放共享池,"一次存储、多次读取",Token 吞吐提升了 +40%。
这里内存池化的时候,光通信的角色依然是核心环节,大带宽、低延时、远距离全部靠光通信。
结论:无论是AI 计算ASIC化,还是内存的池化共享,消减HBM的瓶颈,而这背后就是光互联发挥关键作用:
(1) ASIC 化的AI计算,当前跨框、未来跨板的数据传递必须使用光通信;
(2) ASIC 化的AI计算,需要确定性的低延时,必须使用光通信 + OCS
(3) 池化的内存,使能了DDR这种低成本存储参与到了AI计算中,同样需要低延时、高带宽的传输,光通信和OXC在传输和交换同样发挥着核心作用。
面向未来NPO、CPO大幅提升GPU的光通信扇出能力,更加有利于存储的池化,这个时候,大量的HBM 甚至是DDR不是放在GPU Die的四周,而是放在旁边的线卡或者机柜,存储的问题可能就迎刃而解了。
咱们通信赛道的中际旭创$中际旭创(SZ300308)$,新易盛$新易盛(SZ300502)$,东山精密等$东山精密(SZ002384)$,我们的DPO、NPO、CPO、XPO、LPO等等承重99%都是来自于HBM的数据,是H-B-M的受益者,也是未来H-B-M新架构的关键,欢迎存储越卖越多,存储卖的多,光通信等比例的需求也就越大,所以长期看好光通信。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力