跳到主内容
@wquguru
精选88meng shao技巧与观点

NVIDIA 全栈 NIM 优化 Nemotron 3 Ultra 推理性能实录

NVIDIA 如何用全栈 NIM 优化让 Nemotron 3 Ultra 多服务 2.5 倍用户 ?

原文
发到 X
推荐理由

Agentic 场景下的推理优化实战,拆解了软硬件协同的具体参数与取舍逻辑,对降低单位 token 成本有直接参考价值。

NVIDIA 如何用全栈 NIM 优化让 Nemotron 3 Ultra 多服务 2.5 倍用户 ?

在 4×B200 系统上 @NVIDIAAI 通过 NIM 微服务对推理栈做全栈协同优化,把 Nemotron 3 Ultra 的系统吞吐从 718 tok/s 提升到 1,997 tok/s;在同等交互体验(每用户 50 token/s)下,同一套硬件能服务约 2.78 倍的并发用户。 https://developer.nvidia.com/blog/how-full-stack-nim-optimizations-deliver-2-5x-more-users-on-nemotron-3-ultra/?ncid=so-link-559948

NVIDIA 公布的 2.5x 不是裸吞吐对比,是“固定延迟 SLO 下最大化吞吐”的测量,前提条件非常具体: · 硬件:4× NVIDIA B200 · 模型:Nemotron 3 Ultra 550B-A55B,550B 总参数、55B 激活的 MoE 模型,且是 MoE + Mamba(SSM)混合架构,原生 256K 上下文 · 负载:典型 agentic 场景,64K token 输入、400 token 输出(长上下文进、短决策出),76% KV 复用率(大量请求共享重复前缀,如系统提示、对话历史) · 交互目标:每用户 50 TPS,即 20ms 的 inter-token latency(ITL),这是流式输出体感的及格线 · 软件:NIM 2.0.12,推荐配置 profile 为 vllm-nvidia-b200-nvfp4-tp4-pp1-throughput-90.0

五层优化 1. 精度 + 自动调优内核:采用 NVFP4 量化(Blackwell 原生的 4-bit 浮点格式),并针对 MoE 和 Mamba 两种异构内核做自动调优。混合架构在通用推理栈里没有现成的高效内核路径,这是 NIM 的主要施展空间之一。 2. 并行策略:TP=4(四卡张量并行)、PP=1,配合专家感知执行提高 MoE 层利用率。 3. 前缀与状态复用:前缀缓存跳过重复上下文的重复计算;部分前缀匹配(partial-prefix matching)从不完全命中中也能回收复用收益;Mamba 状态缓存按架构单独调参,SSM 没有 KV cache,但有自己的状态需要缓存管理。 4. 调度器 / 批处理 / 内存调优:并发序列数、批 token 上限、block 大小、显存分配——目标是在延迟预算内让尽量多的请求同时在飞。 5. MTP 投机解码:多 token 预测,通过 NIM_SPECDEC_ENABLE=1 开启。文章诚实指出其增量收益取决于接受率和剩余显存,不是无条件正收益。

测量方式相当规范 用 NVIDIA AIPerf 重放真实流量(Mooncake 格式 JSONL trace 或捕获的真实请求),并发从 1 扫到 64,画出吞吐-延迟 Pareto 曲线,再按 SLO 选工作点。还明确提醒:发布的曲线只是起点,“不是每个应用都能复现同样的结果”。

NVIDIA 这篇博客读后感 1. 它代表了 agentic 时代的推理优化范式。 Agentic 负载“长进短出、高前缀复用”的特征,让前缀缓存、状态复用、投机解码这些优化的杠杆远大于传统 chatbot 场景。推理容量 = agentic 落地的核心成本瓶颈,这里的每倍提升都直接换算成单位 token 成本下降。 2. “全栈”的真正含义是协同,而非堆叠。 文中最好的工程观点:这些优化是“相互作用的配置束,而不是可以简单把百分比相加的独立开关”。量化改变显存余量,显存影响批大小,批大小影响投机解码的接受率——层与层耦合,所以无法给出单项贡献分解。这是对真实系统优化本质的准确描述。 3. 软硬件协同设计(NVFP4 + Blackwell + 自动调优内核)是 NVIDIA 的护城河叙事。 模型-硬件-服务栈垂直整合带来的提升,是纯软件方案难以复制的。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件