跳到主内容
@wquguru
精选70律动 BlockBeats(Telegram)加密货币

英伟达:Qwen3.8-Flash-Next在GB300

英伟达:Qwen3.8-Flash-Next可在GB300NVL72上实现超1.6万Token/秒单卡吞吐

原文
发到 X

英伟达:Qwen3.8-Flash-Next可在GB300NVL72上实现超1.6万Token/秒单卡吞吐 动察 Beating AI 快讯,英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得英伟达 GB300 NVL72 平台支持。该模型总参数规模达 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可通过 YaRN 扩展至 100 万 Token,主要面向智能编程、文档处理及工具调用等长上下文 Agent 应用。 英伟达表示,Qwen3.8-Flash-Next 采用 Gated DeltaNet(GDN)与 Qwen Sparse Attention(QSA)混合架构,以降低长上下文场景下的计算和 KV 缓存开销。测试显示,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒;同时支持 SGLang、vLLM 及 TensorRT-LLM 等推理框架。 原文链接 https://m.theblockbeats.info/flash/363745

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近