芯片专家Mr.Bubble:AI算力瓶颈转向封装与存储,看好硬件层投资
“芯片网红”:AI算力瓶颈早已不是算力芯片,而是先进封装、互连延迟与存储层级
提供AI硬件底层逻辑的深度拆解,对理解算力瓶颈转移及硬件投资主线极具参考价值,建议关注。
当市场在为科技巨头数千亿美元的AI资本支出(Capex)能否回本而焦虑时,产业最前沿的硬件工程师们却在关注另一个更本质的命题:摩尔定律的经济学已经破产,算力竞赛的真正瓶颈,从来不在芯片本身,而是从“设计更快的芯片”变成了“控制从硅片到机架的物理堆栈”。
近日,在知名科技播客Frictionless Podcast by Logan Jastremski的专访中,“芯片网红”、资深芯片设计师、知名硬件分析专家“Mr. Bubble”就当前AI算力供应链的核心瓶颈、未来架构演进及AI投资的最终价值归宿进行了深度剖析。这场对话从晶体管密度讲到存储层级,从机架设计讲到大模型实验室的战略意图,核心结论只有一个:
AI算力基础设施真正的瓶颈,已经从"造更快的芯片"转移到了封装、互连延迟与存储层级这三个更底层、更难解的物理问题上。
(图为Frictionless Podcast主持人Logan Jastremski)
对于当前市场最热门的几个方向——英伟达路线图的可执行性、HBM之后的存储竞争、推理侧的架构分歧,以及大模型实验室"踩边界"背后的真实动机——Mr. Bubble均给出了不少与市场主流叙事相悖的判断。分析认为,与其押注于“互相厮杀”的前沿AI实验室,不如牢牢握住底层的硬件与供应链。
摩尔定律的“经济学破产”与先进封装的崛起
长期以来,市场习惯于用摩尔定律(晶体管密度每两年翻倍)来衡量芯片的进步,但 Mr. Bubble 强调,这一逻辑在经济学层面已经断裂。
“推动这些制程节点(Node)发展所需的资金已经膨胀到了惊人的地步,现在可能需要花费数百上千亿美元。而你甚至无法让晶体管数量翻倍,可能只能获得15%到20%的密度提升。” Mr. Bubble 表示,正是因为晶圆光刻微缩成本呈非线性指数级增长,“先进封装成为了新的摩尔定律”。
他指出,行业不再死磕将更多晶体管塞进同一单位面积,而是通过封装技术“扩大面积”,将多颗芯片连接起来使其像一颗芯片一样运作。这一趋势直接改变了产业链的价值分布。
Mr. Bubble表示,正是因为看清了这一趋势而早于市场看多英特尔——原因是英特尔的封装技术EMIB远超台积电当时的水平,而台积电此后也在向该方向转型。但他直言,"真正应该做多的其实是PCB板厂商",因为当英伟达被迫将Rubin Ultra从四芯片单封装降规成两个独立封装通过PCB连接时,PCB制造商反而成了整个计算链路的新瓶颈。
Mr. Bubble拿英伟达的路线图举例,揭示了其受制于供应链的现实:“如果你看英伟达的路线图,你会发现它并不受英伟达控制,而是受制于内存和封装。”
他透露,英伟达最初计划在 Rubin Ultra 架构中封装 4 颗裸片(Die),但受制于物理和封装极限,最终被迫降级妥协(传闻改为每组封装 2 颗裸片,再通过 PCB 连接两组封装)。
“现在,PCB 制造商成了英伟达让这些相隔几厘米的芯片像一颗芯片一样运作的瓶颈所在。”
"每次我看英伟达的路线图,我看到的都是'今天不可能','今天不可能'。"他强调,Feynman代计划默认搭载四颗芯片,并配备更多HBM,"这些我们直觉上就知道根本不可能实现的东西,我很好奇他们打算怎么解决。"
"人们只是摊开双手说,这是英伟达,Jensen什么都能做。我的回应是:他受制于SK海力士、三星和台积电能做什么,也许将来还要看英特尔能做什么。"
算力的真实单位:不再是芯片,而是“整个机架”
随着大模型参数量级跃升,算力的重心已从“横向扩展(Scale out)”转向了“纵向扩展(Scale up)”。数据中心的算力形态正在重构。
“你不能再在真空中设计芯片了。” Mr. Bubble 强调,“这些系统不再只是一两颗芯片,甚至不是一台服务器,它们是一个完整的机架(Rack),甚至可能是多个机架。在未来,无论AI训练还是推理,设计重点必须是整个机架。”
在纵向扩展领域,互连(Interconnect)的吞吐量和延迟决定了集群的生死。他对比了两种截然不同的架构路线:
英伟达通过NVL72系统和庞大的NVSwitch交换机网络来解决高带宽互连问题,占据了本可用于 GPU 的物理空间;
而谷歌的 TPU 团队则交出了另一种惊艳的答卷,“他们的Scale-up规模达到了惊人的 9600 颗芯片……他们将部分路由逻辑直接构建在了芯片内部,让芯片同时充当伪路由器。”
“基于你的扩展域,你可以改变你的芯片设计。”他举例说,如果拥有极低延迟、高带宽的扩展域且中间交换较少,就可以减少单芯片的内存配置,用“堆更多芯片”代替“堆更多内存”。这也解释了为何谷歌的TPU芯片单卡HBM配置少于英伟达,却依然能撑起超大规模训练。
Mr. Bubble认为,这种系统级的设计能力,将成为未来AI硬件厂商的核心壁垒。
此外,推理侧的"预填充-解码分离(prefill-decode disaggregation)"正成为主流架构范式。Kimi的参考设计已将两个阶段部署在不同节点上,"这正变得无处不在,因为这两个操作在根本上就是完全不同的事情。"
HBM之后,存储战场的真正竞争者是闪存
在 AI 推理端,随着大模型上下文窗口(Context Window)从128K暴增至100万甚至更高,内存容量正面临前所未有的考验。市场普遍认为需要无休止地堆砌昂贵的HBM(高带宽内存),但Mr. Bubble提出了不同的务实解法。
“归根结底,大模型的‘权重(Weights)’应该放在 HBM 里。但如果我们不是一次性使用所有的上下文,为什么要在 HBM 中存放海量的上下文数据呢?”
他指出,推理过程中,占据大量内存空间的其实是用户的历史对话和上下文,而非单纯的模型权重。为了解决这一吞吐量和成本矛盾,行业正在走向“闪存卸载(Flash Offload)”的道路。
英伟达已经推出了针对此类场景的网络附加闪存驱动器机架设计,而更廉价、更高容量的 HBF(高带宽闪存)甚至常规的闪存,结合优秀的闪存控制器设计,完全可以承载海量上下文的需求。
对于未来内存的终极形态,Mr. Bubble 给出了明确的预测:“如果有人想了解我认为内存的未来是什么,那就是3D DRAM。” 他提到,将DRAM直接键合在逻辑芯片上方,通过物理距离的无限拉近(局部性优势)来同时降低延迟、提高带宽并降低功耗,这将是下一次硬件革命的焦点。
“买下建造铁路的人”
对话最后,Mr. Bubble将矛头指向了大模型实验室近期流行的“pacing the frontier(踩边界/放缓前沿)”叙事。
他的核心质疑是:“踩边界是为了我们,不是为了他们自己。”大模型实验室没有暂停任何数据中心建设计划,没有削减任何资本支出,“那些数据中心都是多年期承诺,如果他们是真心的,就应该取消这些开支。但这不会发生。”
在AI安全论上,他坦言自己不是AI终结者叙事的信徒:“让这些GPU持续运行的成本极高,所以它去统治互联网、把一切搞垮,这听起来就是在浪费资源。”他认为更现实的风险在于法律责任,而非科幻式的失控场景。
他真正感兴趣的问题是:踩边界究竟有多少是垂直整合与高价值问题攻坚,有多少只是“监管俘获”。他举例,解决千年数学难题(如Navier-Stokes)"花了1500万美元赚了100万,好吧,但那个问题可能并没有那么高的价值",而Terence Tao的数学研究奠定了LTE通信基础,那才是真正价值数十亿美元的成果。
在投资逻辑上,他的立场一以贯之:“我是一个坚定的信徒,我只相信拥有硬件层、拥有铁路,或者拥有那些构成这一切的核心部件。”
Mr. Bubble 给出了一针见血的投资判断:“你是想投资Anthropic 和OpenAI这种注定会竞争到死、且其超额收益(Alpha)会随着人员跳槽而消散的公司?还是想拥有那些有 10 年、20 年业绩记录,并在开发不可或缺的硬件方面拥有深厚护城河的公司?”
关于让华尔街最头疼的“资本支出回本”问题,Mr. Bubble用最直接的经济账给出了回应:“我认为我们将迎来一次快速的起飞。我的意思是,只要借助AI研发出5到10种新药,就能收回所有的资本支出。”
全文如下(由AI辅助翻译):
第一章:简介 & 为什么硬件才是AI真正的核心话题
Mr. Bubble:
我们会给这些服务器增加更多内存。说到底,问题在于用哪种内存?是HBM?是DRAM?还是闪存?我猜更多会是闪存。现在大家都在讨论如何减少对HBM的需求量。因为说实话,到头来,权重(weights)放在HBM里可能还说得过去。但如果我们不是同时用到所有上下文,为什么要在那里放大量的上下文呢?
Mr. Bubble:
我非常相信一件事,就是要拥有硬件层,或者说拥有"铁路",拥有构成它的那些东西,对吧?所以你是想投资Anthropic和OpenAI这种会互相竞争到死、最终随着人员流动alpha也会扩散出去的公司呢?还是想拥有那些有着10年、20年研发历史和护城河、专门开发核心硬件的公司?是的,他们是在为我们推进前沿,而不是为他们自己。但我,我倾向于非常看多。我是说,现在有利率和伊朗的这些情况,但我不知道,我有种感觉,我们用AI找到几种药物,把对的研究人员聚在一起,或者我们想出办法让5G不需要在一平方英里内建一千座基站。我是说,Starlink,随便什么,只要更高效的东西。我是说,我们会迎来快速起飞。我觉得光靠五到十种药物,就能把所有的资本开支(capex)都合理化掉。
Logan Jastremski:
Mr. Bubble,非常感谢你来参加这个播客。这是我第一次尝试做一个更聚焦于AI的播客,而不是我传统的加密货币播客。所以我非常感谢你的到来,更重要的是,我非常欣赏你在Twitter和X上的各种观点。
Logan Jastremski:
就像我们在按下录音键之前说的,最重要的是,我认为你有一种非凡的天赋,能把技术概念解释得非常简单,而这是很难做到的。所以我非常期待这次对话,真正把你今天所看到的,乃至未来我们认为事情走向的一切都拆解清楚。谢谢你。
Mr. Bubble:
谢谢你邀请我。我要说,我所谓的"简化事物的天赋",很多人其实不喜欢,但我首先是一个芯片设计师。所以我必须简化和抽象,否则我会被各种细节搞得崩溃。另外,如果你是一个交易员,或者像我喜欢说的——赌徒,你真的只需要有一个高层次的概览。我觉得有时候人们会陷入细节的泥潭,对吧?我同意。说到底,你得知道什么是重要的,无论是从芯片角度还是从经济角度。因为我见过有人为某种SerDes的误码率(bit error rate)或某种材料在功耗上好了几瓦而吵架,我只想说,伙计们,算了吧,这个东西到底要做什么,那才是它对世界的经济价值。这里那里差一点点根本无所谓。
Logan Jastremski:
我完全同意。我觉得我们在加密货币领域也有很多这种书呆子式的争论。总体来说,就像Elon喜欢说的——简化,然后删除。架构和设计越简单,通常获得的采用率就越高。我相信在AI领域也有很多类似的情况。
Mr. Bubble:
我一直以来,不是要在播客一开始就跑题,我以前很喜欢哲学,其实我只读古代的东西,大概到斯多葛派为止,但他们有一整套关于事物本质的观点,就像柏拉图的理念论。本质是什么?核心是什么?从那个核心出发,你可以推导出其他一切。这就是我在处理这些话题时的方式——主要的东西是什么? 然后从那里出发,我们再谈细节,看它们是否重要。
Logan Jastremski:
我觉得这是一个很好的出发点。所以我想为所有观众和听众从零到一地讲起,因为我觉得你在解释这些概念方面确实做得非常出色。也许就从摩尔定律这样基础的东西开始,讲讲为什么摩尔定律最终走到了尽头,从那里开始,然后我们再跳到一些更有趣的内容。
Mr. Bubble:
好的,在谈摩尔定律之前,你得先大致了解它在说什么。它说的大体上是晶体管密度。它基本上说,在大约一年半到两年的时间里,具体数字不太重要,你大概能获得双倍的晶体管密度。也就是说,在单位面积内,你能放下更多晶体管。那为什么这很重要?因为晶体管是构建数字逻辑的方式。当我们制造芯片时,我们写程序,程序被转换成数字逻辑,数字逻辑再被转换成一堆晶体管阵列。我们能塞进去的越多,晶体管做得越小,计算机能完成的工作就越多,对吧?就把它想象成你写了一个程序,但它放不进内存里,这当然是非常粗糙的简化,但大概就是这个意思。就是我们有这个操作,这个流程,这个工具,但我们实际上放不下它。所以从一个角度来说,它非常重要——它基本上每两年左右就让性能翻倍,随着晶体管数量越来越多,你能完成的工作也越来越多。但从经济角度来说,它也非常重要,因为你可以为你的资本开支做合理化。你可以预测,"嘿,如果我花一亿美元,我实际上会获得投资回报,因为这些芯片会好这么多。芯片好这么多,我就可以收溢价,可以获取市场份额。"所以从这个角度来说,它相当重要。我觉得从工程角度来说,当然,它很酷,很重要。但真正来说,我认为从商业角度,它极其重要。
不过我认为人们没有意识到的是,有一件事像是摩尔定律的一个分支,我甚至不知道它有没有名字,但我们可以叫它"泡泡定律",或者我只是喜欢借用别人的东西……就是:提升晶体管密度需要花多少钱? 在早期的每一个工艺节点,花费并不多,对吧?你不需要花几十亿美元来让晶体管密度翻倍。而现在,你可能需要花几百亿甚至上千亿美元,才能让晶体管数量不翻倍,对吧?也许每个节点之间,你只能获得15%到20%甚至更少的晶体管密度提升。所以我之所以从经济角度来阐述,是因为这个模式正在崩溃。推进这些节点所需的资金已经膨胀到这样一个程度——真正只有一两家公司能负担得起这样的投入。如果你不投资,你就会落后,对吧?然后就是一个永恒的恶性循环——"哦,你的节点更差,我不想用。"当你没有客户,你实际上就没有资金或时间去迭代来改进你的节点。所以我认为这是摩尔定律的关键所在。我认为人们忽视的一件事就是钱,就是让这些晶体管翻倍的成本。从大约60年代到90年代,这个成本相对来说几乎是免费的。到2000年代初,我们才开始需要在这方面动点脑筋。
第二章:芯片从0到1
Logan Jastremski:
在某个时间点,我相信是在90年代中期,或者也许是2000年代后期,在哪个时间点我们开始从单核性能转向多核,以及这种转变,我认为,改变了事物的动态格局。
Mr. Bubble:
我认为是在2000年代中期。我不一定记得很清楚。也许是奔腾处理器,是第一款双核处理器。我记不住名字了,但大概是在2000年代中期。这背后的部分原因就是:一个核心归根结底是做什么的?它处理指令。你能多快地处理指令?这取决于核心能跑多快,而这只是你时钟频率的函数,对吧?现在时钟频率已经触顶了。这与摩尔定律无关,更多的是与瑟布尔定律有关,以及晶体管能切换多快的问题。
但时钟频率触顶了,世界意识到,如果有些指令可以并行执行呢?并不是每条指令都依赖于另一条,图形处理是最明显的例子,我们称之为"令人尴尬的可并行化"工作负载,对吧?矩阵运算是令人尴尬地可并行化的。 这就是多核系统开始兴起的原因,因为对于某些类型的工作负载来说,这是一种可以提升性能的方式,但对于其他工作负载则不然。所以直到今天,如果你有一个单线程工作负载,或者就是某种逐条指令执行的瓶颈任务,说实话,如果你是一个非常优秀的程序员,你可能可以用一台老电脑就把它搞定,只要它还有相当高的时钟频率。你可以想想英特尔酷睿i9-14900KS,我认为这是有史以来面向公众发布的时钟频率最高的处理器,它的频率大约达到了6GHz的峰值。我们今天实际上还没有任何单核处理器能跑得比这更快。 这对大多数人来说不那么重要。但如果你有一个非常重要的单线程工作负载,比如网络数据包处理,你是一个字节接一个字节地接收数据,那时钟频率就非常关键了。
Logan Jastremski:
最终,正如你提到的,这让位于GPU。英伟达在这方面主导了一段时间。正如你指出的,矩阵乘法与AI的映射相当吻合。你能谈谈AI这边是如何开始扩大规模的吗?我想,是关于更大规模的预训练运行的问题。
Mr. Bubble:
也许我们就从英伟达为什么存在、他们为什么擅长这件事说起。我是说,图形处理说到底,这听起来像个玩笑,但它就是形状旋转,是三角形和正方形,你做一个矩阵乘法来移动和旋转它们。这与我们在AI中使用的数学大致相同,对吧? 但AI的好处是你不需要那么高的精度,而图形处理则需要。如果你考虑物理模拟或速度计算,使用64位浮点数,或者用更多位来表示小数部分,对那些工作负载来说是相当重要的。英伟达,当时并不是唯一的图形芯片公司,但很明显图形处理将需要一个专用处理器,对吧?因为你看,我们已经在CPU领域做到了双核,但那远远不够运行一个60帧的完整游戏,对吧?所以你必须把图形处理卸载到一个新的加速器上。所以英伟达做得非常好,我认为。
有趣的问题是,英伟达为什么能长期主导这个领域? 因为当时这个领域有很多其他公司。我对这个问题的回答是:英伟达从一开始就将其GPU设计得具有很强的灵活性和可编程性。有一个著名的故事,黄仁勋说英伟达差点破产,因为图形API发生了变化,也就是渲染图形的协议改变了,而英伟达不支持它。所以他们不得不立刻流片一块全新的芯片来支持那个协议,否则他们就会被淘汰,因为微软在背后支持那个协议,而微软是那个巨无霸。但英伟达,甚至从最早的时候起,他们就在做一些事情,比如并行化IO,比如GPU的虚拟化IO。他们从一开始就非常强调可编程性,因为那时是蛮荒时代,而这最终得到了回报。 很多选择走固化路线的公司都消亡了。但英伟达,直到今天,这仍然是一条相当深的护城河。他们有很强的可编程性,新模型出来了,英伟达似乎在一两天之内就能跑起来,对吧?所以我认为这就是英伟达优势的核心论点。
那么,你说的"固化",是指定制加速器吗?对,是定制加速器。但我的意思是,英伟达在往GPU里加的东西,甚至超出了规范的要求。就像如果规范改变了,如果我们想做这件事,我们能不能让加速器来分担这个工作?这就是为什么他们很快就进入了科学计算领域,因为他们让那个协议变得非常有用,对吧?没有其他图形芯片公司进入了科学计算领域,这是有原因的。 而那正是他们在进入AI之前的起点,对吧?所以,为英伟达点个赞,他们从一开始就努力让这些大型、复杂、可并行化的处理器变得更具可编程性。我认为那是正确的选择。事后来看,那确实是正确的选择,对吧?对于现在的AI来说,这是否仍然是正确的选择?我们不知道,事情会变化。但就目前而言,显然这为他们带来了巨大的成功。
Logan Jastremski:
那么也许再深入探讨一下,你已经开始——我想先退一步说——你因为对英特尔的判断而出名,真正谈到了封装,认为封装是新摩尔定律。你能解释一下为什么你认为封装是新摩尔定律,以及为什么封装比光刻机更有意思?
Mr. Bubble:
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力