前字节商业化GenAI负责人袁泽寰离职创业,投身世界模型赛道
大厂离职List|前字节商业化GenAI中国区负责人袁泽寰下场“造世界”,Physical AI赛道再添重磅玩家
-
谁能先让AI真正理解物理世界?
撰文╱卢孟洁(ID:jie1366546790) 美术编辑╱卢孟洁
近期,据AI智件消息,字节跳动商业化GenAI中国区负责人、原AI Lab技术负责人袁泽寰确认离职,投身“世界模型”创业,聚焦Physical AI领域基础模型研发。
这位兼具前沿技术与商业落地经验的技术操盘手,正撞上2026“世界模型元年”的资本与产业风口,仅上半年融资已超30亿元。
与此同时,他面对的是大厂与创业公司扎堆的拥挤赛道——互联网巨头们追求通用性,试图为多种应用(如游戏、社交、具身智能)提供可生成的虚拟环境;而创业公司如极佳视界、自变量机器人、星源智等则是主攻“机器人大脑”,专注为机器人研发高精度的物理模拟器或决策规划器。
从AI Lab到商业化落地的技术操盘手
公开资料显示,袁泽寰师从路通教授,2017年从南京大学计算机科学与技术系毕业;读博期间,曾赴密歇根大学访学。
毕业同年,袁泽寰加入字节跳动AI Lab担任研究科学家,从事计算机视觉与多模态生成基础模型研发;2020年,他晋升为技术负责人,担任字节商业化GenAI中国区负责人、媒体智能团队主管,统筹生成式AI从基础研究、模型架构创新到商业化落地的全链路工作。
在字节近九年期间,袁泽寰主导研发了VAR、ByteTrack、LlamaGen、Waver等多款业内标杆模型。
在业界成果转化与学术反哺方面,袁泽寰作为共同作者参与的一篇论文 [1] 发表于2022年欧洲计算机视觉会议,并在2023年初被多个学术榜单评为ECCV 2022最具影响力的论文之一;2024年,他作为通讯作者参与的另一篇论文 [2] 入选NeurIPS Best Paper,这篇论文提出的视觉自回归模型(VAR)首次使GPT类自回归模型在图像生成领域超越扩散Transformer,推理速度提升达20倍。
值得一提的是,第二篇论文的一作正是此前因“篡改代码破坏大模型训练”而被字节开除、索赔的实习生田柯宇——如今同样在世界模型领域创业,其所创办的公司已于上月完成首轮融资,目前估值达2亿美元。
两人高度重合的研究路径,让袁泽寰这次创业自带行业话题度。
和很多技术负责人从业履历贯彻科研路线不同,袁泽寰后期转岗至商业化线,负责营销垂直大模型构建与AIGC、LLM在商业化方面的落地,推动业务增长与效能提升。这种“既懂前沿技术、又懂商业变现”的复合背景,或许是袁泽寰在Physical AI赛道最有辨识度的筹码。
[1] 《ByteTrack: Multi-object Tracking by Associating Every Detection Box》,该论文的核心贡献为提出名为“ByteTrack”的多目标跟踪算法。这个模型的核心思路不同于传统方法只使用高置信度的检测框来跟踪物体,而是会保留那些得分较低的检测框(例如被部分遮挡的物体),然后通过二次匹配来“挽救”这些可能被遗漏的真实物体,从而大幅提升了跟踪的准确性和连贯性。
[2] 《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》,该论文提出了一种名为“视觉自回归建模”(VAR)的全新图像生成范式。它颠覆了传统自回归模型将图像视为一维序列、逐个预测“下一个token”的方式,创新性地采用了由粗到细的“下一尺度预测”策略。实验结果表明,VAR首次使GPT风格的自回归模型在图像生成质量(FID从18.65降至1.73)和推理速度(提升约20倍)上全面超越了此前占据主导地位的扩散模型(如DiT)。
赛道概念未统一,资本已疯狂押注
袁泽寰选择的世界模型赛道,正处在“概念定义尚在争论、资本弹药已疯狂涌入”的特殊节点。
所谓世界模型,核心目标是让AI超越“识别世界”,进阶到“理解物理规律、预测未来状态、推演动作影响”。2026年夏季达沃斯论坛发布的《十大新兴技术报告》将“世界模型”列为未来五年深刻影响世界的核心技术之一。
但具体怎么实现,业界远未达成共识。智源研究院院长王仲远将当前技术路线分为四类:以语言为中心的世界模型;以像素为中心的世界模型,即视频生成;以三维结构为中心的世界模型,包含3D重建;以视觉表征为中心的世界模型。同时,他指出这四类模型距离真正面向物理世界的基座模型都有很大的距离。
尽管如此,全球资本正以前所未有的速度涌入这个新兴赛道。
据不完全统计,2026年以来,中国世界模型相关创业公司融资呈现“亿元是门槛、十亿元是常态”的奇观:千寻智能在三个月内累计融资超45亿元;自变量机器人两个月内闪电完成四轮重磅融资并集结顶级财务机构、超30家顶级国家队与产业资本;极佳视界三个月内融资超35亿元。
海外同样热火朝天:杨立昆创立的AMI Labs完成10.3亿美元种子轮融资,李飞飞的World Labs估值已飙至50亿美元。
据DecibelPartners统计,仅2026年上半年,风险投资基金向世界模型相关企业投入超30亿美元。资本热钱大量涌入源于对未来高收益的期待——据摩根士丹利预测,到2035年由世界模型赋能的产业规模将达10万亿美元。
出走背后
虽然字节早在2024年就有相关人才储备,但实质性的大规模研发和资源倾斜主要集中在2025年下半年至2026年。相比Google、Meta等更早布局该领域的国际科技巨头,字节入场世界模型的时间较晚,其布局呈现“早期关注、中期观望、后期发力”的特点:
2024 年,前阿里达摩院高级算法工程师周畅加入字节,虽然名义上扛起了世界模型研究的大旗,但当时字节内部认为世界模型的路线和商业化前景尚不明朗,优先任务是打好“视频模型”的仗,因此并未进行大规模投入。
2025 年,字节才在小范围内成立研究组,由两支队伍对世界模型中的 VLA(视觉-语言-动作模型)路线进行探索——AI lab负责人李航,基于仿真数据进行世界模型训练; Seed 多模态研究员王文千,基于自然数据做训练。
2026年初,世界模型被确立为2026年字节AI的最高优先级事项。字节为了跻身世界模型第一梯队的目标做了进一步组织架构调整:春节后,Seed 新设立了一支世界模型研究组,负责人为前Meta FAIR Lab研究员范浩奇,该团队走 3D 仿真路线,主打娱乐和游戏类应用场景;而原来由李航和王文千带领的、目标应用场景为具身智能的两个 VLA合并。
另外,在字节内部,高额的训练数据预算也被下批给世界模型研发。一名数据供应商表示,字节在世界模型上的数据投入,是其他厂商的3-4倍。
尽管奋力追赶,但是在Seed领头人吴永辉看来,“字节世界模型和具身智能的效果不及预期”。字节内部评测可以作证这一事实——截至2026年初,字节世界模型的综合性能距离全球 SOTA 仍存在 10% 的差距。
因此,在内部人力和探索路线扩张、资金支持充裕的情况下,袁泽寰仍选择出走,或与字节世界模型研发追赶速度不够有关。
此外,从赛道窗口来看,世界模型正处于“定义未定、卡位即胜”的关键时间点——2026年上半年世界模型赛道融资事件已达42起,几乎追平2025年全年。赛道窗口期的竞争压力或是促使袁泽寰选择在此时独立创业的另一原因。
当下,世界模型赛道的玩家们仍处于早期“盲人摸象”阶段,没有统一的定义和标准,大家都在探索之中。正如智源研究院院长王仲远所言:“世界模型整体仍处于早期阶段,技术路径尚未收敛,数据体系、评测框架都远未成熟。”
然而,袁泽寰有其自身独特的优势——他既有字节AI Lab的前沿研究积淀(ByteTrack、VAR等标杆成果),又有商业化GenAI的一线落地经验。至于其能否在世界模型赛道突围,尚需时间验证。
参考资料:
1.《资本竞逐世界模型:热潮、分歧与未竟之路》,每日经济新闻
2.《世界模型为何成为AI发展新赛道》,中国改革发展报社
3.《自变量发布新一代自研具身智能基础模型WALL-B》,环球网
4.《字节AI1080天闪电逆袭:从后知后觉到AGI全面发力》,21世纪经济报道
5.《风口上的世界模型,到底是什么?》,36氪
6.《世界太小,不够世界模型们用了》,36氪
7.《2026 年字节 AI 的四个关键命题》,36氪
点击标题,阅读更多相关报道:
要闻|京东酒旅换帅:携程系老将败走,90后“嫡系”接棒
要闻|快手可灵补强两位算法核心大将,IPO前夕再加码
大厂离职List|六年老臣、抖音直播负责人钱景,告别调整中的字节
关注青年成长
跟踪职场风向
谁能先让AI真正理解物理世界?
查看原文 →
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力