跳到主内容
精选85meng shao模型发布/更新多源精选 ×3

FLUX 3 发布:定位真实世界模型

FLUX 3 发布了!

原文
推荐理由

FLUX 3 的“真实世界模型”定位和多模态融合架构对 AI 从业者很有启发,尤其是将生成模型与具身智能结合的方向,值得关注其后续产品开放进度。

FLUX 3 发布了!

Black Forest Labs 对它的定位,不再是又一个「文生视频模型」或「文生图模型」,是「真实世界模型」!

团队把 图像 / 视频 / 音频 放进同一套 multimodal flow 架构里,试图学「世界如何运作」,再把同一底座同时接到 内容生成 和 具身/动作预测。

为什么要「多模态一起学」? · 图像:提供某一时刻的空间结构与关系 · 视频:提供时间、动力学、物理规律 · 音频:提供机械现象与声学之间的因果线索 · 语言:提供目标、抽象、指令

各模态都是同一现实的「投影」,单独训只能拟合投影;一起训时,模态之间的互约束(声音必须对得上撞击、运动必须符合质量、未来必须接续过去)才更接近「世界表征」。

能力拆解:同一模型,三条产品线 1. Video(已 Early Access):最长约 20 秒、原生音频;文/图/视频参考、续写、关键帧、多语言对白;可链式拼更长片。 2. Image(随后数周):合成 + 编辑;复杂 prompt、多语文字、风格与分辨率更强(仍在 midtraining 迭代)。 3. Action(伙伴通道):原生动作预测,或把视频骨干当动力学底座微调;已有 FLUX-mimic(mimic robotics / Audi 场景)。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近