Seedance 2.5深度评测:从短视频到电影感的跃迁
一周以后,我想我终于可以来聊聊Seedance 2.5了。
做AI视频和影视的从业者必看,这篇把Seedance 2.5从短视频到电影感的转变讲透了,还给了白模参考做具身数据的思路,赶紧研究下怎么接进你的工作流。
今天,Seedance 2.5的API正式上线了。
我知道几乎所有视频Agent产品、还有一些想做大制作广告、中长精品剧的、影视公司内部的系统,都在等这一刻。
接下来大家都会迅速把Seedance 2.5接进自己的工作流里,然后开始继续碾压式创作,哪怕是AI精品剧、AI短片,我觉得应该也都会迎来一波质量的跃迁。
但说实话,我其实上周就想写Seedance 2.5了,但是在用了一段时间以后,我依然觉得,我自己的能力,完全不足以让我看懂这次更新。
这件事很奇怪。
今年2月的时候,Seedance 2.0刚出来的时候,我几乎只用了一会,就能感受到那种迎面而来的震撼,那一次,我也写了一篇稿子,来描述我对Seedance 2.0的理解。
拥有导演思维,15秒,无可匹敌的调度,精准的多模态可控等等,进步太显眼了。
显眼到冯骥说,AIGC的童年时代结束了。
可2.5不太一样。
它能原生生成30秒,能一次参考30张图片、10段视频和10段音频,能做时间戳级编辑,能参考白模,能处理更复杂的长叙事。
参数全都变大了,功能也全都变强了。
可是这短时间,我看到一些人体验完以后说:
为什么感觉2.5效果好像没有2.0好了?
原来一句话就能出来的东西,现在要写很长的Prompt才能得到。
但是又看到很多影视圈的朋友说,2.5比2.0牛逼太多了,质感完全不一样了,上限被拔高了很多倍,一个个都摩拳擦掌想大干一番。
所以这几天,我很想弄清楚几个问题:
Seedance 2.5到底改变了什么?
为什么一些人觉得升级不明显,而另一波人,比如我的导演朋友,却给出了完全相反的答案?
它所谓的电影感,到底是什么?
最重要的是,2.5这个模型,在进入整个行业以后,它到底会有什么用处?
我有一些自己的体验,但是我依然觉得,我的视角过于业余和片面,于是,我去找了我的几位好朋友,跟他们也深度聊了聊,做了一些采访,希望搞清楚这些问题。
有B站著名的AI视频创作者,我心中世界级的大神,@DiDi_OK。
同样是我心中TOP级的AI视频创作者@海辛和阿文 、@小文&晓丹,以及一个不太能对外透露姓名的朋友。
在跟他们聊完以后,我想,我终于有了答案。
Seedance 2.5给我们带来的,是一个完全不同的未来。
于是,我也想写下这篇文章,给大家也看一下我得到的答案。
那接下来,我们开始。
一. 为什么有人觉得,Seedance 2.5反而没有2.0好用了?
我在跟大家聊得时候,有一句话我觉得很一针见血。
几乎解释了2.5上线以后,所有看起来互相矛盾的评价。
“2.5的指令遵循太强了,所以,当一个模型100%听用户诉求的时候,这个模型本身的能力上限,就变成了用户的上限。”
如果我们回头看,Seedance 2.0当初为啥让大家感觉那么神呢?
如果去掉那些真实的物理、画面的进步之外,有一个很重要的点,也是我之前文章里面写的。
Seedance 2.0,第一次让AI视频模型,有了导演思维。
比如当时我们的一个Case的Prompt。
你无需设计镜头、切镜等等,模型会自己去决定,甚至,他会为了效果,没有那么听你的话。
在模型研究里,这部分可以叫泛化,也可以叫幻觉,但落到普通创作者手里,它就成了创造力。
这是Seedance 2.0最讨喜的地方,让无数的普通人,也能一句话,生成一段很好看的视频。
对于普通用户来说,这种主动性确实很爽。
但,对于专业的影视创作者来说,他有的时候真的就会令人抓狂,代表性的特性就是,它的指令遵循没有那么强,经常的自己发挥。
比如你想要一个克制的长镜头,2.0为了效果,它就非要切镜。
很像是社交媒体上会火的视频,更快的节奏、更密集的信息、更频繁的切镜,特别是模型还会卡点。
这些都是爆款短视频的特点,模型很好地学习了这些能力,形成了2.0特别鲜明的特点性格。
2.0可以生成15秒的视频,它也特别会拍15秒,因为这个时长,太短视频了,它的很多能力,都是为了让普通人,更好的生产出很具有爆感的视频。
而这一次,到了Seedance 2.5。
Seed团队换了目标。
我的不太能透露姓名的朋友告诉我,他们把这一版SFT数据的切分方式、描述方式还有质量标准,是完全按照电影生成的方法重新做了一次。
同时,也重新定义了审美的方向,也重做了质量标准。
这一切,都是为了跟电影标准对齐,而不是短视频和短剧。
模型学习的也不再只是“画面里有什么”“镜头怎样移动”这些描述,还包括一个导演会怎样描述自己的意图。
比如:
我希望观众看到这个镜头以后会难过。
我希望这个角色看起来在笑,眼神里却有一点犹豫。
我希望两个人之间的沉默,成为推动剧情的一部分。
这类描述很抽象,它们指向的也不只是一个动作,还包括表演、节奏、构图、光线和声音等等共同制造出的感受。
模型想要要理解这些,就必须压住自己随手补戏的冲动,从而把创作者想要的东西执行出来。
对于专业人士来说,可控性和一致性,永远是第一要义。
于是,2.5主动消灭了一部分刚刚好的幻觉。
它更听话了,指令遵循也变得极强。
但代价也更直接了,当你只给它一句很短、很含糊的话,它不会像2.0那样兴高采烈地替你补完整套方案,从而达到一个看着很聪明的效果,它可能真的只完成你说的那一点,于是画面或许就会显得有些木。
就像,从一个天马行空的伙伴,变成了一个可靠但可能没那么有意思的搭档。
海辛的描述我觉得非常的准:
“2.0对业余创作者更方便,因为模型自己延展镜头的能力很强。2.5 对专业创作者更友好,因为它稳定、可控,愿意服从更具体的导演意图。”
我用一个例子来表现一下,大家可能能更好的理解。
比如我要做这么个视频。
这是2.0出的效果。
这是2.5的。
你会看到,2.0补了一些镜头,快切非常之猛,并且做了一个很大的运镜调度。
相比之下,2.5的节奏就更平实,没有那么多的切镜,精准的表达你的Prompt需求,并且节奏更加电影感。
这也解释了为什么,把它用好的人,Prompt会写得越来越像分镜表、导演阐述和拍摄计划之类的东西。
模型变得越听话,那反而对创作者的要求,就越高了。
二、30秒的意义
Seedance 2.5这次最显眼的数字,自然就是可以直出30秒的视频了。
2.0最多15秒,这次2.5翻了一倍。
乍一看,其实就是多了15秒,就是一个普通的生成时长增长了。
可是在叙事中,15秒和30秒的片段之间,其实有着质变。
这也能体现出,Seedance 2.5目标是极致影视化而诞生的结果。
15秒来说,通常只能够支撑我们完成一个点子。
比如一个人冲进房间、一辆车穿过城市、一个怪物从水里爬出来之类的。
但如果你想在里面加入铺垫、发展、停顿、转折和结果,那时间立刻就不够用了。
于是模型就只能疯狂切镜,尽可能的在15秒之内压缩达到你的要求,于是,这就变成短视频节奏了。
可是,真正的影视不是这样的。
影视需要铺垫,需要时长,需要沉默。
而30秒,开始在整体上接近一个完整的场景单元了。
比如两个人可以先说一句话,沉默几秒,出现一个细微的表情变化,然后让某个动作改变关系,最后再给观众一点反应时间。
这几秒钟的停顿,看起来什么都没发生。
可在一场戏里,很多情绪和念想,反而恰恰发生在沉默的几秒钟里。
叙事,很多时候讲究的是留白,是那说不满的一寸。
过去的AI视频工作流,本质上是一张图对应几秒动态,再把几十个片段拼成一支片子。
但现在,你要考虑的就是,这三十秒为什么存在,人物在里面发生了什么变化,观众应该在哪一秒知道什么。
这基本已经开始接近导演每天面对的问题了。
三、所谓电影感
这次我问 DiDi_OK,他使用Seedance 2.5最直观的感受是什么。
他几乎没有犹豫。
就一个词,美术。
在他看来,美术是2.5最重要的升级,甚至比30秒、50个参考素材更重要。
因为很多功能上的问题,可以通过多抽几次、换模型、做剪辑、上后期来补。
可画面底子里的材质、光影、颜色和空间啥的,一旦很差,后面就很难救回来了。
海辛表达的也是如此。
她给我看了几组同已输入下的2.0和2.5的对比。
她觉得,最明显的差别,就是颜色终于没有那么油了。
这个视频其实就能很明显的看出来,整体颜色都更舒服,饱和度也更克制,AI味也更弱。
而且人物AI脸的部分,也被大幅改善了。
这也是很多人说2.5有胶片感、实拍感的来源之一。
但电影感绝不只等于低饱和。
让一个画面显得可信,至少还包括这些东西:
光源方向要一致。
材质面对光线时要有正确反应。
人物皮肤、眼睛、毛孔和衣服的纹理,要随着距离和角度自然变化。
声音也要知道远近、遮挡和空间等等。
DiDi_OK提到一个特别有意思的细节。
2.0即使把分辨率拉高,人物边缘有时依然会出现一条很硬的线,手看上去只是一个模糊的面,环境又是另一个面,两者之间泾渭分明。
到了2.5,即使观看的是720P的较低分辨率结果,手背不同斜面的阴影、皮肤细节的暗示、人物和环境之间的光线过渡也更丰富,边缘不再那么硬,主体才终于像真的站在那个空间里面了。
这也是为什么,有些专业创作者会觉得2.5的720P,看起来比过去更高分辨率的结果还舒服的原因。
Seed的朋友也举了一个例子。
你对2.0说,一个女生站在头顶的射灯下面。
它会生成一盏射灯,也会把女生放到灯下面。
从物体清单来看,它完成了指令。
可那盏灯的光,可能根本没有落到女生脸上。
2.5会继续理解后面的因果关系:既然灯在这里亮着,人物的额头、鼻梁、眼窝、肩膀和地面就应该怎样受光,影子又应该落到哪里。
这种进步你很难用一些片段来描述,甚至很多人其实也说不出来个啥,但是就会感觉,哎这一版好像更舒服一点,那一版好像假一点。
可电影感,很多时候就是被无数个这种说不清的小地方,托举起来的。
四、空间与声音
这次还有两个最容易被大家低估的升级,是空间和声音。
DiDi_OK说,2.0时代大家特别爱做快速打斗、快速运镜和疯狂切镜,还有一个现实原因。
那就是空间关系不好控制。
模型很难通过一张图持续理解角色站在哪里,门在哪里,摄影机又在哪里。所以镜头停得越久,观众越容易发现透视不对、人物漂移、背景变了值之类的穿帮。
快速切镜刚好可以把这些问题藏起来。
看起来很燃,但有时也是没办法。
2.5对空间的理解明显变强以后,创作者不需要再用那么多切镜去藏拙了。
一个角色可以在同一空间里连续运动,摄影机换一个角度,模型依然大致知道人物、道具和场景之间是什么关系。
这会给叙事带来非常直接的变化。
只有空间稳定,演员才有地方表演。
只有镜头愿意停下来,观众才有时间看见表情。
只有人物在空间里的位置可信,走近、远离、回头、躲避这些动作才会产生意义。
声音也是同样的道理。
DiDi_OK 以前会专门留出时间和预算,为AI视频重新做音效。
2.0的人声已经很好,角色声音一致性也很强,但它经常会漏掉那些看起来不重要的声音。
比如一个人坐在远处动了一下,或者筷子碰到碗这种,经常都会没有声音。
比如角色拿起一把金属武器,只有对白,没有影视里为了强调重量和机械结构而设计的金属摩擦。
画面动作发生了,可是声音却没有跟上。
2.5在这方面细腻了很多。
碰撞的声音,人体接触物体时很轻的摩擦,抽象生物和机械装置应该发出什么声音,模型都会主动补得更完整。
所以这次,空间感的进步和声音的进步,其实是很多人所忽略的。
当然,它依然有明显问题。
比如DiDi_OK测试时发现,云、烟雾、远处篝火的烟,有时会像壁纸一样挂在天空里,空气流动和环境之间缺少关系,控制物体一多,模型也可能顾住第一件事,漏掉后面的要求。
比如第一人称POV镜头依然容易暴露AI感,真实摄影机里的呼吸、变焦、步伐带来的细碎震动和临场感,还不够灵动。
中文对白有时也会带着一种播音腔,很多聪明的创作者会用方言绕开,因为我们对普通话太熟了,一点点不自然都会被放大。
所以,Seedance 2.5其实也还没有达到随便生成就是影视的地步。
复杂场景依然需要抽卡、调试、后期和人的判断。
五、Seedance 2.5到底有什么用?
聊到这里,终于可以谈最敏感的问题了。
这个全新的模型,他到底有什么用呢?
首先大家最关心的,肯定就是如此影视级的Seedance 2.5,会不会让部分的影视从业者感受到危机?
坦诚的讲,我想说,会。
冲击会沿着任务一层一层传导,先从价格最敏感、交付周期最短、容错率相对更高的地方开始。
比如,广告、电商、MV、宣传片、短视频和短剧里的大量中低成本镜头。
这些其实我们已经能看到大量的AI运用和替代了。
而对真正的大电影、大剧集来说,AI最快进入核心流程的地方,还不是最终画面。
但概念测试、动态分镜、整片Animatic、场景预演、动作预演、光线测试、提案片和样片,都可能会被迅速改写。
而且Seedance 2.5支持白模参考,这件事尤其重要。
一个剧组可以先在简单的 3D 空间里摆好立方体、圆柱、人物位置和运动路径,再让模型根据这些空间信息,快速生成接近最终视觉效果的预演。
过去我们在组里拍预演,即使是全部用3D动捕小人,那个成本依然贵。
现在,静态白模加Seedance 2.5就可能把这些往前推进很多。
但是如果我们只看影视行业,我觉得一切还是太窄了。
其实在我这次聊下来,还有一个很重要的领域,是常常被我们所忽略掉的。
那就是具身智能。
具身这个行业过去一直有一个痛点,就是太缺数据了。
机器人要真正走进工厂和家庭,需要见过大量的物体、动作、环境,以及各种人类想都想不到的意外。
可这些数据,对机器来说,每一条都很贵。
以前当然我们也可以在3D仿真环境里造这些数据。
Seedance 2.5因为能力的跃迁,又提供了一条新的路径。
开发者可以先用白模规定机械臂、目标物体、障碍物和运动路径,再用图片规定材质和环境,用Prompt补充事件。
三十秒的长度,可以覆盖一段相对完整的操作过程。
局部编辑又可以在尽量保持其他条件不变的情况下,只改一个物体、一个动作,或者某几秒里发生的意外。
这个的想象空间,可能比做影视还要大,甚至,疯狂加速具身的落地。
这可能才是Seedance 2.5真正大的产业变化。
六、未来最值钱的能力
当最终的一切,越来越便宜,昂贵的东西会逐渐往上游移动,我觉得未来,最重要的可能就是几个能力了。
第一,是判断。
模型一小时可以给你几十个镜头。
哪一个对,哪一个只有表面好看,哪一个能接住上一场戏,哪一个会破坏人物,依然需要人做决定。
所以,有审美、有叙事能力的导演、美术指导、摄影指导、剪辑师、声音设计师和视效总监,价值只会越来越贵。
第二,是可以被模型使用的资产。
因为Seedance 2.5的50个素材的超强参考能力,未来,角色的多角度设定、表情库、服装、道具、场景、声音、动作、镜头规则、色彩规范,都会从参考资料变成生产资料。
这些,是一致性和可控性的基石。
不仅对影视创作很重要,对具身数据生产,也很重要。
第三,是故事。
当所有人都能做出看起来像电影的画面,电影感会迅速贬值。
今天一段逼真的AI视频还能靠“这居然是AI做的”获得传播。
再过一段时间,观众一定会疲劳,一定会逐渐钝感。
那时候,大家只会在乎一件事,就是你的故事,它好不好看。
模型吃过大量优秀影像,它能学到构图、运镜、光影和节奏的平均规律。它也会把这种平均规律分发给每一个人。
结果可能很残酷。
大家的画面都更高级了,也更像了。
最稀缺的,会变成别人没有讲过的经验、人物和情感。
一个好的故事,依然是最重要的。
也依然,需要从生活里来。
写在最后
写到这里,我终于能回答,Seedance 2.5相比2.0,到底改变了什么了。
2.0的震撼,来自AI突然学会了很多导演才会的东西。
而2.5的变化则更隐蔽。
它开始学会收住自己的表演,理解更细的创作意图,在更长时间里保持空间、角色、光影、声音和节奏,然后把控制权,交还给创作者。
这种变化,更深、更细、却对行业的改变,更加潜移默化。
所以,在今天,我们可能每个人都得思考一个最难的问题:
当你有了Seedance、有了Codex、有了各种各样几乎能让你无所不能的工具,那你,到底想对世界讲述什么呢?
我们每个人。
可能都需要自己的答案。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。
>/ 作者:卡兹克
>/ 投稿或爆料,请联系邮箱:[email protected]
作者: 数字生命卡兹克
查看原文 →
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力