实测H3与Seedance 2.0 fast:8场景横评,性价比之王揭晓
烧掉500块实测H3、Seedance 2.0 fast,意外挖出了性价比之王(附全部提示词)
H3与Seedance 2.0 fast在同一提示词、分辨率和平台下完成多场景视频横评,比较真人表演、短剧、动效、广告和科幻等场景的指令遵循、镜头连贯与画面质感。实测Seedance 2.0 fast整体更稳,H3在视觉动效和广告场景各有优势。
最近AI视频赛道卷飞了,一下子出来了好多新模型,比如Seedance 2.5、Flux 3、Minimax H3、Sand.ai、Wan 3.0、Meta Muse Video、Grok Imagine Video。
尤其是字节Seedance,2.5出来后,反手给上一代模型来了个骨折价。
我知道,你肯定也有和我一样的问题:这么多模型里面,究竟哪款好用,哪款更有性价比?
今天我挑了两款比较热门的模型,一起来做了期横评,从8个场景一起对比,看看他们的真实效果和性价比。
两款模型分别是:MiniMax H3、Seedance 2.0 fast,全部都是同一提示词、同一分辨率,在同一平台进行测试。
同时我也用Seedance 2.5做了showcase,看下他俩跟SOTA模型的差距。
这么一期测评跑下来,模型成本基本不低于500元(后面我会详细介绍成本明细)……如果大家对这类选题感兴趣的话,希望多多三连,我咬咬牙,下期再测测其他型。
话不多说,我们这就开始。
01 一手横评
1)真人表演
真人表演,是做视频绕不开的刚需场景,也最能检验模型的真实能力。
我用同一个提示词,分别用MiniMax H3和Seedance 2.0 fast各跑了一遍,指定了主体人物和场景。
这是提示词,虽然只有2个镜头,但用了大量的细节描述去约束角色的表演。
完整提示词:
女性主体:@图1 年轻漂亮,长发披肩,坐在@图2 车后排。
角色状态:与男友分手告别,表面强撑微笑、内心悲伤压抑,最终情绪崩溃嚎啕大哭。
场景:用@图2的车内部的后排车厢作为空间环境参考,前排副驾驶空位(前景局部失焦虚化);侧车窗与后车窗均被雨水打湿;车窗外为城市街道夜景、霓虹灯光、淅淅沥沥的小雨。画面风格真人实拍质感的青春恋爱电视剧,现代都市写实服化道,细腻情感戏审美,情绪戏节奏克制。影调车内整体偏暗,窗外城市夜景与霓虹灯光透过雨打车窗,在车内形成流动的彩色光斑与明暗切片,勾勒女性面部轮廓与长发边缘;车窗玻璃上雨珠反光;夜景冷调为主,霓虹光斑冷暖交织。
字幕设置:全局约束无字幕、禁止生成字幕。
画面内容:
分镜 1,0s-6s,车内中景,固定机位,摄像机位于前排副驾驶位置朝后方拍摄;前景左下方为副驾驶空座椅背局部(失焦虚化),女性位于画面右侧三分线位置。她侧着脸望向右侧车窗外,轻咬下唇,微笑着与窗外人道别,窗外站着一名身穿灰色夹克黑色牛仔裤的男性,透过车窗只能看见男性的局部身体。对白:女性(轻咬下唇,微笑):「就这样,不用送了。」随后她转头面向镜头,对前排司机说:对白:女性:「司机,开车。」说完她不经意地带出一声压抑的细微啜泣,随即轻轻舒了一口气,脸上仍保持着刚才的微笑。出租车随即启动,车身轻微震动一下,车辆起步向前开动,窗外男性朝着车窗挥手再见(局部入画),男性与窗外雨幕与霓虹灯光快速向后掠过。音效:淅沥雨声打在车顶与车窗,城市夜晚低缓的环境底噪;对白期间人声清晰突出;一声压抑的细微啜泣;轻舒气声;发动机启动声与车身轻微震动;轮胎碾过湿路面的起步声。
分镜 2,6s-15s,切换车内后排近景,手持拍摄,轻微仰拍,镜头随行驶中的车身轻微晃动;焦点在女性肩部以上正面,她背后隔着被雨打湿而模糊的后车窗,城市街景与霓虹灯光逐渐远去。一开始女性脸上仍带着微笑,没有皱眉也没有哭,慢慢地她开始轻微皱起眉头,小幅摇了摇头,像是反悔刚才说出口的话;接着她的嘴角微微下压,抿紧双唇,眼眶开始泛红;她稍稍仰起头试图忍住,眼神有些游离地瞥向旁边车窗外;接着她终于再也压抑不住 —— 嘴角明显下垂,眉毛内收收紧,鼻子开始抽搐,眼神黯淡,眼眶湿润,泪水开始流出;然后她垂下头、微微蜷缩着肩膀,随即猛然仰头,嚎啕大哭,一边哭一边抬手擦去脸上止不住的泪水。整段为逞强微笑→压抑情绪→悲伤外泄→情绪大爆发的连续情绪变化,一镜到底。
音效:雨声持续;行驶中发动机低鸣与轮胎碾过湿路面的沙沙声;呼吸渐重、吸鼻声;压抑啜泣转为放声大哭;手背擦拭泪水的摩擦声与衣料声。
全局配乐:雨夜分手情绪戏(15s 配乐轨,无歌词)。
0-6s 无BGM,只保留对白和环境声;6-8s 微笑→轻微皱眉 | 钢琴单音/两音动机从雨声里渗出,极弱 pad 垫底,像回忆浮上来;8-10s 摇头反悔→抿唇→眼眶泛红 | 钢琴变叹息式下行音型,大提琴长音进入;10-12s 仰头忍泪→眼神游离 | 小提琴组加入,和声加厚,钢琴分解和弦铺开;12-13.5s 嘴角下压→鼻翼抽动→泪落 | 情绪临界:弦乐揉弦+力度加强,钢琴和弦加重;13.5-15s 垂头蜷缩→仰头嚎啕大哭 | 段落峰值:弦乐齐奏主题,钢琴八度重音。
提示词结构by袋鼠帝
来看下对比:
H3首先是镜一的机位出了点问题,略显穿帮;同时模型对车内的画面脑补得也不够,就导致整个车内环境不太协调;镜二的哭戏方面,倒还算合格。
但对比一看,明显Seedance 2.0 fast的指令遵循更强,剧情连贯,人物表演也很到位,完全做到了“逞强微笑 → 压抑情绪 → 悲伤外泄 → 情绪大爆发 ”的连续情绪变化处理,表情控制更细腻,更真实。
这轮实测,Seedance 2.0 fast的镜头感和人物表演都明显强于H3。
2)宫斗短剧
短剧是今年AI视频最大的应用场景,没有之一。我用常见的宫斗剧来测,先生成了3个主体:皇后、宫女和皇上。
这是剧情设计。
完整提示词:
【主体设计】
风格:电影感武侠,悬疑惊悚,冷月夜色,水墨写意×写实质感,高反差冷光,胶片颗粒,幽暗压抑。
主体档案:
主体A「展昭」:约30岁青年侠客,剑眉星目面容清俊,玄青色紧身夜行衣束腰带,背负巨阙宝剑,身法轻捷如猫,沉静机警。
主体B「黑衣卫」(遇险登场):宁王府数名带刀护院,深褐劲装蒙面,持单刀,凶悍警觉。
场景锚点:宁王府深宅,三更月夜,飞檐重楼、回廊深院,红灯笼幽光,冷月清辉,竹影摇曳。
【逐镜分镜】
镜1 | 0.0–1.4s
宁王府高墙外,三更冷月,电影感武侠。主体「展昭」伏身墙头、夜行衣下摆随风轻摆。全景,镜头自墙下缓慢上摇。展昭悄然探头俯瞰府内、冷月勾出身形剪影、竹影在墙上摇曳。展昭居上方居中。
镜2 | 1.4–2.4s
府墙内侧,月影斑驳。主体「展昭」足尖一点、轻盈跃下。中景,镜头跟随下落轨迹下摇。展昭如猫般无声落地、衣袂在跃落中翻飞、惊起檐下宿鸟扑翅。展昭居中。
镜3 | 2.4–3.4s
回廊暗影处,红灯笼幽光。主体「展昭」贴墙潜行、屏息凝神。中近景,镜头侧向横移跟随。展昭贴影疾走、脚步无声、灯笼光在脸上明灭掠过。展昭居左。
镜4 | 3.4–4.4s
飞檐屋脊上,冷月当空。主体「展昭」纵身上檐、伏身疾掠。全景,镜头低角度跟拍飞掠。展昭踏瓦轻掠屋脊、夜行衣鼓风猎猎、瓦片月光下流过。展昭由右向左掠。
镜5 | 4.4–5.4s
正堂窗棂前,幽暗烛影。主体「展昭」伏于窗下、侧耳贴听。近景,镜头极缓推近侧脸。展昭俯身贴窗、目光锐利凝定、窗内烛火在眼中跳动。展昭居右。
镜6 | 5.4–6.4s
窗纸内透出人影,烛光摇曳。主体「展昭」透窗窥视、瞳孔骤缩。特写转中近景,镜头随窥视极缓推近窗纸。窗内黑影攒动、密信地图掠过烛光、展昭眼神一凛。窗纸人影居中。
镜7 | 6.4–7.2s
廊柱阴影深处,冷光暗涌。主体「黑衣卫」持刀转入、巡夜逼近。中景,镜头自暗处缓缓横移露出黑衣卫。黑衣卫提刀踱步、刀锋映出冷月寒光、脚步声渐近。黑衣卫居右。
镜8 | 7.2–8.0s
窗下暗角,千钧一发。主体「展昭」骤然收身、贴柱屏息。近景,镜头急速推近接屏息静止。展昭闪身隐入柱影、按剑屏息、汗珠自鬓角滑落、刀光自身侧掠过。展昭居中。
镜9 | 8.0–8.9s
护院抬眼瞬间,冷光一闪。主体「黑衣卫」警觉回头、刀尖前指。特写,镜头急速横甩(whip pan)。黑衣卫眼神一厉、单刀骤然指向暗影、灯影剧烈晃动。刀尖居中。
镜10 | 8.9–10.0s
庭院月下,寒光骤起。主体「展昭」拔剑而出、剑光破暗。中景,镜头随拔剑动作急速拉开。展昭巨阙出鞘、一道冷光划破夜色、衣袂炸开、群卫拔刀围拢。展昭居中、黑衣卫环绕。
镜11 | 10.0–11.4s
群卫围攻中,刀剑交错。主体「展昭」剑走轻灵、连挑数刀。中景转全景,镜头环绕半圈跟拍。展昭剑光如猫影穿梭、连格连挑震开单刀、火星四溅、衣袂翻飞。展昭居中央旋身。
镜12 | 11.4–14.0s
府院高墙边,冷月孤悬。主体「展昭」反身急退、纵跃上墙。全景,镜头缓缓拉远并上摇。展昭虚晃一剑、足尖连点跃上高墙、回身一瞥后没入夜色、群卫追扑扑空、竹影在月下轻摇。展昭居上方剪影。
来看下对比。
镜头连贯、人物表演和演员台词方面,依旧是Seedance 2.0 fast更优。另外,在场景、服饰和光影这些细节渲染上,Seedance 2.0 fast也更有电影感一些,H3会有一丢丢的塑料感。
尤其是涉及到一些动作镜头,比如甩手、扇耳光、扬手制止等肢体动作,H3的动作力度都偏弱,演绎不出宫斗剧的狠辣与阴险。另外台词功底上,H3的演员爆发力不足,没有Seedance 2.0 fast那股子狠辣。
这轮实测,依旧是Seedance 2.0 fast优于H3。
3)视觉动效
我给最近爆火的《牛来》设计了一个服装logo,是不是看着就挺抽象的。
输入提示词:
完整提示词:
使用参考图 作为唯一核心视觉锚点:严格保留主体的真实轮廓、关键几何结构、内部识别点和原始视觉性格。生成一条「未来系统化材质蒙太奇」品牌 / 产品概念视频。节奏密集,像高级 AE motion design + 科技广告混剪。不要改造成无关主体,不要增加其他 Logo,不要出现大段可读文字;可以出现不可读的小参数、代码感细线、坐标点和 HUD 图层。
全片统一风格:高级科技广告片,极简黑 / 白 / 灰无边界空间,高反差明暗脉冲,强侧光和逆光轮廓光;每 0.25-0.45 秒出现一次视觉变化或图层事件。大量 AE 感关键帧:HUD 线框弹出、扫描线扫过、圆环 tracking 点锁定、glitch 闪断、粒子汇聚、数字网格展开、透明玻璃折射、金属压印、岩石刻痕、App 图标容器、UI 反相闪切。所有 UI 元素必须轻量、细线、边缘化,不遮挡主体。
0.0-0.4秒:纯黑场,主体的核心几何 tracking 点微微亮起,像系统启动;低频启动声。
0.4-0.8秒:主体从边缘或暗场中快速浮现,保持参考图的核心姿态和构图,轮廓光沿主体边缘跑一圈;HUD 十字准星瞬间贴合关键结构。
0.8-1.2秒:镜头急速推入主体的核心几何点或圆环结构,局部放大成透明玻璃通道,边缘出现折射和细碎粒子;短促玻璃嗡鸣。
1.2-1.45秒:黑场闪断,只剩主体关键结构的残影漂浮。
1.45-1.9秒:AE 式网格展开,主体线稿由粒子点云重建,细线节点逐段连接成完整轮廓。
1.9-2.35秒:白场反相,主体变成黑色剪影,背景有极淡 UI 卡片和参数条,文字不可读。
2.35-2.75秒:扫描线从上到下扫过主体,关键几何结构出现机械光圈式缩放,伴随电子 click。
2.75-3.2秒:转入透明芯片或透明介质特写,芯片内部悬浮主体轮廓线稿,边缘有极细电路线和测量刻度,背景极亮,镜头缓慢横移。
3.2-3.55秒:主体被分解为 3 层 AE 图层:外轮廓、核心识别点、边缘结构,三层轻微错位再快速合拢。
3.55-3.9秒:glitch 闪切,主体轮廓变成白色线框,背景瞬间进入纯黑实验室空间。
3.9-4.35秒:显微纤维网或粒子结构快速生长,沿主体外轮廓爬行,形成主体关键形态。
4.35-4.75秒:强侧光扫过材质表面,HUD 小坐标点沿轮廓自动标注,像设计软件正在识别曲线。
4.75-5.15秒:金属圆盘或压印材质微距,主体轮廓被压印在拉丝金属上,周围高反射褶皱产生剧烈高光。
5.15-5.45秒:压印结构快速旋转,AE motion blur 拖影,画面边缘出现细白框和定位线。
5.45-5.85秒:黑场停顿半拍后切到粗糙岩石或颗粒材质,主体像被激光刻入表面,颗粒裂纹被强光扫亮。
5.85-6.25秒:材质表面的刻痕发出细线扫描光,关键几何结构向外扩散两圈。
6.25-6.65秒:切到半透明凝胶 / 玻璃 / 水晶材质主体,边缘折射,结构保持清晰。
6.65-7.05秒:主体被 HUD 线框包裹,四角出现 tracking markers,画面轻微抖动卡点。
7.05-7.45秒:主体进入手机屏幕、App 图标容器或极简 UI 界面,作为系统身份出现;周围 UI 卡片快速滑入滑出,但保持极简不可读。
7.45-7.8秒:主体核心几何结构变成镜头孔或遮罩,镜头向内部二次推入,形成圆形 / 几何遮罩转场。
7.8-8.2秒:纯白高调空间,主体黑色剪影被放大到画面中央,外轮廓出现细线设计稿标注,像品牌规范图。
8.2-8.55秒:设计稿线条迅速拆成多个 motion layer,外轮廓、核心几何点、边缘结构分别轻微位移,再弹性回弹。
8.55-8.95秒:暗场中主体以半透明玻璃形态轻微旋转,背后出现细密粒子星云,但空间仍极简。
8.95-9.35秒:两条扫描光从左右交叉,核心结构被锁定,出现短促数据脉冲和几何波纹。
9.35-9.75秒:主体轮廓压入技术织物或微观材质表面,细纹和缝线以微距展示。
9.75-10.15秒:材质表面发生黑白反相闪切,线框 HUD 在画面边缘弹出,形成 AE 图层叠加感。
10.15-10.55秒:透明方块中封存主体局部,方块旋转 15 度,边缘折射把核心轮廓投影到背景。
10.55-10.95秒:投影扩大为巨大同心几何结构,画面中心短暂只剩抽象几何图形,随即粒子回收。
10.95-11.35秒:主体回到完整形态,从画面边缘或黑场中重新出现;微推近,轮廓光稳定。
11.35-11.75秒:AE 故障帧:三重 ghosting 残影错位 2-3 像素,随后迅速对齐,保持主体清晰。
11.75-12.15秒:极简参数 UI 围绕主体核心几何点旋转,像正在校准传感器或系统身份。
12.15-12.55秒:快速材质 recap:透明芯片、金属压印、岩石刻痕、App 图标四个画面以 0.1 秒闪切方式回放。
12.55-13.0秒:黑场静默半拍,只留下主体关键结构缓慢呼吸发光。
13.0-13.5秒:最终 hero 空间建立,无边界灰色空间中主体完整悬浮,周围极细 HUD 定位线从四边收拢。
13.5-14.2秒:主体轻微旋转后回到正面或参考图核心角度,全部关键结构清晰;镜头缓慢推近,声音从低频脉冲转为干净机械尾音。
14.2-15.0秒:定版停留,所有 UI 图层逐一淡出,只保留主体本体和极少量定位点;最后一个低频收束点卡在画面稳定的一瞬间。
这是两个模型的对比视频。
原提示词一共有36个分镜,2个模型都没有执行完,指令遵循这块都有不及格的地方。对比来看,H3整体表现更优,节奏和卡点更带感。Seedance 2.0 fast则在分镜的细节设计上更高级一点,但节奏略有点拖。
这轮实测,两个模型各有所长。
4)TVC广告
输入参考图。
这轮提示词比较简单,让模型自己发挥。
提示词:给这款运动鞋设计一个广告宣传片,4A广告公司的水准,大师级作品,无台词。
这是对比视频。
两个模型整体都还不错,各有侧重点。H3更关注鞋子本身,用各种运镜去展示鞋子细节;Seedance 2.0 fast更有故事感一些,画面先从鞋面开始,然后logo马一直跑,引出运动员开跑,最终用环绕快镜来展示这双鞋。
这轮实测,Seedance 2.0 fast的表现略优于H3。
5)科幻电影
这轮测试,提示词非常简单,就一句话。我想看看模型自己脑补画面、设计分镜的能力。
提示词:科幻电影:演绎一艘未来的星舰飞船即将坠入黑洞的全过程。
来看下H3和Seedance 2.0 fast的对比视频。
两个模型在飞船、黑洞的设计上都还不错,做到了场景还原。不过H3整体还是要糙一点,黑洞模型比较劣质,切换到驾驶舱的真人画面也比较油,AI味明显。
这轮实测,Seedance 2.0 fast优于H3。
这个场景实在太棒了,真想看看30秒的视频长什么样,于是我又用Seedance 2.5跑了一下。
这效果真的太了,感觉就像看一场电影一样。
6)特效渲染
参考@海辛和阿文 的提示词,我用H3和Seedance 2.0 fast复刻了一下“把巨型海洋生物放进上海”的奇幻故事。
完整提示词:
主体:上海城市上空的巨型海洋生物,包括一头巨型座头鲸、一只巨型魔鬼鱼、一只优美而古老的鹦鹉螺、一条巨型鲨鱼。所有生物保持真实动物结构、巨大尺度和缓慢而有重量感的运动,同时拥有美丽、自然、电影化的外观,不呈现怪兽化或廉价CG质感。城市建筑、人群、飞机、江面、车辆、云层和地标作为尺度参照。
场景:一支从清晨推进到深夜的上海巨物奇观混剪。时间从淡蓝晨雾、晴朗上午、雨后午后、橙紫黄昏逐渐进入浓雾深夜。上海中心大厦、金茂大厦、环球金融中心、东方明珠、黄浦江、高架桥、飞机舷窗和湿润街道参与叙事,承担空间、尺度和情绪变化。
音乐:不要生成任何背景音乐和旋律,只生成现场环境音与自然音效:江面风声、远处船声、飞机舱内低沉的引擎声、舷窗轻微震动声、乘客压低的惊叹声、玻璃幕墙的风声、云层气流声、雨滴、轮胎碾过湿路面的声音、低沉的巨物震动声和雾中的空气回响。
镜头1:清晨,镜头从黄浦江水面高度平稳向前推进,超广角远景展示被淡蓝晨雾包围的陆家嘴天际线和东方明珠。一头完整的巨型座头鲸在高楼上空缓慢向右游过,像在空气形成的海洋中前进。鲸鱼的背部被晨光染成深蓝灰色,身体边缘带有柔和的金色轮廓光;鲸鱼游过时,腹部阴影缓慢掠过楼顶和江面,晨雾像水流一样从它身后延展开来。几艘小船、江边车辆和楼顶上的微小人影作为尺度参照。鲸尾摆动一次,大片雾气被轻轻推开,镜头顺着鲸尾的曲线向上抬升。
镜头2:上午,镜头切入一架正在上海上空飞行的客机内部。画面从靠窗乘客的视角开始,先看到椭圆形舷窗、玻璃上的细微反光、云层和下方缩小的黄浦江与陆家嘴天际线。舷窗外,一只巨型魔鬼鱼正与飞机平行飞行,庞大的翼展横跨整片云海,像一架有生命的深蓝色飞行器。它的背部在阳光下呈现深蓝与银灰色渐变,翼尖缓慢起伏,腹部露出柔和的浅色纹理和细小水珠。魔鬼鱼从飞机窗外优雅滑过,翅膀边缘掠过云层,形成巨大的流体阴影。舱内乘客只以局部剪影出现,有人缓慢靠近舷窗,有人抬手遮住阳光;镜头切到魔鬼鱼眼睛和翼尖的近距离特写,再拉回舷窗远景,展现它与飞机、城市和云层的巨大尺度关系。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力