跳到主内容
@wquguru
精选88人人都是产品经理(RSS)产品与增长

AI互动叙事:供给、交互与状态三道锁的解锁路径

三道锁:AI 给叙事产品解开了什么

原文
发到 X
推荐理由

不仅拆解了AI互动叙事的底层逻辑,更给出了具体的兜底设计策略和成本判断指标,PM可直接参考其框架评估自身产品的可行性。

互动叙事品类提了近十年,为何始终未能爆发?本文从供给、交互、状态三道锁出发,结合AI生成技术的最新进展,剖析内容成本、用户自由度与持久性难题的解锁路径,为产品经理揭示这一赛道从人力堆量转向计算驱动的拐点信号。

Long time no see~这段时间处于各种原因一直没有更新,恰巧期间一直在做AI互动叙事类型的产品,有了一些思考,简单整理了一下,趁这个契机想和大家聊聊,那么话不多说,直接进入正题~

一个提了快十年都没做大的品类

互动叙事不是新概念

先把范围划一下。这篇文章说的互动叙事,不是 RPG、视觉小说、Galgame 这些早就跑通的传统游戏品类,而是夹在影视、短剧、文字内容和游戏中间的那一层:以看故事为核心,同时允许用户用选择、输入和行动去影响剧情走向的内容

我是从玩家那头入的坑。2019 年,中文市场有了自己的互动影游,我用一个周末通关了三遍,还在本子上画了张分支图,就想搞清楚哪些选择是真的有用、哪些只是摆设。画完有点扫兴,真正会改变结局的节点其实没几个,大部分分支绕一圈还是回到同一条路上。那阵子所有人都在说,这是下一个内容形态

后来呢?后来就安静了

这个品类有个很奇怪的规律,每隔一两年就会被重新提起一次,开一轮会,立一批项,再往后就没什么声音了。我这些年做 AI 产品,被问得最多的一个问题就是:互动叙事这东西看着挺好,提了快十年,为什么还没做大

我以前的答案很含糊,说市场没起来,说用户没习惯。现在我觉得,这个答案至少没有碰到最核心的问题

用户不是不想互动。你去看直播间里有多少人在刷”选左边”,去看短剧评论区有多少人在写”如果我是女主我就”。至少从这些场景看,用户并不排斥参与故事,表达”如果是我会怎么做”的欲望一直存在。真正卡住这个品类的,是三样很具体的东西

我把它们叫做三道锁

一道是供给锁,内容量上不去。过去的互动内容高度依赖人力堆量,多一个真正有效的分支,就意味着额外的剧本、拍摄、动画、配音和后期制作。创作者不是不想做,是做不起

一道是交互锁,意图说不出来。用户脑子里想的是一整句话,落到屏幕上只剩两三个预设选项

还有一道是状态锁,发生过的变化留不下来。你拿到了什么、改变了什么、和谁建立了怎样的关系,很难稳定成为世界后续运行的一部分

三道锁松动的时间并不一样。供给锁最早,这两年一直在松;真正让我坐直的是 2026 年,另外两道也开始动了。智象未来的 HiDream-O1-World 让角色、环境和剧情可以在运行当中继续生成;爱诗科技的 PixVerse R2 则把生成式互动影游进一步往”正在运行的系统”推进,用户的输入不只改变当下画面,也开始进入后续状态

这几件事看着很散,我盯了一个多月,越看越觉得它们其实是同一件事的三个层次

这篇文章就想把这三个层次讲清楚,写给同行看,尤其是那些手上正好有一个互动叙事的想法、又不知道现在到底能不能干的产品经理

先把三道锁摆到桌面上

我习惯做产品前先画一张最简单的地图,把复杂的事情压到一张表里

这张表就是全文的地图,后面每一部分讲一道锁

供给锁:内容量上不去

叙事产品最硬的一条约束是内容量

互动内容最麻烦的地方在于,有效分支一多,需要生产的素材就会迅速膨胀。理论上的完整剧情树甚至会随分支深度指数增长,实际制作虽然会通过分支汇流和资产复用控制规模,可交互越多,生产成本仍然越难压住

更麻烦的是,它很难像软件那样低成本迭代。实拍内容一经定型,后续修改往往意味着重新协调演员、场景和拍摄计划,相比游戏和软件可以持续更新的生产方式,传统影视内容的迭代灵活性要差得多

所以这道锁的核心不是”做不出好内容”,而是内容规模长期受制于生产成本。解锁逻辑只有一个字:生成。这也是三道锁里最早松动、最先看到产业结果的一道

交互锁:意图说不出来

再往下一条约束是自由度。不是产品不想给自由,是过去的内容生产方式承接不了这种自由

这里最硬的技术约束之一是延迟。用户发出的指令,时间尺度差得太远,短的要快速反馈,长的本身就是一段完整演出。这个问题后面单独讲

状态锁:发生过的变化留不下来

最隐蔽的一条约束是持久性,它其实分两层

上面一层是显式状态:你拿到了什么、完成了什么、跟某个角色是什么关系。这一层理论上可以通过数据库、状态机或者关系系统存下来

下面一层难得多,是世界本身的连续性。生成系统天然带误差,记忆里写着门已经打开了,画面里那扇门却可能又合上了

所以状态锁真正卡住的不只是记不记得住,而是已经发生过的变化,能不能既被系统记住,又在后面的世界演化里继续成立

这三道锁虽然对应不同的问题,放在生成式互动叙事里,更像一条能力递进:内容能不能做出来,用户能不能自由影响它,这些影响最后能不能留下来。下面从最早松动的那道开始讲

供给锁:内容量不再只由人力决定

这曾经是一个人力堆量的行业

线性影视拍 100 分钟,就是 100 分钟的素材。互动内容不是这个逻辑,多一个真正有效的分支,往往意味着额外的一套内容制作

过去两年,这个品类整体仍然面临明显的盈利压力。支线多会直接抬高素材量,在真人实拍前提下制作成本高企,变现方式却相对有限,往往只有跑到头部才更容易覆盖成本。有行业测算认为,2024 到 2025 年期间,互动影视项目的亏损比例可能接近九成

结果就是一个特别反讽的局面:这个品类产能不足,不是因为没人想做,而是创作太难、制作太贵、发行门槛太高,很难形成持续的人才和内容供给循环

我认识几个做过互动剧的编剧,最后都转去写短剧了。不是不喜欢,是养不活自己

AI 砍掉的是哪一段成本

变化最先发生在生产端,而且已经开始可以量化

先看成本。原本千万级的真人实拍项目,AI 介入之后能压到六七百万这个量级,甚至更低。制作周期也有明显缩短,从大半年压到几个月,在后期修脸、特效置景这些环节尤其明显。放到漫剧这种更轻的形态上,AI 漫剧的制作成本已经开始进入每分钟千元级,而传统动画和真人制作往往高得多

再看周期。字节有一款修仙题材的 AI 游戏,大部分内容由 Seedance 2.0 生成,团队早期十来个人,半年就跑完了三成左右的进度。更极端的是 Yoroll 做过的一次公开实测,GPT Image 2 负责画面、Seedance 2.0 负责视频,从剧本到成片只用了三个小时。产出的不是几张截图拼成的片段,而是一个有分支剧情、有选择、有不同结局的完整互动游戏

三个小时。我当时看完这条消息,去买了杯咖啡,回来又看了一遍

产出效率也在跳。Seedance 2.0 发布之后,角色一致性、动作执行和镜头控制继续改善,小团队在真实内容生产里的效率也开始往上走,十来个人的团队、一个月的制作周期,已经有作品跑到十亿量级播放,投资回报率达到三位数

这里得留个心眼。爆款同时受题材、IP、分发和平台算法影响,它能证明的是小团队跑得快,不能反过来证明模型能力已经成熟。我自己看这类数据,只把它当成生产曲线发生变化的旁证

行业里流传很广的一句成本判断,来自一位从业者,他说:”过去 CDN 是传统内容分发的成本,现在 Token 是 AI 实时生成内容的成本,当 Token 价格低于 CDN 价格的时候,AI 互动影游才真的能够成立”

这句话很形象,我更愿意把它当成一个比喻,而不是一条严格公式。CDN 和 Token 计价的东西根本不是一回事,硬拿来对齐很容易算歪

真正该盯的是另一条线:一个用户每玩一分钟,要烧掉多少生成成本,这一分钟又能换回多少钱

这两条线什么时候开始接近,生成式互动内容才算真正进入可以规模化算账的阶段。从模型推理成本和生成效率的变化看,这条线至少正在往可计算、可验证的方向移动

天花板掀掉之后,什么被释放了

有一层释放是题材

过去真人实拍的互动影游高度集中在现代都市和恋爱类型。为什么?因为古装题材动辄千万,末世科幻、盗墓探险的特效和置景成本更高,市场规模又有限,投资风险自然更大。现在已经有团队在做美漫风格的全 AI 互动叙事产品,也有团队重新启动过去因为成本限制难以推进的科幻项目

另一层释放是形态

2025 年 DeepSeek 这类通用大模型快速普及之后,一个被开发者叫做”AI 文游”的新品类开始冒出来。大致分三类:AI 带团的跑团游戏,网页形态的各种模拟器小游戏,还有一种更轻的,以提示词为本体,复制到任意大模型里就能开玩。今年 5 月上线的一款历史题材模拟器更进一步,玩家买断本体之后还要继续消耗 Token,剧情不再靠提前写好的文本推进,而是跟着玩家输入的施政意图实时变化

你买的不是内容,是一段可以持续燃烧的计算。这个商业模型跟过去完全不是一回事

还有一层释放是创作者

工具端也在同步发力。腾讯光子工作室群推出了 AI 互动游戏创作平台,用户用自然语言说出创意就能生成剧本、角色、场景、剧情树和可交互作品,内测期社区已经积累几十款内容,目前平台上已经有近三百款互动影游。老牌文字互动平台橙光也推出了自己的创作助手,输入故事设定和人物关系,可以自动辅助生成场景、配音以及剧情分支。互影科技同样开放了创作类 Agent 产品

数据也在说明供给曲线确实变了。去年 AIGC 漫剧的月度占比从几乎为零涨到年底的一成上下,播放量到了二十亿量级,全年翻了百倍不止。抖音每月排名前五千的短剧里,全 AI 生成的微短剧从年初个位数涨到了年末两百多部

我觉得最要紧的不是便宜

供给锁开始松动之后,最值得产品经理记住的,不是成本降了多少,而是这个品类第一次真正获得了更强的迭代能力

一位在这行做了十年的创始人说得很准,AI 可以让过去近乎一次性的拍摄制作,变成更接近游戏开发的可迭代模式

另一位从业者的判断更接近本质,他说 AI 的核心不是低成本量产内容,而是实现个性化的内容定制。这恰好匹配互动叙事千人千面、用户驱动剧情的核心特质

不过制作门槛下降之后,一个新的问题马上出现了:差异化竞争力从哪来。这个问题先放在这里,文章末尾再回来

我还想补一句自己的观察。内容量不再稀缺之后,稀缺的东西会往后挪一格

过去内容是瓶颈,谁能产出,谁就有议价权。现在产出变便宜了,瓶颈会逐渐往注意力和分发迁移。你一天能生成一百段互动剧情,可用户一天只有几十分钟,平台推荐位也只有那么几个坑

我见过好几个团队栽在这里。工具用得飞起,一周做十个原型,最后发现没有一个能说清楚,用户为什么要在今天晚上打开我这个东西。这不是技术问题,是老老实实的产品问题,AI 一点忙都帮不上

交互锁:意图不必再被压缩

用户想说的话,被压成了几个选项

互动叙事产品里的”选择”,长期是一种妥协

用户脑子里想的是一整句话,落到界面上却变成二选一、三选一。前面算过那笔账,在实时生成能力出现之前,多一种真正不同的结果,就意味着多准备一套对应内容

所以过去这类产品的交互逻辑,本质上是”我要选什么”,产品提前把可能性枚举好,用户从里面挑一个

AI 把这个逻辑翻过来了

有一段乙女向的演示很能说明问题。用户在对话框里输入”给我生成一个温泉福利剧情”,画面里就开始生成对应的角色和互动场景。不需要提前把这条分支拍完,也不需要先做成一个按钮,用户先说出想要什么,世界再尝试给出结果

输入形态也在同步变宽。今年 1 月的 PixVerse R1 主要通过提示词改变世界,到了 R2,选项、文字、语音、快速反应事件都开始加入,镜头控制、方向移动、跳跃这些更有游戏感的操作也逐步出现。目前公开玩法大致可以归成三类:世界构建与探索、剧情互动与推进、角色实时互动

拦在中间的那堵墙叫延迟

“听懂用户说什么”和”立刻给出画面”,是两件完全不同的事

完整的世界模型能力很重,实时交互对延迟又极其敏感。难点在于用户的指令长短差得太远。按一下 W 键,用户期待的是快速响应;说一句完整的话,角色可能需要几秒做完动作、演出和台词,这本身就是一个完整事件。如果每段都切得很短,动作和语义容易被拦腰截断;如果每段都留得很长,用户按完键又要等半天

R2 的一个解法叫 Dynamic Chunk,翻成人话就是动态分块。道理其实很朴素:短操作匹配短块,完整事件允许更长的生成时间,模型按照控制信号的语义和时间尺度去组织音视频生成

说白了就是把指令分级。上下左右移动这类操作优先保证反馈速度,复杂提示词则需要留出完整的演出时间,模型不用再拿同一种生成节奏同时兼顾反应和演出

配套的变化是,多种输入也开始能够同时发生。语音、文字、音频参考、图片参考、方向与镜头控制可以一起进入系统,官方那段”送信”演示里,你能一边跑,一边继续打字下达新的指令

我看到这里的时候有个很直接的感受:这不是把视频做得更像游戏,而是把一部分交互设计的自由度还给了创作者

创作者已经跑在前面了

技术松动的同一个月,爱诗科技旗下的 PixLab 影像内容实验室邀请了三位签约 AI 创作者,共创了三款 AI 互动影游,先给行业打了个样

三支作品用的都是同一种模式:预置视频分支加实时 AI 生成的混合交互。创作者设定大背景和故事主线,同时给玩家留出自由探索的空间

这个混合模式值得每个产品经理记下来,它至少是现阶段非常现实的一种落地形态

其中一款把”意图不必被压缩”讲得最直观。故事设定在中世纪风格的魔法学院,红发少年连续两年测出零魔力,成了被人嘲笑的零印法师。战斗中面对第一只魔兽,玩家可以通过念咒语的方式实时生成魔法

创作者的原话我很喜欢,她说:”最开始我们做 AI 视频,大家开玩笑说提示词就像咒语,现在我们真的把提示词做成了咒语。打怪的时候你想放火、放水还是召唤雷电?想用什么魔法,都可以实时打字生成”

据她介绍,第一章为了打开世界观,互动占比相对低一些,大约在 35% 左右,后续还会增加不同选择导向不同魔法师成长路线这样的玩法

另一款走的是心理恐怖。男主是一位深空研究员,玩家通过他的视角探索被怪物席卷后的封闭空间,并不断判断到底相信谁。核心概念被概括成”信任即现实”,你信任谁,谁就成为现实;不信任谁,谁就可能变成怪物。团队还设计了一个类似系统助手的数字人角色陪玩家探索,最终导向四个主要结局

还有一款世界观最硬,中式武侠、硬核科幻加末日废土。月球白天 14 天、夜晚 14 天,温差发电站建在阴阳交接线上,月壤粗糙带电,飞行器只能贴着表面滑行

爱诗把这三部作品称作三个样板间。它们未必证明完全开放的 AI 世界已经成熟,可至少说明创作者已经开始把实时生成能力放进真正的叙事设计里,而不是只做一段技术演示

这道锁松开的到底是什么

交互锁卡住的是自由度,过去用户能表达的,最后往往都会被压缩成屏幕上的预设选项

现在输入形态开始扩展到语音、文字、快速反应事件和镜头控制,延迟也在通过新的生成机制被进一步压低。一句话收束:过去只能选,现在开始可以说

这里必须留一句冷静的话。目前大量公开展示依然属于限定场景下的能力预览,不能由几个效果很好的演示推导出一个完全开放的世界,也不能把它当成已经成熟的商用互动娱乐引擎。我们做产品的人,最容易在这个地方兴奋过头

从”我要选什么”到”我想要什么”

这是我认为整篇文章最重要的一句话

刚才那段温泉演示,跟传统乙游从固定选项里挑一个的逻辑完全不同。AI 带来的体验,有机会从”我要选什么”转向”我想要什么”

这句话对产品经理的含义是:过去我们设计的是选项,未来更重要的是设计意图的承接方式。选项是有穷的、可枚举的、可以做测试用例的;意图是开放的,很难穷举

这是交互锁松动之后,我们接手的第一个新问题。用户说出一句你完全没预料到的话时,你的世界怎么接住它?接不住的时候怎么兜底?兜不住的时候,会不会把整个世界观撞碎

关于兜底,我最近想了三种思路,还比较粗糙

一种是收敛到主线。用户的输入可以开放,可世界仍然有自己的因果关系和关键节点。武侠世界里你非要掏出一把手枪,系统不一定要直接否定,也可以让这把明显不属于世界的东西成为一个异常线索,把冲突重新拉回剧情

一种是让角色替系统说不。世界不一定要拒绝用户,角色可以。一个古板的守门人本来就不该让你随便进密室,这个”不”是人设的一部分,用户感受到的是这个角色有脾气,而不是系统能力不足

还有一种是把越界本身变成剧情。用户想干的荒唐事,恰恰可能是最好的支线素材。你越想把用户框住,用户越想跳出来,有时候不如把跳出来这件事本身设计成一种玩法

三种方式背后其实是同一件事:开放交互不是取消边界,而是尽量把边界设计在世界内部。在一个号称能听懂你说话的世界里,一句突然出现的”暂不支持”,对沉浸感的破坏有时候比画面糊掉还严重

状态锁:让世界记得住你

前面两道锁,一道解的是内容够不够,一道解的是表达自不自由。这一道最隐蔽:这个世界会不会记得刚刚发生过什么

过去的世界是死的

判断一段 AI 生成内容究竟更像一段视频,还是开始像一个世界,有个最简单的动作:转身

沿着街道往前走,拐过一个路口,再回到原地,刚才那栋建筑还在吗?推开桌上的杯子,它会按照合理的方向倒下吗?镜头从第一人称切到第三人称,人物、空间和光影还能对得上吗

这些听起来理所当然的事情,对今天的 AI 视频模型来说都很难

过去两年 AI 视频一直在卷画质、卷时长、卷运镜,可只要用户无法进入、无法持续控制,场景也无法延续刚刚发生的变化,它本质上仍然更接近一次性生成、播放完就结束的内容

现在,世界开始记住你

一个值得注意的节点出现在 2026 年,智象未来和爱诗科技先后把这道锁撬开了一条缝

HiDream-O1-World 给出了很直接的产品画面:角色、环境和剧情可以在运行中继续生成,用户可以停下来探索原本只是背景的街道,也可以走进创作者没有逐帧制作过的空间

更早一点的信号来自阿里。ATH 创新事业部的 HappyOyster 在 4 月就展示了两种模式,Wander 让用户以第一人称进入实时生成的空间,每一步都继续触发新的世界生成;Direct 则允许用户在生成过程中继续插话,修改镜头、角色动作和剧情走向,而不是全部推倒重来

这类产品通常会被放在”世界模拟器”或者交互式世界模型的讨论里,它和 Genie 3 属于相近的产品想象:不是生成一段视频,而是让用户持续进入并改变一个正在生成的空间

PixVerse R2 则把这件事进一步推向了叙事层。它更关键的变化不只是响应更快,而是开始关心改变带来的后果

假如你在一个场景里从桌上拿走了一把钥匙,那后面的世界就应该承认这件事发生过。你在对话里惹恼了一个角色,下一次见面时,系统也应该能体现关系发生过变化。你完成了一个任务,世界要继续呈现这个结果,而不是镜头一切就全部刷新

落到产品语言上就是,玩家的选择与指令不只改变当下镜头,还要继续影响后面的剧情、关系和世界状态

这里要把两层状态分开看。上面一层是角色记忆、人物关系、任务和剧情变量,这些内容可以被结构化存储,本质上还是软件工程问题,已经有相对成熟的解决方法。下面一层才更难,生成模型要让这些变化在后续画面、空间和行为里继续成立

所以真正困难的,不是给模型挂一个记忆模块,而是让记忆里的事实和生成出来的世界对得上。记忆里写着你已经带走了钥匙,画面里那把钥匙就不应该还躺在桌上

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件