跳到主内容
@wquguru
精选88硅谷101(YouTube)行业动态

AI模拟赛道:Simile估值20亿,Aaru近10亿

AI开始预测人类:83亿虚拟人格、数字社会,与一门押注未来的生意|解析AI预测模型|AI prediction model

原文
发到 X
推荐理由

AI模拟预测赛道集中爆发,Simile与Aaru的高估值及具体落地案例揭示了Agent社会仿真的商业潜力,值得从业者关注这一新兴范式。

你相信我们其实是 生活在一个虚拟的世界中吗 马斯克曾在Lex Fridman的采访中被问到 如果有一天人类实现了AGI 并且只能问它一个问题 他会问什么 在思考了长达10秒之后 他说 What's outside the simulation 听到这句话 我全身鸡皮疙瘩都起来了 模拟之外到底是什么 这是马斯克对这个世界的终极追问 而早在2016年 他就表示 人类生活在真实世界里的概率 或许不到十亿分之一 我不知道这个数他是怎么给算出来的 但是显然这种几近科幻的理论 目前还没有任何的科学证明 然而 非常有趣的一点是 随着最近AI的进展 在硅谷 人们开始尝试去扮演“造物主” 去创造一个AI的“模拟世界” 而这也催生出了一个新的赛道 AI simulation 最近这个领域在不断升温 李飞飞、Andrej Karpathy 同时押注的Simile 最新估值达到了20亿美元 00后团队创办的AI模拟预测公司 估值也已经冲破10亿美元 由哈佛大学与MIT最新联合发布 200多位顶尖科学家 共同参与的项目MatrAIx 更是一举模拟了83亿个AI虚拟人格 相当于把全人类都镜像到了数字空间 哈喽 大家好 欢迎收看《硅谷101》

我是陈茜 那么AI Simulation究竟在模拟什么 有哪些不同的研究路线 它能够在哪些商业场景产生价值 又最终是否会创造出一个 全新的智能体文明呢 关于这个前沿又有点“科幻”的概念 此次我们也采访到了 这个领域的创业者、投资人 以及MatrAIx论文的作者们 来帮我们一起深入解读一下 下面就让我们一起走进AI的“黑客帝国” Hi 各位 又是我Jacob 最近有很多观众在视频底下留言 问我们平时用到的一些AI画面是怎么制作出来的 那在进入这期视频正片之前 我就花几十秒来给大家大致介绍一下 我们平时用到的一个秘密武器 AI早在两年前就嵌入了 我们后期团队的工作流 但过去一直有个让我们头疼的问题 市面上的模型五花八门 到底该选哪个 而且单一模型生成出来的东西总像开盲盒 每次生成你要抽很久才能有可以用的画面 比如像这样的一段动画 放在过去我们得开三四个平台 一个个写prompt、喂参考 今年我们把这些全搬到了TapNow的画布上 除了可以灵活调用各家主流的AI生成模型之外 TapNow最好用的一点就是 它可以把视频生成的每一步拆成一个个节点 就像一个片场的导演 在TapNow里 我们把提前准备好的参考图和各种素材 丢进画布里 当确定好我场景的美术风格和方向后 我就可以给它描述我每一个分镜的 具体画面构图和运镜 让它开始生成 这里哪个镜头不对 我可以马上回到那个节点换参考、换模型 改prompt 前面的都可以不用再重跑 这样的工作流可以把每次尝试和前后关系 全都留在同一个项目里 让我知道问题出在哪、应该从哪里开始改 我们后来做封面 或者遇到素材库里找不到的B-roll 也会沿用这套方法 团队可以在同一个项目画板里面脑爆、协作 快速地把想法设计出来 我们把刚才那段动画的TapNow画布 链接放在了简介里 如果你感兴趣的话可以自己点开上手研究一下 好 把时间交还给Qian姐 今天很多领域其实都在谈Simulation 但是定义却有所不同 机器人和自动驾驶领域有物理仿真模拟 世界模型领域有世界引擎的模拟 但是我们这次想聊的 是一个更大维度、更复杂的概念 人类与社会的模拟 并借此去理解 甚至预测现实世界 World model(世界模型)

或者physical world model(物理世界模型)里面 它最小颗粒度可能是 世界中的某个分子 或者说某一个原子 模拟的是某些物体 但是在agent society(智能体社会)里面 其实我们模拟的最小颗粒单位 是一个人的个体 我其实并不关心这个人手怎么动 然后他往哪去跑 我其实关心的是这个人的 作为一个人的整体 他接受到什么样的输入 然后他的output action(输出动作)

大概是什么样的 而关于人类与社会模拟这件事 最早引发广泛讨论的 其实是一篇20多年前的哲学论文 2003年 牛津大学哲学家Nick Bostrom 在《我们生活在计算机模拟之中吗?》当中 提出一种推演 如果一个先进的文明拥有足够强大的算力 并且有意愿通过模拟 去重现文明的发展过程 那么模拟世界中的意识数量 将远远超过真实世界 从概率的角度 人类就极有可能身处在一个模拟世界当中 这就是后来广为流传的 “模拟假说(Simulation Hypothesis)”

但由于技术的限制 二十多年来 这个假说一直停留在哲学讨论 和科幻作品中 直到近年来 大模型的发展迎来了突破 2023年 斯坦福大学与Google 联合发布了一个 对AI智能体研究影响广泛的实验 《Generative Agents》 研究团队搭建了一个 像素风的虚拟小镇 Smallville 里面有街道、房屋、咖啡馆 还有25个穿梭其中的“小人” 这些“小人” 都是由大语言模型驱动的AI Agent 拥有各自的记忆、性格和行为逻辑 它们的活动没有“剧本” 研究者只是把它们放进这个小镇 然后退到一旁去观察 结果发现 这些Agent 不仅会自己生活、工作、建立关系 还会自主思考和行动 “斯坦福小镇”第一次证明 Agent可以拥有持续的记忆 规划和社交能力 并且在互动中自然涌现出群体行为 (这个研究)

意义就是让大家认识到 这个语言模型是可靠的 就是说它真的可以去复现 人类社会的一些现象 更多人关注到这个领域 让大家愿意去相信这个事情 25个Agent只是一个开始 随着近几年模型能力的飞速提升 和推理成本的下降 大家也开始有能力去尝试更大规模的模拟 并且出现了不同的探索方向 首先是在模拟精度上尝试跟人类深度对齐 “斯坦福小镇”的实验很有趣 但是25个居民都是大模型“编”出来的 那么如何让它们能够真的像人呢 2024年 斯坦福团队 把实验扩展到了1052个Agent 每个Agent背后 都对应一个真实的美国成年人 研究人员先进行大约两小时的深度访谈 了解他们的成长经历、家庭、工作 价值观和生活经验 再把这些信息交给大模型 生成对应的AI“数字分身” 而这样得到的Agent 就不再只是一个 符合“平均画像”的虚拟人物了 在实验当中 这些Agent回答社会调查问卷的结果 与真人两周之后的答案 达到了85%的相似度 也就是说 在一定程度上 AI开始能够复现真实个体的想法和选择 访谈也是有技巧的 不是随便访谈 然后他用一些最高效的方式 能够“榨取”你是谁 其实本质上就是在“蒸馏”你是谁 但是它蒸馏得比较细 然后放到这里面来 所以它的好处是针对于每个个体 它的特异性会影响整个仿真的进入场景 第二种研究思路 我们称之为“社会演化路线” 是不去关注Agents个体如何 而是把重点放在了Agent社会的演化 关系的形成上 比如由前MIT教授Robert Yang团队 发起的Project Sid项目 他们直接用LLM生成了1000多个Agent 并且把它们放进《我的世界》

游戏当中 运行了12天 结果智能体们自发搞出了 经济、文化、宗教、法律这些东西 社会结构自己就长了出来 不久之前 创业公司Emergence AI 也做了一个实验 他们分别基于Claude、GPT、Gemini、Grok 和混合模型作为底座建立了5个平行世界 每个世界有10个Agents 用以观察这个世界的演化有什么不同 结果显示 Grok的世界迅速陷入混乱和犯罪 快速灭亡了 GPT世界因为缺乏协作而逐渐崩溃 Gemini的世界充满了暴力 而Claude的世界建立了稳定的治理秩序 活到了最后 混合模型社会也坚持到了最后 但表现稳定的Agents 却受到其他模型Agents的影响 出现了暴力行为 Emergence AI的CEO Satya Nitta 就告诉我们 这种模拟 对于观测不同模型的Agents 在复杂环境中的长期、自主行为 是非常重要的 如果你只是看静态Benchmark 就认为这些系统应该是安全的 那你可能会得出错误的结论 因为未来的Agent 会运行在非常复杂的环境中 无论是物理世界还是数字世界 它们会与其他Agent互动 也会受到环境中的噪声和各种变化的影响 所以我们正在逐步把Emergence World 发展成一个Benchmark 用于研究“长期自主性” 最近还有一条研究路线 就是专门从“评估”入手的 比如说MatrAIx 就是试图为AI模拟建立一套 “评估基础设施” 这项研究由哈佛、MIT等机构牵头 汇集了200多位 来自学术界和产业界的研究者 其中就包括40多位 来自OpenAI、Anthropic等等 前沿AI实验室的参与者 它构建了一个 包含83亿个独特人格的数据集 每个人格由心理特征、生活习惯等 1290个维度定义 再用Claude Opus 4.8、GPT-5.5 和Claude Haiku 4.5等模型 把这些人格变成可以行动的Agent 这些Agent被放进问卷调查、AI聊天 网页浏览和App四种环境当中 完成了超过1.8万次测试 用以观察不同人格 在真实场景当中的行为差异 研究团队通过400次的受控实验发现 91.5%的情况下 Agent都能够遵循预设的人格和行为特征 这项研究的目的是把“AI模拟”推进到 怎么系统地衡量这个Agent到底有多可靠 而MatrAIx的团队就认为 只有先建立起这样的评估体系 未来的模拟才会更加真实、可落地 我们的evaluation infra(评估基础设施)

Raise the floor(提高最低能力水平)的 这个意思是说 能够先通过这个 Cohort diversity(用户群体的多样性) 这个产品出来之前 我可以在各个task(任务)下 各个情况下 各种使用方式之下去评测它 它就可能会踩中 很多的corner case(边缘场景) 这个corner case(边缘场景)

的分析 是非常有用的 你的这个Agent能够告诉你哪一步错了 哪一步他不喜欢 哪一步他的这个思维 到底背后是怎样的推理 做出这样的一个偏好和选择 所以我们想要的是 先要有一个方法论去怎么样构建这个 Ground truth(事实基准) 然后再下一步再说怎么样去提高 而当AI模拟开始在研究层面被证明 具备一定的可行性了之后 大家也开始思考 如果真的 AI能够在数字世界中 复现人类行为、推演社会运行 那么它能够产生出什么真实的价值呢 从目前的探索来看 根据AI模拟的阶段和目的的不同 主要是出现了两类商业化思路 第一种生意叫做卖“模拟” 卖“模拟”的核心逻辑 是把现实世界中的人、消费者 甚至社会关系 变成可以被反复调用的数字替身 比如说AI可以根据企业的具体需求 快速生成一批具有不同年龄、背景、偏好 和行为特征的Agent 让它们去提前体验产品 在虚拟环境中不断做测试 接着观察他们会怎么选择、怎么对话 在哪里流失 从而为产品设计和迭代提供有价值的参考 并不是说他们喜不喜欢这个product(产品)

喜不喜欢可口可乐涨价两块钱 而是说他们的一个reasoning(推理) 他们到底在这个过程当中 遇到了什么样子的波折 或者一个什么样的想法 导致他们最后在这个预测当中 可能转了一个向 或者是最后预测成这样子一个 Distribution(分布) 不仅要看到一个人 他是怎么样做这样子的一个决策 而是想看到这样 Population level(人群水平)

如果是百万级、数亿级 甚至是83亿级 他们会遇到什么样子的一个结果 我们觉得这都是非常有意义的 所以这种思路就是把模拟本身 作为一种产品评估和观察的手段 而比如说Emergence AI也告诉我们 他们之所以做Emergence world的实验 其实主要目的也是为了 测试自己所提供的Agent产品是否安全 我们主要是用Agent 来提高半导体的良率等等 也正因为如此 Emergence World这个实验 就非常重要 我们想弄清楚一个问题 我们在这里构建的这些Agent 能不能真正安全地行动 它们能不能始终遵守 我们为它们设定的安全护栏和基本规则 更重要的是 它们能不能以一种确定性的方式运行 给出真正值得信赖的输入、建议和洞察 这些输入建议和洞察要足够可信 不能只是概率性的 也不能是模型“幻觉”出来的 当然 这种单体模拟的能力 也可以扩展到“社会”层面 比如说英国创业公司Artificial Societies 主打的就是“社会关系”测试 他们让大量不同人格的AI Agent彼此互动 形成一个可以进行实验的虚拟社会 企业可以把产品、品牌 或者营销策略放进去 去观察不同Agent之间 如何交流、影响和做出反应 而MatrAIx也告诉我们 他们研究的下一步 也是要让这83亿人格给“动”起来 所以我们会在新版本中加上这个 Dynamic persona attribute(动态画像属性)

这些东西它是可变的 还有一个就是我们假设现实生活中 有一些big events(大事件) 它发生了会有影响 此外 这些合成人格 并不一定只能停留在数字世界里面 它们未来还可以被迁移到不同的载体上 比如说机器人 从这个角度上来看 AI模拟或许也有可能 会成为未来人机交互的一层基础能力 我们用uni-trained robot(通用训练机器人)

把persona(人物形象)加到robot上 它不只是存在于虚拟世界 存在于Matrix中 它甚至可以在现实生活中 跟我们interact(交互) 让我们真的能感受到 这个不同的persona(人物形象) 它背后代表的这个思维模式和行为模式 是不一样的 不过 现在很多人认为 只停在了“模拟”还不够 在这个基础上 更有意思 也更有挑战的事情是 预测 我们知道 在商业中 “预测”往往是昂贵的 比如说企业要不要进入一个新市场 你的产品价格上涨10%之后会发生什么 如果政府调整一项政策 会对整个社会产生什么样的影响 这些问题的答案 都必须等事情发生之后才能够知道 而AI模拟 如今提供了一种新的可能 就是先把这个还没有发生的未来 在虚拟世界当中先跑一遍 然后把结论作为决策的依据 目前 在着重于“预测”这个领域 两家比较有代表性的创业公司 是Simile和Aaru Simile是由“斯坦福小镇”项目的 那批核心研究者 Joon Sung Park、Michael Bernstein 还有Percy Liang教授等人创办 它的主要思路 就是从“模拟一个人”出发来进行预测 在2024年那篇“数字人格”研究的基础上 Simile是试图使用深度访谈等方式 尽量高精度地去还原人类 AI Agent拥有类似真实人的记忆 经历、反思和决策过程 接着被放进不同的环境当中 让它们持续行动 这样一来 模拟回答的 就不止是“这个人现在怎么看” 还可以进一步地去观察 当比如说价格、政策等外部环境 发生变化之后 这个人会怎么做 会不会改变自己的选择 所以Simile想做的 是去建立一个“人类行为基础模型” 通过模拟人的行为过程 去推演现实世界可能发生的结果 因为这条路线追求的是尽量“真实” 所以更加适合消费者研究、产品测试 客户体验、投资者关系 这些需要摸透特定人群的场景 Simile也在今年2月正式亮相 目前最新估值已经突破了20亿美元 已经和多家大企业达成了合作 Simile目前官方披露的数据显示 自上线以来 它为财富100强企业跑了数千万次模拟 比如说美国最大的连锁药房CVS 就已经跟Simile合作长达一年 他们一起用真实用户数据 造了多达40万个数字分身 用来研究病人怎么按时吃药 测试消费者体验和帮助产品设计等等 不过 高保真的另一面 是成本和规模化的代价 Simile这个情况下 如果你需要非常准确 可能非常难standardize(标准化)

比如可口可乐需要的 和这个TikTok他们需要的 这个user profile(用户画像) 是完全不一样的 那么对这个公司来说 他们的代价就是对于每一个公司 或者对每一个场景类型 他们都需要去做一个 或者去post-train(后训练) pre-train(预训练)的方法 去做一个这样子的模型 这样子的代价是巨大 而且它可迁移的能力我们是不知道的 所以 以Aaru为代表的另一种思路 是直接通过“群体模拟”来进行预测 基于现实世界的人口、消费等数据 快速构建一个 尽可能接近真实世界的模拟人群 Aaru的数据分三层 第一层是公开数据 比如说全国人口普查、就业 健康等官方数据 负责搭出一个基准线 第二层是一些授权数据 比如说匿名消费记录、常去的哪些地方 看什么媒体 这些数据能够补上人群近期的真实行为 第三层则是用户提供的私有数据 比如说企业的用户分层 购买历史、产品细节等等 这样就把范围收窄到具体要研究的那群人 接着基于这些数据去构建一张“关系网” 把特征之间的关系还原出来 不只是年龄和收入要对上 行为特征和彼此关系 也要尽可能去接近真实的模拟人群 之后 Aaru会改变其中的一个现实变量 比如说价格、产品或者政策 然后再去观察整个群体的行为会如何变化 从而推演现实世界可能会出现的结果 (Aaru)

可能关注的更多是速度 关注这些群体之间发生的关系 但至于说是某一个个体 它的那个深刻的影响是什么 其实我可能并不关心 Aaru的创始团队非常年轻 两位创始人Cameron Fink和Ned Koh 成立公司的时候只有18岁和19岁 技术负责人John Kessler甚至只有15岁 他当时的投资文件都是他父亲给代签的 最早他们在朋友家的地下室 拿美国大选来验证这套系统 在回测2020年大选的时候 预计结果与实际结果只差了不到0.5% 而因为这条路线的特点是规模大、速度快 所以也很适用于大规模的市场调研 Aaru目前的客户就已经包括了 麦当劳、安永、拜耳 还有A24等等公司 安永曾经让Aaru复现过 一项复杂的全球调研 Aaru一天就完成的结果 与他们的调查高度吻合 气泡水品牌Spindrift 曾经用两个月、500名消费者 完成的一项调研 Aaru的Agent 一周就得出几乎相同的结论 这些真实的案例让Aaru的估值飞升 目前已经接近了10亿美元 最近 一些AI大佬 也开始押注“预测”这门生意 卡耐基梅隆大学教授 苹果首任AI主管Russ Salakhutdinov 就参与创立了一家AI预测模型实验室 Sooth Labs 专注于地缘政治和市场风险的预测 首轮融资大概5000万美元 并且获得了Yann LeCun Jeff Dean等人的支持 Russ Salakhutdinov在采访中就表示 当AI能够模拟和预测未来 未来所有的咨询公司都可能消失 麦肯锡 为什么麦肯锡还存在 波士顿咨询集团 这些都是大型机构 你懂的 它们全都应该被AI取代 不过 尽管AI模拟已经出现了 不少有意思的落地方向 它究竟能够在多大程度上 真正地去影响企业决策 创造多少商业价值 现在还是个大问号 以Aaru为例 目前的营收规模 依然只有数千万美元的级别 所以今天市场给这类公司的高估值 更多还是在提前押注它们的未来 可能会打开的市场空间 就当前的阶段来说 无论是把模拟当作一种新的评估工具 还是进一步用它来做预测 大家都还处在一个 不断寻找“最大商业价值”的过程当中 因为一个市

原文超出正文长度上限,此处截断——上游还有内容,完整版见上方「原文 ↗」。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件