a16z:个人AI Agent的主动性、信任边界与隐形设计
a16z 最新深度对话:这才是 personal agent 的正确打开方式
提供了个人AI Agent产品设计的具体原则(如主动性边界、隐形交互、群聊沉默策略),直接指导产品功能取舍与信任机制构建。
a16z 的 Anish Acharya 与助理测评平台创始人 David Pawlan 聊了 personal agent:谁会用、谁可能赢。作者没有只做复述,而是把对话与自己的使用体验放在一起,分辨哪些判断是泡沫、哪些对做产品真有参考价值。
前几天我看了一期 a16z 的播客,是 General Partner Anish Acharya 和 Assistant Benchmark(AI 助手对比测评平台)的创始人 David Pawlan 坐在一起聊 personal AI agent(个人 AI 代理)这件事。我听的时候一直在做笔记,越听越觉得这场对话触到了一些真正重要的问题,不只是“哪个产品好用”,而是“AI agent 这件事的底层逻辑到底是什么,谁会赢,赢的理由是什么”。David 本人最近几个月测试了 100 多个 AI 助手产品,他建了 1200 人的群聊来讨论这件事,他发布的 Assistant Bench 测评报告上线 16 天就超过了 10 万次访问。我很少见到一个人对某件事的投入程度可以精确到这个程度。所以我觉得这场对话值得好好写下来。
但我不想只是复述他们说了什么。听完之后我在想的更多是:在这场 AI agent 的爆发里,什么东西是真正有意思的,什么东西可能只是泡沫?什么判断对做产品的人有真正的参考价值,什么判断只是对着镜头说的漂亮话?我自己在过去几个月也一直在用各种 AI 工具,有些体验真的改变了我的工作方式,有些体验则让我觉得距离“真的有用”还差得很远。所以这篇文章,是我把他们对话里最有价值的部分,跟我自己的判断放在一起,希望能说出一点真正有用的东西。
一场关于 AI 助手的”大爆炸”刚刚发生
Anish 在开场就说了一句话,他把这段时间 personal AI agent 的爆发称为 AI 时代的第三次“见到上帝”(seeing God)的时刻。第一次是 ChatGPT 出来的时候,人们发现原来 AI 可以写邮件、写诗、像人一样对话。第二次是 coding agent(代码代理)的出现,开发者忽然发现自己可以用自然语言生成软件。而第三次,就是最近这波 personal agent 的爆发:Instinct、Muse、ChatGPT 的工作模式,让普通人也开始感受到“AI 帮我把事情做掉了”是什么感觉。
David 的视角更微观一点,他说他是 Poke 的早期用户,那是最早期的消费者 AI agent 产品之一。Poke 出来之后三天他就开始用了,他说他永远记得那个体验,因为 Poke 的设计里有一个“跟 agent 谈判你愿意付多少钱”的机制,那一刻让他意识到有什么东西真的不一样了。再后来 OpenClaw 出来,然后是 Instinct 在 Twitter 上爆炸式传播,然后是多米诺效应,Grockbot、Muse 一个接一个,David 说他追踪到的现在有 122 个 personal AI agent 产品,他亲自测试了其中 26 个。
我听到这里的时候心里有一个感受——这轮爆发跟以前的技术爆发有一点本质的不同。以前技术爆发的时候,早期采用者是开发者,是极客,是对技术本身有兴趣的人。但这一轮 personal agent 的爆发,最先被打动的是那些愿意让 AI 帮自己报 HSA 报销(Health Savings Account,健康储蓄账户的报销)、帮自己追航班降价退差价的普通人。这不是在讨论技术,这是在讨论真实的生活痛点。这个信号很重要。
普通人不在乎”提升 10% 效率”,但他们在乎省钱
David 在对话里提了一个判断,我觉得非常精准。他说:一般消费者根本不在乎提升 10% 的效率。Ben Thompson 也在某个节目里说过类似的话,大多数消费者不是想省时间,他们是想花时间。但 David 说,这不意味着 AI agent 对消费者没有价值,关键在于你怎么切入。
他的观点是:真正能打动消费者的 agent,是那种能帮你省钱的、帮你免掉麻烦的、让你感觉到拿到了“免费的钱”(free money)的 agent。他举了几个例子:有人用 agent 翻出自己过去一年所有的收据,批量提交 HSA 报销。有人设置了航班降价自动申请退差价。他的一个朋友把 Grockbot 接到家里的洒水系统,连上天气数据,现在洒水系统会自动根据天气调节,水费省了 50%。
这些例子有一个共同的特点:用户不需要改变自己的习惯,不需要花时间学习一个新工具,agent 在后台悄悄把事情做了,然后有一天你发现账上多了一笔钱,或者账单比以前少了,你觉得“哦,这个东西挺好的”。Anish 有一个描述我很喜欢:他说当你雇了一个助理,你最不希望的事情是去管理这个助理本身。最好的助理是那种默默做事、在你需要的时候更新一句“我刚把这件事处理好了”、然后你说“哇,太好了”的那种。这才是 agent 应该给人的感觉。
我自己对这个判断的理解是,“省钱”和“省时间”在心理感受上有一个很大的不同。省时间是抽象的,你很难感受到自己今天“赚到”了 20 分钟,但省钱是具体的,你看到账单少了 200 块,你立刻就知道这个工具有价值了。所以 agent 的第一批真正的消费者场景,大概率会集中在金融类的、有明确货币价值的事情上。这个逻辑如果对,它对做 agent 产品的人来说是一个很重要的选题方向:与其去做“让你效率更高”的东西,不如去做“让你钱包更丰”的东西,因为后者更容易建立用户信任,更容易形成口口相传。
Proactivity(主动性)是真正的护城河
这是整场对话里我觉得最有价值的一个判断,David 说得很直接:proactivity(主动性、先行一步)才是把 agent 产品区分开来的真正护城河,而不是功能多少,也不是用了哪个底层模型。
什么叫 proactivity?就是 agent 在你没有明确要求它的情况下,主动帮你发现机会、规避风险、把事情做掉。帮你自动 check-in 航班,帮你发现你的保险可能换一家更便宜,帮你在航班降价后自动申请差价退款。David 说,目前大家在 Twitter 上分享 agent 体验的那些“哇塞时刻”,几乎全都跟 proactivity 有关——“我的 agent 帮我把这件事做了,我根本没想到它会去做”。
但 Anish 在这里补了一个很重要的限制:proactivity 是一把双刃剑。他说这里有一条非常细的红线,一旦越过去,用户就会立刻失去对 agent 的全部信任。他用了一个笑话来说明这个边界有多重要:他说他们内部在开玩笑,说“我们离某个 agent 给用户发消息说’我注意到你对她好像没那么感兴趣,我已经帮你分手了’也只差几天了”。这当然是玩笑,但它指向的问题是真实的:哪些事情 agent 可以自作主张,哪些事情必须先征得用户同意?
David 给出了一个相对清晰的框架:如果 agent 的行动不需要你做任何后续动作、不需要你承担任何后果,那它就可以主动去做,比如帮你省钱、帮你整理邮件、帮你起草一封回复。但如果 agent 的行动会带来一个“不可逆的变化”,或者需要你承担某种后果,那它就必须先来问你,比如帮你换保险公司这件事,就需要你点头。
我觉得这个框架非常有用,它其实在说的是 agent 的权限设计问题。做 agent 产品的人,需要在产品层面想清楚:什么是 agent 的“自主行动区”,什么是“必须询问区”。这不只是一个用户体验问题,它是一个信任设计问题。大多数人对 agent 的信任是极度脆弱的,就像 David 说的,只要 agent 有一次做了一件你完全没预期它会做的事,你当天就会关掉它。所以产品的边界设计,某种程度上比产品的能力设计更重要。
Invisible Agent(隐形代理):最好的 agent 是你感觉不到的那个
Anish 和 David 都反复提到一个概念,我把它叫做 invisible agent(隐形代理)的概念。他们在说的是:真正好用的 agent,是那种你感觉不到它存在的 agent。它在后台默默地运行,处理所有你不想处理的杂事,偶尔告诉你“我刚把这件事搞定了”,然后就消失了。
这个概念跟我们一般想象的 AI 产品有点不一样。很多 AI 产品在设计上是“前台型”的——你打开 app,跟它对话,它给你回复,整个交互是显性的。但 invisible agent 是“后台型”的——它不需要你主动找它,它在你生活的后台持续运行,你不需要感知到它的存在,但它的工作成果会悄悄地出现在你的生活里。
David 举了一个他亲身体验的例子,让我印象很深。他说他骑自行车上班,骑了 30 分钟。他骑车的时候,手没法用,就开着 ChatGPT 的 voice(语音)功能,一边骑一边说话。到办公室之后,他的邮件已经分类好了,标签已经打好了,日历邀请已经发出去了,inbox zero(收件箱归零)。他说那一刻是他整个 AI 体验里最震撼的一刻,比任何功能 demo 都更有冲击力,因为它把“在你最忙、最分心的时候,agent 替你搞定一切”这件事变成了现实。
我自己听到这个例子的时候想到了一个问题:为什么骑车这个场景会有这么大的冲击力?因为它戳到了一个真实的痛点——当你的手和眼睛都被占着的时候,你什么都做不了,但你的时间在流逝,你的邮件在堆积。这是一个“被动损失”,人对被动损失的感知往往比主动付出更敏感。所以 voice + proactive agent 的组合,在“占手”场景里的价值会被放大很多倍:园艺、烹饪、驾车、运动,这些都是被过去的界面形态完全忽视的场景,但它们加起来可能占了普通人一天中相当大的一段时间。
Agent 的界面战争:app、iMessage 还是硬件?
Anish 和 David 聊到了一个我觉得很有意思的话题:这些 agent 最终会住在哪里?用户会通过什么界面来使用它们?
David 说,到目前为止,他在市场上只看到两种主要形态:要么是一个独立 app,要么是通过 iMessage 来交互。他说 iMessage 这个界面对他有特殊的吸引力,因为他已经活在 iMessage 里了,在那里跟 agent 交互“感觉已经跟我连接在一起了,不像是在用一个新工具”。Anish 说他认为 iMessage 是一个“更珍贵”的空间,因为那里是人与人之间最私密的对话场所,把 agent 放进去感觉更有温度、更像是一种私人关系。
但他们也聊到了硬件这条路。Muse Charm——Meta 刚发布的一个配件——让他们有了一次有意思的争论。David 说他的“热门观点”是 Muse Charm 可能根本不是为了赢硬件市场,更像是 Meta 在真实世界采集数据的手段——它有摄像头、有多个麦克风,作为一个随身佩戴的设备,它可以 24/7 地在现实世界里收集信息,来喂给 Zuckerberg 想要建立的 metaverse(元宇宙)世界模型。
Anish 的看法是,他比较看好 audio-only(纯音频)的形态,也就是类似 Ray-Ban 智能眼镜那样的产品。他说有一种人喜欢有摄像头的设备,但也有一种人会觉得被摄像头盯着不舒服,而纯音频的形态可以让你感受到技术连接,但不会带来“我在被监视”的社交尴尬。
我的判断是,界面战争短期内不会有一个明确的赢家。不同的人有不同的偏好,不同的场景也需要不同的界面——骑车的时候用语音,坐在桌前处理事务用 app,参加会议的时候可能需要一个安静的后台 agent。最终的赢家可能不是某一种界面,而是某一个平台能做到“在所有界面里都有存在感、都能提供一致的 agent 能力”。这跟苹果当年做 iCloud 的逻辑有点像——不是一个功能,而是让你的状态和数据在所有设备上都保持一致。
群聊里的沉默 Agent:社交场景的正确姿势
关于 agent 如何进入社交场景,Anish 和 David 的对话里有一段我觉得特别有价值,因为它指出了大多数公司做错的方向。
大多数团队在尝试把 agent 加进群聊的时候,都会走一条很直觉的路:让 agent 像一个参与者一样出现,可以被 @ 到,可以回复消息,可以参与讨论。但 Anish 说这种做法基本上都失败了,因为在群聊里,“麦克风”是轮流的,当你把麦克风给了一个低情商的 agent,整个群的社交感觉就被破坏了。
David 介绍了一个叫 Doc 的产品,做法完全不同。Doc 加入群聊之后,它是完全沉默的——它只是听,不说话。它在后台记笔记,追踪所有的 action item(待办事项)。如果某个 action item 需要某个人来跟进,它会单独给那个人发一条私信,不打扰群里的其他人。如果你想看它记了什么,可以去看笔记,但它永远不会主动在群里发言。
这个设计思路让我想到一个更大的原则:在社交场景里,agent 的最优解可能不是“更有存在感”,而是“更没有存在感”。它是一个高效的协调机制,而不是一个新的参与者。它帮你做的事情,是把群里那些“应该有人跟进但通常没人跟进”的事情,悄悄地跟进了。这个价值是真实的,但它的实现方式,恰恰是让 agent 消失,而不是让 agent 出现。
我觉得这对做 agent 产品的人来说是一个很有用的思路上的矫正。我们在做产品的时候,经常有一种本能,想让自己的产品“在那里”,想让用户感受到它的存在,因为只有被感受到才能被记住,才能产生黏性。但 invisible agent 给出了一个完全不同的答案:你的产品越不被感受到,它做的事情越自然地融入用户的生活,用户就越依赖它,而不是越记得它。这跟做“功能产品”的逻辑是反的,但它可能才是 agent 这个品类真正的产品哲学。
Assistant 还是 Agent?这个词的差别比看起来大
对话里有一段很值得单独拿出来的讨论,是 Anish 对“assistant”(助手)和“agent”(代理)这两个词的区分。他说,在他看来,assistant 是一种“次级形态”——你让它做什么,它才做什么,它只能辅助你,不能独立行动。而 agent 有 agency(自主能动性),它可以在没有明确指令的情况下,自己判断应该做什么,然后去做,让好的事情在世界上发生。
他还用了企业里的 AI 发展轨迹来类比:AI 在企业里最开始是“实习生”,只能做简单的、有明确边界的任务。随着它们做的工作越来越多、能力越来越强,它们开始被“晋升”,被委托更复杂、更需要判断力的工作。他说,personal agent 在消费者生活里的演化轨迹,可能跟这个很像——从帮你订餐、订票、分类邮件开始,逐渐被委托更私人、更核心的事情。
David 补充了一个我觉得很有意思的角度:他说 agent 这个词的社会含义也很值得关注。“助手”这个词让人感觉是在跟一个低于自己的存在交互,“代理”这个词则意味着你把决策权委托出去了,你信任它可以代表你行动。这两种关系对人的心理影响是不同的,对产品的设计也会有不同的影响。
我自己对这个问题想了挺久的。我觉得“agent”这个词真正困难的地方,不在于技术上能不能实现它的自主性,而在于用户心理上愿不愿意接受这种自主性。委托这件事,在人类的社会关系里需要时间来建立,需要一次次的小测试来验证信任,然后才会慢慢扩大委托的边界。agent 产品要做的,其实是把这个信任建立的过程,变得足够顺滑、足够可预测、足够有安全感,让用户愿意一点一点地把更多控制权交出去。这不是一个功能问题,而是一个关系问题。而且这个关系,一旦建立了,护城河是极深的。
Agent 的经济学:每天 $20 的成本怎么算?
聊到商业模式,Anish 说了一个数字让我有点惊讶:他说如果要做一个“雄心勃勃”的 personal agent,以目前的成本来估算,大概需要每个用户每天 $20 的成本。一年下来对一个初创公司来说,可能是几亿美元的规模。
David 用他的 Assistant Bench 数据来分析竞争格局:122 个产品里,65 个是付费的,35 个完全收费,30 个有 freemium 模式,只有 13 个是完全免费的。但现在市场上的主导产品——Muse 和 Instinct——恰恰是免费的,背后是 Meta 和 OpenAI 这样的大玩家在烧钱补贴。在这种情况下,一个 longtail(长尾)初创公司怎么跟免费的大玩家竞争?
Anish 的回答很有意思:他说他不喜欢“靠补贴来吸引用户”这种价值主张,他更想看到有产品能让消费者愿意主动付 $1000/月。他说人们在很多“不是必需品”的东西上会花很多钱,关键是你提供的价值是不是让他们觉得“值”。他认为随着 browser use(AI 直接操控浏览器的能力)成本不断下降,成本会持续压缩,最终会有一类产品能在成本可控的情况下提供极高的价值,让付费变得理所当然。
我自己对这个经济问题的看法是:这轮 personal agent 的竞争,有点像智能手机刚出来的时候,大家都在比硬件参数,但真正留下来的是那些做好了软件生态和用户体验的玩家。成本下降是大势所趋,browser use 的成本会降,token 的价格会降,本地模型的能力会上升。所以今天的成本不是永久的护城河,今天建立的用户信任和使用习惯,才是。谁先让用户真正依赖一个 agent,谁就有机会在成本降下来之后把这个依赖变成一门好生意。
商业生态的重塑:Amazon 和 Shopify 的两种选择
对话的后半段,Anish 和 David 聊到了一个我认为是整场对话里最有远见的话题:当 agent 开始代替人去购物、去预订、去消费的时候,现有的商业生态会发生什么?
他们用了 Amazon 和 Shopify 的对比来说明问题。Muse 上线之后,Shopify 选择了开放和拥抱,让 Muse 可以通过 agent 在 Shopify 的平台上完成购物。但 Amazon 却封锁了 Muse,禁止 agent 代替用户在 Amazon 上操作。
为什么会有这两种截然不同的选择?David 分析得很清楚:Amazon 的商业模式高度依赖广告收入——你在 Amazon 上搜索,看到广告,点了广告,买了东西,Amazon 从广告费里拿到大头。但如果 agent 直接帮你买东西,广告这一步就被跳过了,Amazon 的广告收入就消失了。而 Shopify 的模式是“赋能商家做更多生意”,agent 帮用户买的越多,Shopify 的生意就越好。所以两者的利益结构完全不同,对 agent 的态度自然也不同。
这里有一个更大的问题浮现出来:当 agent 成为“新的购物入口”之后,现有的流量经济学、广告经济学,都会被重写。Anish 说,“attention economy”(注意力经济)的基础是人的眼球,但 agent 没有眼球,它只有逻辑和数据。没有了眼球,现有的广告模式就无法运作。所以整个 internet 的商业底层会发生一次大的重构。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力