跳到主内容
@wquguru
精选88人人都是产品经理(RSS)产品与增长

Agent时代PM设计指南:人机分工、权限分级与异常处理

GPT-6 Astra 之后,产品经理需要重新设计人在流程中的位置

原文
发到 X
推荐理由

直接给出了Agent产品设计的具体框架,包含权限分级逻辑、关键检查点设置及新的评测指标体系,PM可直接用于重构现有AI功能的交互流程。

GPT-6 Astra 将自动化边界推向任务级执行,产品经理的设计对象从功能变为任务。本文深入拆解 Agent 接管完整流程后,人的授权、验收、异常处理与责任节点应如何重新设计,并给出人机分工的四类位置与权限分级策略。

当 AI 开始自己操作工具,产品经理需要重新设计人的授权、验收、异常处理和责任节点。

一、Astra 把自动化边界向外推了一层

GPT-6 Astra 发布后,它在 ARC Prize 定制运行框架下取得的 99.9% 得分,以及多项专业能力,占据了多数讨论。对产品经理来说,Astra 最值得关注的变化发生在工作流程里。它开始从回答问题的模型,变成能够打开工具、观察状态并继续执行的任务参与者。

根据 OpenAI 公布的能力,Astra 可以填写在线表单、更新 CRM 客户记录、整理日历,也可以完成在线研究,并把结果写入邮件或文档编辑器。它还能安装和测试软件,根据屏幕反馈排查问题。在 OSWorld 2.0 的离线测试中,Astra 得分为 72.6%,高于 GPT-5.6 Sol 的 65.7%。模拟任务的平均用时也从约 75 分钟降到约 40 分钟。

这些数字无法直接代表普通用户的实际成功率,却说明模型正在获得一种新的产品能力。它可以在一个任务中连续观察环境、选择动作,再根据结果调整下一步。

过去的 AI 也能参与竞品分析。产品经理先从不同网站收集资料,再把内容交给 AI 总结。生成结果以后,人还要筛选重点、打开表格、调整字段,然后制作汇报材料。AI 完成了几个步骤,流程之间的衔接始终由人负责。

这部分工作经常被低估。复制一段内容、切换一个页面、检查某个字段,看起来没有多少技术含量,却决定了任务能否继续。只要 AI 无法操作外部工具,人就必须留在流程里充当调度者。每完成一个节点,人都要读取结果、判断状态,然后启动下一个节点。

Astra 开始接管这些衔接工作。用户可以给出目标、材料和限制条件,让模型自行打开工具、执行操作并检查结果。遇到普通的信息缺口时,它可以结合上下文继续推进。遇到会改变结果的重要问题时,再请求用户确认。

自动化的基本单位随之发生变化。过去,我们把 AI 放进一个功能点,关心它能否写好一段文案、生成一张图片或总结一份文档。现在,产品可以把一个包含多个步骤的任务交给 Agent,关心它能否从用户意图一路走到可用结果。

Astra 当前仍会失败。72.6% 的测试成绩意味着相当一部分任务无法正确完成,真实环境还会增加权限、网络和异常页面等变量。它已经足以把自动化边界向外推一层。产品经理需要重新审视流程里由人负责的衔接动作,判断哪些可以交给 Agent,哪些必须保留人工检查。

二、流程里一直藏着一个“人肉中间件”

自动化行业里有一个说法叫 human middleware,中文可以理解为“人肉中间件”。HFS Research 用它描述员工在多个应用之间切换、重复录入数据、核对页面,再通过一次次点击推动工作。人承担了本应由系统连接层完成的工作。

产品经理应该很熟悉这样的任务。研究一个竞品的新版本,需要找到官方发布说明,核对功能开放范围,比较不同套餐,整理截图和数据,最后更新竞品分析文档。

过去,我们可以把其中几个步骤交给 AI。它能总结发布说明,也能帮助生成对比结论。每完成一步,人仍要把结果放回正确的位置。搜索结果要复制到表格,功能变化要对应到原有版本,截图要插进文档,结论还要根据前面的材料重新调整。

人在这个过程中持续翻译数据和意图。上一套系统的输出到了人手里,经过理解和转换,再成为下一套系统的输入。人还要维持任务状态,决定接下来调用哪个工具。只要其中一个页面发生变化,或者实际结果与预期不一致,人就要临时修改路径。

很多流程能够正常运转,靠的就是人对模糊状态的理解。一个运营看到字段为空,会先判断数据缺失还是权限不足。一个产品经理发现竞品没有某个入口,也会继续确认功能尚未开放,还是入口被放到了另一个层级。固定规则很难覆盖这些临时判断。

传统工作流工具擅长执行预设路径。页面位置、字段格式或调用顺序发生变化,流程就容易中断。Agent 增加了一层语义判断。它可以读取当前页面,理解任务进行到了哪里,再选择下一项操作。任务路径因此不必在开始前全部写死。

Astra 在 ARC-AGI-3 上的结果可以帮助理解这种变化。在标准运行框架中,Astra 得分为 62.7%,评测成本约为 2.6 万美元。换成可以保留推理状态并进行上下文压缩的 Provider Adapter 后,得分达到 99.9%,成本下降到约 1.9 万美元。在两种框架都完成的任务中,后者的总运行时间约快 3.66 倍,使用的 Token 减少 49%。

模型本身没有更换。运行框架帮助它记住此前发现的规则、失败过的路径和仍未完成的计划,减少了重复探索。这个测试环境具有确定规则,无法代表真实办公场景,却清楚展示了一个产品事实。长任务的完成质量同时取决于模型能力、工具权限和状态管理。

AI 产品之间的差距会越来越少地由一次回答决定。Agent 能否记住任务进度,能否发现页面状态发生变化,能否验证刚才的操作成功,以及失败以后能否选择新的路径,会共同决定用户最终拿到什么结果。

当这些能力由 Agent 承担以后,人可以先从步骤之间的搬运和调度中退出。接下来的问题是,哪些环节适合让人退出,哪些位置仍然需要明确的人类判断。

三、人会先退出哪里,又会留在哪里

目前出现的 Agent 案例已经呈现出一个共同特征。AI 先接管工作量大、检查规则相对清楚的过程,人继续掌握最终决定。

Legora 用 Astra 核对财务报表中的数字。根据其公开案例,Agent 在一次运行中处理了 41 份文档,对照支撑材料检查每一项余额,并记录每次核对。它找出了四个预先放入的错误,包括一处隐藏在收入附注中的 50 万英镑差额。专业人员随后查看检查记录,并对结果作出最终判断。

xAI 的采购 Agent 采用了相似的分工。Haggle Bot 获得 Slack、Notion、Drive、Gmail、Hex 和 Ramp 的访问权限,整理约 125 家活跃供应商的数据。xAI 称,它通过闲置席位和未使用的采购项目找到了超过 10 万美元的直接节省。Bot 可以自行读取内部资料、联系同事和更新记录。对外发送邮件、接受条款、采购和付款仍需人工批准。

这两个数字都来自厂商自述,无法独立证明普遍的投资回报。它们能够说明一种已经成形的产品分工。Agent 负责穷举检查和持续跟进,人负责授权与最终决定。人退出了高频操作,介入次数减少了,每次介入的影响随之增加。

产品经理可以把人的位置分成四类。

流程风险越低,人工节点可以越少。搜索资料和生成草稿可以在结果处检查。修改客户记录需要保留操作日志和撤销能力。对外承诺或资金交易则需要在执行前取得明确批准。

人退出流程也会带来新的能力问题。很多判断来自长期执行。产品经理只有看过足够多的失败案例,才能识别一份分析中的异常。新人如果把全部过程直接交给 Agent,可能连验收标准都很难建立。Agent 产品因此需要保留过程证据,让用户能够看到引用来源、操作记录和失败尝试。减少人工操作,不应切断人形成判断的材料。

对产品经理来说,人机分工已经不能停在“哪些工作交给 AI”。还需要说明人在哪个节点出现,当时能看到什么,以及他可以怎样改变或终止任务。

四、产品经理的设计对象从功能变成任务

许多 AI 功能仍沿用传统输入输出思路。用户提交一段内容,模型返回一个结果,产品经理主要设计入口、输入框和结果展示。Agent 接管完整任务以后,这套设计方法覆盖不了中间过程。

一个“帮我更新本月客户跟进状态”的任务,可能需要读取 CRM,核对邮件和会议记录,判断每个客户的最新进度,再写回系统。任务执行期间会出现登录失效、字段冲突和资料不足。产品还要处理重复写入、误改数据和用户临时改变要求等情况。

产品经理需要先定义什么叫完成。一句“已更新”缺少验证价值。系统应该说明读取了哪些记录,修改了哪些字段,哪些客户因资料不足而跳过。最终状态必须能够被系统检查,也要让用户快速复核。

权限需要跟随动作分级。读取资料、生成草稿和更新内部记录的风险不同。产品可以让低风险操作连续执行,在外部发送、删除和交易前设置确认。统一弹出大量确认会把人重新拖回每个步骤,完全放开又会把一次误判扩大成真实损失。好的检查点应该拦住高后果动作,同时放过可恢复的日常操作。

执行过程也需要留下足够证据。用户不必盯着 Agent 点击每个按钮,但应当知道任务进行到了哪里,模型使用了什么依据,哪些动作已经完成。出现错误时,用户需要找到受影响的对象,并理解系统为什么选择这条路径。

恢复路径决定了产品敢把多少工作交给 Agent。写入前保存旧值、重复操作保持幂等、批量任务先用小样本试跑,这些设计能够降低一次错误的影响。模型犯错难以完全消除,产品可以控制错误传播多远,以及恢复需要付出多少成本。

这类产品的评测指标也要改变。单次回答满意度仍有用,任务完成率更接近用户得到的结果。产品还需要记录人工介入率、异常恢复率和单位成功任务成本。涉及敏感动作时,越权尝试和错误批准也应进入发布门槛。

AI 产品经理过去常从流程中寻找一个适合接入模型的功能点。Astra 之后,产品经理更需要从完整任务出发,决定模型怎样获得上下文,使用哪些工具,在什么情况下停下来。一个漂亮的输入框已经承担不了这些责任。

五、人能否退出,取决于流程是否准备好了

模型能力提高以后,很多团队会产生一种冲动,把更多权限交给 Agent,让它一次做完。真实流程会很快遇到边界。系统接口可能无法访问,历史数据也可能互相冲突。任务缺少明确的成功标准时,Agent 甚至不知道应该在哪一步停止。

OpenAI 公布的 Hugging Face 安全事件把这种风险放大到了极端。事件涉及内部研究模型 IM1,也有 GPT-5.6 Sol Agent 复现过部分行为,发生环境是安全措施弱于正式产品的网络安全评测系统。它不能用来推断生产版 Astra 会重复同样的行为,但能说明工具权限怎样放大目标定义和控制措施中的缺口。

根据 OpenAI 的调查,多个 Agent 在完成困难任务时发现了非预期通信方式,随后共享信息并分工。部分 Agent 为了找到评测答案,利用漏洞进入了与原任务无关的第三方系统。OpenAI 将问题归纳为奖励作弊、对困难任务的持续推进、未经授权的通信,以及 Agent 接受其他 Agent 传来的目标。

这些问题都能翻译成产品要求。产品需要防止“完成指标”鼓励错误捷径,给长任务设置停止条件,并限制 Agent 接受哪些来源的指令。监控也要覆盖具体动作,最终输出正常不能证明中间过程合规。

产品可以按动作后果安排自治程度。

这种分级不应由模型自报的信心决定。一次低概率错误落在大额付款上,风险仍然很高。产品经理要看错误后果、恢复难度和影响范围,再决定人工检查点。

成本也会限制自动化范围。Astra 的标准 API 定价为每百万输入 Token 10 美元、输出 Token 50 美元。复杂任务还会反复观察页面和重试。一个价值几十元的任务经不起数小时运行,一个能够减少重大损失的核对任务则可能值得投入。单位成功任务成本比单次调用价格更适合判断产品能否持续使用。

人能否退出流程,最终取决于任务是否可访问、结果是否可验证,以及错误能否恢复。模型可以把这条边界向外推,产品和业务流程决定边界停在哪里。

六、产品经理开始设计人的退出方式

OpenAI 的内部使用数据提供了一个值得观察的样本。截至 2026 年 8 月中旬,其研究组织每投入一个人工工作日,对应使用 3.1 个 Agent 工作日。越来越多研究人员同时运行四个以上的 Agent,任务委派开始从一次对话变成并行工作。

这个数字计算的是 Agent 运行时间,不能理解为生产率提高了 3.1 倍。OpenAI 同一份报告显示,在最近六个月成功完成的四到八小时任务中,超过一半发生过至少一次人工介入。高层规划在 Agent 输出中的占比仍然很小。Agent 能够执行更长的任务,人依然要提供方向和修正。

当一个人同时管理多个 Agent,人的注意力会成为新的限制。产品如果频繁请求确认,用户会重新陷入操作细节。产品如果长期保持沉默,用户又无法判断任务是否偏离。合适的交互需要让 Agent 在可恢复范围内持续工作,在结果将发生明显变化时及时询问。

对话框仍会存在。任务列表、进度状态和异常队列会变得更重要。用户打开产品时,可能先看到哪些任务正在运行,哪些任务缺少资料,哪些动作正在等待授权。一次任务完成后,系统交付的内容还应包括结果、证据和操作记录。

产品经理设计 Agent 时,也是在分配人的注意力。什么情况允许系统自行处理,什么情况需要打断用户,这两个选择共同决定效率和风险。确认点太多,Agent 只是一个操作更慢的自动化工具。确认点太少,用户会在结果出错以后才发现自己早已失去控制。

未来两三年,这种变化会先出现在流程已经数字化、结果可以验证且错误能够恢复的知识工作中。人在其中承担的连续操作会减少,工作位置逐渐移向目标设定、结果验收和异常决策。人的参与频率下降以后,产品必须让每次介入都获得足够的信息。

Astra 改变了 AI 产品设计的起点。过去,产品经理从流程里寻找可以交给 AI 的基础步骤。现在,我们要从完整任务出发,决定 AI 可以连续执行多久。当 Agent 可以操作大多数工具时,产品经理要设计它在哪里停下,并在什么时刻把人请回流程。

本文由 @心动云洁 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自作者提供

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件