跳到主内容
@wquguru
精选80meng shao技巧与观点

Skill Doctor:用历史对话评估并改进本地 AI Agent

[Skills 分享] Skill Doctor

原文
发到 X
推荐理由

做 Agent 工程化的同学值得收藏:Skill Doctor 给出了一套可照做的“用真实对话反向检验 Skills”的完整流程和评分公式,直接拿去评估你自己的配置。

[Skills 分享] Skill Doctor https://www.warp.dev/skill-doctor

来自 @warpdotdev 团队,用于评估并改进你本地 AI Agent 的 Skills 配置,并产出具体的 Skills 修改建议和一份可分享的报告。核心理念是:用你真实的历史对话记录作为"考卷",反向检验你的 Skills 写得好不好。

工作原理:三步闭环 聚合:Agent 收集本地的历史对话记录(transcripts),来源可以是 Claude Code、Codex 或 Warp 等。 评分:由 subagents 基于经过验证的评分量规,从效率、代码质量、Skills 覆盖率三个维度对这些对话打分。 改进:Agent 根据评分结果,提出可直接合并的 Skills 修改建议。

核心机制:六步执行流程 Step 0 · 启动 — 验证 Agent 环境是否受支持;交互确认评分范围(当前仓库 / 全部 / 指定项目)与评估对象(含全局 Skills / 仅项目 Skills);产物一律写入临时目录,不碰用户仓库。 Step 1 · 采集 — 脚本聚合本地会话:默认回溯 45 天、采样 12 条;产出清单文件。无会话则终止,无 Skills 则继续(覆盖率记 0)。 Step 2 · 评分 — 逐份转录对照两份量规打分:效率 + 代码质量;大批量分片并行,全程本地。无代码改动的会话记"证据不足",不计入代码质量均分。 Step 3 · 聚合 — 总分 = 0.5 × 效率 + 0.35 × 代码质量 + 0.15 × Skills 覆盖率;原始分 < 0.5 的会话判为"失败会话",作为后续所有改进建议的唯一证据来源;提炼 3 条核心发现。 Step 4 · 起草修改 — 只改证据支持的部分(没触发的触发描述、缺失的预检、试错出的流程),产出完整改进版 Skills 文件 + unified diff,不直接改动真实文件。 Step 5 · 渲染报告 — 生成单页自包含 HTML 报告并自动打开:记分卡、发现、带 diff 的建议同页呈现,支持导出分享图。 Step 6 · 输出 — 口头汇报等级与三条发现,最后询问用户是否应用修改。 主线逻辑:采集真实对话 → 量规评分 → 定位失败模式 → 产出可合并的 Skills 修改——全程本地、证据驱动、非破坏性。

关键特性 完全本地运行:对话记录、会话文件不会上传到任何地方,唯一可分享的产物是用户自己选择发布的报告页面。 范围可控:可以只评当前仓库的对话、指定项目的对话,或全部本地对话;可以只评项目级 Skills,或连同全局 Skills 一起评。 输出可落地的改进:不是泛泛的建议,针对 Skills 文件的具体编辑提案。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近