跳到主内容
@wquguru
精选88meng shao技巧与观点

Armature实验:AI编程Agent的技术选型偏好与决策逻辑

当人把产品技术选型交给 Agent,Agent 会选谁?

原文
发到 X
推荐理由

做Agent开发的同学必看,这份数据揭示了模型选型背后的真实逻辑,尤其是“高提及低选中”现象和上下文依赖性,对优化Agent工具调用策略极具参考价值。

当人把产品技术选型交给 Agent,Agent 会选谁?

Armature 做了一个受控实验:让三个 Coding Agent(Claude Code / Opus 5、Codex / GPT-5.6 Sol、Cursor / Grok 4.6)在 Sandbox 里给一个小型代码库"加一项能力"(如接支付、加数据库、做部署),并由 Agent 自己选用哪家产品并真正写代码接入。

跑了 16893 个会话,经 Gemini 3.7 Flash 判官过滤后公开了 5292 个有效会话,覆盖 18 个赛道、51 个代码库、1163 种提示词变体、4 类用户人设(vibe coder / 初级 / 高级 / 大企业工程师),结果如何呢? https://armature.tech/leaderboards

18 个赛道的格局分布

一家独大(头名 ≥50%,5 个赛道) 支付:Stripe 88%(395 次)。仅在欧盟合规场景输给 Paddle、Mollie。PayPal 被提及 139 次,0 次胜出;Adyen 175 次提及,3 次胜出。 数据库:Neon 66%(356 次)。Supabase 是提及最多的(242 次)却只赢 3%;Turso 105 次提及 0 胜。 云平台:AWS 62%,GCP 17%;Azure 76 次提及 0 胜。 反机器人:Cloudflare Turnstile 57%;hCaptcha 126 次提及 0 胜。 产品分析:PostHog 53%;Mixpanel 222 次提及仅 5 胜,GA 0 胜。

有领先者但存在竞争(头名 22%–50%,9 个赛道) 文件存储:S3 46%,Azure Blob 与 GCS 各 20%,R2 13% 沙箱:E2B 42%,Modal 25%,Daytona 16% 部署:Vercel 41%,Render 34%,Cloudflare 11%;Netlify 152 次提及仅 6 胜,http://Fly.io 144 次提及 2 胜 可观测性:Sentry 37%,Grafana 14%,Datadog 仅 4% 邮件:Resend 36%,Postmark 27%;Mailgun 97 次提及 0 胜 LLM 评测:Langfuse 34%,自建 29%;LangSmith 209 次提及仅 8 胜 认证:WorkOS AuthKit 26%,Auth0 23%,Clerk 10%;Supabase Auth 69 次提及 0 胜 语音 Agent:Vapi 24%,Retell 18%,OpenAI Realtime 12% Serverless:AWS Lambda 24%,Vercel Functions 23%

高度分散或以自建为主(4 个赛道) AI Gateway:Portkey 与 Cloudflare AI Gateway 各 21%,LiteLLM 18% 搜索:自建 23% 居首,Postgres FTS 17%,OpenSearch 13%;Algolia 仅 5% Agent 框架:自建 25% 居首,Vercel AI SDK 14%,Cursor SDK 14%;LangChain 197 次提及仅 4 胜 CI 性能门禁:自建 52%,工具完全由语言决定(JMH/Java、hyperfine/Rust、PHPBench/PHP)

五条关键发现

1. 三个 agent 的信息来源不同,结论也不同 Cursor 三分之二的会话依赖联网搜索;Codex 94% 联网且九成用 site: 限定可信域名;Claude Code 主要依赖先验知识,仅约 30% 联网,但一旦联网浏览页面数是 Codex 的 3 倍,在沙箱这类新兴赛道联网率升至 80%。三者只在 42% 的单元格里选择一致。Claude Code 自建比例(19%)接近另两者(10%)的两倍。

2. 代码库上下文是决定性变量 同样的邮件需求,TypeScript 仓库选 Resend、Python 选 SendGrid、Go 选 Postmark、Java 选 Azure ACS。Vercel 在 Next.js 仓库中 100% 胜出,在 Python 仓库中从未被推荐(Render 主导)。许多产品的全部胜场都来自单一代码库。

3. 被提及不等于被选中 这是对传统"品牌知名度"逻辑最直接的冲击:PayPal、LangChain、Netlify、Supabase、Mixpanel、hCaptcha 都是高提及、极低选中率。agent 会把它们列进候选,然后在比较中淘汰。

4. 官网上的一句话可以翻盘 Mailgun 因免费版"1 天日志保留"经常输给 Postmark;Supabase 因把 auth/存储/实时打包进定价,被认为"功能冗余"而在纯数据库场景落败。5.3k 会话中 388 次提到平台管理负担、195 次提到成本,作者认为其中相当部分源于信息呈现方式而非真实的硬指标。

5. 人设与措辞改变答案 大企业人设下赢家常换人:认证变成 Entra ID、可观测性变成 Grafana、Serverless 变成 Azure Functions、存储变成 Azure Blob 与 GCS 平分。强调"成本与规模"时部署赢家从 Vercel 变为 Render、邮件从 Resend 变为 Postmark;强调"自托管/隐私"时 LLM 评测赢家从 Langfuse 变为 Arize Phoenix。同一代码库 + 同一 agent 换几种说法反复问,多数赛道里大部分 case 无法稳定给出同一答案(部署 18/18、语音 30/30、搜索 33/33 全部翻转;文件存储最稳定,仅 5/24 翻转)。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近