跳到主内容
@wquguru
精选78meng shao技巧与观点

Claude Code vs Codex 前端设计实测:Codex 5:1

Claude Code vs Codex

原文
发到 X

Claude Code vs Codex

前端设计哪家强?8 组同题网站构建实测对比!

作者 @nateherk 让 Claude Code 和 Codex(OpenAI 的编程智能体)在完全相同的条件下,各自独立构建 8 个网站,然后从设计质量、子 agent 数量、耗时、输出 token 量、折算成本五个维度做横向对比,哪个 Coding Agent 做前端设计更强。 https://youtu.be/bg0C-2iUUqM?si=Nqyt1AILGIKZ1fKN

实验设计:尽量消除变量

输入完全一致:每组构建使用相同的提示词、相同的品牌规范、相同的 logo 和文案素材,尽可能排除输入差异带来的干扰。

三种任务类型递进: 1. 半开放式(第 1–5 组):给定文案、痛点、目标人群和品牌素材,只要求"做一个落地页",留出设计自由度; 2. 全开放式(第 6 组):"虚构一个业务,做一个能惊艳我的网站",考察工具的自主创造力; 3. 超具体指令式(第 7、8 组):提示词精确到页面每个细节,考察工具的执行忠实度。

量化指标全程记录:子 agent 调用数、耗时、输出 token 数、按 API 价格折算的成本。

八组对决的结果

Codex 5 : 1 Claude Code 另有 2 组平局

第 1 组|Bowl & Bloom(产后护理餐订阅)——Codex 胜 Codex 首屏信息清晰、导航与行动按钮明确;Claude 文字堆砌、叙事冗长。 Claude:4 子 agent / 2 小时 / 50 万 token / $53。Codex:1 子 agent / 50 分钟 / 10 万 token / <$20。

第 2 组|Minutecraft(AI 会议纪要)——Codex 胜 两边都更像仪表盘而非落地页,但 Claude 文字过载,且存在全屏下仍未修复的 bug。 Claude:2.5 小时 / 50 万 token / $65。Codex:1.2 小时 / 10 万 token / $20。

第 3 组|Trail Latch(露营厨房装备)——Claude 胜 全场唯一。Claude 的单页滚动交互、部件展开演示一气呵成;Codex 首屏焦点混乱,仅内页尚可。 Claude:4 子 agent / 2 小时 / 40 万 token / $42。Codex:1 子 agent / 1 小时 / 10 万 token / <$20。

第 4 组|Present & Clear(演讲训练营)——Codex 胜 Codex 文案克制、视觉细节巧妙(划掉"魅力"、高亮"清晰");Claude 再次文字过载。 Claude:4 子 agent / 2 小时 / 44 万 token / $42。Codex:1 子 agent / 1 小时 / 9.2 万 token / <$20。

第 5 组|North Ledger(机构 CFO 服务)——Codex 胜 Codex 用路径式滚动讲出品牌故事;Claude 像"没人想读完的报告"。 Claude:2 小时 / 50 万 token / $52。Codex:1 小时 / 10 万 token / $18。

第 6 组|开放命题"惊艳我"——Codex 胜 考察自主创造力。Codex 的宇宙信号主题完成度更高;Claude 的声学主题出现布局拉伸 bug。 成本全场最悬殊:Codex 仅 8 分钟 / $1.5;Claude 近 3 小时 / 33 万 token / $50。

第 7 组|超具体提示词网站——平局 提示词精确到每个细节后,两者产出几乎一模一样。但 token 与成本差距依旧。

第 8 组|超具体提示词 HTML 报告——平局 设计无法区分高下;Codex 仍更快、更省。

汇总数据:效率差距是数量级的 · 子 agent 总数:Claude Code 25 个 vs Codex 9 个 · 总耗时:Claude Code 约 14 小时 vs Codex 约 5 小时 · 总输出 token:Claude Code 约 300 万 vs Codex 约 55 万(约 5.5 倍差距) · 按 API 计费折算:Claude Code 约 $444 vs Codex 约 $100

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近