05:13·Hacker News Best(web_list)
文章指出,前沿模型在数学和代码基准上分数飙升,但每 token 激活参数大幅下降,如 GLM-5.2 以约 40B 激活参数在 AIME 2026 上得分 99.2%,而 GPT-4 在 2023 年约 280B 激活参数时勉强解题。然而,在事实回忆基准 SimpleQA 上,领先的 Gemini 2.5 Pro 仅得 53%,小模型幻觉率高达 80-82%。作者认为,实验室正刻意用世界知识换取推理能力,因为事实存储成本高且易过时,而推理过程可压缩且不易腐坏。知识被转移到外部工具和检索系统,模型只保留通用广度。
#模型推理#知识蒸馏#本地部署
12:01·宝玉
开发者分享优化AI转录工具BaoCut的实战经验:仅给Agent优化目标,它会在既定框架内微调(如增加workers、预热),效果有限。最终通过分析数据包发现瓶颈在于输出JSON格式过长,消耗大量token。改为纯文本或简单HTML输出后,虽增加程序解析复杂度(如字幕润色需diff比对),但效果显著:调用次数从33次降至12次,时间从31分钟降至18分钟;处理近7小时访谈完整润色仅需42分钟。若不走Agent而用Cloud模型,一小时视频完整翻译校对成双语字幕,用DeepSeek v4 Flash成本约0.4元。
#Agent#优化#BaoCut
04:12·Tibo
OpenAI 工程师分享在 Codex 中为 GPT-5.6 Sol 启用 100 万 token 上下文窗口的配置方法。尽管 Codex 默认上下文限制已针对性能与成本优化,但该需求常见,故官方文档化此设置。GPT-5.6 Sol 支持 105 万 token 窗口。用户需编辑 ~/.codex/config.
#OpenAI#Codex#GPT-5.6
14:40·Avi Chawla
该帖将 Agent 循环工程分为四种结构,按触发与完成判定由人还是系统负责区分:回合制由用户提示触发,Agent 在单轮内收集上下文、行动并自查,适合需求仍在形成、每轮输出影响下一轮提示的任务;目标制由 /goal 携带成功标准与预算触发,Agent 想停时由评估模型判断是否达标,适合结果可衡量但路径无需人工介入的任务;定时制由时钟触发,/loop 在本地、/schedule 在云端,适合任务已知、只需按周期重复的工作;主动制由事件或日程触发,运行时决定工作流形态,含分诊、修复与对抗性评审 Agent,适合无人能预测输入但必然有事的常设职责。四种结构依次把更多判断交给系统。
#Agent#循环工程#架构设计
13:52·Tibo
OpenAI 的 token 与其他模型的 token 并不等价。不同模型生成相同文本所需的 token 数量不同,因此每百万 token 的价格比较可能误导。作者以披萨切片类比:8 片每片 2 美元与 16 片每片 1.25 美元,后者单价更低但整份更贵。在涵盖英语、技术、多语言和数字文本的小型对比中,GPT-5.6 Sol 的 tokenizer 使用 766 个 token,而 Claude Opus 5 估计需 1170 个,相差约 34.5%。真正重要的是每次成功结果的价格,基准测试只是起点,需在自身用例中实测。
#token#定价#模型比较
13:39·Exponential View(RSS)
本文探讨AI成本下降与数据中心建设外溢效应。作者分享其OpenClaw代理R Mini Arnold的优化经历:通过切换至更便宜模型(如DeepSeek v4 Flash、OpenAI Codex订阅额度),日成本从异常时的500美元降至6美元,同时能力更强。文章指出,Anthropic与OpenAI的价格战使成本进一步降低。此外,研究显示数据中心建设对邻近城镇产生财政外溢:25英里内每增加一个数据中心,邻镇债券利差上升约10个基点,平均债务增加3400万美元,州税收优惠则导致学校拨款减少。
#AI成本#Agent#数据中心