15:35·IT之家(RSS)
Anthropic 发布博客,分享 Claude Code 的六大省钱技巧,帮助开发者避免浪费 token。技巧包括:任务完成后使用 /clear 清空对话;开局锁定模型和推理强度,避免中途切换导致缓存失效;用 @引用文件而非手打路径;给输出多的命令加静默参数;在休息前使用 /compact 压缩对话;将大输出任务交给子 Agent。文章还解释了 token 计价逻辑,强调提示缓存是最大省钱利器,并指出缓存失效的六种情况。Anthropic 称开发者日均消耗 13 美元 token,月均花费 150 至 250 美元。
#Anthropic#Claude Code#token优化
03:41·Avi Chawla
当任务准确率不足时,最经济的干预点是推理阶段。推理计算有两种扩展方式:并行采样多个结果并选择,或延长单条轨迹。文中总结了8种方法:思维链(CoT)、多数投票、Best-of-N、扩展思考、自我精炼、思维树、束搜索和MCTS。多数投票可降低方差但无法纠正偏差;Best-of-N依赖奖励模型,存在过度优化风险;扩展思考并非越长越好,Anthropic发现某些任务中轨迹变长准确率反而下降;自我精炼在GSM8K上净效果为负,但若批评来自编译器或测试套件则有效。每种方法都生成候选并选择,因此选择器决定上限。建议先构建验证信号,再扩展搜索。
#推理优化#思维链#Best-of-N
00:59·Hacker News Best(web_list)
GPU Mode 与 Core Automation 联合举办自动研究主题竞赛,要求实现批量方形紧凑 Householder QR 分解。作者在 183 名参赛者中位列第 12,实现了较基线 232 倍的加速。文章详细介绍了其方法:利用 popcorn CLI 进行快速迭代,通过 LLM 辅助学习 QR 分解数学,采用分块 Householder 算法和 WY 更新,并引入思路多样性以跳出局部最优。作者强调,即使没有领域知识,也能通过 agent 循环获得可观加速,但深入理解有助于提出更好的问题。文中还提供了实现提示和可改进之处。
#GPU#CUDA#QR分解
20:00·硅谷101(YouTube)
本期《硅谷101》邀请前Google DeepMind资深研究科学家曹原,探讨AI for Science的爆发。曹原认为,AI在数学和编程能力成熟后,自然延伸到科学发现,形成研发闭环是科研加速核心,但验证是瓶颈。他解读了Jeff Dean等离开谷歌创立Discovery Loop的背景,认为谷歌仍具全栈优势,但需调整优先级。他还区分了AI4S、AI4AI与RSI概念,并指出AI在数学、物理、生物制药等领域的进展,如OpenAI的Astra推导出10道数学难题,Anthropic将黎曼猜想零点下界推进至67.2%。曹原认为AI拿诺贝尔奖至少需二三十年,概念抽象是AGI的最后一英里。
#AI for Science#曹原#DeepMind
19:28·MarkTechPost(RSS)
本教程实现端到端监督微调流程,基于 XYZ-Aquila-SFT 数据集、Hugging Face Transformers、PyTorch 和 PEFT。内容涵盖:流式加载并检查数据集、解析多轮工具轨迹、提取结构化调用、分析语料特征;转换工具 schema 格式,渲染 Qwen 兼容 ChatML 并应用 assistant 损失掩码;构建自定义数据集与 collator,用 LoRA 微调 Qwen3-0.6B;最后评估训练前后工具调用预测,并导出转换后数据集与统计。教程提供完整可运行代码,适合希望掌握工具调用微调全流程的开发者。
#工具调用#微调#Qwen3
11:00·meng shao
吴恩达老师分享由DeepLearningAI团队制作的「AI Engineering技能图谱」。团队分析了超1万份JD,并对AI专家、招聘经理和猎头进行数十次结构化访谈,结合问卷与网络数据,提炼出AI工程师的四大核心技能:1.构建与部署AI应用,关键在于用统计方法度量、引导和治理AI系统,尤其是“纪律严明的评估与错误分析闭环”;2.软件工程基本功,理解成本、可扩展性、可靠性等权衡,用精确工程语言驾驭智能体;3.使用编程智能体,包括管理上下文、提供验证器、编写规格说明、编排多智能体等;4.塑造构建方向,工程师需具备产品Sense与商业上下文,参与定义“做什么”。
#吴恩达#AI工程#技能图谱
20:54·The Zvi(RSS)
本文是 Zvi 对 Dwarkesh Patel 播客中与 Redwood Research 的 Ryan Greenblatt 对话的深度解读,聚焦递归自我改进(RSI)的可行性与验证问题。Ryan 认为 AI 研发任务因验证充分而适合 AI,并主张通过训练 AI 完成简化版研发任务(如训练模型)来逐步实现 RSI;Dwarkesh 则持怀疑态度,认为 AI 尚未展现概念性跳跃,且到 2030 年低垂果实将被摘尽。Zvi 在评论中批评了窄化训练的思路,指出其可能沦为“为对齐不良模型做 RLVR 的 RLVR”,并质疑“研究品味”作为神秘能力的必要性。
#递归自我改进#AI安全#播客解读
19:54·Ahead of AI(RSS)
Sebastian Raschka 发布教程,从零构建一个简单的 AI 文本检测器,以解释 AI 检测器的工作原理,并作为验证器案例,用于训练小型语言模型生成难以被检测的文本。教程基于类似 Pangram 模型的方法(据称是 Substack AI 检测功能背后的技术),通过微调 DistilBERT 分类器,输出 0-100 的 AI 生成概率分数。项目目标包括构建端到端 LLM 应用,涵盖评估、训练和本地部署,最终提供可供人类和 Agent 使用的 API 及用户友好的 UI。
#AI检测#教程#DistilBERT