09:19·meng shao
Databricks 团队基于自身实践及与 Stripe、Coinbase、Uber、Ramp 等企业基础设施负责人的交流,提出规模化部署 AI 编码工具时控制成本的四大杠杆。核心概念是区分“效率前沿”与“智能前沿”:日常编程只需“够好”的模型,而效率前沿(同等智能下价格最优)几乎每周推进,因此最大成本杠杆是持续将用量迁移到更高智能/价格比的新模型。四大杠杆包括:迁移到开源和低成本模型(需自建评测,如 Stripe 测出 Opus 4.7 质平价升而拒绝上线);动态请求与任务路由(实测成本降 30%+,质量持平);采用可见性、绊线与渐进式摩擦而非硬预算;
#Databricks#成本优化#AI编码
04:54·MarkTechPost(RSS)
东北大学和斯坦福大学的研究人员发布了 Shepherd,一个开源的 Python 运行时基底,可将 Agent 的执行记录为类似 Git 的类型化事件轨迹,从而支持对任意历史状态进行分支和回放。与 Git 不同,Shepherd 的提交同时覆盖 Agent 进程和文件系统(写时复制),因此分支携带的是实时状态,而不仅是文件。研究团队报告,Shepherd 分支 Agent 进程和文件系统的速度比 Docker 快 5 倍,且由于分支点之前的提示前缀未变,回放时提示缓存复用率超过 95%。该框架围绕任务、效果、运行和工作区四个概念组织,权限在签名中声明,并在原生系统调用沙箱中强制执行。
#Shepherd#Agent#开源
18:33·Rohan Paul
一个名为KISS Sorcar的AI代理在不到8小时内,以不到150美元的成本,将SQLite性能提升了59%。SQLite是经过近20年优化的成熟代码库,该代理在事务处理、分析查询和blob I/O等场景中发现了多处默认配置的额外开销,通过修改代码和配置、基准测试并自我审查,最终在官方speedtest1上获得2.06倍加速,TATP上1.90倍,Star Schema Benchmark上1.30倍,kvtest上1.25倍,且超过100万项SQLite测试仍然通过。
#AI代理#SQLite#性能优化
16:41·Avi Chawla
本文用图示清晰解释了8种LLM精度格式。背景:浮点数由符号位、指数位和尾数位组成,减少指数位导致大值溢出,减少尾数位导致邻近值合并。FP32占4字节/参数,默认保留优化器状态。BF16和FP16同为16位,BF16保留8位指数,转换不溢出;FP16保留10位尾数,范围小,小梯度会清零,因此FP16训练需缩放损失。TF32在张量核心内计算,不改变存储。FP8有两种布局:E4M3用于权重和激活,E5M2用于梯度。INT8和INT4均匀量化,但离群值会破坏精度,LLM.int8和SmoothQuant用于解决。NF4非均匀分布,使QLoRA能以4位冻结基座模型。量化减少内存,但需权衡指数或尾数位。
#LLM#量化#精度格式
01:35·宝玉
开发者分享工作流:开发项目第一版先用Claude Design设计UI原型,打磨后存本地,配合Baoyu-Design Skill维护。每次开发新功能前,先修改本地原型,确认后再改功能。规则写入Agents.md/claude.md后,只需说修改或增加功能,默认先改原型,确保原型与实际功能始终一致。好处是低成本验证产品与UI设计;Claude Design产出React代码和结构化JSON,通过git diff清晰查看版本变更,功能确定后agent参考diff实现代码更易。
#Claude#工作流#原型设计
09:58·宝玉
很多人不知道如何用好 Agent 的 /goal 功能,即给 Agent 一个目标,让它长时间运行直到完成。关键在于明确目标、验证结果和停止条件。以性能优化任务为例,作者用 Fable 5 将视频转录性能优化了 2 倍多。提示词先让 Agent 用 Moss 模型测试大视频转录,建立基准,再分析瓶颈并优化,直到认为没有优化空间。注意主要任务是分析、编排和验证,具体任务交给 subagent(Opus5)执行。停止条件设为“没有优化空间”,而非具体指标,避免过早结束或过度优化。此外,可用 worktree 验证新方案是否有效,无提升则放弃。
#Agent#/goal#提示词