08:10·meng shao
Shopify CEO Tobi Lütke在访谈中提出企业应把AI当作培养判断力的环境,而非单纯的多产出工具。内部实践显示,工程师常运行10至50个Agent实例,约半数PR来自与AI对话;名为River的AI员工具备人格并直接提交代码变更。他主张组建由多个子智能体构成的“AI理事会”辅助决策,强调机器无法承担责任,人类必须留在决策回路中。同时警惕“垃圾手雷”现象,即因懒惰导致的产出过剩。他认为直觉是品味与判断被重复成习惯后的瞬时调用能力,并引用SpaceX迭代案例说明持续修剪与重建的重要性。
#Shopify#AI Agent#管理实践
02:55·PyTorch 博客(RSS)
PyTorch博客发布FlashAttention-4的MXFP8前向与反向传播实现,在LLM形状下前向达到2.85 PF/s,反向达到2 PF/s,相比BF16分别获得1.6倍和1.52倍的性能增益。该方案针对NVIDIA Blackwell架构优化,利用其原生支持的块缩放MMA指令(tcgen05.mma.block_scale),将量化过程融合到周围的Producer中,并开发了端到端的零gather jagged模块,使大部分激活值和计算保持在FP8格式。
#PyTorch#FlashAttention#MXFP8
15:06·Hacker News Best(web_list)
开发者Cody Ho与Niklas在约一个月内,利用自建hypervisor捕获硬件trace,逆向工程Apple AGX固件ABI,成功为M4 Mac Mini和MacBook Neo构建了符合OpenGL ES 3.0标准的Linux GPU驱动。该过程采用干净室方法,未查看任何Apple二进制文件,仅通过实时探测发现硬件特性。项目实现了用户态驱动、自定义IR/着色器编译器及内核态驱动,支持WebGL合成,Minecraft运行达200fps。
#GPU驱动#逆向工程#M4 Mac Mini
13:42·meng shao
Browser Use 联创 Greg Pr07 发布文章,基于两年产品演进阐述 Browser Agents 的“做减法”经验。团队从最初人工定义点击/输入动作与状态空间,逐步收缩至让模型直接通过 CDP 接口编写代码完成任务。关键数据显示,用单个 browser_exec 工具替换 12 个专用工具后,Opus 4.8 与 Kimi K3 的 Token 消耗分别下降 60% 和 66%,且任务成功率保持 100%。
#Browser Use#Agent 工程#Harness Engineering
03:00·PyTorch 博客(RSS)
PyTorch Conference North America 2026 将于10月20日至21日在加州圣何塞举行,聚焦开源研究、工具链与性能优化。会议涵盖 torch.compile 内部机制改进,如降低图断裂成本、引入新 FakeTensor 实现加速编译、静态形状检查 Pyrefly 及轻量级 FX Tracing。内核工程方面,AMD FlyDSL 集成至 TorchInductor,Meta Helion DSL 新增 CuteDSL 与 Pallas 后端以支持异构硬件,并展示基于贝叶斯优化与 LLM 引导的自动调优技术。
#PyTorch#Conference#torch.compile
21:45·elvis
一位 Agent Harness 构建者在 X 平台分享了对子代理(subagents)在复杂任务中实用性的深度思考。作者指出,尽管子代理在并行研究、代码审查等场景中表现优异,能有效提升效率并改善上下文管理,但其广泛采用仍受限于协调成本与系统稳定性。当前最佳实践通常是一主一从架构,多子代理混合模型时易出现协作崩溃。作者认为前沿模型尚未充分训练以应对多样化上下文,导致深层或多子代理系统往往难以落地。该观点强调通过工程手段如消息板优化上下文而非盲目增加代理层级,为开发者提供了关于 Agent 架构设计的务实参考。
#Agent#Subagents#Engineering Practice
16:27·Avi Chawla
文章通过可视化方式解析LLM应用的可观测性分层,指出仅靠输入输出不足以调试RAG等复杂链路。详细定义了Trace(记录请求全路径)与Span(记录单个操作)的概念,并列举了Query、Embedding、Retrieval、Context及Generation各阶段需捕获的关键指标,如延迟、重试次数、相关性分数、Token计数与成本。Opik作为开源工具已实现该基础设施,支持跨LLM调用、检索步骤与工具执行的追踪,帮助团队定位检索错误、上下文截断等问题,并通过Trace ID关联单次请求的所有操作以进行精细化成本分析。作者还将可观测性列为构建生产级LLM系统的八大核心领域之一。
#Opik#LLM Engineering#可观测性
10:00·meng shao
Perplexity以自建CobbleDB、Pillar和Lorry三件套替换DynamoDB,解决AI搜索中离线写入与在线批量读的负载冲突。新架构通过职责分离实现热数据调优与持久状态解耦,生产环境P50延迟降至5.6ms(提升约5.6倍),成本降低至少20%。该系统由2名工程师配合数百个持续在线的编码Agent在两个月内完成开发,验证了AI Agent集群在大型工程中的协作潜力。
#Perplexity#CobbleDB#AI Infra