21:40·meng shao
本文基于TrueForge(TrueFoundry开源harness)上的研究型Agent案例,系统拆解长时运行Agent的工程要点。作者指出,当Agent从短演示走向长任务,决定成败的是包裹模型的运行时(Agent Harness)而非模型本身。一个可用Agent由模型、MCP工具、Skills、Sandbox四块积木组成,长时运行还需子Agent、上下文管理、审批检查点、持久会话。核心工程难点包括:渐进式披露避免上下文窗口被工具schema耗尽;Skills将规程与能力分离、按需加载;Sandbox双重隔离执行与上下文;上下文管理四板斧(渐进式披露、Code Mode、大结果外置、压缩);
#Agent#Harness#TrueForge
10:33·meng shao
开发者 @b_nnett 将编译后的闭源 Grok Bot 应用反推为约 44 万行可读 TypeScript(运行时)与 5.4 万行 React(渲染层),并在此基础上做了功能扩展,代码已开源。整体分层为:渲染层 → preload 窄桥 → Electron 主进程(设置/密钥/认证/窗口)→ coordinator(utilityProcess 托管,崩溃退避重启)→ host(推理、工具、MCP、turn 执行)。主进程被拆成依赖注入图,缺绑定即 fail-closed。新增四个扩展:1.
#Grok#逆向工程#Electron
05:35·GitHub 博客(RSS)
GitHub 博客分享其在 secret scanning 场景中评估 LLM 系统的实践经验,强调从原型到生产时评估问题的变化。文章提出三大要点:首先,从产品决策而非模型出发,明确评估要支持的业务目标,并将指标分为主要结果(如误报减少、精确率)、安全约束(如召回率)和运营护栏(延迟、成本、可靠性等),避免将指标等同对待。其次,将离线评估视为集成测试,在每次对提示词、模型、输入构造或系统逻辑做出有意义变更时重跑,并记录提示词版本、模型版本、数据集版本等,确保可重复性和可对比性。最后,建议一次只改变一个主要变量,以明确结果归因,并定期测试模型升级,因为更强的模型可能用更简单的提示词表现更好。
#GitHub#LLM评估#工程实践
16:44·Avi Chawla
生产环境中的模型路由,传统做法按意图分类,但同一任务内意图会变化,每次调用独立评分,缺乏上下文。若路由层中途切换模型,新模型需以冷缓存重建整个缓存。问题在于按调用路由,而非路由本身。常见解法是每个任务路由一次:首次调用正常路由,模型被固定到会话 ID,后续调用都走同一模型;任务变化时重置固定,重新路由。这被称为模型亲和性(model affinity),简单任务走廉价模型,困难任务走昂贵模型。开源项目 Plano 已实现该机制,提供 OpenAI 兼容端点,只需改 base URL,路由配置在 YAML 中定义。
#模型路由#模型亲和性#Plano
11:00·meng shao
Addy Osmani 发布 Web 质量审计 Skill(web-quality-audit),为 Agent 注入一套 Lighthouse 风格的 Web 质量审计方法论,覆盖性能、可访问性、SEO、最佳实践与智能体浏览五个维度。工作流分五步:确定审计目标、采集实时基线、以运行时证据定位源码、分级修复、复测验证。核心是"测量认识论",强调证据优先于分数、先实测后读码、证据类型分层(CrUX 现场数据、一方 RUM、DevTools trace、Lighthouse 实验室跑分、静态代码检查)与可复现性纪律(关键结论至少跑 3 次取中位数)。
#Addy Osmani#Web 质量审计#Lighthouse
00:04·eric zakariasson
X 用户 ericzakariasson 分享了让 Grok Bot 计划运行更持久的 6 个实用技巧:1) 尽量使用事件触发(如 Slack、GitHub、reaction),而非定时 cron,避免空转;2) 指示 bot 在无法推进或停滞时立即通知你,以便人工介入纠偏;3) 优先使用 connector 而非浏览器操作,后者会产生大量截图和步骤,前者一次调用即可获取数据,更快更流畅;4) 保持技能(skills)精简,但写入真正能引导运行的细节,过于模糊会导致 bot 徘徊重试、成本增加,过于具体则需确保其正确性;
#Grok#Agent#效率优化
10:50·Latent Space(RSS)
Latent Space 报道,吴恩达(Google Brain 和 Coursera 联合创始人)重新推出 DeepLearning.ai,将重心转向 AI 工程。该定位基于对超 1 万条招聘信息的分析、数十次结构化访谈及调查数据。吴恩达列出四项最重要的 AI 工程技能:构建和部署 AI 应用(理解 LLM、上下文工程、RAG、Agent 工作流,并用统计方法评估和治理系统);软件工程基础(理解权衡,避免盲目 vibe coding);使用编码 Agent(掌握其心智模型、局限、干预时机,协调多 Agent 并规避风险);塑造构建过程(具备产品感、业务和客户理解,推动项目落地)。
#吴恩达#AI工程#DeepLearning.ai