11:35·meng shao
Perplexity 开源专为 Mac 端 Hybrid Compute 设计的本地推理引擎 Lily。该引擎基于 Rust 运行时与自定义 Metal 内核,针对 Qwen3.6-35B-A3B 模型与 Apple Silicon 硬件深度定制,不依赖 PyTorch 或 MLX。核心优化策略包括按推理阶段匹配 GPU 路径、最小化数据搬运及动态选择内核。实测显示,在 M5 Max 上,Lily 的 prefill 吞吐为 MLX-LM 的 1.23 倍,decode 为 1.35 倍。
#Perplexity#Lily#Apple Silicon
17:34·Avi Chawla
文章系统梳理了大语言模型服务中的四种缓存层,旨在优化预填充(prefill)阶段的计算成本与首字延迟。第一种是KV缓存,为单个活跃请求在各层保留键值张量;第二种是前缀缓存,将张量持久化至服务器,如vLLM采用16-token块哈希链匹配,首个不匹配处停止并重新预填充后缀;第三种是提供商层面的提示缓存,按写入和读取费率计费,例如Anthropic的定价策略;第四种是语义缓存,通过嵌入向量相似度搜索直接返回存储答案,虽能节省输入输出token但需承担嵌入开销且存在误判风险。前三者基于精确文本匹配,而语义缓存基于相似度匹配。
#LLM Serving#工程实践#缓存优化
12:17·meng shao
Greg Isenberg 精选 GitHub 近 30 天五个高星仓库,直击 Agent 落地痛点。No AI Slop 通过 Skill 识别并清除 AI 写作痕迹,保留作者声音;Comp AI CRM 是 Agent-first 的开源 CRM,让 Agent 主动维护客户关系而非被动存储;Video Use 利用 Claude Code 等编码 Agent 自动化视频剪辑流程;NVIDIA SkillSpector 扫描 Agent Skill 的安全风险,支持静态与动态检测;Phone Harness 连接真机实现移动端自动化操作。
#GitHub#Agent#开源项目
12:03·华尔街见闻(RSS)
广发证券发布报告,提出以还原真实投研链路为核心的AI投研系统构建框架。针对大模型上下文衰减、输入敏感及输出非确定性等缺陷,报告建议采用开源架构Agent负责复杂生产场景,一体化产品辅助维护的最佳实践。在架构上,通过实习生、分析师与投资总监的多代理矩阵分步加载任务,破解上下文积压;引入三阶段渐进式披露的Skill体系,结合CodeAct与数学抽象层消除工具调用干扰与计算随机性。此外,报告论证私域RAG知识库优于LLM-Wiki,并指出KYA能力将成为从业者必备基本功。
#广发证券#AI投研#Agent架构
09:58·meng shao
斯坦福大学Fall 2026学期开设CS 329Z课程,聚焦从模型到系统的AI Agent工程学。由Diyi Yang、DSPy核心贡献者Michael Ryan及SWE-agent作者Jianwei Yang联合授课。课程围绕分解、数据与评估三大挑战,涵盖LLM流水线构建、RAG优化、工具调用、DSPy等框架设计模式、记忆架构、多Agent编排、提示词与权重优化决策、数据飞轮、4元组评估框架及安全护栏等模块。作业要求从零手写Agent系统并使用DSPy重构,以及设计包含代码Grader与LLM-as-judge的完整评估套件。
#Stanford#AI Agents#Engineering
08:00·Hugging Face 博客(RSS)
Hugging Face博客发布教程,演示如何使用TRL库和GRPO(Group Relative Policy Optimization)算法,在仅100步训练内微调350M参数量的LLaMA-3.2-1B模型,以显著提升其生成JSON等结构化输出的准确率。文章提供了完整的代码实现与配置细节,展示了小模型通过强化学习对齐特定格式要求的可行性与高效性,为开发者优化Agent工具调用及API响应格式提供了可复现的工程实践方案。
#Hugging Face#GRPO#TRL
13:25·Rohan Paul
一项针对8351个Claude Code插件及77773次提交的研究揭示了其维护痛点。研究发现,标记为“文档”的提交中74%实际改变了运行时指令,真实文档占比仅1.7%。当脚本与Markdown文件共同变更时,78%的PR存在功能耦合,如模型名称或路径变更需同步更新SKILL.md。由于缺乏编译器检查,过时的文档会导致调用不存在的接口。研究建议将指令文件视为需自动化校验的运行时接口,以确保与脚本同步。
#Claude Code#Agent开发#工程实践
09:39·meng shao
Anthropic 发布 Claude Fable 5.1 的提示词工程指南,重点解决模型输出中常见的“机器味”问题,如 Claudish、Claudese 和 AI Slop。该文档提供了具体的优化策略,旨在让 Claude 生成更自然、更具可读性的人类化文本。核心方法包括调整写作密度、优化句式结构以及避免过度使用特定连接词和模板化表达。通过遵循这些最佳实践,开发者可以有效提升生成内容的质量与自然度,使其更符合人类阅读习惯。此指南适用于需要高质量文本生成的应用场景,为 Prompt 设计提供了可操作的参考框架。
#Anthropic#Claude#Prompt Engineering