11:24·硅谷101(YouTube)·关联 6 源
本期视频梳理了AI模型开源的完整概念与生态影响。大模型从训练到发布涉及数据、架构、基础设施、训练、权重、部署、技术报告七个环节,开源程度分为闭源、开放权重和完全开源三类。当前主流开源模型多为开放权重,如Meta的Llama、DeepSeek、Kimi K3等,但开放程度差异大:DeepSeek不仅公开技术报告,还开源了DeepEP、FlashMLA等基础设施;Kimi K3同步开放MoonEP、FlashKDA、AgentEnv三大底层工具。
#开源模型#开放权重#DeepSeek
03:57·Avi Chawla
连续批处理是 LLM 推理的关键优化技术,也是热门面试题。传统静态批处理中,批次成员固定,短请求需等待同批次最长请求完成,导致 GPU 算力浪费。连续批处理则在每次前向传播后重新调度,完成的请求立即释放槽位,排队请求随即补入,显著提升吞吐。Anyscale 基准测试显示,在输出长度方差较大时,vLLM 的吞吐量可达朴素 Hugging Face 服务的 23 倍。vLLM、SGLang、TGI、TensorRT-LLM 等主流推理引擎默认启用该机制,NVIDIA 称之为 in-flight batching。
#LLM#推理优化#连续批处理
02:37·Hacker News Best(web_list)
skitter-creek-bath-salts 项目通过修改内存控制器(MCT/DCT)中的 DRAM 地址翻译寄存器,重写物理地址到 DRAM 坐标的映射,从而绕过基于物理地址的安全机制,解锁平台安全处理器(PSP)、系统管理模式(SMM)、C6 DRAM 和 CPU 微码。该项目针对 AMD Family 16h CPU 开发,这是最后一代数据手册中记录这些翻译寄存器且显示无法锁定的 CPU;后续架构未公开此信息。项目展示了内存层次结构底层的安全漏洞,其原理可扩展到 ARM、RISC-V 等架构。
#AMD#DRAM#安全漏洞
10:19·meng shao
Cursor 团队 Eric Zakariasson 分享将 Grok 4.6 作为日常主力模型数周后的实战经验。他让模型代走网站、在供应商控制台点出 API key、对运行中应用做 QA、压缩收件箱,并起草发布帖与制作发布视频。他通过电子表格应用、浏览器版帝国时代 2、MSN Messenger、Excalidraw 演示模式等对照压测模型极限。最看重两点:信息密度(摘要含真信息,能判断何时打断)和速度与智能的提升(4.6 更快更聪明,让他更愿同步协作)。关于提示词,他对比长短 prompt 与措辞,发现措辞几乎无用,长 prompt 买的是具体性,短 prompt 依赖模型品味;
#Grok#xAI#实战经验
05:27·Boris Cherny
开发者 Boris Cherny 分享实验:让 Claude 接管应用日常维护。他们设置 Slack 频道,Claude Tag 运行多种日常任务,覆盖 iOS、Android、桌面、Web、CLI 和 Agent SDK,包括崩溃模糊测试、重复抽象统一、死代码移除、泄漏抽象修复等。过去几周,这些例程开启 388 个 PR,其中 180 个在 Claude Code Review 和人工审核后合并。Claude 通常一次就能正确完成 PR,偶尔需调整例程。作者建议通过 Claude Code 或 Tag 创建类似例程,并分享了部分提示词。
#Claude#自动化#工程实践
15:24·Alibaba Cloud
阿里云指出,游戏AI Agent在演示中表现良好,但在生产环境中容易失败。为此,他们提出了一种为期3天、包含7个步骤的AgentLoop方法,旨在提升Agent的可靠性。该方法强调:追踪证据而非仅凭声明;评估工具与API事实;通过技能护栏修复根本原因;并使用数据集与警报进行回归测试。该方法为游戏开发者提供了一套系统性的调试与优化流程,以应对生产环境中的挑战。
#阿里云#游戏Agent#AgentLoop
08:00·Hugging Face 博客(RSS)
Hugging Face 团队在 ICML 2026 开放复现计划中,尝试复现了 2200 篇论文,并分享了过程中的经验与教训。他们发现,许多论文存在代码缺失、依赖不明确、环境配置复杂等问题,导致复现难度远超预期。团队开发了自动化工具来简化流程,并强调了文档和代码质量对可复现性的重要性。该计划旨在推动机器学习研究的可复现性,为社区提供可参考的实践指南。
#Hugging Face#可复现性#ICML