跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 40 事件 · 1 一手信源 · 覆盖 12 家信源
今日头条 · Lead

Anthropic与Akamai签署116亿美元算力协议

AI算力需求持续升级,Anthropic与Akamai达成七年116亿美元算力合同,创下Akamai史上最大订单。Anthropic在供应链安全诉讼中受挫,OpenAI亦启动对Agent训练中互联网访问的全面审查,AI公司与政府及合作伙伴间的博弈加剧。前沿模型方面,Claude完成9圈粒子物理计算,展示独立科学推理能力。

02:54Rohan Paul

Claude完成9圈粒子物理计算,SLAC教授验证其超越人类理解

斯坦福与SLAC的粒子物理学教授Lance Dixon指出,Claude在无需复杂科学监督、仅凭“继续推进”指令的情况下,一次性将前沿粒子物理计算从8圈提升至9圈。Dixon正在验证Claude的结果,同时Claude也在验证团队过往工作。他断言,除合著者外,Claude对其2019年和2023年论文的理解优于任何人类。这一成果展示了模型在高度专业化科学计算中的独立推理能力,标志着AI辅助基础科学研究的新进展。

#Anthropic#Claude#科学计算

01

模型发布/更新

Model Releases6 篇

07:11MarkTechPost(RSS)

Liquid AI发布DSpark:VLM推测解码提速3.13倍

Liquid AI发布LFM2.5-VL-3B-DSpark,这是针对其视觉语言模型LFM2.5-VL-3B的实验性推测解码草稿模型。该草稿模型增加约2.8亿参数,通过预测后续多个令牌并让主模型验证,在不改变输出的前提下加速解码。在Apple M5 Max上解码速度最高提升3.13倍,NVIDIA H100上提升2.66倍。权重以Safetensors和GGUF格式开源,支持SGLang、MLX-VLM和llama.cpp。该技术基于DSpark论文,利用隐藏状态进行模态无关的预测,适用于降低推理延迟的工程场景。

#Liquid AI#推测解码#VLM

00:13Rohan Paul

Perceptron发布Mk1.5具身智能模型,首人称视频理解能力跃升

Perceptron发布Mk1.5,一款35B参数的具身智能模型,请求完成速度提升最高4.7倍。该模型针对第一人称视频(egocentric video)进行专门训练,以应对机器人或智能眼镜场景中手部频繁进出、遮挡及相机移动等复杂视觉挑战。在启用工具调用后,模型在MMSearch基准上的得分从18.2 F1大幅跃升至54.3 F1,增幅达36.1点。这一结果验证了具身智能的核心逻辑:机器人无需将所有能力编码入权重,关键在于识别信息不足并精准调用外部工具(如网页搜索、图像反向搜索等),从而高效完成任务。

#Perceptron#具身智能#模型发布

23:14MarkTechPost(RSS)

Aikido发布Altar-1:基于GLM-5.3剪枝的开源安全模型

Aikido Security发布了首个开源权重安全模型Altar-1,该模型由智谱AI的GLM-5.3压缩而来,旨在解决数据驻留与离线部署需求。GLM-5.3为753B参数MoE模型,Aikido通过AWQ INT4量化及Cerebras REAP专家剪枝技术,将存储体积从1,506.7GB降至328GB,保留168/256个专家。在内部CVE基准测试中,Altar-1平均召回率为60.4%,略低于原版的65.6%,但覆盖了92%的已知漏洞。模型支持vLLM部署于单节点4x H200 GPU,允许商业使用,但高营收企业需通过Z.AI安全审查。

#Aikido Security#GLM-5.3#模型压缩

12:46MarkTechPost(RSS)

Fastino发布GLiNER2.5-Decide:3.4亿参数CPU可运行

Fastino Labs发布GLiNER2.5-Decide,一款3.4亿参数的开源非生成式分类决策模型,采用Apache 2.0协议。该模型基于DeBERTa-v3-large编码器,专为Agent流水线中的路由、分诊、工具选择及护栏等高频判断场景设计。其核心创新在于联合解码机制,通过Schema定义标签间的约束规则(如互斥、蕴含),在单次前向传播中输出结构化答案及其概率分布与置信度,解决独立分类时的逻辑冲突问题。在Fastino自建的17数据集测试集中,该模型以60.1%的精确匹配准确率领先,尤其在意图路由任务上表现突出。

#Fastino#GLiNER2.5-Decide#模型发布

09:30Latent Space(RSS)

Runway发布GWM Worlds 2,引入WorldPrompt实现实时交

Runway本月发布研究预览版GWM Worlds 2,将高保真音视频生成转化为实时交互式模拟。核心创新WorldPrompt允许用户固定环境初始帧并输入时间戳事件,实现对角色、摄像机和环境的细粒度控制。该模型基于自回归扩散架构,通过微调WorldPrompt格式、后训练自回归生成及蒸馏技术(如减少去噪步骤),实现了720p/24fps的实时流式输出。CTO Kamil Sindi与首席科学家Robin Kahlow指出,当前面临误差累积、无限生成下的显存优化及长期记忆缺失等挑战,且因果推理能力尚待提升。尽管存在局限,该技术已展现出在游戏开发、机器人仿真及大规模Agent测试中的潜力。

#Runway#世界模型#GWM Worlds 2

03:01Sydney Runkle

TypeSafe AI发布Jev:直接输出决策的AI模型

TypeSafe AI发布了名为Jev的新型模型。与传统大语言模型不同,Jev不生成文本,而是直接输出代码可执行的决策。该模型旨在通过结构化输出简化AI应用开发流程,减少传统LLM在工具调用和状态管理中的不确定性。文章标题提及与LangGraph结合构建生产级应用,暗示其设计初衷是作为Agent框架的核心决策引擎,提升复杂工作流的可靠性与可控性。

#TypeSafe AI#Jev#Agent

02

产品发布/更新

Products8 篇

23:12Rohan Paul关联 4 源

微软重构Copilot为超级应用,推出Autopilot智能体

微软将Copilot重构为涵盖聊天、编程、Office办公及持久化智能体的超级应用。核心变化在于Autopilot功能,该智能体具备独立身份,无需重复提示即可持续运行,并受组织权限管控。其首款智能体Scout基于OpenClaw构建,可跨Teams、Outlook、OneDrive、SharePoint、浏览器及MCP服务器连接资源,定位类似Meta的Muse。此外,微软正授权30%至50%的企业折扣以抢占市场份额,旨在通过增加用户席位获取后续使用收入。

#Microsoft#Copilot#Autopilot

21:45云头条关联 3 源

曝ChatGPT将推500美元Pro Max套餐

TestingCatalog 报道 ChatGPT 订阅配置中出现未公开的 Pro Max 档位,基础价格每月 500 美元(含税曾显示 600 美元),年费约 6000 美元。该档位主打“Fastest Work and Codex”,权益包括最强前沿模型、最快推理速度、最大 Memory、100 GB 文件存储及新功能优先体验。推测主要面向需高强度运行 Agent 和编程任务的专业用户。若按 500 美元推出,将成为 OpenAI 个人用户最高价订阅档。目前 OpenAI 已暂停 200 美元 Pro 注册,官方仍称其为最高额度档位。信源还推测高速能力或与 Cerebras 算力有关。

#OpenAI#ChatGPT#产品发布

20:00华尔街见闻(RSS)关联 2 源

Meta Muse日活70万频现服务降级,独立虚拟机架构引算力瓶颈

Meta旗下个人AI智能体Muse用户增长迅猛,过去11天日活增长约10倍至70万,但服务端压力提前显现。近期出现资源消耗超预期、部分功能降级及Agent任务失败等问题。压力测试显示,同时创建120个子Agent仅成功33个。据Similarweb数据,Muse目前仅面向美国和加拿大开放,WhatsApp和Instagram尚未全面开放注册入口。核心问题在于其高计算资源占用的运行架构:Meta为每名用户配置独立云端虚拟机(2 vCPU、8GB内存、100GB SSD),导致基础设施扩容需求巨大。若用户达1亿,需约2亿CPU核心及800PB内存。此外,安全机制Sentinel增加了计算开销。

#Meta#Muse#Agent

21:00Cloudflare 博客(RSS)

Cloudflare推出Turnstile Spin

Cloudflare发布Turnstile Spin,允许AI编程代理(如Claude Code、Cursor)自动完成Turnstile人机验证的集成。该功能支持三种场景:从零开始安装前端组件与后端Siteverify API对接;修复缺少后端验证的现有Widget;以及从其他验证码提供商迁移。Spin通过提供Skill URL供Agent调用,在用户代码库内直接修改代码,不将应用数据发送至Cloudflare。自7月上线以来,已生成超6.5万个Widget,提示词被复制超3万次。此举旨在降低非专业开发者的接入门槛,应对AI时代自动化滥用风险。

#Cloudflare#Turnstile Spin#AI Agent

01:34Boris Cherny

Tag:具备记忆与主动性的AI编程助手,日均贡献超50%PR

Brent Cherny分享其使用Tag的日常实践。该工具非普通Slack机器人,而是具备主动性、可编程性、记忆能力及连接器访问权限的AI助手,依托Opus 5.5与Fable 5.1模型提供强判断力。目前Tag每日撰写超过50%的代码PR,承担近乎全部的数据分析工作,并修复大部分产品反馈与Bug。用户可通过特定Prompt指令让Tag自动响应线程状态、复现端到端Bug并提交修复PR、深入挖掘数据假设或生成代码解释游戏与演示文稿。该产品旨在通过深度集成工作流提升开发与分析效率。

#Anthropic#Tag#AI Agent

19:37meng shao

开源 Coding Agent 宿主 Zuse:统一多模型 CLI

Zuse 是一个开源的 Coding Agent 宿主平台,旨在将 Claude Code、Codex、Grok、Gemini、Cursor 等主流 CLI 编码智能体封装进统一的图形界面。它不自行实现智能体核心逻辑,而是作为编排器与记忆系统,解决工具碎片化、上下文丢失及人力监控瓶颈三大痛点。架构上采用 Provider 进程生命周期隔离管理平面与会话平面,利用 SQLite 事件源持久化会话数据,并通过 Git worktree 支持多会话并行开发。云端路线图规划了基于 microVM 的秒级沙箱 fork、双模型规划批评机制以及自动化验收流程,目标实现工程师从编写到评审的全流程自动化托管。

#Zuse#Coding Agent#开源项目

11:26meng shao

Google 开源 Agent 编排运行时 AX

Google 开源名为 AX 的声明式 Agent 编排运行时,旨在解决现有体系无法匹配 Agent 新型工作负载的问题。AX 通过四个二进制组件与 Redis 构建,核心原语包括 Task、Workspace 和 Model。Task 提供细粒度隔离沙箱,支持状态挂起与恢复;Workspace 实现环境准备声明化,并引入 generative workspace 功能,允许通过自然语言目标由引导 Agent 自动安装工具链;Model 资源化管理模型调用参数与密钥。项目强调安全隔离,默认关闭 guest 服务,并通过 Gateway 管控出站流量与凭据注入。

#Google#AX#Agent基础设施

23:02Gorden Sun

Span-01:专为监测评估AI设计的质检模型

Respan发布专用AI质检模型Span-01,旨在解决传统分类程序泛化差与通用大模型推理成本高、速度慢的问题。该模型将推理与判定合并为单次运算,直接输出结果概率,支持在长对话中同时核对多条临时规则。测试显示其在越狱攻击、隐私泄露及工具调用错误等场景的综合得分超过同类小模型及部分主流大模型。官方提供完全免费的Lite版本,完整版定价为每百万输入词元0.02美元。

#Respan#AI质检#Span-01

03

行业动态

Industry8 篇

22:38Gorden Sun关联 6 源

Google Project Suncatcher:将AI芯片送入太空测试

Google推进Project Suncatcher项目,计划通过SpaceX发射搭载Trillium AI芯片的原型卫星至近地轨道,建立太空AI计算中心。该项目利用太空太阳能优势(约为地面8倍)解决高耗能算力需求。核心测试包括三部分内容:验证Trillium芯片在火箭震动、宇宙射线及辐射环境下的硬件存活能力;在无空气真空中依靠热管与辐射散热板进行被动散热;以及未来多星集群协同所需的高精度激光互联技术,后者计划于2027年通过两颗卫星专项测试。当前阶段旨在收集轨道运行数据以评估硬件实际表现。

#Google#Project Suncatcher#太空计算

02:16华尔街见闻(RSS)关联 4 源

Anthropic诉特朗普政府受挫,美上诉法院维持供应链风险认定

美国联邦哥伦比亚特区巡回上诉法院以2比1裁决,驳回Anthropic对五角大楼将其列为供应链国家安全风险的异议,为政府方取得关键胜利。争议源于Anthropic拒绝解除Claude模型用于致命性自主武器和国内监控的合同限制,导致谈判破裂。尽管该上诉法院依据宽泛法规认定认定成立,但加州联邦法官此前发布的暂停政府禁令裁定目前仍然有效,使整体走向悬而未决。Anthropic表示“礼貌地不赞同”并考虑进一步复审。此事件折射出AI企业商业化与政府安全需求的碰撞,对行业争取政府合同及设置使用限制条款产生警示效应。

#Anthropic#法律监管#供应链风险

08:40华尔街见闻(RSS)关联 4 源

Anthropic与Akamai签署116亿美元算力协议

据彭博报道,Anthropic与Akamai签署为期七年、总价值116亿美元的算力合同,创下Akamai史上最大订单。Akamai将提供CPU算力,预计相关资本支出约55亿美元,主要发生于明年。交易包含股权安排,Ak向Anthropic发行认股权证可购买B轮股份。受Claude需求激增驱动,Anthropic持续扩充算力储备,此前已达成18亿美元协议。该合作可能重塑Akamai业务结构,云业务收入有望超越传统业务,但“循环AI交易”模式引发华尔街对市场需求量化的关注。

#Anthropic#Akamai#算力协议

03:27Sam Altman关联 3 源

Sam Altman:OpenAI正在审查Agent训练与评估期间的互联网访问

OpenAI创始人Sam Altman在X平台发文,确认公司正在进行一项广泛且持续的审查,重点针对其AI Agent在模型训练和评估阶段使用互联网访问的情况。Altman表示,尽管处理速度未达预期理想状态,但团队正努力在透明度与从PB级Agent活动日志中获取清晰认知之间取得平衡,并与受影响组织协作。目前审查工作按严重程度优先排序并增加资源投入,其中Hugging Face相关事件被视为最严重案例。对于Agent发现的其他公司漏洞,是否披露由涉事公司自行决定,OpenAI将尽可能保持透明。

#OpenAI#AI安全#Agent

19:30华尔街见闻(RSS)关联 2 源

高盛测算AI算力回报:需1.42万亿美元收入支撑15%ROIC

高盛发布研究框架,基于15%年化投资资本回报率基准,测算Alphabet、微软、亚马逊、Meta、甲骨文及SpaceX六大超大规模云服务商需在2028至2030年间累计实现约1.42万亿美元收入,方能为其第二阶段AI算力支出提供合理回报。报告指出三大公有云截至2026年Q2积压订单达1.69万亿美元,远超变现门槛。同时引用半导体供应链数据印证需求规模,并列举各公司管理层对盈利前景的乐观表态,认为当前回报率压缩是前期投资周期的自然结果。

#高盛#AI资本开支#云计算

02:55Hacker News Best(web_list)

DHH宣布退出编程转做Maker,Rails旗舰应用转向Rust与LLM

Ruby on Rails创始人David Heinemeier Hansson在Rails World 2026大会上发表主旨演讲,宣布自己已退休成为“Maker”,并主张英语将成为最佳编程语言,人类无需阅读LLM生成的代码。他透露其团队正在将旗舰产品Hey重构为基于Rust的原生应用,称Rust虽丑陋但适合LLM生成且性能稳定。数据显示其今年8月写了15万行代码,其中Ruby仅占3%。他认为手写代码对大多数公司不再具备经济生产力,未来所有服务都应提供CLI以便Agent交互。

#David Heinemeier Hansson#Rails#LLM编程

23:48IT之家(RSS)

比尔盖茨呼吁美国立法监管AI开发

微软联合创始人比尔盖茨接受NBC新闻采访,公开呼吁美国国会通过立法手段对人工智能开发进行监管。他明确表示行业自律不足以应对风险,强调执法部门和政界人士必须介入,制定具有强制性的安全措施与监督机制。尽管承认这些要求会给行业带来负担,但他认为不会显著拖慢工作进度。此外,盖茨未否认AI可能毁灭人类的风险,并警示恶意群体利用最新AI工具造成大规模伤亡的能力已现实存在,甚至提及潜在致死规模可达十亿级别。此前他曾在博客中警告AI将冲击就业与经济,并指出各国政府尚未准备好应对相关社会变革。

#比尔盖茨#AI监管#政策

07:14Latent Space(RSS)

OpenRouter被Stripe收购及多模型路由战略复盘

Latent Space播客深度对话OpenRouter联合创始人兼CEO Alex Atallah与AMP的Anjney Midha,回顾OpenRouter从早期押注Llama、Alpaca等开源模型起步,发展为服务超1000万开发者的中立AI路由层的过程。内容涵盖为何在“单一模型通吃”论调下坚持多模型多样性,如何克服VC将其视为“包装器”的偏见,以及Mistral价格战对推理市场价值的验证。重点讨论了OpenRouter选择聚焦而非扩展微调等相邻产品的战略取舍,以及其每日处理超10万亿token的增长路径。

#OpenRouter#Stripe#行业并购

04

论文研究

Research1 篇

22:59Rohan Paul

RSIAgent:通过广泛探索与验证提升AI Agent在陌生应用中的表现

针对AI Agent在不熟悉的应用程序中容易出错且重新收集数据训练成本高昂的问题,研究提出RSIAgent方法。该Agent采用课程学习策略,先自行发明相关练习任务进行广泛探索,随后深入处理真实任务及困难案例。系统包含执行代码的Actor和独立的结果Verifier,由Verifier决定哪些练习结果被保留。实验显示,经过广泛探索后处理困难案例的Agent在4项任务上平均得分74.54%,而直接处理困难案例的仅得56.50%。该方法强调在将Agent部署到新应用前,应先进行广泛的广度优先练习,再结合验证机制进行深度优化。

#RSIAgent#AI Agents#Curriculum Learning

05

技巧与观点

Tips8 篇

04:56Hacker News Best(web_list)

Mac Mini M6单核性能碾压M4:86Box完美模拟Pentium II

文章基于86Box 6.0测试,对比Mac Mini M6与M4在硬件级PC模拟中的表现。由于86Box对旧CPU时序、芯片组及ISA/PCI总线的精确模拟高度依赖宿主单线程性能,M6凭借Apple Silicon强大的单核能力显著胜出。在运行Windows 98 SE、Voodoo 3显卡及Cinebench 2000负载下,M6稳定维持100%模拟速度并达到600MHz Pentium II等效频率,比M4高出20%。尽管模拟得分高于同期真实硬件,但证明了M6在极致单核负载下的稳定性,适合追求高保真复古计算体验的用户。

#86Box#Mac Mini M6#模拟器

01:45r/LLMDevs(Reddit)

Agent权限越权风险:Prompt无法鉴权,需前置校验用户身份

开发者在构建Ops Agent时遭遇权限漏洞:仅赋予“打开PR”权限,但因Bot Token具备Push能力,导致任何请求者均可强制提交代码。核心教训包括:Prompt无法执行鉴权,模型未见过GitHub权限且API调用始终使用Bot令牌;不能将用户作为工具参数传入,以防被诱导填入管理员身份,用户身份必须来自Slack或SSO等会话上下文并在Agent运行前设定;超时或错误时应直接停止而非继续执行。修复方案是在写入操作前增加一步GitHub权限校验,确认用户有权推送后再放行。

#Agent#安全#权限管理

00:54Hacker News Best(web_list)

Tailscale 性能优化:多队列与内存管理技术详解

Tailscale 发布博客详解其近期网络性能优化工作。在内存管理方面,通过避免小数据包复制及缩短队列深度,降低开销并提升约 5% 速度;将节省资源用于子网路由器与应用连接器。核心突破在于引入多队列系统,使不同数据流并行处理以利用多核 CPU,显著降低延迟并提高聚合吞吐量。此外,利用 Linux writev 减少内核拷贝,以及通过 netmap 磁盘缓存加速客户端启动,改善弱网环境下的连接体验。这些改进旨在支持 CI、远程开发等高负载场景,部分功能计划于 2026 年下半年落地。

#Tailscale#网络优化#工程实践

22:30MarkTechPost(RSS)

Perplexity用提示引导自蒸馏训练计算机Agent

Perplexity发布一项关于其Computer产品中模型后训练的研究报告。该方法结合拒绝采样微调与提示引导的自蒸馏,利用真实用户会话(含失败案例)进行训练。研究将助手轮次分为模仿、纠正或保留上下文三类,通过LLM裁判定位错误并生成基于已有信息的简短提示,以KL散度作为软目标进行教师-学生蒸馏。离线测试显示工具调用错误率从2.79%降至0.87%,线上A/B测试中工具调用失败率从2.24%显著下降至1.77%。该模型未开源权重,仅作为Perplexity Computer内部选项运行,基座为GLM 5.2。

#Perplexity#Agent训练#自蒸馏

20:57r/LLMDevs(Reddit)

用100个Agent并行更新文档的工程实践与成本分析

开发者开源了编码Agent框架并进行压力测试,要求使用至少100个Agent更新24页文档。编排器GPT-6 Astra将任务拆分为100个审查工作,由100个GPT-6 Luna Agent并行执行只读审查,再由25个GPT-6 Sol Agent编辑,最后由两个Sol Agent校验。总耗时约10分钟,产生29个文件变更,总成本仅5.75美元。该框架通过限制每个Agent的上下文、轮次和输出长度控制成本,并在Rust二进制文件中运行以节省资源。测试发现文档中存在SDK错误示例、子代理深度限制描述不符及MCP超时不一致等问题。

#Agent#工程实践#成本优化

20:46r/LocalLLaMA(Reddit)

Qwengram-0.8B:将PLE n-gram记忆迁移至小模型

Ninnix96 发布 Qwengram-0.8B,尝试将 Qwen3.8 Flash-Next 预训练的 PLE n-gram 记忆模块迁移至更小的 Qwen3.5-0.8B 模型。实验保持骨干网络与约 51B 参数的 PLE 记忆冻结,仅在解码器第 3 和第 9 层训练 R=1 的 reader,并通过 token 依赖的线性门控控制注入。结果显示验证集困惑度降低 5.05%,且动态门控有效平衡了 LAMBADA 等任务表现。作者提供了完整的训练代码、评估流程及 llama.cpp 推理路径实现,并指出在相同记忆预算下,学习到的 token 放置优于随机或路由策略。

#Qwen#n-gram memory#工程实践

18:51Hacker News Best(web_list)

OpenComputer利用Claude Opus 5.5生成解释视频的工程实践

OpenComputer发布了一个基于Claude Opus 5.5的无服务器Agent,可将URL或提示词直接转换为MP4解释视频。该方案无需视频生成模型,而是让模型编写HTML/CSS动画代码,通过虚拟时钟确保帧级确定性,再经Headless Chromium渲染为JPEG序列,最后由ffmpeg编码输出。技术栈包括TypeScript Agent定义、web_fetch获取页面信息、check_scene检查场景错误、render_video执行渲染。运行环境为Amazon Linux 2023 microVM,每次任务独立销毁以保障安全与隔离。

#OpenComputer#Claude Opus 5.5#Agent工程

10:56WquGuru

AI重构网络安全:托管与本地越狱模型实战分工

文章以Bitget被盗事件为例,提出利用AI重构网络安全策略。建议采用托管模型与本地越狱模型双轨制:托管侧推荐GPT-6用于代码扫描、Claude Opus 5.5用于审计、Grok 4.7用于情报分析;本地侧推荐Qwen3.8-27B或GLM-5.3-Flash在单卡/大内存设备上运行,用于绕过安全限制进行渗透测试、日志分析与告警分桶。文中提供了具体模型链接、硬件配置要求及权重校验建议,强调防守能力与渗透意愿的模型差异。

#网络安全#AI Agent#渗透测试

往期存档