跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 15 事件 · 1 一手信源 · 覆盖 9 家信源
今日头条 · Lead

DeepSeek发布V4-Pro与Harness公测

今日,DeepSeek正式发布V4-Pro-0813模型并推出代码智能体框架Harness公测,模型能力对标顶尖闭源。同时,Dyna Robotics发布世界动作模型Dyna-2,机器人操作迈向新高度。资本层面,Anthropic传出2万亿美元估值IPO计划及60亿美元收购Decart AI,AI领域竞争与投入持续升温。

20:52IT之家(RSS)关联 4

DeepSeek发布V4-Pro-0813及Harness公测

8月13日,DeepSeek正式发布V4-Pro-0813模型,并推出代码智能体框架Harness的公测版,同步开放NPM插件生态,但GitHub仓库仍非公开。Harness将模型转化为智能体,调度上下文、工具与任务状态,对标OpenAI Codex和Anthropic Claude Code。团队负责人崔添翼已于8月2日全球征集内测用户。V4-Pro-0813为MoE模型,总参数1.6万亿,推理时激活490亿参数,支持100万token上下文和38.4万token输出,提供思考与非思考模式,支持JSON输出、Tool Calls及Responses API等。

#DeepSeek#模型发布#Harness

01

模型发布/更新

Model Releases2

15:42MarkTechPost(RSS)

Dyna Robotics发布Dyna-2:百万小时人类视频预训练的世界动作模型

Dyna Robotics推出用于机器人操作的世界动作模型Dyna-2,基于超过一百万小时的第一人称人类视频预训练,约合170年连续清醒经验。团队构建从1000到100万小时的数据阶梯,验证了人类数据上的缩放定律,并首次将该定律迁移到未见过的机器人数据。Dyna-2采用混合Transformer架构,视频与动作分别token化,通过流匹配联合去噪。在14个后训练任务中,平均归一化得分从20%升至53%,在锁箱钥匙转动等任务上从0%跃至90%。与生产级VLA Dyna-1相比,早期Dyna-2成功率提升1.55倍,在未见客户现场通过生产标准87%对46%。

#Dyna Robotics#世界动作模型#机器人操作

19:29量子位(RSS)

Claude扫清2000阶以下哈达玛矩阵,AI清空数学待解列表

量子位报道,Claude模型在数学领域取得突破,一举扫清了2000阶以下的哈达玛矩阵问题。哈达玛矩阵是数学中的经典难题,此前一直未有完整解答。此次Claude的成功,标志着AI在解决数学难题方面迈出重要一步,开始清空数学待解列表。该成果展示了AI在数学推理和问题求解上的潜力,引发业界关注。

#Claude#数学#哈达玛矩阵

03

行业动态

Industry5

22:52华尔街见闻(RSS)关联 2

Anthropic拟以2万亿美元估值上市,或成史上最大IPO

据英国《金融时报》报道,多名Anthropic股东透露,该公司计划于今年秋季以2万亿美元或更高估值上市,有望超越SpaceX成为史上最大IPO。投资者预计,到2026年底,Anthropic年化营收将达1000亿至1200亿美元,较2026年初增长逾10倍。公司今年5月宣布年化营收突破470亿美元,并于6月向SEC提交IPO申请,目前处于静默期。然而,上市计划面临变数:商务部对Anthropic旗舰模型的出口管制导致6月营收增速放缓,且公司与美国政府关系紧张,仍处于针对国防部的诉讼中。

#Anthropic#IPO#融资

18:27IT之家(RSS)关联 2

谷歌DeepMind换帅内情:Gemini延期两月,编程能力仍落后

据路透社报道,谷歌DeepMind重组与下一代旗舰Gemini模型延期有关。知情人士称,Gemini发布时间已推迟约两个月,内部测试显示其在编程等关键能力上仍落后于竞争对手。开发团队存在多名项目负责人,在开发重点和资源分配上分歧不断,加之算力资源紧张,导致编程等方向一度资源不足。谷歌内部审批和管理流程也影响迭代速度。8月5日,谷歌宣布DeepMind大规模调整:哈萨比斯转任董事长,副手卡武库奥卢接任主要管理工作,并拥有最终决定权;Gemini技术联合负责人杰夫·迪恩和奥里奥尔·维尼亚尔斯出走创业。谷歌联合创始人布林近期加强关注AI工作,曾敦促加快开发,并推动投入“递归自我改进”研究。

#谷歌#DeepMind#Gemini

13:29华尔街见闻(RSS)关联 2

联想Q1财季营收增43%,AI服务器订单储备达540亿美元

联想集团发布2026/27财年第一财季业绩,营收269.43亿美元,同比增长43%,超市场预期;经调整净利润10.75亿美元,同比增长176%,首次突破10亿美元。基础设施业务(ISG)营收85亿美元,同比增长98%,运营利润率升至9.1%,AI服务器订单储备达540亿美元,环比增长157%。智能设备业务(IDG)营收171亿美元,同比增长27%,全球PC市场份额24.2%,连续十季度扩大领先优势。方案服务业务(SSG)营收29亿美元,运营利润率24.2%创新高。公司预计本财年营收有望突破1000亿美元。IFRS口径下净亏损6.09亿美元,源于认股权证非现金重估,不影响经营实质。

#联想#财报#AI服务器

16:26华尔街见闻(RSS)

Anthropic拟60亿美元收购芯片优化公司Decart AI

据彭博报道,Anthropic正就收购AI初创公司Decart AI展开谈判,交易估值约60亿美元,若达成将成为其迄今最大收购案。Decart成立于2023年,核心业务包括“世界模型”及提升芯片效率的基础设施软件,其技术已应用于电商虚拟试穿、直播等场景。今年5月,Decart完成3亿美元融资,估值近40亿美元。若收购完成,Decart团队将并入Anthropic推理与性能部门,有助于降低算力成本。谈判尚未敲定,存在破裂可能。Anthropic正筹备IPO,算力投入构成财务压力。

#Anthropic#Decart#收购

04:14TechCrunch AI(RSS)

Databricks融资50亿美元,估值1900亿

据TechCrunch报道,Databricks首席执行官Ali Ghodsi表示,AI成本高昂,公司原计划融资10亿美元,但投资者需求旺盛,最终融资50亿美元,估值达1900亿美元。此次融资规模远超原计划,反映出市场对AI基础设施的强烈兴趣。

#Databricks#融资#AI基础设施

05

技巧与观点

Tips7

11:24硅谷101(YouTube)关联 6

从DeepSeek到Kimi,AI模型开源到底开了什么?

本期视频梳理了AI模型开源的完整概念与生态影响。大模型从训练到发布涉及数据、架构、基础设施、训练、权重、部署、技术报告七个环节,开源程度分为闭源、开放权重和完全开源三类。当前主流开源模型多为开放权重,如Meta的Llama、DeepSeek、Kimi K3等,但开放程度差异大:DeepSeek不仅公开技术报告,还开源了DeepEP、FlashMLA等基础设施;Kimi K3同步开放MoonEP、FlashKDA、AgentEnv三大底层工具。

#开源模型#开放权重#DeepSeek

03:57Avi Chawla

LLM 连续批处理机制详解

连续批处理是 LLM 推理的关键优化技术,也是热门面试题。传统静态批处理中,批次成员固定,短请求需等待同批次最长请求完成,导致 GPU 算力浪费。连续批处理则在每次前向传播后重新调度,完成的请求立即释放槽位,排队请求随即补入,显著提升吞吐。Anyscale 基准测试显示,在输出长度方差较大时,vLLM 的吞吐量可达朴素 Hugging Face 服务的 23 倍。vLLM、SGLang、TGI、TensorRT-LLM 等主流推理引擎默认启用该机制,NVIDIA 称之为 in-flight batching。

#LLM#推理优化#连续批处理

02:37Hacker News Best(web_list)

DRAM 地址加扰漏洞:解锁 AMD CPU 全部安全机制

skitter-creek-bath-salts 项目通过修改内存控制器(MCT/DCT)中的 DRAM 地址翻译寄存器,重写物理地址到 DRAM 坐标的映射,从而绕过基于物理地址的安全机制,解锁平台安全处理器(PSP)、系统管理模式(SMM)、C6 DRAM 和 CPU 微码。该项目针对 AMD Family 16h CPU 开发,这是最后一代数据手册中记录这些翻译寄存器且显示无法锁定的 CPU;后续架构未公开此信息。项目展示了内存层次结构底层的安全漏洞,其原理可扩展到 ARM、RISC-V 等架构。

#AMD#DRAM#安全漏洞

10:19meng shao

Grok 4.6 实战笔记:验收标准比提示词更关键

Cursor 团队 Eric Zakariasson 分享将 Grok 4.6 作为日常主力模型数周后的实战经验。他让模型代走网站、在供应商控制台点出 API key、对运行中应用做 QA、压缩收件箱,并起草发布帖与制作发布视频。他通过电子表格应用、浏览器版帝国时代 2、MSN Messenger、Excalidraw 演示模式等对照压测模型极限。最看重两点:信息密度(摘要含真信息,能判断何时打断)和速度与智能的提升(4.6 更快更聪明,让他更愿同步协作)。关于提示词,他对比长短 prompt 与措辞,发现措辞几乎无用,长 prompt 买的是具体性,短 prompt 依赖模型品味;

#Grok#xAI#实战经验

05:27Boris Cherny

Claude 接管应用维护:388 个 PR 的自动化实验

开发者 Boris Cherny 分享实验:让 Claude 接管应用日常维护。他们设置 Slack 频道,Claude Tag 运行多种日常任务,覆盖 iOS、Android、桌面、Web、CLI 和 Agent SDK,包括崩溃模糊测试、重复抽象统一、死代码移除、泄漏抽象修复等。过去几周,这些例程开启 388 个 PR,其中 180 个在 Claude Code Review 和人工审核后合并。Claude 通常一次就能正确完成 PR,偶尔需调整例程。作者建议通过 Claude Code 或 Tag 创建类似例程,并分享了部分提示词。

#Claude#自动化#工程实践

15:24Alibaba Cloud

游戏Agent演示易失败,阿里云提出AgentLoop七步法

阿里云指出,游戏AI Agent在演示中表现良好,但在生产环境中容易失败。为此,他们提出了一种为期3天、包含7个步骤的AgentLoop方法,旨在提升Agent的可靠性。该方法强调:追踪证据而非仅凭声明;评估工具与API事实;通过技能护栏修复根本原因;并使用数据集与警报进行回归测试。该方法为游戏开发者提供了一套系统性的调试与优化流程,以应对生产环境中的挑战。

#阿里云#游戏Agent#AgentLoop

08:00Hugging Face 博客(RSS)

复现ICML 2200篇论文的启示

Hugging Face 团队在 ICML 2026 开放复现计划中,尝试复现了 2200 篇论文,并分享了过程中的经验与教训。他们发现,许多论文存在代码缺失、依赖不明确、环境配置复杂等问题,导致复现难度远超预期。团队开发了自动化工具来简化流程,并强调了文档和代码质量对可复现性的重要性。该计划旨在推动机器学习研究的可复现性,为社区提供可参考的实践指南。

#Hugging Face#可复现性#ICML

往期存档