跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 38 事件 · 2 一手信源 · 覆盖 8 家信源
今日头条 · Lead

小米发布3nm AI旗舰SoC玄戒O3及智驾芯片D100

今日,小米正式发布首款AI旗舰SoC玄戒O3与智驾芯片玄戒D100,均采用3nm工艺。同日,阿里云上线2.8T参数模型Kimi-K3与视频生成模型Wan3.0,达摩院发布肝癌AI诊断模型DAMO LiON。行业方面,英伟达拟投资Perplexity AI,字节整合AI办公业务,燧原科技启动科创板IPO。

22:17MarkTechPost(RSS)

Generalist AI发布机器人基础模型GEN-1.5:单次演示即可学习新

Generalist AI发布了机器人基础模型GEN-1.5,该模型可通过30秒上下文窗口中的单次3至12秒演示数据学习新的物理操作任务。在10种不同任务中,零梯度更新的单次提示平均成功率达59%;仅需每任务5分钟数据的10步梯度更新,成功率即提升至83%。该能力源于超八个月的持续预训练,无需架构修改或元学习循环。此外,模型展现出组合泛化、零样本仿真到现实迁移及人类模仿等特性。目前为研究发布,无公开权重、API或定价,仅通过直接合作提供。

#Generalist AI#机器人基础模型#GEN-1.5

01

模型发布/更新

Model Releases4

21:53Rohan Paul

dots3-note预览版:面向长周期任务的280B多模态模型

rednote旗下dots studio发布dots3-note Preview,一款专为现实世界长周期智能体任务设计的开源权重多模态模型。该模型总参数量280B,激活参数16B,支持512K上下文窗口及文本、视觉和语音理解。其核心特性在于能够适应目标演变、新约束出现及计划失败等动态场景,具备自我学习与评估能力,以在数小时至数周的复杂任务中保持有用性。

#dots studio#多模态模型#长周期智能体

11:37Alibaba Cloud

阿里云上线 Kimi-K3 模型,2.8T参数支持1M上下文

阿里云通过 Model Studio 与 Qwen Cloud 平台正式上线 Kimi-K3 大模型。该模型参数量为 2.8T,原生支持 100 万 token 的上下文窗口。官方指出该模型专为仓库级软件工程、视觉创作及具备自主规划能力的 Agent 场景设计。目前提供 100 万 token 的免费试用额度,用户可通过上述两个平台入口进行体验。

#Kimi-K3#阿里云#模型发布

12:16IT之家(RSS)

达摩院发布肝癌AI模型DAMO LiON,可精准识别1厘米微小肿瘤

阿里巴巴达摩院联合中国医科大学附属盛京医院等机构研发出肝癌诊断AI模型DAMO LiON,通过CT影像识别微小肝脏癌变病灶。该模型在《自然·医学》发表论文,并在两个月真实世界前瞻临床试验中部署于医院日常阅片。期间AI阅读超1万名患者增强CT影像,发现15例原本被遗漏的恶性肿瘤,多为1厘米左右病灶,帮助改变治疗方案。实验显示,AI协助医生阅片用时减少27%,对恶性肿瘤敏感性提高11.5%。模型采用改进网络架构,能捕捉病灶与肝脏关系并保留局部纹理,有效应对脂肪肝、肝硬化等困难病例及不同期相影像融合。

#阿里巴巴#医疗AI#DAMO LiON

23:00NVIDIA 博客(RSS)关联 2

英伟达发布 Groq 3 LPX,Vera Rubin 推理性能提升 4 倍

英伟达宣布 Vera Rubin 机架级系统 Groq 3 LPX 全面投产。在 Artificial Analysis 基准测试中,运行开源智能体模型 Gemma 4 31B 时,Groq 3 LPX 在 10 万 token 长上下文场景下实现每秒 3400 个输出 token,速度是竞品平台的 4 倍。该系统与 Vera Rubin NVL72 协同设计,Rubin GPU 负责大规模上下文处理,LPX 加速延迟敏感的 token 生成。

#NVIDIA#Groq 3 LPX#Vera Rubin

02

产品发布/更新

Products2

11:17IT之家(RSS)关联 3

阿里云视频生成模型 Wan3.0 正式上线,支持文档输入与 30 秒视频

8 月 24 日,阿里云视频生成模型 Wan3.0 正式上线。该版本在生成时长、创作能力、参考能力及真实世界还原等维度全面升级,单次可生成 30 秒视频,并首次支持 doc、xls、ppt、pdf、md 等多种文档格式输入。公测期间,模型在指令遵循、跨镜头一致性、音频质感及视频编辑方面持续优化。用户可通过阿里云百炼、万相官网、千问 AI 平台等多个渠道体验。API 定价方面,480P/720P/1080P 分别为 0.3/0.6/1.2 元每秒,活动期间享七折优惠。此外,跳跃视界、Deevid、美图等多家第三方平台已接入该模型。

#阿里云#Wan3.0#视频生成

10:20小互

ChatGPT Search底层机制突变:site查询占比激增45倍

Promptwatch监控数据显示,8月8日后ChatGPT Search中针对特定网站的site:查询占比从日均0.368%激增至16.78%,增幅约45.5倍。这一变化暗示其搜索流程可能已调整为先全网发现候选来源,再锁定特定域名深入抓取文档、规则与更新内容。该机制变动对网站生成式引擎优化(GEO)策略产生直接影响,竞争逻辑转变为域名入选与页面引用争取的两层结构。建议网站优先构建可被高效抓取且具备核验价值的一手内容体系,以适配新的搜索分发逻辑。

#OpenAI#ChatGPT Search#GEO

03

行业动态

Industry8

11:30IT之家(RSS)关联 3

英伟达拟向 Perplexity AI 投资数十亿美元,估值超 300 亿

据外媒 The Information 报道,英伟达正考虑在 Perplexity AI 的最新融资轮中投资数十亿美元,双方同时洽谈技术授权协议。Perplexity AI 计划以超 300 亿美元估值进行新一轮融资,较去年 7 月的 180 亿美元估值上涨逾六成。其估值飙升主要得益于 Perplexity Computer 工作流自动化智能体的快速发展,推动公司年化营收从 2026 年初的不足 2.5 亿美元迅速增长至 7.5 亿美元以上。该消息揭示了算力巨头与头部 AI 应用厂商之间深度的资本与技术绑定趋势。

#NVIDIA#Perplexity AI#融资

17:38华尔街见闻(RSS)关联 2

字节整合TRAE与扣子至豆包,加速AI办公入口成型

8月24日,字节跳动完成旗下AI办公业务团队整合,TRAE与扣子(Coze)团队整体并入豆包体系。调整后,TRAE Work与扣子将融入豆包工作场景,TRAE IDE及CLI作为编程产品线保留并纳入豆包品牌,相关团队统一向豆包产品负责人赵祺汇报。此次调整旨在明确豆包的AI主干定位,集中资源打造统一的AI办公体验。字节最快将于本周推出独立AI办公产品“豆包工作”,作为面向AI办公场景的统一入口。此前,飞书产品团队已并入豆包,形成以豆包为中心的产品链路和由火山引擎承接的商业化链路。现有用户权益不受影响,但“豆包工作”的具体功能、上线时间及收费方案尚未公布。

#字节跳动#豆包#TRAE

16:41华尔街见闻(RSS)关联 2

美国数据中心民意反弹,两党州长收紧审批限制AI扩张

The Information报道指出,美国公众对数据中心的反对率从一年前的42%飙升至75%,且跨党派普遍存在抵触情绪。这种由电力、用水及环境影响引发的社会反弹已转化为实际政策:德州州长叫停1800个数据中心项目,宾州签署行政令收紧扩张。科技巨头如Oracle、Anthropic等试图通过慈善或强调医疗价值改善公关,但效果有限。共和党参议员委员会警告该议题可能影响中期选举选情,迫使科技公司增加政治游说投入。AI基础设施正从纯技术问题演变为涉及资源分配与政治博弈的社会争议。

#数据中心#美国政策#舆论风险

14:05IT之家(RSS)关联 2

小米发布首款AI旗舰SoC玄戒O3,采用3nm工艺

8月24日,小米举行玄戒芯片技术沟通会,正式发布首款AI旗舰SoC玄戒O3。该芯片采用3nm旗舰工艺,晶体管数量达240亿,较前代增长26%,芯片面积为133mm²。架构全面升级后,在小米实验室低温环境下,安兔兔跑分达到5,228,014分。这是小米在自研芯片领域的重要进展,标志着其正式进入AI旗舰SoC市场。

#小米#玄戒O3#自研芯片

10:49华尔街见闻(RSS)

三星披露HBM三阶段路线图:终局zHBM取消中介层

在Hot Chips大会上,三星DRAM设计团队Sangwook Han正式披露HBM演进三阶段路线图。第一阶段利用4nm工艺与D2D接口优化Base Die,释放XPU面积并降低功耗;第二阶段集成内存扩展控制器、处理单元(PE)及RAS传感器,实现功能扩展;第三阶段推出zHBM架构,通过WoW与HCB封装技术将DRAM直接垂直堆叠于计算芯片之上,彻底取消2.5D中介层。该方案宣称相比HBM4E可降低70%功耗、提升230%带宽,旨在突破AI系统功耗、面积与容量瓶颈。

#三星#HBM#先进封装

19:33IT之家(RSS)

燧原科技启动科创板 IPO,拟募资 60 亿元

燧原科技公告称首次公开发行股票并在科创板上市,拟发行约 4303.52 万股,占发行后总股本的 10%。初步询价日为 8 月 28 日,网上网下申购日为 9 月 2 日。公司拟募资 60 亿元,资金将用于第五代和第六代 AI 芯片系列产品的研发及产业化项目、先进人工智能软硬件协同创新项目等。燧原科技创立于 2018 年,与摩尔线程、沐曦股份和壁仞科技合称为“国产 GPU 四小龙”。目前公司尚未盈利,如上市时仍未盈利将纳入科创成长层,保荐人为中信证券。

#燧原科技#IPO#GPU

14:36IT之家(RSS)

小米玄戒D100智驾芯片亮相,明年商用可本地部署200B模型

IT之家8月24日消息,国内首款3nm智驾高算力AI芯片小米玄戒D100正式亮相。该芯片已研发完成,计划于明年正式商用。据官方介绍,玄戒D100采用3nm先进工艺制程,内部集成20核高性能CPU与16核高算力NPU。在内存方面,最高支持160GB统一内存配置,具备强大的数据处理能力。凭借这一硬件基础,该芯片可在本地直接部署参数量高达200B的超大语言模型,旨在为智能驾驶场景提供端侧大模型推理支持。

#小米#玄戒D100#智驾芯片

11:48华尔街见闻(RSS)

高盛上调全球晶圆厂设备支出预测,存储与先进代工成引擎

高盛大幅上调2026至2028年全球晶圆厂设备(WFE)支出预测,市场规模预期分别提升至1500亿、2180亿及2810亿美元。驱动因素包括半导体资本开支超预期及设备供应商乐观展望。代工领域受台积电N2制程量产爬坡带动,预测显著上调;DRAM领域因HBM4迁移与产能扩张,三星与SK海力士资本开支预测上调;NAND以升级改造为主,供给偏紧延续至2027年;逻辑及其他领域受益于英特尔复苏及SpaceX、特斯拉Terafab项目投入。报告维持半导体设备板块看多立场,认为行业景气周期有望延续至2028年。

#高盛#半导体#晶圆厂设备

04

论文研究

Research5

19:48Rohan Paul

论文:LLM Agent技能积累未必带来性能提升,上下文反馈更关键

新研究ContinualSkillBench评估Agent在100个连续任务中的能力演化。结果显示,保留上下文与反馈的纯上下文学习(平均归一化奖励0.605)略优于显式技能维护(0.602)。尽管整体执行有16.9%增益,但消融实验表明,性能提升主要源于上下文传递而非可靠的技能抽象。这表明当前Agent难以通过积累数百个技能实现按比例的性能跃迁,自主技能创建仍不可靠,重复工作中维持上下文比构建显式技能库更有效。

#LLM Agents#技能积累#上下文学习

21:12Import AI(RSS)

METR研究AI加速差异及SPADE、Hawkeye技术解析

Import AI 470期报道三项内容:METR研究显示AI在网络安全漏洞发现上显著加速,数学研究轻微加速,但AI自身算法优化未见明显加速。论文SPADE提出自适应性合成可执行环境生成框架,通过LLM交替设计环境与推理,利用Qwen3-30B模型在游戏与工具使用基准上取得提升。另一项工作Hawkeye由哈佛等机构开发,提供开源GPU内核生成框架,通过结构化单元测试帮助编码Agent生成硬件感知的高性能内核。

#Import AI#METR#SPADE

21:09Rohan Paul

对抗式审查:结构化分歧提升多智能体代码审查质量

论文提出对抗式审查机制,通过引入规则约束解决多智能体相互复核时易产生共识偏差的问题。该结构包含代码冻结、审查者撰写意见、批评者审计意见及最终编辑四个阶段。实验显示,在 LiveCodeBench 上,3 个智能体的方案达到 87% 准确率,优于 5 智能体方案的 82%。针对真实 Pull Request 审查,初始 F1 分数仅为 0.457;通过强制批评者区分异议基于代码还是直觉,并要求审查者提供代码证据回应,F1 提升至 0.533 并居首位。研究表明,仅当共识需以代码证据为代价时,第二智能体才具实质帮助。

#AI Agents#代码审查#对抗式学习

20:47elvis

NVIDIA提出ACES框架:通过技能提升度评估Agent能力

NVIDIA发布新论文,探讨如何更有效地评估AI Agent的技能。传统企业常用结构扫描检查格式与安全,但研究发现其与LLM评分的相关性极低(Spearman rho仅0.14)。为此,团队提出ACES框架,引入“技能提升度”指标:在相同模型、沙箱与评分器下,对比加载技能前后任务完成度的差异。研究基于58个生产级技能、947组配对案例,将轨迹标准化为Agent Trajectory Interchange Format以跨环境比较。结果显示,该指标能显著反映技能执行、行为检查及效率方面的实际增益,为Agent技能库的质量审查提供了更可靠的量化依据。

#NVIDIA#Agent评估#ACES

22:45Rohan Paul

Meta新论文:训练智能体学会何时使用记忆与工具,成功率翻倍

Meta 新论文指出,仅给智能体更多记忆和工具并不够,关键在于训练其判断何时值得使用外部状态。研究提出 EvoHarness-RL 方法,将长期任务中的当前状态、已完成步骤和过往经验存放在模型外部,分别作为 Belief、Progress 和 Experience,并让策略学习何时读取或更新这些状态,因为每次调用都会消耗交互步骤。在 ALFWorld 基准上,Qwen3-8B 搭配 ReAct 的可见任务成功率为 47.9%,而 EvoHarness-RL 达到 96.9%,未见任务上为 86.6% 对比 ReAct 的 50.0%。

#Meta#论文#Agent

05

技巧与观点

Tips8

05:16Avi Chawla

图解受限 LLM Agent:如何省下近 3 倍 Token

同一模型执行同一任务,不同 Agent 的 Token 消耗可相差近 3 倍,差异源于外围代码(harness)如何决定每次调用进入上下文的内容与调用次数。若某工具返回 50k Token 的 JSON 且留在上下文中,模型后续每一步都会重复读取;工具定义同理,默认全部常驻提示词。优化原则是适时将内容移出模型:Memory 存状态,Skills 存程序性知识,Protocols 存交互契约。上下文并非永久消失,而是按需加载。管理大载荷可写入文件并保留预览与路径、交给上下文随后丢弃的子代理,或对旧消息做摘要。

#Agent#LLM#Token优化

21:26meng shao

Addy Osmani Agent Skills:让AI可靠执行的操作规程设计

深度解析 Addy Osmani 开源项目 agent-skills 中的核心规范文档,这是一套面向 AI 行为工程的提示设计方法论。其结构强调最小必需与按需扩展,禁止空目录。Frontmatter 的 description 需明确 what 和 when,严禁包含流程摘要以防 Agent 短路。正文通过 Core Process 提供具体可执行指令,利用 Common Rationalizations 预演并封堵 LLM 偷懒借口,Red Flags 标记违规信号,Verification 要求证据支撑退出标准。脚本约定遵循上下文经济学,JSON 输出至 stdout。

#Addy Osmani#Agent Skills#Prompt Engineering

13:19meng shao

Addy Osmani访谈:从Chrome DevTools到AI工程实践与认

Google前工程总监Addy Osmani深度分享职业历程与AI时代思考。他回顾了在Google主导Chrome DevTools和Core Web Vitals的经历,强调将用户感受转化为量化指标的重要性。针对AI工程,他提出警惕“认知投降”,建议通过阅读Agent决策摘要并记录关键选择来保持批判性思维;倡导构建包含遥测反馈的闭环Loop Engineering系统,但需严格的质量门禁。此外,他探讨了AI写作中的风格同质化困境,并建议工程师拓展产品与市场能力以应对岗位解绑趋势。

#Addy Osmani#AI工程#深度访谈

12:52meng shao

深度访谈:AI Agent重塑内容创作与创业的方法论

Bilawal Sidhu分享从OpenClaw转向Codex的Agent工作流,强调应用内浏览器作为人机共享画布的价值。他主张模型分工:Claude处理高审美决策,Codex执行细节任务,Gemini负责空间推理。在视觉内容上,利用编程模型生成精确可视化以弥补视频生成的准确性不足。其创业方向是为物理现实建立审计追踪,V1版本本月开源。他认为2026年前为个人Agent革命,下半场将转向团队级协作,并提倡通过公开原型和长视频构建社区驱动的产品范式。

#AI Agent#工作流#创业方法论

10:35Hacker News Best(web_list)

利用 agent.md 文件提升 LLM 辅助编程代码质量

作者分享通过项目根目录的 agent.md 文件注入系统提示词,以规范大模型生成代码的风格与结构。该文件包含多项具体规则:要求注释精简、避免魔法数字、减少缩进层级、函数名短于30字符、使用枚举替代布尔参数、遵循分层架构边界、提交信息遵循特定格式及先写测试后修复等。针对上下文稀释问题,建议按功能开启新会话并显式重载配置。此外,还介绍了让 Agent 自动更新 agent.md 的方法,将重复的代码审查转化为可复用的工程实践,显著提升代码可用性。

#LLM#编程技巧#Agent

09:00elvis

Netflix LLM Judge 生产实践:四阶段生命周期与 A/B 测试验证

Netflix 每周处理数十万条推荐解释,面向数百万移动端用户。其 LLM Judge 采用包含四个阶段的生命周期管理:定义评估标准并构建带人工标签的基准;通过推理对齐规范微调优化判据;部署用于质量把关和反思生成;持续监控漂移并触发重新微调。五周 A/B 测试显示,相比无解释对照组,该方案显著引导用户观看未看内容并提升浏览到播放成功率,且无质量相关下架事件。论文发表于 arXiv:2608.18300。

#Netflix#LLM Judge#Prompt Engineering

08:34Hacker News Best(web_list)

利用AI Agent逆向分析外设固件:麦克风与摄像头实战复盘

作者使用Claude Opus 5对Insta360 Link摄像头、ASUS ROG显示器及Shure MV7麦克风进行自动化逆向工程。通过提取固件并设定目标,Agent成功破解了摄像头的LED状态控制、显示器的DDC/CI接口以及麦克风的明文命令Shell。其中麦克风暴露出基于字符串比较的脆弱权限验证机制。整个过程耗时约13小时,生成大量可复现脚本,展示了AI在硬件安全分析与固件修改中的高效落地能力。

#Claude#AI Agent#逆向工程

04:56GitHub 博客(RSS)

GitHub 开源 alt text 质量检查插件:从确定性规则到模型评审

GitHub 博客介绍其构建的 alt text 质量检查插件,用于改进网页图片替代文本。WebAIM 2026 报告显示,主流首页中 16.2% 的图片缺少 alt text,另有 10.8% 的 alt text 无描述性(如 alt="image" 或文件名)。插件基于 GitHub Accessibility Scanner,默认运行五条确定性规则,无需调用模型:检查属性缺失、文件名、占位符、泛化词(如 image、logo)及相邻图片重复。重复检测基于页面布局而非 DOM 顺序,通过边界框间距判断。

#GitHub#无障碍#alt text

往期存档