跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 42 事件 · 5 一手信源 · 覆盖 16 家信源
今日头条 · Lead

谷歌发布Gemini 3.8 Live:实时推理+深度思维链

今日,谷歌发布Gemini 3.8 Live,主打实时流式推理与深度思维链;阶跃星辰推出StepAudio3系列,多项语音基准登顶。OpenAI寻求1.2万亿美元估值融资,谷歌TPU集群规模达百万级。AI竞赛正从模型能力延伸至实时交互与算力基础设施。

01:05Google DeepMind 博客(RSS)关联 5

Google DeepMind 发布 Gemini 3.8 Live

Google DeepMind 发布 Gemini 3.8 Live,支持实时流式推理与低延迟交互。新增 Extended Thinking 模式,通过深度思维链提升复杂逻辑、数学与代码任务表现。该版本优化了多模态理解能力,强化对长上下文信息的精准提取。模型提供 API 接入,面向开发者与企业用户开放测试,旨在提升 AI Agent 在动态环境中的响应速度与决策准确性。此次更新聚焦于实时交互体验与深层推理能力的结合,为构建高可靠性智能应用提供底层支持。

#Google DeepMind#Gemini#模型发布

01

模型发布/更新

Model Releases5

02:05Rohan Paul

Odyssey-3世界模型以20小时仿真数据实现真实驾驶

Odyssey-3基础世界模型发布,旨在解决机器人学习对特定任务数据的依赖。其方法基于预训练的世界模型,附加在数十小时机器人演示上训练的解码器。该模型仅用20小时仿真驾驶数据即能在印度真实街道行驶。Odyssey主张通过广泛的世界模型预训练吸收下游策略需重复学习的知识,从而减少各新身体控制所需的经验数据量。目前报告的数据规模较小,包括机械臂、人形遥操作及无人机模拟的数十小时数据。核心逻辑是一次性投入大规模预训练预算构建通用世界模型,随后以较少数据教授不同硬件的控制能力。

#Odyssey-3#世界模型#机器人学习

17:58量子位(RSS)

分子之心AI模拟:单GPU实现10万原子级化学反应电影化

量子位报道,分子之心(Molecular Mind)利用AI技术突破分子模拟的“不可能三角”,在单张GPU上实现了十万原子级别的化学反应模拟。该成果将复杂的化学反应过程以类似“电影”的高保真形式呈现,显著提升了计算效率与精度。这一进展展示了AI在科学计算领域的强大潜力,为材料研发、药物发现等需要高精度分子动力学模拟的场景提供了新的技术路径,有望加速相关行业的创新进程。

#分子之心#AI for Science#分子模拟

15:45IT之家(RSS)

阶跃发布StepAudio3系列语音大模型,多款获全球第一

9月15日,阶跃星辰正式发布StepAudio3系列语音大模型,包含Realtime、ASR、TTS、Gen和Music五款子模型,均已上线阶跃星辰开放平台。该系列覆盖实时交互、语音识别、语音合成、音频生成与音乐创作等核心场景。在Artificial Analysis榜单中,StepAudio3 Realtime以98.9%得分居全球第一,推理准确率99.7%亦列榜首;StepAudio3 ASR在非流式识别WER达1.7%,并列全球第一。新模型强调原生全双工交互、复杂语境理解及多模态音频统一生成能力,旨在提升AI语音应用的真实感与生产力。

#阶跃星辰#StepAudio3#语音大模型

05:01Hacker News Best(web_list)

TypeSafe发布System One模型Jev,主打结构化决策与低延迟

TypeSafe AI创始人Diogo Almeida宣布推出首款System One模型Jev。该模型采用并行采样架构与RLCD训练方法,放弃字符串生成以优化结构化输出,承诺无类型错误并附带校准概率。官方数据显示其端到端响应时间70-500ms,较现有前沿模型快40-200倍,输入成本为每百万token 0.042美元,输出免费。Jev目前处于早期访问阶段,主要面向AI工作流、智能路由及实时应用等需要高可靠结构化决策的场景。

#TypeSafe AI#Jev#模型发布

02:47elvis

TypeSafe新架构并行回答结构化问题提速40-200倍

TypeSafe团队发布了一种新型AI架构,旨在大幅提升响应速度。该架构的核心机制是并行处理结构化问题的回答,并采用RLCD(强化学习从正确性中直接学习)技术对概率进行训练,使模型输出更准确地反映其正确率。据团队报告,在System One查询场景下,该架构的响应速度提升了40至200倍。这一进展展示了通过改变推理与生成范式来优化AI性能的技术路径,为追求低延迟和高效率的应用场景提供了新的工程参考。

#TypeSafe#架构创新#RLCD

02

产品发布/更新

Products8

06:24NVIDIA 博客(RSS)关联 2

黄仁勋Dreamforce演讲:Salesforce发布基于Nemotron

英伟达CEO黄仁勋在Salesforce Dreamforce大会上发表主题演讲,提出“知一切、做一切”愿景。Salesforce同步发布首款推理模型Koa,该模型基于英伟达开源Nemotron 3 Super,利用近三十年企业CRM数据合成数据集进行监督微调与强化学习训练。Koa在Salesforce CRM基准测试中表现优异,错误率降低三倍,且完全在Salesforce内部基础设施运行,不接触客户数据。目前Koa已在Slack员工助手中使用,10月起进入客户试点,预计2026年冬季在美国地区正式商用。黄仁勋强调安全是工程问题,创新与安全可兼得,并指出每家公司都将成为AI公司。

#Salesforce#NVIDIA#Koa

02:33Ars Technica AI(RSS)关联 2

Agility发布Digit 5人形机器人:遇人可蹲下避让

Agility Robotics发布了首款专为在人类附近安全工作而设计的人形机器人Digit 5。该机器人配备了复杂的安全运动系统,能够根据检测到的人类存在情况采取多种缓解措施。当检测到人员时,Digit 5会自动移动避让或静止等待;若人员进入近距离范围,机器人甚至可以选择蹲下并呈坐姿,以避免伤害同事。这一安全特性有望消除仓库和汽车工厂中对隔离工作区和物理屏障的需求,从而解锁更多在人机协作场景下的应用机会。Agility首席技术官Pras Velagapudi表示,该系统能针对不同的人类接近程度做出相应反应。

#Agility Robotics#人形机器人#Digit 5

12:48IT之家(RSS)

iOS/iPadOS 27 隐藏新功能汇总:聚焦 AI 与细节打磨

MacStories 主编 Federico Viticci 梳理了 iOS / iPadOS 27 的 54 项隐藏新特性。系统整体侧重性能提升、可靠性增强及细节打磨,并深度整合 Apple Intelligence。Siri 方面实现全系统悬浮搜索框,具备屏幕感知能力,可跨 App 执行操作;相机集成 Siri 视觉问答,支持上下文追问;写作工具升级为 Write with Siri。照片应用新增视频单帧保存、证件聚合相册及 Clean Up 高质量模式。此外,主屏幕引入超大型小组件与液态玻璃强度调节,备忘录支持导出 Markdown 及章节链接,快捷指令支持自然语言创建与全局变量存储。

#Apple#iOS 27#Apple Intelligence

08:38Claude Code 文档(sitemap)

Claude Code v2.1.250更新:恢复会话、受限模式与反馈报告

Anthropic发布Claude Code Desktop应用v2.1.240至v2.1.250版本更新。核心功能包括:在桌面端通过/resume命令无缝恢复CLI启动的终端会话,保留完整上下文;新增Claude自动起草反馈报告功能,用户可审查并发送或忽略,需v2.1.238以上版本;引入受限模式(Restricted Mode),默认禁用运行命令和代码的工具,适用于评估框架驱动的场景,可通过--restricted参数或环境变量开启,并支持通过--tools白名单恢复特定工具。

#Anthropic#Claude Code#产品更新

00:55NVIDIA 博客(RSS)

NVIDIA DSX平台实测:固定功耗下算力提升24%

NVIDIA在AI Infra Summit发布DSX基础设施软件套件,旨在优化AI工厂的每兆瓦吞吐量。核心组件DSX MaxLPS通过动态功率分配与实时监测GPU及机架级能耗,回收静态配置中的闲置容量。云服务商Lambda在HGX B200集群上的验证显示,在相同功耗预算下,集群Token吞吐量从每秒400万提升至500万,增幅达24%,能效提升23%。此外,NVIDIA合作伙伴Emerald AI的Conductor平台已在硅谷电力系统中实现自动化需求响应,将工厂负载从4MW降至3MW且不影响高优先级任务。

#NVIDIA#DSX#AI基础设施

11:12日经中文网

特斯拉Cybercab在奥斯汀正式运营,日经记者实测体验与定价

特斯拉无人驾驶专用车Cybercab于9月4日起在美国得克萨斯州奥斯汀向公众提供网约车服务。日经中文网记者实地体验发现,车辆去除了方向盘、踏板及后视镜,采用双座布局与触控屏交互,起步停车平稳但黄灯通行策略激进。计费方面,4.5公里行程约12.7美元,低于Uber同期价格。目前奥斯汀注册自动驾驶出租车达437辆,其中Cybercab为49辆,累计行驶里程超百万英里。尽管马斯克曾计划2026年底全美普及,但美国NHTSA已启动安全调查,监管不确定性成为主要瓶颈。此外,特斯拉将于9月中旬在日本东京等地展示该车型。

#特斯拉#Cybercab#Robotaxi

12:51meng shao

腾讯微信团队开源企业级LLM知识平台WeKnora

腾讯微信团队开源企业级LLM知识平台WeKnora,作为微信对话开放平台核心技术框架,支持私有化部署。该平台将碎片化文档转化为三种知识库资产:支持BM25、GraphRAG等策略的RAG问答库;具备跨会话记忆与多工具编排能力的ReAct Agent;以及可自动蒸馏文档并生成结构化Markdown与知识图谱的Wiki模式。系统提供多租户隔离、四级RBAC权限控制、API Key作用域限定及AES-256-GCM加密等安全特性,内置E2E评测工具以量化检索质量,旨在解决企业知识沉淀与可持续演进难题。

#腾讯#WeKnora#开源项目

18:12Two Minute Papers(YouTube)

Claude文本生成引入隐形水印技术

Anthropic宣布在Claude生成的文本中植入机器可检测的隐形水印。该算法基于词元概率分布,通过向特定“绿色”候选词施加微小偏好偏差来嵌入指纹,人类无法察觉且能抵抗轻度编辑。检测方通过统计绿色词频判断来源,原文指出重写全文或使用开源模型可规避。目前仅部分机构具备检测权限,该技术旨在区分AI与人类内容,引发关于透明度的讨论。

#Anthropic#Claude#文本水印

03

行业动态

Industry8

14:54华尔街见闻(RSS)关联 4

字节跳动整合豆包飞书火山引擎,梁汝波押注AI办公

字节跳动完成旗下AI办公业务重组,将豆包、飞书与火山引擎整合为一体化企业智能平台。CEO梁汝波出席大会表示,Agent、模型与协作环境需紧密融合,豆包提供智能,火山引擎提供算力与企业服,飞书承载协作场景。飞书同步发布8.0版本,对Agent进行系统性重构,对外开放功能接口从247个增至767个,并推出“豆包工作伙伴”赋予Agent独立身份与权限。数据显示飞书上半年ARR增速达去年同期2.5倍,超九成新增客户采购AI产品。此举标志着字节正式以集团军姿态入场,与腾讯WorkBuddy、阿里千问办公正面竞逐AI办公市场。

#字节跳动#AI办公#组织架构调整

09:11华尔街见闻(RSS)关联 4

黄仁勋All-In峰会:批AI末日论,谈RSI工程逻辑与开源战略

英伟达CEO黄仁勋在All-In Summit 2026上驳斥AI末日论,称相关预测缺乏科学依据。他解释递归自我改进(RSI)为可控的工程流程,强调发布前需评估测试。特朗普现场致电支持数据中心建设,视其为未来石油。黄仁勋阐述英伟达“向上走、向下压”的生态战略,透露收购Hugging Face后布局自动驾驶等垂直领域开源模型,并指出超级智能已在特定窄域实现。

#英伟达#黄仁勋#AI安全

23:33IT之家(RSS)

华为郭平:ICT目标成英伟达,昇腾950有望赶上对手

华为监事会主席郭平在员工座谈中披露公司战略。AI方面,华为将实现人工智能视为最大机遇,ICT与计算业务目标是成为英伟达,核心优势在于支持客户构建大模型并确保其在昇腾、鲲鹏及集群上高效运行;终端与智能驾驶需自研大模型以利用数据飞轮,华为云亦须拥有自研大模型维持竞争力。半导体领域,面对先进制程约束,华为推动设计与制造一体化,通过架构创新弥补工艺不足,昇腾950系列未来有望赶上对手。此外,华为不追求超越苹果,而是虚心学习其供应链管理,车BU引望将继续由华为领导并面向全球。

#华为#郭平#昇腾

20:37IT之家(RSS)

字节跳动上半年利润降至200亿美元,AI投入加大致净利下滑

据The Information援引知情人士消息,受AI投入增加影响,字节跳动今年上半年净利润下降至200亿美元,降幅为个位数百分比。同期营收达1200亿美元,同比增长约30%,TikTok国际广告和电商收入强劲增长是主要推动力。这一增速较过去两年略有加快,但利润下滑反映出AI投入对盈利能力的压力。此外,字节跳动正在扩张AI云业务,其Seedance视频生成模型已跻身全球领先行列。公司近期还从银行借入约300亿美元创纪录贷款,用于支持不断扩大的AI投入,并开发自研推理芯片以运行AI模型。

#字节跳动#财报#AI投入

19:48IT之家(RSS)

OpenAI内部Lily项目曝光:人工审核ChatGPT聊天记录优化模型

404 Media披露OpenAI代号“莉莉计划”的内部流程,通过人工审核匿名化后的用户聊天记录以优化大模型。审核员被称为“提示词审核员”,负责评判回复质量、检查AI式话术及拟人化表述,时薪超50美元。该流程仅标记明显错误,与独立的安全审查分离。尽管隐私政策提及数据用于模型优化,但未明确告知人工读取细节,且历史数据删除无法追溯。此举揭示大模型迭代仍依赖大量人力参与,谷歌Gemini等竞品亦有类似做法。

#OpenAI#ChatGPT#数据隐私

06:59华尔街见闻(RSS)

OpenAI新一轮融资目标估值1.2万亿美元,IPO推迟至2027年后

据华尔街见闻报道,OpenAI正与投资方就新一轮私募融资进行初步接触,拟定估值达1.2万亿美元,较今年3月完成的8520亿美元融资大幅跃升。此次接触由投资方主动发起,是否推进及时间节点取决于公司上市计划。OpenAI CEO Sam Altman此前表示赴美上市时机不当,已将IPO窗口推迟至2027年之后,尽管公司已于今年6月秘密提交招股书。支撑高估值的因素包括GPT-5.6发布后年化营收突破400亿美元,环比增长20%。同时,Altman在Dreamforce大会上强调行业有能力自主推进安全发展,无需外部强制监管介入。

#OpenAI#融资#IPO

06:43IT之家(RSS)

谷歌宣布 TPU 集群规模达百万级,电力成算力扩张核心瓶颈

在 SEMICON Taiwan 2026 活动中,谷歌宣布其 TPU 互联架构已支持将最多 100 万颗芯片连接为统一计算集群,实现跨数据中心分布式训练。谷歌 CTO Amin Vahdat 指出,AI 基础设施的核心瓶颈已从芯片制造转向电力供给,制约进一步扩张的主要因素变为“找不到电”。谷歌与 Anthropic 达成合作协议,涉及高达 100 万颗 TPU 芯片及超 1 吉瓦计算功率,预计从 2027 年起提供 3.5 至 5 吉瓦算力容量,交易价值约 400 亿美元。

#Google#TPU#Anthropic

04:11Latent Space(RSS)

Good Start Labs:用游戏训练AI,技能能否迁移到真实工作?

Good Start Labs由Every前AI训练主管Alex Duffy创立,获General Catalyst等360万美元融资。公司核心思路是将游戏作为AI的训练环境,通过强化学习验证模型能力并探索技能迁移。早期观察显示,不同前沿模型在策略游戏Diplomacy中表现迥异,如o3擅长规划背叛而Claude拒绝撒谎导致失败。后续实验表明,基于Diplomacy微调能提升客服与工业操作基准表现。最新研究利用1830铁路游戏训练30B模型,发现采用多轮终端Agent设计而非单轮问答,能有效将游戏中的金融推理习惯迁移至Finance-Agent基准测试。

#Good Start Labs#强化学习#技能迁移

04

论文研究

Research1

02:14elvis

Google发布Stellar Colosseum多智能体数学证明系统

Google Research推出Stellar Colosseum,一个用于长周期任务的许多智能体协作框架。该系统通过探索多种证明策略、在就绪门控后分解子问题并并行生成候选方案,结合定向证伪与批判性合并机制处理复杂任务。基于Gemini 3.1 Pro和Gemini 3.7 Flash模型,系统在TCS-Bench研究级定理证明基准上达到71.0%准确率,并在执行反馈下解决222道Codeforces题目中的218道,产出FOCS与JMLR论文中的新结果。相关论文已发布于arXiv。

#Google#Agent#数学证明

05

技巧与观点

Tips6

05:37MarkTechPost(RSS)

NVIDIA cuDNN Graph API实战:融合、自动调优与计划复用

本文详细演示了如何在 PyTorch 环境下使用 NVIDIA cuDNN Frontend 的 Graph API。内容涵盖从安装 nvidia-cudnn-frontend 包及解决 libcudnn.so 动态链接库加载冲突开始,到定义张量维度与步长、构建计算图、执行五步构建流程(验证、构建操作图、创建执行计划、检查支持、构建计划),再到最终执行并对比 PyTorch 参考结果以验证融合正确性与性能开销。

#NVIDIA#cuDNN#AI工程

22:42meng shao

构建可审计文档问答Agent:云端解析与本地迭代方案

本文介绍构建“有据可查”文档问答 Agent 的技术方案,核心目标是让 AI 答案具备可追溯性。技术架构分为三层:解析层利用 LlamaParse 生成带页码元数据的布局感知 Markdown,并通过文件哈希缓存避免重复消耗;本地层使用 Ollama 的 nomic-embed-text 进行嵌入、LlamaIndex 建立向量索引并检索 Top-4 片段,最后由本地 qwen3:4b-instruct 模型生成回答;引用层通过 CitationQueryEngine 强制模型以 [1]、[2] 格式内联引用。

#RAG#LlamaIndex#Ollama

22:29meng shao

NVIDIA 全栈 NIM 优化 Nemotron 3 Ultra 推理性能实录

NVIDIA 发布技术博客,详述在 4×B200 系统上通过 NIM 微服务对 Nemotron 3 Ultra(550B-A55B MoE+Mamba 混合架构)进行全栈协同优化。在固定延迟 SLO(每用户 50 TPS)下,系统吞吐从 718 tok/s 提升至 1,997 tok/s,并发服务能力提升约 2.5 倍。核心优化手段包括 NVFP4 量化、MoE/Mamba 异构内核自动调优、前缀与状态复用、调度批处理内存调优及 MTP 投机解码。测量采用 AIPerf 重放真实流量绘制 Pareto 曲线,强调各优化层存在耦合效应,非简单叠加。

#NVIDIA#Nemotron#推理优化

08:47meng shao

Addy Osmani 分享 Agent Skills 工作流:定义到交付

在 MSBuild 2026 大会上,刚刚加入 Anthropic 的 Addy Osmani 接受了微软 Burke Holland 的现场访谈。两人围绕“什么是 Agent”展开讨论,重点分享了 Agent Skills 的实战经验。Osmani 提出了一套标准化的 Agent Skills 工作流,包含六个关键阶段:Define(定义)、Plan(规划)、Build(构建)、Verify(验证)、Review(审查)以及 Ship(发布)。该分享旨在为开发者提供可复用的工程实践框架,帮助理解如何系统化地设计与部署具备特定技能的智能体应用。

#Anthropic#Agent#MSBuild

16:10Avi Chawla

一文详解单卡部署百个微调模型的多LoRA Serving架构

本文详细解析如何在单张 GPU 上通过多 LoRA Serving 技术同时服务上百个微调模型。核心机制在于共享基础大模型的权重,仅加载各变体的适配器(Adapter)参数,从而大幅降低显存占用。内容涵盖适配器内存管理、请求路由策略、动态 Batching 优化、冷启动处理以及 Worker 扩展方案等工程细节,为开发者提供了一套可落地的多模型并发部署实践指南。

#LLM推理#LoRA#Serving

06:05宝玉

Anthropic工程师复盘FDE模式:从Palantir到AI

Anthropic Applied AI团队Kevin Bai分享FDE(前端部署工程师)入门课。FDE核心在于通过深入理解客户业务场景,在可复用平台上组装定制方案以交付结果,而非外包式从零写代码。该模式适用于产品技术门槛高且买家非技术的场景,前提是拥有共享基础组件以控制维护成本。随着AI让软件构建极易且平台走向Agent化,客户对能力的认知模糊度增加,FDE正从Palantir等少数公司的特有玩法,转变为更多软件公司需考虑的通用策略。适合者需兼具扎实技术能力与客户信任度。

#Anthropic#FDE#工程实践

往期存档