跳到主内容

日报

LIVE每早八时发报 · 更新于 08:01NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 23 事件 · 1 一手信源 · 覆盖 8 家信源
今日头条 · Lead

苹果发布M6与M5 Ultra芯片,AI算力大幅跃升

今日苹果推出M6与M5 Ultra芯片,分别搭载于新款Mac mini和Mac Studio,端侧AI算力与能效显著提升。与此同时,Anthropic筹备史上最大规模IPO,OpenAI高管展望个人AGI融合方向,Meta发布面向AI以太网的新传输协议,行业竞争与基础设施升级同步加速。

16:04华尔街见闻(RSS)关联 2

OpenAI高管:ChatGPT与Codex将融合为个人AGI,推理提速60%

OpenAI Codex负责人Tibo Sottiaux接受专访,称Codex已深度并入ChatGPT,未来产品边界将淡化,最终收敛为一个长期理解用户、自主完成任务的个人通用智能(Personal AGI)。他披露,Codex用户量约2000万;过去三个月OpenAI普通推理速度提升约60%;Ultra Fast极速模式最高实现14倍生成加速,预计1至2年内接近行业默认水准。他还透露,OpenAI已利用强大模型优化底层推理架构,使Luna模型运行成本下降约80%,并称这是递归自我改进的早期形态。Tibo认为,下一代模型将颠覆现有智能体系统,手动维护技能、记忆与子智能体属早期笨拙形态;

#OpenAI#Codex#ChatGPT

02

产品发布/更新

Products2

07:48MarkTechPost(RSS)

Liquid AI 开源 Pipette:统一评测端侧模型、量化、运行时与硬件

Liquid AI 开源 Pipette,一个可复现的端侧模型基准测试套件,与 Artificial Analysis 合作开发,后者作为独立方法论验证方。Pipette 将端侧行为视为部署系统的属性,而非模型孤立属性,其度量单位是完整配置:模型 + 量化 + 运行时 + 设备。发布数据集涵盖 30+ 模型、1000+ 配置,覆盖五种端侧性能指标,支持 macOS、iOS、Windows、Android 的 llama.cpp 构建,上下文长度从 256 到 8192 token。

#Liquid AI#端侧模型#基准测试

03:12MarkTechPost(RSS)

Perplexity 发布 Portable Computer:本地运行

Perplexity 发布 Portable Computer,这是其 agentic Computer 平台的本地优先版本,将 agent harness、编排器、规划器、工具路由及后训练模型打包,直接运行于 NVIDIA DGX Spark。所有任务从设备端开始,本地模型处理的工作不产生按 token 计费。当某步骤需要实时网络或前沿推理时,编排器会暂停并询问用户,经 PII 分类器检查后,才将该步骤发送至 15+ 云端模型之一。用户可选择 Qwen 3.8 27B 或 Perplexity 后训练的 PPLX 27B,NVIDIA Nemotron 3.5 Lightning 即将支持。

#Perplexity#本地AI#Agent

03

行业动态

Industry8

22:53Hacker News Best(web_list)关联 4

苹果发布M6与M5 Ultra芯片,性能与AI算力大幅跃升

苹果今日发布M6与M5 Ultra芯片,分别搭载于新款Mac mini和Mac Studio。M6是苹果首款2纳米芯片,配备12核CPU、12核GPU及双16核神经引擎,统一内存带宽最高170GB/s,GPU AI算力较M5提升近30%,神经引擎峰值算力翻倍。M5 Ultra采用四芯片封装架构,配备最高36核CPU、80核GPU及32核神经引擎,统一内存带宽达1.2TB/s,较M3 Ultra提升50%,GPU AI算力提升4.5倍,支持最高512GB统一内存,可本地运行大规模AI模型。两款芯片均强调能效与端侧AI能力。

#苹果#芯片#M6

07:08华尔街见闻(RSS)

Anthropic拟IPO估值2万亿美元,最快9月上市

Anthropic正筹备IPO,拟向投资者披露超30万亿美元潜在市场规模,刷新SpaceX创下的纪录。公司预计2028年收入达1900亿至2000亿美元,目标估值约2万亿美元,最高募资1000亿美元,最快9月或10月上市。此次IPO有望成为史上最大规模。

#Anthropic#IPO#融资

21:43IT之家(RSS)

苹果发布 M6 芯片:2纳米制程,12核CPU单线程全球领先

苹果今日在新款 Mac mini 中推出 M6 芯片,这是苹果首款采用 2 纳米制程的芯片。M6 配备 12 核 CPU(2 个超级核心、4 个性能核心、6 个能效核心),单线程性能全球最快,多线程性能较 M5 最高提升 1.2 倍、较 M1 最高提升 2.4 倍。GPU 为 12 核,每个核心均配备神经网络加速器,AI 场景下 GPU 峰值性能较 M5 提升近 30%、较 M1 提升 8 倍以上。芯片还集成双 16 核神经引擎,峰值算力为前代 2 倍,支持最高 32GB 统一内存与 170GB/s 内存带宽。

#苹果#M6芯片#2纳米

11:49华尔街见闻(RSS)

马斯克承认Grok落后,SpaceX 600亿美元收购Cursor

SpaceX以600亿美元完成对AI编程工具Cursor的收购,马斯克在全员会议上罕见承认旗下AI产品Grok在市场竞争中处于落后地位,并将此次收购定性为追赶竞争对手的战略举措。据科技媒体The Information 8月24日报道,五位知情人士透露,在收购完成当日的全员视频会议上,马斯克直言SpaceX旗下AI部门落后于竞争对手,并坦言"不习惯失败"。他特别点名称赞Anthropic在AI竞赛中处于领先地位,并强调SpaceXAI的Grok在其所在市场并非领导者,迫切需要追赶。马斯克还表示,SpaceX将持续积累业内最强的算力储备。此次收购对Cursor的冲击已在多个层面显现。

#SpaceX#Cursor#收购

16:57华尔街见闻(RSS)关联 2

任少卿创立具身智能公司,蔚来战略投资并保留智驾职务

华尔街见闻获悉,8月24日蔚来CEO李斌在智驾全员会上宣布,智能驾驶负责人任少卿已创立一家聚焦物理AI基础模型和具身智能的独立公司,蔚来将战略投资并开展合作。任少卿并未离职,仍全面负责蔚来智驾,职务和职责不变。任少卿2020年加入蔚来,推动高阶智驾转向端到端和世界模型,并参与神玑NX9031智驾芯片量产。蔚来2023年启动世界模型研发,2025年开始量产推送,今年6月最新版本覆盖超70万用户。蔚来资本2025年以来先后支持逐际动力融资、领投原力灵机A轮和灵猴机器人Pre-B轮。李斌曾表示,神玑芯片独立发展后不只服务汽车,也要面向机器人等端侧推理场景。

#蔚来#任少卿#具身智能

01:25MarkTechPost(RSS)

Meta 发布 MetaRoCE:面向 AI 以太网的全新 RDMA 传输协议

Meta 推出 MetaRoCE,一种专为 AI 工作负载设计的全新 RDMA 传输协议,旨在解决大规模集群中网络成为训练瓶颈的问题。该协议颠覆了标准 RoCE 的假设,将网络视为有损,并把排序、路径选择与恢复功能移至网卡。其核心设计包括:默认乱序传输、原生多路径、容忍丢包、双端拥塞控制、拓扑无关以及连接状态优化。在 64 节点 AMD GPU 集群上,MetaRoCE 相比 RoCEv2 在 all-reduce 和 all-to-all 操作中实现了更高吞吐和更低流完成时间,并在 1% 丢包率下保持约 86% 的吞吐。

#Meta#RDMA#网络协议

21:46IT之家(RSS)

苹果发布 M5 Ultra 芯片,最高 36 核 CPU/80 核 GPU

苹果今日在新款 Mac Studio 中推出 M5 Ultra 芯片,这是苹果有史以来性能最强的芯片,面向专业及 AI 工作负载。该芯片首次在 M 系列 SoC 中采用新一代 UltraFusion 技术构建四芯片架构,由两颗双芯片 M5 Max 连接而成,芯片间带宽超 4.4 TB/s。M5 Ultra 配备最多 36 核 CPU(含 12 个超级核心和 24 个性能核心),单线程性能比 M3 Ultra 高至多 1.25 倍,多线程高至多 1.3 倍;

#苹果#M5 Ultra#芯片

18:12Chubby♨️

Nvidia B300服务器被指走私入华,台湾检方起诉九人

据路透社报道,台湾检方起诉九人,涉嫌将Nvidia B300 AI服务器走私至中国,以规避美国出口管制。被告包括一名Nvidia台湾员工和两名超微(Super Micro)台湾前员工。检方指控,虚假文件声称130台B300服务器将留在台湾某设施,但其中74台被直接或经印尼、日本和香港交付给中国客户,其余56台被海关截获。

#Nvidia#出口管制#AI服务器

04

论文研究

Research2

23:35elvis

阿里新方法:把Agent上下文管理当编程任务

阿里巴巴提出一种新的Agent上下文管理方法,将其视为编程任务。该方法为每个Agent会话配备追加式事件日志和沙箱化持久Python内核,工具输出、检索历史和派生状态绑定到跨模型调用的类型化变量,而非每轮序列化进提示词。模型编写的代码搜索和转换状态,仅显式打印的投影进入工作视图。事件日志保留无损真实信息,工作视图接近预算时,过期片段被驱逐但仍可恢复,驱逐索引保留与事件日志地址关联的紧凑地标,使Agent能直接导航回区域。在Qwen3.8-Max上,LongMemEval_S达94.8%,BEAM_10M达73.1%(超最佳已发布记忆系统5.1分),LOCA_256K达86.7%。

#阿里巴巴#Agent#上下文管理

21:45elvis

微软AutoSaddler:自动优化Agent harness

微软及合作者发表新论文,提出AutoSaddler方法,将Agent的harness视为代码,通过离线失败轨迹自动学习修补。该方法运行小批量任务,诊断失败原因,生成针对提示词、工具配置和控制逻辑的结构化补丁,仅当补丁通过验证时才保留更新。在GAIA2、SWE-Bench Pro和Terminal-Bench 2.0上,相比基础harness分别提升9.0、9.6和10.0分。研究还发现,深度调试优于浅层反思,定向编辑优于无约束编辑,泛化感知选择优于仅修复当前轨迹。

#微软#Agent#AutoSaddler

05

技巧与观点

Tips7

21:40meng shao

长时运行Agent的工程解剖:开源Harness四板斧与审批门

本文基于TrueForge(TrueFoundry开源harness)上的研究型Agent案例,系统拆解长时运行Agent的工程要点。作者指出,当Agent从短演示走向长任务,决定成败的是包裹模型的运行时(Agent Harness)而非模型本身。一个可用Agent由模型、MCP工具、Skills、Sandbox四块积木组成,长时运行还需子Agent、上下文管理、审批检查点、持久会话。核心工程难点包括:渐进式披露避免上下文窗口被工具schema耗尽;Skills将规程与能力分离、按需加载;Sandbox双重隔离执行与上下文;上下文管理四板斧(渐进式披露、Code Mode、大结果外置、压缩);

#Agent#Harness#TrueForge

10:33meng shao

逆向重构 Grok Bot:44 万行 TS 还原闭源应用并加四扩展

开发者 @b_nnett 将编译后的闭源 Grok Bot 应用反推为约 44 万行可读 TypeScript(运行时)与 5.4 万行 React(渲染层),并在此基础上做了功能扩展,代码已开源。整体分层为:渲染层 → preload 窄桥 → Electron 主进程(设置/密钥/认证/窗口)→ coordinator(utilityProcess 托管,崩溃退避重启)→ host(推理、工具、MCP、turn 执行)。主进程被拆成依赖注入图,缺绑定即 fail-closed。新增四个扩展:1.

#Grok#逆向工程#Electron

05:35GitHub 博客(RSS)

GitHub 分享 LLM 上线前评估实践:从原型到生产

GitHub 博客分享其在 secret scanning 场景中评估 LLM 系统的实践经验,强调从原型到生产时评估问题的变化。文章提出三大要点:首先,从产品决策而非模型出发,明确评估要支持的业务目标,并将指标分为主要结果(如误报减少、精确率)、安全约束(如召回率)和运营护栏(延迟、成本、可靠性等),避免将指标等同对待。其次,将离线评估视为集成测试,在每次对提示词、模型、输入构造或系统逻辑做出有意义变更时重跑,并记录提示词版本、模型版本、数据集版本等,确保可重复性和可对比性。最后,建议一次只改变一个主要变量,以明确结果归因,并定期测试模型升级,因为更强的模型可能用更简单的提示词表现更好。

#GitHub#LLM评估#工程实践

16:44Avi Chawla

生产环境模型路由:按任务固定模型,而非按调用切换

生产环境中的模型路由,传统做法按意图分类,但同一任务内意图会变化,每次调用独立评分,缺乏上下文。若路由层中途切换模型,新模型需以冷缓存重建整个缓存。问题在于按调用路由,而非路由本身。常见解法是每个任务路由一次:首次调用正常路由,模型被固定到会话 ID,后续调用都走同一模型;任务变化时重置固定,重新路由。这被称为模型亲和性(model affinity),简单任务走廉价模型,困难任务走昂贵模型。开源项目 Plano 已实现该机制,提供 OpenAI 兼容端点,只需改 base URL,路由配置在 YAML 中定义。

#模型路由#模型亲和性#Plano

11:00meng shao

Web 质量审计 Skill:给 Agent 注入 Lighthouse

Addy Osmani 发布 Web 质量审计 Skill(web-quality-audit),为 Agent 注入一套 Lighthouse 风格的 Web 质量审计方法论,覆盖性能、可访问性、SEO、最佳实践与智能体浏览五个维度。工作流分五步:确定审计目标、采集实时基线、以运行时证据定位源码、分级修复、复测验证。核心是"测量认识论",强调证据优先于分数、先实测后读码、证据类型分层(CrUX 现场数据、一方 RUM、DevTools trace、Lighthouse 实验室跑分、静态代码检查)与可复现性纪律(关键结论至少跑 3 次取中位数)。

#Addy Osmani#Web 质量审计#Lighthouse

00:04eric zakariasson

让 Grok Bot 计划运行更持久的 6 个技巧

X 用户 ericzakariasson 分享了让 Grok Bot 计划运行更持久的 6 个实用技巧:1) 尽量使用事件触发(如 Slack、GitHub、reaction),而非定时 cron,避免空转;2) 指示 bot 在无法推进或停滞时立即通知你,以便人工介入纠偏;3) 优先使用 connector 而非浏览器操作,后者会产生大量截图和步骤,前者一次调用即可获取数据,更快更流畅;4) 保持技能(skills)精简,但写入真正能引导运行的细节,过于模糊会导致 bot 徘徊重试、成本增加,过于具体则需确保其正确性;

#Grok#Agent#效率优化

10:50Latent Space(RSS)

吴恩达重推 DeepLearning.ai 聚焦 AI 工程,列出四大核心技能

Latent Space 报道,吴恩达(Google Brain 和 Coursera 联合创始人)重新推出 DeepLearning.ai,将重心转向 AI 工程。该定位基于对超 1 万条招聘信息的分析、数十次结构化访谈及调查数据。吴恩达列出四项最重要的 AI 工程技能:构建和部署 AI 应用(理解 LLM、上下文工程、RAG、Agent 工作流,并用统计方法评估和治理系统);软件工程基础(理解权衡,避免盲目 vibe coding);使用编码 Agent(掌握其心智模型、局限、干预时机,协调多 Agent 并规避风险);塑造构建过程(具备产品感、业务和客户理解,推动项目落地)。

#吴恩达#AI工程#DeepLearning.ai

往期存档