跳到主内容
NewsHub

日报

LIVE每早八时发报 · 更新于 00:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 16 事件 · 2 一手信源 · 覆盖 9 家信源
今日头条 · Lead

Grok 4.5发布:以性价比挑战顶级模型

今日,SpaceXAI发布Grok 4.5,定位编码与Agent场景,以显著低于竞品的成本提供接近顶尖的性能,引发行业对模型性价比的重新审视。与此同时,OpenAI推出GPT-5.6、Meta公开1450亿美元AI资本支出计划,MiniMax启动19亿美元融资,AI算力竞赛与模型效率之争同步加速。

Latent Space(RSS)关联 8

SpaceXAI发布Grok 4.5,定位编码与Agent旗舰模型

xAI(SpaceXAI)正式发布Grok 4.5,定位为编码与Agent场景优化的前沿模型,强调性价比而非绝对基准领先。该模型参数量1.5T,是Grok 4.3的3倍。官方定价为输入$2/百万token、输出$6/百万token,缓存命中折扣75%,长上下文(超20万token)费用翻倍,上下文窗口为50万token(计划下周恢复至100万)。Cursor参与训练并称其为“迄今最强模型”,已集成至Grok Build、API、Cursor等平台。第三方评测机构Artificial Analysis显示,Grok 4.5在智能指数排名第4,编码Agent指数得分76,与GPT-5.5在Codex中持平,但成本显著更低:智能任务平均输出token约1.4万,比Opus 4.8低60%以上;编码Agent任务平均总token仅190万,远低于Fable 5的720万。马斯克称其“接近Opus 4.7但更快”。

#xAI#SpaceXAI#Grok 4.5

01

模型发布/更新

Model Releases5

IT之家(RSS)关联 7

Meta 向开发者开放 Muse Spark AI 模型 API

Meta Platforms 今日正式向开发者开放 Muse Spark AI 模型 API,并发布升级版 Muse Spark 1.1,标志着 Meta 加入 AI 模型商业化竞争。Muse Spark 1.1 是 Meta 在编程和 AI Agent 任务方面能力最强的模型,具备编写调试代码、操作软件及调用外部工具、理解多模态内容、完成复杂多步骤任务等能力。美国开发者可通过 Meta Model API 公开预览版使用该模型,注册可获得 20 美元免费额度。定价为每百万输入 Token 1.25 美元,每百万输出 Token 4.25 美元,高于 GPT-5 mini 和 Claude Haiku 4.5,但低于 Claude Sonnet 4.6。Muse Spark 1.1 已在 Meta AI 应用和网页版中以 Thinking 模式上线,未来将逐步取代 Llama 系列模型。

#Meta#Muse Spark#模型发布

MarkTechPost(RSS)关联 3

蚂蚁集团开源 LingBot-VLA 2.0 机器人基础模型

蚂蚁集团旗下 Robbyant 发布 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型,用于跨本体机器人操作。该模型基于 Qwen3-VL-4B-Instruct 视觉语言骨干,采用混合专家(MoE)架构的动作专家,并引入双查询蒸馏机制,结合深度预测和时序语义先验实现预测性动力学建模。训练数据包含约 6 万小时高质量数据(5 万小时机器人轨迹 + 1 万小时第一人称人类视频),覆盖 20 种机器人配置。模型使用 55 维规范动作空间统一不同本体,支持单臂、双臂、灵巧手、移动底座等。在 GM-100 通用双机械臂基准上,AgileX Cobot Magic 平台进步率/成功率 66.2/34.4,Galaxea R1Pro 平台 34.6/15.6,优于 π0.5 和上一代。在长时移动操作任务中,域内和域外设置均领先 π0.5。代码、权重和技术报告均以 Apache-2.0 协议开源。

#蚂蚁集团#Robbyant#LingBot-VLA

量子位(RSS)关联 3

全球首个具身专属MoE视频模型开源

近日,全球首个专为具身智能设计的MoE(混合专家)视频模型正式开源。该模型由国内团队研发,旨在为机器人提供更高效的视频理解和生成能力,通过MoE架构实现多任务协同,降低计算成本。模型在机器人操作、导航等任务上表现出色,有望加速具身智能在工业、服务等场景的落地。开源代码和预训练权重已发布于GitHub,供研究者和开发者使用。

#具身智能#MoE#视频模型

IT之家(RSS)关联 3

Claude Fable 5 横扫行业指数,成本超 DeepSeek V4 百倍

科技媒体 The Decoder 报道,Artificial Analysis 新增 6 个行业指数测试,基于 O*NET 职业分类体系,针对金融、法律、医疗、战略、工程、经济学场景,按技能频率分配权重推出 8 项能力指数。Anthropic 的 Claude Fable 5(备选 Opus 4.8)在所有 8 项指标中均列第一;Claude Opus 4.8 (max) 六项第二,剩余两项第二由 OpenAI GPT-5.5 (xhigh) 获得。开放权重模型中,GLM-5.2 (max) 在 5 个行业指数领先,工程基准排名第五。成本方面,Claude Fable 5 在战略与运营指数中每任务成本 3.48 美元,比 DeepSeek V4 Pro max(0.03 美元)高 100 多倍,性能仅领先 12 分。DeepSeek V4 Flash (max) 所有指数任务成本低于 0.04 美元,得分中游。

#Anthropic#Claude#DeepSeek

02

产品发布/更新

Products2

IT之家(RSS)

TypeScript 7.0 正式发布,编译性能提升约10倍

微软今日发布 TypeScript 7.0 正式版,这是自 2012 年诞生以来最重大的底层重构。编译器使用 Go 框架重写,借助原生代码速度与共享内存并行,编译和类型检查速度相比 6.0 平均提升约 10 倍。在大型开源代码库上测试显示,编译时间显著缩短,内存需求减少。打开带有错误的文件从约 17.5 秒降至不到 1.3 秒。TypeScript 7.0 未附带 API,预计 7.1 将提供新 API。微软发布了兼容性包 @typescript/typescript6,支持 6.0 与 7.0 并行运行。TypeScript 7 可通过 npm 安装。

#微软#TypeScript#编译器

Anthropic Newsroom(web_list)关联 3

Claude 推出使用反思功能,帮助用户优化 AI 使用习惯

Anthropic 于 2026 年 7 月 9 日宣布,在 Claude 中推出 beta 版“反思”功能,帮助用户追踪和可视化其与 Claude 的交互方式。该功能位于网页版或桌面版 Claude 的设置中,可查看过去 1、3、6 或 12 个月的聊天活动摘要,包括关键主题、使用模式和任务类型。未来还将增加使用时长视图。反思功能会定期提出引导性问题,如“即使 Claude 能更快完成,你仍想自己做什么?”,并允许用户与 Claude 讨论。用户还可设置静音时段或定时提醒休息。该功能基于 4D AI 素养框架(委托、描述、辨别、勤勉)提供技能提升建议。隐私方面,不涉及隐身聊天、健康集成工具对话及底层文件,且反思数据仅用于该功能。目前面向已开启记忆功能的 Free、Pro 和 Max 用户开放。

#Anthropic#Claude#功能更新

03

行业动态

Industry7

The Verge AI(RSS)关联 4

OpenAI 关闭 ChatGPT 浏览器 Atlas

OpenAI 宣布将关闭其名为 Atlas 的 ChatGPT 浏览器,该浏览器可代表用户执行任务。Atlas 于去年 10 月发布,但 OpenAI 在今日的 ChatGPT Work 更新中确认将“停用”Atlas,目标停用日期为 8 月 9 日。近几个月来,OpenAI 还关闭了视频生成应用 Sora,并暂停了 ChatGPT“成人模式”计划,以集中精力减少“支线任务”,并在生产力功能上追赶 Anthropic。

#OpenAI#ChatGPT#Atlas

IT之家(RSS)关联 2

Meta计划9月量产自研AI芯片Iris,明年AI算力目标14吉瓦

据路透社查阅的Meta内部备忘录,Meta计划最早于2025年9月开始量产其自研AI芯片Iris,作为将整体AI算力提升至14吉瓦(GW)计划的一部分。Iris芯片属于Meta自研MTIA四代产品路线图,测试仅用六周且未发现重大问题,标志着项目取得积极进展。Meta与博通合作设计,由台积电制造,旨在降低AI算力成本并减少对英伟达和AMD的依赖,但并非完全取代GPU,而是用于补充加速训练和推理任务。Meta计划从2025年到2027年,每约六个月推出一款新AI芯片,节奏快于行业常规。备忘录还显示,Meta预计2025年AI基础设施投资最高达1450亿美元,并已与三星电子、闪迪、住友电工等签订长期供应协议,以保障内存、闪存和光纤设备供应。

#Meta#AI芯片#Iris

The Verge AI(RSS)关联 3

OpenAI AGI负责人Fidji Simo因病离职转任顾问

OpenAI的AGI负责人Fidji Simo宣布因神经免疫疾病辞去全职职务,转为兼职顾问。她于今年4月刚担任AGI负责人,随后因健康问题休假。此前,OpenAI首席运营官Brad Lightcap已离职专注“特殊项目”,首席营销官Kate Rouch也因健康原因离职,计划康复后回归担任更窄范围的职务。

#OpenAI#人事变动#AGI

华尔街见闻(RSS)

MiniMax解禁日启动19亿美元融资,算力军备竞赛加码

7月9日,MiniMax在限售股解禁首日股价暴跌逾18%后,紧急启动上市以来最大规模再融资,计划通过配售新股及零息可转债筹集约19亿美元,接近其1月IPO净募资的三倍。配股价格为每股268港元,较当日收盘价折让约9.9%;同步发行65亿港元零息可转债,转换溢价25%。公司正研发参数规模达2.7万亿的新一代大模型M3 Pro,并计划搭建首个国产算力集群,资金需求迫切。管理层给出2025年底ARR达1亿美元、2026年底达10亿美元的目标,但旗舰模型M3发布后不久即降价50%,引发市场疑虑。此次融资被视为对市场信心的压力测试。

#MiniMax#融资#算力

华尔街见闻(RSS)

苹果设备端AI新突破:270亿参数模型可本地运行

初创公司PrismML宣称,已成功将270亿参数的AI大模型压缩至可在iPhone 17 Pro上本地运行,创下移动端AI模型规模新纪录。该模型基于阿里巴巴的开源模型Qwen 3.6,通过数学方法将体积从约54GB压缩至不足4GB,压缩比超90%,且声称性能不受影响。PrismML是加州理工学院的衍生公司,其CEO Babak Hassibi是该校教授,相关专利由Caltech独家授权。该公司今年早些时候完成1625万美元种子轮融资,Khosla Ventures参与投资。据知情人士透露,苹果已与PrismML就技术使用举行会谈。苹果此前在设备端AI模型压缩中曾遭遇性能下滑,而PrismML的技术可能成为关键拼图。PrismML计划继续将更大规模模型压缩至设备端,包括万亿参数级别。

#苹果#PrismML#设备端AI

IT之家(RSS)

华为李文广:明年高速L3自动驾驶技术上可实现,欢迎特斯拉FSD入华

华为智能驾驶解决方案产品线总裁李文广在采访中透露,从技术上讲,明年高速场景可进入L3自动驾驶时代,今年将进行试点并推动常态化准入。下半年部分高端车型将为高速L3进行硬件预埋。李文广表示,华为正与三大保险公司合作推出泊车及智驾权益,并强调安全优先。华为今年在自动驾驶领域投入超100亿元,明年将超200亿元。对于特斯拉FSD入华,李文广表示欢迎,认为可同场竞技并推广订阅模式。此外,华为乾崑智驾ADS系统车辆已达170万辆,预计年底增至300万辆,其辅助驾驶模式下事故率远低于全国平均水平。

#华为#自动驾驶#L3

04

论文研究

Research1

Rohan Paul

更强AI Agent来自系统扩展而非仅模型扩展

本文指出,更强的AI Agent不仅来自更大的模型,更来自围绕模型的系统(即“harness”)的改进。harness包括决定模型看到什么、能使用什么工具、记住什么以及哪些动作被检查的系统。当前许多AI Agent的评估错误地将行为归因于模型本身,而忽略了记忆、工具、上下文、路由、检查和权限等外围系统的影响。作者认为,进步应来自扩展harness的三个关键部分:更好的上下文控制、更可信的记忆、以及更好的工具或辅助Agent路由。长上下文不等于可用上下文,记忆不等于可信记忆,拥有许多工具不等于知道何时使用它们。过时的笔记可能比没有笔记更危险,因为它让Agent在需要重新检查世界时过于自信。专门的子Agent也可能静默失败,如果其输出听起来合理但后续层未验证其真实性。因此,一次性基准测试分数越来越显得单薄。两个Agent可能达到相同的最终答案,但一个消耗更多token、进行更冒险的工具调用、携带损坏的记忆,或仅凭偶然成功。下一个前沿不仅是扩展机器内部的思维,更是扩展其周围的纪律。

#Agent#系统扩展#Harness

往期存档