OpenAI News(RSS)关联 9 源
OpenAI 发布 GPT-5.6:更强性能与按需能力
OpenAI 推出 GPT-5.6,该模型在每 token 智能、每美元性能以及按需能力方面均有提升,旨在应对最复杂的工作负载。
每早八时出报
AI · 模型 · 产业
新闻枢纽 · 日报
中文 AI 资讯
NEWSHUB DAILY
今日,SpaceXAI发布Grok 4.5,定位编码与Agent场景,以显著低于竞品的成本提供接近顶尖的性能,引发行业对模型性价比的重新审视。与此同时,OpenAI推出GPT-5.6、Meta公开1450亿美元AI资本支出计划,MiniMax启动19亿美元融资,AI算力竞赛与模型效率之争同步加速。
Latent Space(RSS)关联 8 源
xAI(SpaceXAI)正式发布Grok 4.5,定位为编码与Agent场景优化的前沿模型,强调性价比而非绝对基准领先。该模型参数量1.5T,是Grok 4.3的3倍。官方定价为输入$2/百万token、输出$6/百万token,缓存命中折扣75%,长上下文(超20万token)费用翻倍,上下文窗口为50万token(计划下周恢复至100万)。Cursor参与训练并称其为“迄今最强模型”,已集成至Grok Build、API、Cursor等平台。第三方评测机构Artificial Analysis显示,Grok 4.5在智能指数排名第4,编码Agent指数得分76,与GPT-5.5在Codex中持平,但成本显著更低:智能任务平均输出token约1.4万,比Opus 4.8低60%以上;编码Agent任务平均总token仅190万,远低于Fable 5的720万。马斯克称其“接近Opus 4.7但更快”。
OpenAI News(RSS)关联 9 源
OpenAI 推出 GPT-5.6,该模型在每 token 智能、每美元性能以及按需能力方面均有提升,旨在应对最复杂的工作负载。
IT之家(RSS)关联 7 源
Meta Platforms 今日正式向开发者开放 Muse Spark AI 模型 API,并发布升级版 Muse Spark 1.1,标志着 Meta 加入 AI 模型商业化竞争。Muse Spark 1.1 是 Meta 在编程和 AI Agent 任务方面能力最强的模型,具备编写调试代码、操作软件及调用外部工具、理解多模态内容、完成复杂多步骤任务等能力。美国开发者可通过 Meta Model API 公开预览版使用该模型,注册可获得 20 美元免费额度。定价为每百万输入 Token 1.25 美元,每百万输出 Token 4.25 美元,高于 GPT-5 mini 和 Claude Haiku 4.5,但低于 Claude Sonnet 4.6。Muse Spark 1.1 已在 Meta AI 应用和网页版中以 Thinking 模式上线,未来将逐步取代 Llama 系列模型。
MarkTechPost(RSS)关联 3 源
蚂蚁集团旗下 Robbyant 发布 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型,用于跨本体机器人操作。该模型基于 Qwen3-VL-4B-Instruct 视觉语言骨干,采用混合专家(MoE)架构的动作专家,并引入双查询蒸馏机制,结合深度预测和时序语义先验实现预测性动力学建模。训练数据包含约 6 万小时高质量数据(5 万小时机器人轨迹 + 1 万小时第一人称人类视频),覆盖 20 种机器人配置。模型使用 55 维规范动作空间统一不同本体,支持单臂、双臂、灵巧手、移动底座等。在 GM-100 通用双机械臂基准上,AgileX Cobot Magic 平台进步率/成功率 66.2/34.4,Galaxea R1Pro 平台 34.6/15.6,优于 π0.5 和上一代。在长时移动操作任务中,域内和域外设置均领先 π0.5。代码、权重和技术报告均以 Apache-2.0 协议开源。
量子位(RSS)关联 3 源
近日,全球首个专为具身智能设计的MoE(混合专家)视频模型正式开源。该模型由国内团队研发,旨在为机器人提供更高效的视频理解和生成能力,通过MoE架构实现多任务协同,降低计算成本。模型在机器人操作、导航等任务上表现出色,有望加速具身智能在工业、服务等场景的落地。开源代码和预训练权重已发布于GitHub,供研究者和开发者使用。
IT之家(RSS)关联 3 源
科技媒体 The Decoder 报道,Artificial Analysis 新增 6 个行业指数测试,基于 O*NET 职业分类体系,针对金融、法律、医疗、战略、工程、经济学场景,按技能频率分配权重推出 8 项能力指数。Anthropic 的 Claude Fable 5(备选 Opus 4.8)在所有 8 项指标中均列第一;Claude Opus 4.8 (max) 六项第二,剩余两项第二由 OpenAI GPT-5.5 (xhigh) 获得。开放权重模型中,GLM-5.2 (max) 在 5 个行业指数领先,工程基准排名第五。成本方面,Claude Fable 5 在战略与运营指数中每任务成本 3.48 美元,比 DeepSeek V4 Pro max(0.03 美元)高 100 多倍,性能仅领先 12 分。DeepSeek V4 Flash (max) 所有指数任务成本低于 0.04 美元,得分中游。
IT之家(RSS)
微软今日发布 TypeScript 7.0 正式版,这是自 2012 年诞生以来最重大的底层重构。编译器使用 Go 框架重写,借助原生代码速度与共享内存并行,编译和类型检查速度相比 6.0 平均提升约 10 倍。在大型开源代码库上测试显示,编译时间显著缩短,内存需求减少。打开带有错误的文件从约 17.5 秒降至不到 1.3 秒。TypeScript 7.0 未附带 API,预计 7.1 将提供新 API。微软发布了兼容性包 @typescript/typescript6,支持 6.0 与 7.0 并行运行。TypeScript 7 可通过 npm 安装。
Anthropic Newsroom(web_list)关联 3 源
Anthropic 于 2026 年 7 月 9 日宣布,在 Claude 中推出 beta 版“反思”功能,帮助用户追踪和可视化其与 Claude 的交互方式。该功能位于网页版或桌面版 Claude 的设置中,可查看过去 1、3、6 或 12 个月的聊天活动摘要,包括关键主题、使用模式和任务类型。未来还将增加使用时长视图。反思功能会定期提出引导性问题,如“即使 Claude 能更快完成,你仍想自己做什么?”,并允许用户与 Claude 讨论。用户还可设置静音时段或定时提醒休息。该功能基于 4D AI 素养框架(委托、描述、辨别、勤勉)提供技能提升建议。隐私方面,不涉及隐身聊天、健康集成工具对话及底层文件,且反思数据仅用于该功能。目前面向已开启记忆功能的 Free、Pro 和 Max 用户开放。
Serenity关联 3 源
一份Meta内部备忘录被公开,显示其AI投入持续加速:已与三星和闪迪签署长期协议(LTA)采购内存,与住友电工签署光纤LTA;预计今年部署7GW计算基础设施,2027年翻倍;今年资本支出高达1450亿美元;计划到2027年每约六个月推出一款新芯片。
The Verge AI(RSS)关联 4 源
OpenAI 宣布将关闭其名为 Atlas 的 ChatGPT 浏览器,该浏览器可代表用户执行任务。Atlas 于去年 10 月发布,但 OpenAI 在今日的 ChatGPT Work 更新中确认将“停用”Atlas,目标停用日期为 8 月 9 日。近几个月来,OpenAI 还关闭了视频生成应用 Sora,并暂停了 ChatGPT“成人模式”计划,以集中精力减少“支线任务”,并在生产力功能上追赶 Anthropic。
IT之家(RSS)关联 2 源
据路透社查阅的Meta内部备忘录,Meta计划最早于2025年9月开始量产其自研AI芯片Iris,作为将整体AI算力提升至14吉瓦(GW)计划的一部分。Iris芯片属于Meta自研MTIA四代产品路线图,测试仅用六周且未发现重大问题,标志着项目取得积极进展。Meta与博通合作设计,由台积电制造,旨在降低AI算力成本并减少对英伟达和AMD的依赖,但并非完全取代GPU,而是用于补充加速训练和推理任务。Meta计划从2025年到2027年,每约六个月推出一款新AI芯片,节奏快于行业常规。备忘录还显示,Meta预计2025年AI基础设施投资最高达1450亿美元,并已与三星电子、闪迪、住友电工等签订长期供应协议,以保障内存、闪存和光纤设备供应。
The Verge AI(RSS)关联 3 源
OpenAI的AGI负责人Fidji Simo宣布因神经免疫疾病辞去全职职务,转为兼职顾问。她于今年4月刚担任AGI负责人,随后因健康问题休假。此前,OpenAI首席运营官Brad Lightcap已离职专注“特殊项目”,首席营销官Kate Rouch也因健康原因离职,计划康复后回归担任更窄范围的职务。
华尔街见闻(RSS)
7月9日,MiniMax在限售股解禁首日股价暴跌逾18%后,紧急启动上市以来最大规模再融资,计划通过配售新股及零息可转债筹集约19亿美元,接近其1月IPO净募资的三倍。配股价格为每股268港元,较当日收盘价折让约9.9%;同步发行65亿港元零息可转债,转换溢价25%。公司正研发参数规模达2.7万亿的新一代大模型M3 Pro,并计划搭建首个国产算力集群,资金需求迫切。管理层给出2025年底ARR达1亿美元、2026年底达10亿美元的目标,但旗舰模型M3发布后不久即降价50%,引发市场疑虑。此次融资被视为对市场信心的压力测试。
华尔街见闻(RSS)
初创公司PrismML宣称,已成功将270亿参数的AI大模型压缩至可在iPhone 17 Pro上本地运行,创下移动端AI模型规模新纪录。该模型基于阿里巴巴的开源模型Qwen 3.6,通过数学方法将体积从约54GB压缩至不足4GB,压缩比超90%,且声称性能不受影响。PrismML是加州理工学院的衍生公司,其CEO Babak Hassibi是该校教授,相关专利由Caltech独家授权。该公司今年早些时候完成1625万美元种子轮融资,Khosla Ventures参与投资。据知情人士透露,苹果已与PrismML就技术使用举行会谈。苹果此前在设备端AI模型压缩中曾遭遇性能下滑,而PrismML的技术可能成为关键拼图。PrismML计划继续将更大规模模型压缩至设备端,包括万亿参数级别。
IT之家(RSS)
华为智能驾驶解决方案产品线总裁李文广在采访中透露,从技术上讲,明年高速场景可进入L3自动驾驶时代,今年将进行试点并推动常态化准入。下半年部分高端车型将为高速L3进行硬件预埋。李文广表示,华为正与三大保险公司合作推出泊车及智驾权益,并强调安全优先。华为今年在自动驾驶领域投入超100亿元,明年将超200亿元。对于特斯拉FSD入华,李文广表示欢迎,认为可同场竞技并推广订阅模式。此外,华为乾崑智驾ADS系统车辆已达170万辆,预计年底增至300万辆,其辅助驾驶模式下事故率远低于全国平均水平。
Rohan Paul
本文指出,更强的AI Agent不仅来自更大的模型,更来自围绕模型的系统(即“harness”)的改进。harness包括决定模型看到什么、能使用什么工具、记住什么以及哪些动作被检查的系统。当前许多AI Agent的评估错误地将行为归因于模型本身,而忽略了记忆、工具、上下文、路由、检查和权限等外围系统的影响。作者认为,进步应来自扩展harness的三个关键部分:更好的上下文控制、更可信的记忆、以及更好的工具或辅助Agent路由。长上下文不等于可用上下文,记忆不等于可信记忆,拥有许多工具不等于知道何时使用它们。过时的笔记可能比没有笔记更危险,因为它让Agent在需要重新检查世界时过于自信。专门的子Agent也可能静默失败,如果其输出听起来合理但后续层未验证其真实性。因此,一次性基准测试分数越来越显得单薄。两个Agent可能达到相同的最终答案,但一个消耗更多token、进行更冒险的工具调用、携带损坏的记忆,或仅凭偶然成功。下一个前沿不仅是扩展机器内部的思维,更是扩展其周围的纪律。