跳到主内容
NewsHub

日报

LIVE每早八时发报 · 更新于 00:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 17 事件 · 覆盖 5 家信源
今日头条 · Lead

Anthropic发现Claude内部推理空间,打开AI“黑箱”

Anthropic研究人员首次定位Claude内部推理空间J-Space,可观察并引导模型行为,为可解释性开辟新方向。英伟达Kyber机架延迟至2028年,为AMD等竞争者创造窗口;腾讯混元Hy3开源降价,性能比肩大模型。行业持续演进,合规与安全挑战同步凸显。

上海证券报关联 5

腾讯发布新一代AI大模型混元Hy3,开源并降价

7月6日,腾讯正式发布新一代AI大模型混元Hy3。相较preview版本,Hy3在推理、智能体、长上下文等任务上显著进步,比肩国内外更大尺寸旗舰模型(参数规模为Hy3的2-5倍)。Hy3已在WorkBuddy、CodeBuddy、元宝、Marvis、ima等多个业务接入,API已在腾讯云TokenHub上线,多个海外API平台也将陆续接入。自preview上线以来,日均Token消耗量增加20倍。Hy3基于preview版本提升后训练数据质量和多样性,扩大RL算力规模。在内部270位专家盲测中,Hy3(均分2.67/4)优于GLM5.1(均分2.51/4)。Hy3还改善了输出格式和工具调用稳定性、知识常识和抗幻觉能力(幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%)、复杂上下文承接与多轮意图保持能力(多轮问题率从17.4%降至7.9%,MRCR从42.9%升至75.1%)。Hy3已以Apache 2.0协议在GitHub、HuggingFace、ModelScope、GitCode开源。API价格降低,输入(命中缓存)0.25元/百万Tokens,输入1元,输出4元。

#腾讯#混元Hy3#模型发布

01

模型发布/更新

Model Releases1

meng shao

Claude新模型工具调用变差,工程师深挖根因

Flask/Sentry 资深工程师 @mitsuhiko 发现,Claude Opus 4.8 与 Sonnet 5 在调用非主流工具 schema(如 Pi 的嵌套 edits[] 数组)时,会凭空添加 requireUnique、type、id 等字段,导致校验失败。该问题仅在长 agentic 历史下复现(约 20%),去掉 thinking 块可减半失败率,开启 strict 模式则消失。作者分析认为,Anthropic 模型工具调用本质是带标记的文本生成,嵌套 JSON 由模型手写,失败点位于熵最高的位置。根因可能是 RL 后训练对 Claude Code 的 forgiving harness 过拟合:Claude Code 的 edit 工具为扁平结构,且客户端极度宽容(接受参数别名、过滤未知键、自动重试),导致模型学到“edit 可多带可选字段”的先验,但在其他 schema 下随机编造字段名。与 OpenAI 的 harmony 路线(显式 JSON 约束采样)形成对比。结论:工具 schema 不是中性契约,越强的模型可能越难对抗后训练分布,harness 开发者应开启 strict 模式或采用约束解码。

#Anthropic#Claude#工具调用

02

产品发布/更新

Products2

宝玉

Anthropic工程师:砍掉80%提示词,Claude Code新范式

Anthropic Claude Code 工程师 Thariq Shihipar 在 AI Engineer World's Fair 上分享 Fable 5 的实践经验。核心观点包括:模型能力存在“能力悬余”,需通过工具释放;Claude Code 砍掉 80% 系统提示词,因为 Fable 级别模型自身想象力优于示例,新做法是给上下文而非约束。他还提出“找到你的未知”方法论:让模型做盲区扫描、生成多个原型、主动提问、参考其他代码库、记录决策点并反向考问开发者。演讲后半段反思 AI 编程带来的得失,建议开发者“打破常规”,重新审视好、快、省的取舍。

#Anthropic#Claude Code#Fable 5

meng shao

Google 开源 Agent Skills:将工程纪律固化为 AI 工作流

Google 工程与开发者关系负责人 Addy Osmani 开源了 Agent Skills 项目(GitHub 69.7k 星),旨在将资深工程师的生产级工程纪律固化为 AI 编码代理可机械执行、强制验证、跨工具复用的工作流。项目针对 AI 编码代理默认走最短路径、跳过规格与测试等问题,提供六阶段生命周期(DEFINE→PLAN→BUILD→VERIFY→REVIEW→SHIP)和 24 个技能,涵盖元技能、定义、计划、构建、验证、评审、发布等环节。其中 doubt-driven-development 针对高代价决策进行对抗性复盘,source-driven-development 要求框架决策引用官方文档,deprecation-and-migration 将代码弃用作为独立技能。项目标注了来自《Software Engineering at Google》和 Google 工程实践指南的方法论。

#Google#Agent Skills#AI编码

03

行业动态

Industry8

华尔街见闻(RSS)关联 4

英伟达Kyber NVL144机架延迟超12个月至2028年

7月6日,半导体研究机构SemiAnalysis在X平台披露,英伟达Kyber NVL144机架架构因PCB中板制造困难,延迟超过12个月至2028年。该中板采用78层M9级覆铜板+石英布+PTFE混合材料,线宽线距≤25μm,制造难度极高。替代方案NVL72x2因云服务商反对被取消。NVL576因CPO挑战也可能延迟或小批量出货。此外,4芯片版Rubin Ultra被取消,仅保留2芯片版。英伟达将通过增加Oberon Rubin机架销售弥补算力缺口。SemiAnalysis认为,这为AMD MI500X或TPUv8i等竞争对手在规模扩展能力上超越Rubin Ultra留下空间。

#英伟达#Kyber#NVL144

Rohan Paul关联 2

字节跳动与阿里巴巴关停拟人化AI伴侣功能

字节跳动和阿里巴巴在中国新规生效前,关停旗下AI产品的拟人化伴侣功能。豆包和通义千问此前允许用户创建命名助手、导师、角色及情感陪伴型AI。中国新规针对模仿人类个性、进行持续情感交互的AI服务,旨在区分有用自动化与建立情感依赖的软件。豆包宣布其智能体功能将于7月15日下线,相关数据在10月15日后不可见;通义千问将先禁用拟人化和用户创建的智能体,随后于7月15日移除更广泛的智能体服务。用户反弹表明这些产品已成为部分人的情感基础设施。

#字节跳动#阿里巴巴#AI监管

小互关联 5

美国富裕家庭弃传统学校,年付7.5万美元上AI私校

美国富裕家庭正将孩子从传统学校转入Alpha School等AI私校,该校采用每天2小时AI辅导加项目制工坊模式,学费最高每年7.5万美元。2025年新增8个校区,2026年秋季计划再开近24个。两份研究(覆盖超2.6万名学生的中国研究和UC Berkeley研究)显示,用AI写作业分数更高,但考试成绩最高下降24%,81%的长期用户将思考直接甩给AI。传统学校目前缺乏应对策略,而Alpha School瞄准了教学生“善用AI”而非“被AI代替思考”的空白。

#Alpha School#AI教育#美国

IT之家(RSS)关联 3

三星电子Q2营业利润预计暴涨18倍,AI存储芯片需求持续引爆

据路透社报道,受AI产业扩张拉动存储芯片供给紧张、价格走高影响,三星电子第二季度营业利润预计同比暴涨约18倍,达86万亿韩元(约3786.58亿元人民币),连续三个季度刷新纪录。分析师指出,存储芯片市场供给短缺至少持续至明年,不仅HBM需求强劲,普通DRAM和NAND闪存需求也大幅走强。三星是英伟达、谷歌、苹果等核心供应商,第二季度DRAM和NAND闪存平均售价环比分别大涨44%和53%。但分析师提示,若三星计提员工奖金准备金超出预期,二季度业绩可能不及预期。此外,AI基础设施投资落地不及预期是存储芯片牛市最大隐患。

#三星电子#存储芯片#AI

Import AI(RSS)

Fable 编写 GPU 内核,AI 自动化能力提升

Import AI 第464期报道了多项 AI 进展:Fable 在 KernelBench-Mega 基准上编写了首个最快的 megakernel,实现 18.71 倍加速,优于其他模型;CAIS 和 Scale Labs 的远程劳动指数显示,AI 系统在在线自由职业项目上的成功率从 2025 年 10 月的 2.5% 升至 2026 年 7 月的 16.1%,前沿模型如 Fable 5 达到 16.1%;OSWORLD 2.0 基准发布,包含 108 个长时任务,中位数耗时 1.6 小时,当前最强模型 Claude Opus 4.8 仅达 20.6% 准确率,但性能预计将快速提升。这些进展表明 AI 在经济相关任务上的自动化能力正在加速。

#Fable#KernelBench#远程劳动指数

华尔街见闻(RSS)

模型路由器成降本新趋势,企业AI成本最高降97%

在AI使用成本持续攀升的背景下,“模型路由器”技术正加速渗透企业市场。其核心逻辑是为任务自动匹配合适而非最贵的模型,在效果基本不减的前提下大幅压缩Token支出。这推动企业从“默认调用最强模型”转向“按任务分层调度”。产业层面,模型路由器正从工具型产品向基础设施级组件跃迁,科技大厂和AI平台公司加速布局。头部企业降本实践显示,Palantir的Evolve AI路由系统在某些案例中使推理成本下降高达97%;建筑公司McCarthy Building的AI token使用量同比下降约60%。Databricks的Unity AI Gateway已在内部广泛使用。资本市场也迅速跟进,模型路由平台OpenRouter在4月完成1.2亿美元融资,其路由策略中约三分之一请求分配至Google低成本模型,仅约10%流向OpenAI较强模型。AI编程公司Cognition也推出路由系统,在编程基准测试中接近前沿模型表现,成本下降约35%。

#模型路由器#降本#OpenRouter

IT之家(RSS)

中央网信办整治AI应用乱象,清理600余万条信息

中央网信办自2026年4月启动“清朗·整治AI应用乱象”专项行动,聚焦未履行大模型备案、AI平台安全审核不足、数据投毒、生成内容标识缺失等问题。第一阶段累计处置违规AI产品1.4万余款,清理违法违规信息600余万条,处置账号2.6万余个,下架违规AI商品1300余个、违规开源数据集9个。各地网信部门采取针对性措施,如北京建立联动工作机制,上海升级举报机制,浙江优化模型审核能力等。重点平台加强管控:华为在应用商店增加AI备案和标识审核;阿里巴巴完善数字指纹比对与关键词拦截;智谱构建多模态审核模型;稀宇识别阻断恶意行为;DeepSeek嵌入异常检测算法。下一步将聚焦虚假信息、不良内容、假冒仿冒、侵害未成年人权益、网络水军等问题开展第二阶段工作。

#中央网信办#AI监管#合规

云头条

Meta 建设超 1GW AI 集群,投入数千亿美元

Meta CEO 扎克伯格宣布正在建设名为 Prometheus 的超大规模 AI 集群,功率超过 1 GW,计划 2026 年上线,主要用于训练。此外,Meta 还在推进 Hyperion 项目,未来可扩展至 5 GW,并计划建设多个“titan clusters”。扎克伯格表示,Meta 将在 AI 基础设施上投入数千亿美元,资金来自核心广告业务(上一财年营收约 1650 亿美元)。Meta 已成立 Superintelligence Labs,重组 AI 业务,并通过高薪争夺顶级 AI 人才。扎克伯格认为,其核心工作是集中人才、资本和基础设施,让研究团队拥有足够资源密度。

#Meta#AI基建#算力集群

04

论文研究

Research2

elvis

Anthropic 发现 Claude 内部推理空间 J-Space

Anthropic 发布重要研究,声称发现 Claude 模型内部存在一个名为 J-Space 的推理空间,该空间在训练中自然涌现,不同于思维链或草稿板。J-Space 提供了一个窗口,可观察 Claude 如何内部推理:信息被持有、组合并在模型不同部分传递。研究人员可以读取该空间,并通过修改它来引导模型行为。这一发现首次让研究者能够直接指向模型内部进行推理的具体位置,而非仅从输出文本猜测。这为可解释性开辟了新方向,可能实现更高级的推理能力,并改进模型审计、安全护栏和异常行为检测。

#Anthropic#Claude#可解释性

Rohan Paul

DeepMind论文警告:AI代理面临6种新型攻击

Google DeepMind发布论文,首次系统分类了针对自主AI代理的6种攻击类型。恶意网站可向AI代理展示人类不可见的隐藏内容,包括:HTML注释或白底白字中的指令、图像像素隐写术、PDF或元数据中的覆盖命令、跨会话持久化内存投毒、目标劫持以及多代理场景下的级联攻击。论文指出,AI代理的安全问题不仅在于模型本身,更在于其读取的环境——网络本身可被武器化。在基准测试中,隐藏提示注入在高达86%的场景中部分控制代理,子代理劫持成功率58-90%,数据窃取攻击在五种不同代理架构上成功率超过80%。若代理使用RAG或持久内存,投毒可潜伏在语料库中后续激活,低于0.1%的数据污染即可实现超过80%的攻击成功率。

#Google DeepMind#AI安全#自主代理

往期存档