跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 25 事件 · 覆盖 8 家信源
今日头条 · Lead

OpenAI大幅降价,匿名模型技术指纹指向智谱新旗舰

今日AI应用层迎来价格调整与竞品试探的双重变动。OpenAI宣布未来三个月内下调GPT-5.6 Sol API及积分价格超20%,意在降低开发者门槛并优化推理效率;同期匿名模型ox-alpha在编程基准中超越GPT-5.6,技术特征高度匹配智谱GLM-5架构,预示多模态旗舰迭代节奏加快。底层基建与资本端同样承压,英伟达加速绑定电力与数据供应链,博通拟发行千亿美元表外债务锁定芯片产能,凸显算力扩张背后的隐性财务风险。大模型竞争正从单一参数比拼转向商业化降本与生态绑定的深水区。

17:13华尔街见闻(RSS)关联 2

匿名模型ox-alpha编程超越GPT-5.6,技术特征指向智谱未发布新模型

独立研究人员Ben Davis测试发现OpenRouter上线的匿名模型stealth/ox-alpha在部分编程基准中表现优异。该模型支持文本、图像和视频输入,上下文窗口达104.8万token。通过视频编码器采样方式、分词器Token计数及音频拒绝行为等技术指纹比对,Davis认为其高度匹配智谱GLM-5系列架构,推测为下一代多模态旗舰。目前智谱尚未官方确认,但免费访问窗口预计持续至8月27日。

#智谱#模型发布#GLM-5

01

模型发布/更新

Model Releases5

03:34OpenAI

OpenAI宣布GPT-5.6 Sol API及积分价格下调超20%

OpenAI在X平台发布消息,为持续推动能力前沿并提升效率,决定在未来三个月内将GPT-5.6 Sol的API调用费用与积分价格下调超过20%。此次降价旨在降低开发者使用最新模型的成本门槛,同时体现公司在优化推理效率方面的进展。该优惠措施具有明确的时间窗口,为期三个月,适用于所有使用该特定模型版本的客户。

#OpenAI#GPT-5.6 Sol#API降价

21:49Rohan Paul

Google DeepMind利用AlphaEvolve优化矩阵乘法理论界

Google DeepMind团队利用AI系统AlphaEvolve改进了矩阵乘法指数ω的最优理论上界,将记录从ω < 2.371339提升至ω < 2.371177。该提升幅度与过去40年多数改进相当。研究团队基于组合损失分析框架,使用JAX和并行张量操作重构优化流程,支持递归层级从3级扩展至4级,可优化参数规模由约2.5万激增至700万。其中梯度下降贡献了约0.97×10^-4的改善,而AlphaEvolve通过修改优化代码进一步提升了约1.62×10^-4。最终结果通过精确有理算术进行了严格验证。

#Google DeepMind#AlphaEvolve#矩阵乘法

02:09Rohan Paul

TARS发布具身原生基础模型AWE 3.5

TARS Robotics发布具身原生基础模型AI World Engine (AWE) 3.5,采用“Born as One”架构,将动作、感知、几何与触觉整合于单一模型。训练包含双先验预训练与World Engine驱动的后训练:前者赋予物理规律理解,后者通过预测未来状态优化决策。该模型宣称具备几分钟级长视界闭环推理能力,任务执行效率约为PI0.5的两倍,旨在实现跨任务、环境与机器人本体的泛化。

#TARS Robotics#具身智能#基础模型

17:21Teortaxes▶️ (DeepSeek 推特🐋铁粉 2023 – ∞)

Anthropic发布V4-vision-exp:单图117-384 token

Anthropic 发布了视觉模型版本 V4-vision-exp。该模型每张图像消耗 117 至 384 个 token,并沿用 V4-Flash 的定价标准。尽管其综合性能可能并非市场最佳,但具备极高的推理速度与成本效率优势。这一特性使其在处理大规模视觉任务时极具竞争力,有望对现有高成本推理基础设施构成挑战。

#Anthropic#Claude#模型发布

05:33Elon Musk

X.ai 发布 Grok 4.6 模型

X.ai 官方在 X 平台宣布推出新一代大语言模型 Grok 4.6。官方建议用户通过其自研的 Grok Build harness 或 Cursor 应用来体验该模型,以获取最佳使用效果。Grok Build harness 的访问入口为 http://X.ai/build。此次更新标志着 xAI 公司在基础模型能力上的进一步迭代。

#xAI#Grok 4.6#模型发布

02

产品发布/更新

Products3

05:15MarkTechPost(RSS)关联 2

Anthropic Claude Security接入Mythos 5

2026年8月21日,Anthropic宣布将最强网络安全模型Claude Mythos 5集成至Claude Security产品。该功能面向Claude Enterprise客户开放公测,无需单独购买模型权限,扫描费用计入现有计划的标准Token用量。用户连接GitHub仓库后,系统通过追踪数据流与Git历史进行代码审计,返回包含CWE分类、置信度、严重性及修复建议的结果,并经过对抗性验证以降低误报。此设计旨在隔离模型交互界面,防止直接提示词被用于生成攻击载荷。

#Anthropic#Claude Security#Mythos 5

15:18IT之家(RSS)

OpenAI 开源 Codex Harness Agent 框架

OpenAI 宣布全面开源 Codex 底层核心框架 Harness,包含 CLI、SDK 及 app-server 组件,采用 Apache-2.0 许可。该框架提供任务理解、记忆维持、工具调用及人类审批等完整智能体循环能力,旨在解决通用聊天框交互局限。官方数据显示,优化 Harness 设计可使 GPT-5.6 Sol 在 ARC-AGI-3 基准测试得分从 13.3% 提升至 38.3%,同时 Token 消耗减少六倍。目前已有 Cisco 等企业将其集成至云控制平台,开发者可借此构建深度融入业务流的原生 AI 应用。

#OpenAI#Codex#开源

00:01Rohan Paul

X Square Robot WALL-B模型分拣万包裹实录

X Square Robot发布WALL-B具身智能模型在物流分拣场景的实测数据。该模型在5小时14分钟内完成10,000个包裹的分拣,处理速度达1,911个/小时(约1.88秒/个),准确率超98%。任务要求机械臂识别包裹姿态、翻转标签朝上并滑入传送带,同时区分毛绒玩具等异形件。相比此前公开测试的1,816个/小时,此次结果提升了吞吐量与稳定性。系统需闭环执行3D感知、抓取推理、运动规划、力控及在线修正,重点验证了长周期运行下微小物理误差累积对系统稳定性的影响,展示了具身智能在复杂动态环境中的持续作业能力。

#X Square Robot#具身智能#WALL-B

03

行业动态

Industry8

20:13华尔街见闻(RSS)关联 2

长江存储科创板IPO获受理,一季度净利334亿

上交所显示长江存储控股科创板IPO申请已获受理,保荐机构为中信证券及中信建投。公司拟发行不超过24.3亿股,募资330亿元用于产线升级与研发。招股书披露,2026年一季度长存营收470.42亿元,归母净利润333.79亿元,单季盈利超2025年全年两倍,主要受益于NAND Flash价格大涨及产能利用率提升。按TrendForce数据,其一季度全球出货量与金额均排第三、中国第一。股权结构分散,无控股股东,前四大股东含大基金一期及二期。地缘政治被列为首要风险因素。

#长江存储#IPO#半导体

13:45Latent Space(RSS)关联 2

Poolside获英伟达反向收购,全员套现后转型AI for Science

英伟达以120亿美元估值对Poolside进行反向收购,吸纳其109名技术人员。不同于常规收购,此次创始人及全员均获巨额回报并离开,原公司实质解散。Poolside此前因融资失败错失算力集群建设。其孵化的PIC Infraco计划扩展至7GW新云算力。创始团队透露战略重心转向“AI for Science”,认为通用智能将开源商品化,而结合真实实验反馈的科学发现引擎将成为核心价值高地。

#Poolside#NVIDIA#并购

21:31华尔街见闻(RSS)

英伟达拟数亿美元投资电力开发商CloverLeaf

据华尔街日报报道,英伟达正就投资数据中心电力开发商CloverLeaf Infrastructure进行深入谈判,预计投资规模达数亿美元。CloverLeaf成立于2024年,专注于为数据中心项目提供电力解决方案,已向甲骨文和OpenAI等出售超7吉瓦供电土地项目。此举是英伟达近期密集布局能源领域的最新动作,此前已入股软银旗下SB Energy并向Lancium投资20亿美元。通过提前介入电力开发环节,英伟达意在确保未来数据中心的电力供给与芯片出货节奏相匹配,巩固其在AI算力基础设施生态中的核心角色。

#英伟达#基础设施#融资

15:19华尔街见闻(RSS)

博通拟发千亿美元表外债务,AI融资隐忧引CDS新高

博通正与黑石、阿波罗洽谈,计划通过特殊目的载体发行高达1000亿美元的表外债务,用于为Anthropic等客户定制AI芯片提供融资。该交易结构类似此前350亿美元项目,旨在利用SPV压低融资成本并将负债移出资产负债表。消息公布后,博通信用违约掉期(CDS)飙升至历史新高,穆迪与标普警告其或有负债将限制财务灵活性。此举被视为科技巨头锁定算力并挑战英伟达竞争态势的战略动作,同时也折射出Alphabet、Meta等九家科技公司合计约3万亿美元的表外承诺引发的市场担忧,凸显AI基础设施巨额资本开支背后的隐性债务风险与时序错配问题。

#博通#AI融资#表外债务

16:33华尔街见闻(RSS)

英伟达拟入股Mercor,后者估值翻倍至200亿美元

据The Information报道,英伟达正寻求入股AI数据供应商Mercor,参与其新一轮融资。若交易达成,Mercor估值将达200亿美元,较此前100亿美元翻倍。Mercor成立三年,上半年毛收入6.14亿美元,主要招募人类专家对AI模型进行专业任务评估与标注。英伟达已将Mercor数据用于Nemotron开源模型训练,双方业务从采购向股权绑定演进。此举标志着英伟达投资触角延伸至数据供应链上游,以强化自身开源AI竞争力。Mercor将成为AI数据标注赛道最高估值企业,超越Scale AI。

#英伟达#Mercor#融资

16:04Hacker News Best(web_list)

AI公司扫描后销毁实体书,Anna's Archive呼吁加速抢救珍本

Anna's Archive发布文章指出,Anthropic等AI公司正通过中间商大量收购二手纸质书,在扫描获取训练数据后予以销毁。此举旨在独占2022年前未被机器处理的原始文本,防止竞争对手获取并规避法律风险。文章警告这种垄断行为将导致人类知识永久封闭于私有服务器,呼吁全球志愿者紧急扫描并上传书籍与文献,以对抗AI对公共领域知识的侵蚀。

#Anthropic#AI伦理#版权争议

06:31Satya Nadella

微软数据中心首批 Vera Rubin 芯片到货

微软 CEO 萨提亚·纳德拉在社交平台宣布,首批生产级 Vera Rubin 芯片已抵达微软数据中心。他感谢了英伟达合作伙伴以及 Azure 硬件和数据中心团队在这一里程碑中的贡献。Vera Rubin 是英伟达下一代 GPU 架构,此次到货标志着微软在 AI 算力基础设施部署上取得重要进展。

#Microsoft#Nvidia#Vera Rubin

22:00TechCrunch AI(RSS)

美国司法部调查a16z董事会席位冲突

据 TechCrunch 报道,美国司法部(DOJ)已对 Andreessen Horowitz (a16z) 展开为期近一年的反垄断调查。调查焦点在于 a16z 合伙人 Ben Horowitz 与 Martin Casado 分别担任 Databricks 和 Fivetran 董事的董事会席位安排。尽管两家公司在投资初期并非直接竞争对手,但如今业务存在竞争关系。此次调查援引了一项极少用于风险投资机构的百年反托拉斯法,旨在评估此类交叉任职是否构成潜在的反垄断违规或市场支配力滥用。这是监管机构针对 VC 行业治理结构的一次罕见且严肃的法律行动,可能对未来风投机构的董事会合规策略产生深远影响。

#Andreessen Horowitz#反垄断#风险投资

04

论文研究

Research2

06:32Rohan Paul

Salesforce研究:自改进Agent记忆易累积错误导致性能不稳定

Salesforce在arXiv发表论文,测试基于记忆的自改进Agent在WebArena上的表现。发现任务顺序显著影响结果:默认顺序下ReasoningBank提升1.5分,打乱后下降4.5分。原因是默认顺序先处理简单任务,Agent容易习得正确经验;但记忆机制同样会保存错误决策(如在不可用环境中推荐API),并在后续任务中重复调用,导致71%的案例结果更不稳定。即使优化环境反馈,仅能恢复31%的性能损失。研究表明“从经验中学习”的有效性高度依赖于学习内容的准确性,记忆机制可能放大错误而非仅积累有用知识。

#Salesforce#Agent#Memory

21:47elvis

Google研究:EnvRigger通过动态环境重塑提升Agent训练效率

Google发布研究,提出EnvHarness与EnvRigger框架以解决Agent训练环境静态化及滞后问题。EnvHarness通过可编程插件层重塑环境行为而不修改底层逻辑,保留原始验证器以确保训练安全;EnvRigger将策略视为黑盒,读取执行轨迹以诊断缺陷并合成针对性环境组件,再经新 rollout 验证。在四个领域的五个基准测试中,该方法在保持原有验证标准的同时,使未见实例性能最高提升9.0分,且执行步骤减少9.8%。相关论文已发布于arXiv。

#Google#Agent#训练环境

05

技巧与观点

Tips6

22:07Hacker News Best(web_list)关联 4

DeepSeek发布v4-flash-vision-exp视觉模型接入指南

DeepSeek官方发布deepseek-v4-flash-vision-exp模型的API接入技术文档。该模型支持图像与文本混合输入,可用于图片描述、截图OCR及图表分析。文档详细说明了通过OpenAI兼容接口和Anthropic兼容接口发送图像的三种方式:Base64内联、外部URL引用及Files API文件ID。同时列出了关键限制参数,包括请求体上限48 MiB、单图最大32 MiB(Files API可达64 MiB)、每请求最多600张图及Token计费规则。内容涵盖代码示例、分辨率缩放逻辑与错误处理规范,为开发者提供完整的工程落地参考。

#DeepSeek#视觉模型#API接入

17:25Avi Chawla

LLM微调12种核心技术与OpenPipe ART实战

文章总结了作者两年大模型微调经验,梳理了LoRA、QLoRA、Prefix tuning、Adapter tuning、Instruction tuning、P-tuning、BitFit等基础参数高效微调技术,以及RLHF、RLAIF、DPO、GRPO、RLVR等基于人类或机器反馈的强化学习优化方法。针对RAG、摘要等缺乏明确黄金标签的任务,指出传统手写奖励函数校准困难且脆弱。为此推荐OpenPipe开源的ART工具,利用Judge LLM对采样轨迹进行相对排名以生成稳定奖励信号,并提供了GitHub仓库链接及详细训练流程解析。

#LLM微调#RLVR#OpenPipe

08:10数字生命卡兹克

AI Agent时代12个高频Prompt合集:提问、学习与决策

作者整理并优化了12个适用于当前大模型能力的Prompt模板,涵盖问清问题、学习、解决问题、决策与认识自己五大场景。具体包括苏格拉底式提问以厘清核心需求;双层解释法、反向拆解、横纵分析法与事实核查用于知识获取与验证;专家会诊、第一性原理与跨领域借解用于复杂问题解决;双向钢人论证与最小实验设计辅助决策;以及基于盖洛普优势识别与斯坦福人生设计法的个人天赋挖掘与职业规划工具。所有模板均适配主流AI产品,支持直接复制使用。

#Prompt技巧#工作流#深度思考

06:00MarkTechPost(RSS)

AutoFigure教程:构建智能文档处理流水线与科学图表生成

本文介绍 AutoFigure 工具包,用于根据文本描述或论文内容直接生成科学图表。教程涵盖环境搭建、依赖修复(如 Pillow 兼容性)及 SVG/PNG 渲染配置。通过自定义参考图与 API 工作流,演示将智能文档智能流水线转化为出版级科学图示。涉及离线渲染测试、样本论文生成及输出归档。代码示例展示如何配置 OpenRouter/Gemini 模型、设置质量阈值与迭代次数,并实现从长文档输入到结构化输出的全流程自动化,适用于金融报告等复杂场景的可视化需求。

#AutoFigure#教程#Agent

20:19meng shao

Cursor Team Kit 新增 Thermo-Nuclear 代码审查

Cursor Team Kit 新增 Thermo-Nuclear Code Quality Review Skill,提供极端严格的代码可维护性审查方法论。该工具旨在对抗 AI 代码生成的冗余包装、散落分支与空壳抽象等病灶。其核心包含八条不可妥协的审查标准:优先结构性简化以消除冗余;设定 1000 行红线限制文件膨胀;拒绝意式增长与非必要临时逻辑;坚持直接可维护优于魔法代码;确保类型与边界清洁;要求逻辑归位并复用既有工具;警惕串行编排与非原子更新。该 Skill 将代码质量从模糊审美转化为可操作的检查清单,适用于审查 AI 生成的 PR。

#Cursor#代码审查#工程实践

19:14IT之家(RSS)

青少年用 Claude Code 为惠普冷门打印机开发 macOS 原生驱动

IT之家报道,一名名为 Kuber Mehta 的青少年开发者利用 Anthropic 推出的 AI 编程工具 Claude Code,成功为缺乏 macOS 官方支持的惠普 HP Laser 1008a 激光打印机开发了原生驱动程序。该开发者让 Claude Code 充当智能体,协助分析现有软件、逆向打印流程并编写修正代码,仅耗时 4 小时即完成适配。项目最终摒弃了依赖惠普专有组件和 Linux 容器的方案,转而采用修改后的开源 SpliX 打印引擎搭配原生 macOS USB 组件。目前该项目已开源,支持惠普 HP Laser 1003、1006 和 1008 系列打印机。

#Anthropic#Claude Code#AI 编程

往期存档