跳到主内容
NewsHub

日报

LIVE每早八时发报 · 更新于 00:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 18 事件 · 3 一手信源 · 覆盖 8 家信源
今日头条 · Lead

美团发布万亿参数大模型LongCat-2.0

今日AI领域迎来多项重磅发布:美团基于国产算力训练出万亿参数大模型LongCat-2.0,Anthropic推出Claude Sonnet 5,Agent能力逼近Opus。字节跳动时隔四年调整管理理念,全面聚焦AI,Kimi估值飙升至315亿美元。成本竞争加剧,多供应商策略与自研芯片正松动英伟达CUDA护城河。

Anthropic Newsroom(web_list)关联 8

Anthropic发布Claude Sonnet 5,Agent能力接近Opus

Anthropic 发布 Claude Sonnet 5,定位为最具 Agent 能力的 Sonnet 系列模型。该模型在规划、工具使用(浏览器、终端)和自主运行方面表现显著提升,性能接近 Opus 4.8,但价格更低。相比前代 Sonnet 4.6,在推理、工具使用、编码和知识工作等 Agent 关键能力上有大幅改进。安全评估显示,Sonnet 5 的不良行为率低于 Sonnet 4.6,在 Agent 场景下更安全,但网络安全能力远低于 Opus 模型。即日起,Sonnet 5 成为 Free 和 Pro 计划的默认模型,Max、Team、Enterprise 用户也可使用,同时上线 Claude Code 和 Claude API。API 定价为每百万输入 token 3 美元、每百万输出 token 15 美元,2026 年 8 月 31 日前享优惠价 2 美元/10 美元。

#Anthropic#Claude#Sonnet 5

01

模型发布/更新

Model Releases3

IT之家(RSS)关联 3

美团发布万亿参数大模型 LongCat-2.0,基于国产算力训练

美团发布新一代万亿参数大模型 LongCat-2.0,总参数 1.6T,平均激活约 48B,动态范围 33B~56B,原生支持 1M 超长上下文。该模型在五万卡国产算力集群上完成全流程训练与推理,从零开始预训练,数据规模超 30T tokens。团队攻克了万卡级训练中的硬件故障、通信异常等难题,将月均日故障率降低 70% 以上,训练 MFU 提升 1.5 倍,稳态日吞吐超 1T tokens/day。推理方面,通过专家并行、零计算专家、稀疏注意力等优化实现低延迟解码。模型采用 MOPD 架构融合 Agent、Reasoning、Interaction 三组专家能力,在 SWE-bench Pro 获得 59.5,SWE-bench Multilingual 获得 77.3,Terminal-Bench 2.1 获得 70.8,在搜索智能体评测集 RWSearch 中获得 78.8,生产力场景评测集 FORTE 中获得 73.2,BrowseComp 中获得 79.9。预览版已通过 OpenRouter 和 longcat.ai 开放调用,并跻身 OpenRouter 全球调用量前三。

#美团#LongCat-2.0#万亿参数

Google DeepMind 博客(RSS)关联 5

Google推出Nano Banana 2 Lite与Gemini Omni Flash

Google DeepMind 宣布推出 Nano Banana 2 Lite 和 Gemini Omni Flash 两款新模型。Nano Banana 2 Lite 是轻量级模型,适用于移动端和边缘设备,在保持性能的同时降低计算需求。Gemini Omni Flash 是多模态模型,支持文本、图像、音频等输入,旨在提供快速响应和高效推理。开发者可通过 Google AI Studio 和 Vertex AI 平台开始构建应用。

#Google#模型发布#Nano Banana 2 Lite

Teortaxes▶️ (DeepSeek 推特🐋铁粉 2023 – ∞)

首个国产NPU预训练大模型问世

据X平台消息,首个基于国产NPU(神经网络处理器)预训练的大型语言模型(LLM)已出现。该模型标志着中国在自主算力芯片上训练大模型的重要突破。同时,消息还提及日本近期也推出了首个严肃的预训练大模型(Fugu不算,因其为编排模型)。

#中国#NPU#大模型

02

产品发布/更新

Products3

NVIDIA 博客(RSS)关联 6

NVIDIA BioNeMo Agent Toolkit 集成 Claude Science,加速生命科学研究

NVIDIA 发布 BioNeMo Agent Toolkit,集成到 Anthropic 新推出的 Claude Science 科研工作台中。该工具包将 NVIDIA 加速的模型、库和 NIM 微服务封装为可调用的技能,使 Claude Science 的 AI 代理能通过自然语言指令自动选择工具、准备输入并执行工作流,涵盖基因组学、蛋白质结构预测、药物设计等领域。工具包包含 Parabricks(基因组分析加速)、RAPIDS-singlecell(单细胞分析加速 120 倍)、nvMolKit(化学信息学加速 3000 倍)以及 BioNeMo 开放模型和 NIM 微服务。目前全球前 20 大药企中有 18 家使用 NVIDIA BioNeMo。该工具包已通过 NVIDIA 开发者资源和 GitHub 开放,Claude Science 进入公开测试阶段。

#NVIDIA#BioNeMo#Claude Science

IT之家(RSS)

特斯拉Cybercab量产版启动公开道路工程测试

特斯拉已在得克萨斯州奥斯汀市的公共道路上,正式开展首批量产版 Cybercab 的工程测试,这批车辆未配备方向盘与脚踏板。埃隆·马斯克证实并发布了实拍视频。测试车辆内配有一名安全监督员,但无任何驾驶员操控装置,得州交通局已确认该设计。特斯拉于2024年10月首次展示概念车,2026年6月30日量产实车上路测试,耗时约20个月。此前,特斯拉已于2026年1月上线无安全员无人驾驶出租试运营,6月22日开放付费服务。本次测试投入34台Cybercab,在奥斯汀市中心验证量产整车硬件可靠性,不对外开放乘客搭乘。Cybercab为双座车型,从设计之初就完全围绕全自动无人驾驶打造,无后期改装操作。

#特斯拉#Cybercab#自动驾驶

meng shao

Flowith推出Matrix:多Agent操作系统,实现商业闭环

Flowith团队推出「Matrix」,定位为Agent公司的操作系统。用户设定使命后,Matrix编排多Agent部门长期运转,目标覆盖从创建、分发到变现的完整商业闭环。核心主张包括:自演化多层级的multi-agent runtime;用户作为战略负责人设定mission,而非日常执行;组织模型为CEO Office→OKR→部门(Research/Engineering/Growth/Product)→证明与复盘;商业闭环涵盖建站、接Stripe、发邮件、投广告、产内容、收revenue;提出新指标VPTD(Value Per Token Dollar)。产品架构分三层:Runtime层(每个Agent独立browser、工具、文件、记忆,支持Neo/Claude Code/Codex等,强调超长时运行和主动执行)、协调层(用户输入intent+资产,CEO Office定目标,OKR分解,各部门并行,以proof闭环)、公司原语(内置网站部署、Stripe收款、Agent Wallet、Agent Email)。交付形态为macOS客户端,Web版coming soon。GDPval-Bench数据:Matrix(GPT 5.5+harness)95.45%,Codex CLI(GPT-5.5)84.9%,Claude Opus 4.7 80.3%。

#Flowith#Matrix#Agent操作系统

03

行业动态

Industry8

华尔街见闻(RSS)

英伟达CUDA护城河松动:自研芯片与多供应商策略侵蚀份额

华尔街见闻报道,英伟达在AI加速器市场的份额从87%下滑至75%,其CUDA生态正面临多重侵蚀。OpenAI发布自研推理芯片Jalapeño,与博通合作9个月完成流片,目标降低30-50%推理成本。Anthropic采用三平台算力策略:训练用谷歌TPU、推理用亚马逊Trainium,英伟达GPU仅用于前沿研究探索,且规模最小。AMD MI400系列预计2026年下半年量产,Meta已签署6吉瓦采购承诺。软件层Triton和JAX框架实现硬件无关,降低CUDA锁定。英伟达原版4芯片Rubin Ultra因封装基板翘曲问题取消,回退至2芯片设计,性能缩水近半。竞争对手通过自研ASIC、多供应商布局和软件解耦三条路径侵蚀英伟达定价权。

#英伟达#CUDA#自研芯片

Rohan Paul关联 2

OpenAI 将部分模型推理成本削减超一半

据 The Information 报道,OpenAI 已将部分现有模型的推理成本削减超过一半,同时未登录的 ChatGPT 流量仅运行在几百块英伟达 GPU 上。可能的优化手段包括量化、KV 缓存改进、批处理、推测解码以及将简单查询路由至更便宜的模型。若属实,这将构成核心竞争杠杆,降低成本可提高利润率、扩大使用限制或减轻 API 定价压力。背景方面,OpenAI 2025 年调整后毛利率从 2024 年的 40% 降至 33%,推理成本翻了两番。有报道预计 2026 年第一季度毛利率回升至 39%,年底目标 52%。Anthropic 毛利率约为 44%,前沿实验室仍远低于成熟软件公司的经济水平。

#OpenAI#推理成本#毛利率

上海证券报关联 2

字节跳动时隔四年调整管理理念,全面聚焦AI

6月29日,字节跳动CEO梁汝波向全员发送内部邮件,宣布更新公司文化内容,这是继2022年后时隔四年再次对核心管理理念进行实质性调整。邮件明确“激发创造,丰富生活”使命不变,首次提出“通过计算换智能,通过智能提升创造力和体验”的战略路径,确认向AI时代跨越的方向。新版“领导力原则”确立为10条,新增“做有高度的事”“敢于设定高目标”,强化“有危机感”“深入一线”及“Context over Control”理念,旨在纠治管理僵化与形式主义。该原则将作为人事考核依据,于2026半年绩效评估周期应用。此前6月23日,梁汝波在火山引擎FORCE原动力大会上首次公开谈及AI战略,称AI是继PC、Web、Mobile后的重大变革,字节已收缩业务宽度聚焦AI,重点提升模型能力。截至6月,豆包大模型日均Token调用量突破180万亿,火山引擎在中国公有云MaaS市场以49.5%份额位居第一。

#字节跳动#AI战略#组织调整

云头条

Claude Code 被曝暗查中国时区,嵌入隐蔽风控标记

2026年6月30日,Reddit 用户发帖称,Anthropic 在 Claude Code 2.1.91 版本起嵌入隐蔽检查逻辑:当检测到代理启用时,会检查系统时区是否为 Asia/Shanghai 或 Asia/Urumqi,以及代理 URL 是否匹配中国域名或中国 AI Lab。根据检查结果,Anthropic 会修改 system prompt 中的日期格式和撇号字符(如将 ' 替换为不同 Unicode 字符),从而在用户不知情的情况下传递时区、代理及组织归属信息。该逻辑在二进制文件中通过 XOR 混淆,且未在发布说明中提及。作者认为,此举虽旨在检测未授权转售和模型蒸馏,但严重侵犯用户隐私和信任,且对真正有技术能力的对手难以奏效。

#Anthropic#Claude Code#隐私

IT之家(RSS)

Kimi估值涨至315亿美元,收入曲线类似Anthropic早期

据《科创板日报》独家消息,月之暗面Kimi上一轮200亿美元估值融资已完成交割,新一轮融资启动,投前估值涨至315亿美元。接近Kimi的机构人士透露,其最新ARR(年度经常性收入)于6月中旬突破3亿美元,收入增长主要来自模型迭代带动的开发者使用和API收入提升,API收入已占整体7成以上。收入曲线呈现Anthropic早期商业化特征:开发者调用放量、API占比提升、海外付费用户增长,模型能力迭代带动价格体系上移。此前5月消息称,月之暗面完成20亿美元融资,估值超200亿美元,过去6个月累计融资约39亿美元。

#月之暗面#Kimi#融资

云头条

Coinbase 将 GLM 5.2、Kimi 2.7 设为默认模型,AI 支出减半

2026 年 6 月 27 日,Coinbase CEO Brian Armstrong 发文称,公司通过内部 LLM gateway 将智谱 GLM 5.2 和月之暗面 Kimi 2.7 等开放权重模型设为默认选项,以控制 AI 成本。具体措施包括:更好的默认设置(而非使用上限)、自动模型路由、缓存优化(缓存命中率从 5% 提升至 60%)、精简上下文以及成本可见性。在 token 使用量持续增长的情况下,AI 支出已接近减半。工程师仍可根据任务选择模型,但默认入口向开放权重模型倾斜。此举被视为中国大模型进入海外企业核心工作流的标志性案例。

#Coinbase#GLM 5.2#Kimi 2.7

One Useful Thing(RSS)

聊天机器人的黄昏:AI能力加速与智能体崛起

文章指出,AI领域正经历加速发展:美国领先实验室的模型发布频率加快,能力提升呈超指数趋势。METR和英国AI安全研究所的评估显示,AI单次提示可完成的人类编程工作量持续增长;Epoch发现Opus 4.7在14小时内自主构建了相当于人类2-17周工作的软件包,仅花费251美元。作者实验表明,Fable可自主运行9小时完成复杂软件项目。同时,中国开源权重模型落后前沿6-12个月,但同样沿指数曲线提升。AI使用方式正从聊天机器人转向智能体:OpenAI内部研究显示,四分之一员工每周同时运行至少4个智能体,法律、HR等非技术岗位采用率与程序员相近。Claude Code用户研究发现,领域专长比职业背景更能预测使用效果。文章认为,AI能力呈指数增长,而机构反应速度滞后,导致政策与市场频繁动荡。

#AI能力#智能体#OpenAI

05

技巧与观点

Tips1

宝玉

多微服务场景下如何让AI Agent高效协作

针对公司有十几个微服务、希望用AI Agent进行系统设计和编码的场景,本文给出了关键建议:将微服务放在一个workspace(monorepo或虚拟monorepo)下,配合分层文档(根目录AGENTS.md索引+各服务目录职责文档)和按需加载;利用OpenAPI等机器可读规格自动生成文档,并强调协议测试代码(如contract test)作为活文档的价值。验证方面,建议为每个微服务提供mock server或基于OpenAPI的模拟服务,让Agent通过本地contract test形成“写代码→跑测试→自我修正”的闭环,无需依赖完整集成环境。进阶可参考consumer-driven contract testing(Pact)。

#AI Agent#微服务#Monorepo

往期存档