跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 22 事件 · 2 一手信源 · 覆盖 9 家信源
今日头条 · Lead

宇树机器人跳高破纪录,Anthropic收入激增七倍

今日AI领域多点开花:宇树科技上市前夕发布人形机器人“超人”,跳高与速度打破人类纪录;Anthropic年化收入达650亿美元,较去年底增长逾7倍。语音模型、代码托管平台等新品密集上线,AI投资叙事则转向融资与基础设施,市场关注度持续升温。

02:36MarkTechPost(RSS)

MiniMax 发布开源音乐模型 Music3,可一次生成五分钟歌曲

MiniMax 发布开源权重文本转音乐模型 MiniMax-Music3,可基于带段落标签的歌词与结构化音乐描述,单次生成最长五分钟的完整歌曲,输出为 32kHz、16-bit 立体声 WAV。架构采用混合分层自回归与连续合成路径:8B 全局 LLM 逐帧预测首个 RVQ 码本并把握长程结构,0.6B 局部 LLM 预测帧内其余码本;合成阶段融合两个 LLM 的最终隐藏状态,输入 2.4B flow-matching 模块,再由 123M Flow-VAE 解码,推理时不加载离散 tokenizer 解码器。

#MiniMax#音乐生成#开源模型

01

模型发布/更新

Model Releases1

16:01IT之家(RSS)

Qwen-Audio-3.0系列语音模型上线阿里千问平台

8月17日,阿里云宣布Qwen-Audio-3.0系列语音模型正式上线千问AI平台和阿里云百炼平台,开发者可通过API调用或订阅Token Plan使用。该系列包含三款模型:语音识别大模型Qwen-Audio-3.0-ASR,支持复杂语境和专业领域识别;语音合成大模型Qwen-Audio-3.0-TTS,支持多语种、多方言,可控制情绪、语气与节奏;实时语音交互对话模型Qwen-Audio-3.0-Realtime,支持端到端语音理解与对话,可边听边说、随时打断追问,并支持工具调用。

#阿里云#Qwen-Audio#语音模型

02

产品发布/更新

Products2

02:01宝玉

Cursor 代码托管平台 Origin 上线,主打 AI Agent 工作流

Cursor 的代码托管平台 Origin 正式上线,用户可从 GitHub 同步仓库开始使用。Origin 是 Cursor 自研的 GitHub 替代品,提供代码存储、Git 托管、代码审查与团队协作,但设计前提是将 AI Agent 作为主要用户。在 Compile 大会演示中,Origin 在单个仓库内达到每秒 22.6 次提交、每小时 29.6 万次克隆,全球同步延迟低于 400 毫秒,并内置 AI 驱动的自动合并冲突解决。其技术源自 Cursor 2025 年底收购的 Graphite 团队,后者擅长堆叠式 PR 管理,适配 AI 智能体并行工作。

#Cursor#Origin#代码托管

01:32宝玉

yetone 开源 Cumora:让 AI Agent 成为聊天群正式成员

yetone 开源新项目 Cumora,将 AI Agent 引入类 Slack 聊天界面,使其成为群聊正式成员。Agent 拥有名字、人设、记忆,可私聊、建群、认领任务、收发邮件,并能在未被 @ 时主动发言。默认团队含 Atlas(研究员)、Bram(工程师)等角色。技术上有两种运行方式:Cumora Cloud 将 Agent 托管于云端 Kubernetes Pod,由 OpenAI Responses API 驱动;BYOA 模式则通过 npx cumora agent computer 在本地运行,使用 Claude Code 或 Codex CLI,密钥不经过服务器。

#yetone#Cumora#多Agent协作

03

行业动态

Industry8

03:52Chubby♨️

Anthropic 年化收入达 650 亿美元,为 2025 年底 7 倍多

据彭博社报道,Anthropic 截至 7 月底的年化收入达 650 亿美元,是 2025 年底运行率的 7 倍以上。最近一个完整季度收入超过 115 亿美元,上年同期为 7.87 亿美元,并录得正的调整后营业利润。其年化运行率在 5 月已突破 470 亿美元。相比之下,OpenAI 近期年化收入超过 400 亿美元,但两家公司计算口径可能不同。这些数据对 Anthropic 即将进行的 IPO 意义重大。

#Anthropic#收入#财务

20:16华尔街见闻(RSS)

宇树科技8月19日登陆科创板,发行价150.80元

人形机器人企业宇树科技将于2026年8月19日登陆科创板,发行价150.80元/股,对应发行后总市值约609.93亿元,发行市盈率219倍,远超行业平均。公司公开发行4044.64万股,占总股本10%,募资净额约59.17亿元。创始人王兴兴通过特别表决权安排,上市后合计控制约65.31%表决权。战略配售引入DeepSeek、腾讯关联方等机构。业绩方面,2023至2025年营收复合增长率达226.78%,但2026年上半年营收同比增长48.54%至11.52亿元,扣非净利润同比下降19.34%。挂牌前夕,公司发布人形机器人新品“超人”,演示原地跳高2米、极限速度12.66m/s。

#宇树科技#IPO#人形机器人

19:56华尔街见闻(RSS)关联 2

宇树科技上市前夕发布人形机器人“超人”

宇树科技在科创板IPO发行结果落定、即将挂牌之际,发布名为“超人”的人形机器人。8月17日公布的30秒演示视频显示,“超人”在0.85米腿长的硬件基础上实现原地跳高2米、极限速度12.66m/s,两项指标均打破人类原地跳高与奔跑速度纪录。宇树科技表示,这款全新整机刚用3个多月研发出来,未来几个月仍有较大完善空间。发行结果显示,公司发行价150.80元/股,对应发行后总市值约609.93亿元;网上中签率仅0.0181%,为科创板史上最低,有效申购倍数8288倍,吸引978.46万户散户参与。以发行价计,对应2025年度净利润的市盈率为219倍,远高于约38倍的行业平均水平。

#宇树科技#人形机器人#IPO

03:23Hacker News Best(web_list)

Wiz Red Agent攻破Snowflake Jira:AI

Wiz Research通过Snowflake的HackerOne漏洞披露计划,使用自主AI安全研究工具Red Agent,在Snowflake公共仓库snowflakedb/snowflake-connector-net中发现一个严重的GitHub Actions工作流漏洞。该漏洞源于PR #1218(2026年6月18日合并),该PR由Copilot Autofix(AI)共同编写,将原本安全的env变量+jq解析模式替换为直接字符串插值,导致未认证用户可通过构造恶意issue标题在GitHub Actions runner上执行任意命令。

#Wiz#Snowflake#AI安全

09:37华尔街见闻(RSS)

AI叙事转向融资:巨头现金流告急,债市拉响警报

AI投资叙事正从技术、资本支出转向融资。摩根士丹利预测,2028年前AI基建总支出将达3.2万亿美元,其中约1.75万亿需通过信贷市场筹集。Apollo数据显示,AI相关债券发行已占长久期供给的40%,超大规模云计算商信用利差显著走阔,而整体投资级市场几乎未动。摩根士丹利大幅下调各大超大规模云计算商2027年自由现金流预测,甲骨文接近-400亿美元;采购承诺已增至9820亿美元,且大量表外。甲骨文CDS从2025年中约40个基点飙升至2026年4月峰值近190个基点。摩根士丹利将2027年云计算资本支出增速预测从14%上调至29%。

#AI融资#算力基建#信贷市场

12:27IT之家(RSS)

AI视频平台Higgsfield融资4亿美元,估值54亿美元

据英国《金融时报》报道,AI 视频生成平台 Higgsfield 已从 DST Global、高盛、Liberty Global 和英特尔等投资者处筹集 4 亿美元,估值达 54 亿美元。该公司由前 Snapchat 高管 Alex Mashrabov 创立,成立仅两年,上一轮融资为 8 个月前,当时估值 13 亿美元。Higgsfield 于 2025 年推出,年化收入今年 8 月已达 7 亿美元,而一年前仅 2000 万美元。目前在全球 238 个国家和地区拥有超 3000 万用户,美国为最大市场。公司正加速商业化,拓展企业订阅业务,大部分收入来自企业客户。

#Higgsfield#融资#AI视频生成

14:09华尔街见闻(RSS)

顶级机构加仓超大云服务商,看空算力租赁

AI投资叙事正发生关键转变。Wellington Management和Capital Group等顶级机构在继续持有半导体仓位的同时,积极加仓亚马逊、微软、谷歌等超大云服务商,认为云计算增长提速、算力供应紧张将令掌控基础设施与客户关系的企业获益最深。同时,依赖高价租赁算力运营的“新云”服务商被视为脆弱标的,部分机构建议做空。费城半导体指数今年累计上涨约75%,CoreWeave和Nebius分别大涨约50%和逾200%。机构警告,一旦新增算力大规模上线、租赁定价回归正常,后者高债务、高定价模式将面临考验。

#投资策略#超大云服务商#算力租赁

05

技巧与观点

Tips8

14:15meng shao

Claude Code 会话成本优化指南:缓存、上下文与 Subagent

本文基于 Anthropic 官方博客,讲解如何最大化 Claude Code 会话价值。token 单价由模型大小、输入输出(输出约为输入 5 倍,thinking token 占大头,可用 MAX_THINKING_TOKENS=0 关闭)及提示词缓存(缓存读取 0.1×,写入最高 2×)决定。切换模型、/effort、开启 Fast mode、/compact 等会击穿缓存导致全价 prefill。会话 token 量方面,进入上下文的内容每轮重发,需注意探索成本、命令输出(超 3 万字符自动落盘)及轮次累积。Subagent 可隔离上下文,适合产出大量无需保留输出的任务。

#Claude Code#成本优化#缓存

01:52MarkTechPost(RSS)

用 docTR 构建端到端文档智能流水线:OCR、版面分析

本教程基于 docTR 库,演示如何构建端到端的文档智能流水线。内容包括:生成逼真的合成发票文档,通过 DocumentFile 加载图像与 PDF,构建支持 GPU 的 OCR 预测器,并对不同检测-识别架构组合进行速度与精度基准测试。教程深入解析 Document 内部层级结构,可视化置信度感知的边界框,使用独立的检测与识别模型,对低置信度词实施两遍识别,调整检测阈值,并引入自定义流水线钩子用于框过滤与填充。同时处理旋转与倾斜文档,实验版面检测与 KIE,重建阅读顺序与表格信息,提取结构化发票字段,并将结果导出为文本、JSON、hOCR、合成文档图像及可搜索 PDF。

#docTR#OCR#文档智能

09:55Lee Robinson

Grok Bot 四大技术决策:无 UI、厚服务端、常驻电脑、浏览器自动化

Grok Bot 产品负责人分享其设计背后的四项关键技术决策:1. 最佳 UI 即无 UI,界面极简,专为当前前沿模型能力设计,随模型进步仍易用;2. 客户端薄壳、服务端厚壳,客户端仅负责消息传递,复杂度移至服务端,保证桌面与移动端流畅;3. 常驻云端电脑,每个 bot 连接专属持久化文件系统,无需为每次对话新建虚拟机,支持在持久环境中运行 agent;4. bot 可使用浏览器,结合代码编写与浏览器操作,可自动化几乎任何计算机任务,并支持录制操作生成可重复流程。

#Grok#Agent#产品设计

15:27InfoQ 中国(RSS)

KMP 在鸿蒙上落地:渲染内存降95%、GC卡顿率降90%

本文复盘 KMP(Kotlin Multiplatform)在鸿蒙系统上的工程实践。团队将业务逻辑用 Kotlin 编写并编译为 ArkTS 字节码,实现跨平台复用,同时针对鸿蒙运行时做深度优化:用 ArkUI 声明式 UI 与 KMP 解耦,渲染任务下沉原生层以减少桥接开销;通过内存池复用、对象生命周期管理与 GC 参数调优,显著降低渲染内存占用与 GC 卡顿率。实测渲染内存峰值降约 95%,GC 卡顿率降约 90%。文章还分享了鸿蒙上调试 KMP、处理 ArkTS 与 Kotlin 类型映射差异、构建打包流程的踩坑经验,为其他团队提供可复用参考。

#KMP#鸿蒙#性能优化

00:00GitHub 博客(RSS)

GitHub Copilot canvases:让 Agent 工作流可见可控

GitHub 博客作者分享了在 GitHub Copilot 中使用 canvases 的实践。Canvases 为开发者和 Agent 提供持久、共享的工作表面,使工作进展可见、可引导、可审批,解决了纯聊天界面中上下文丢失、审查耗时、多 Agent 编排困难等问题。作者构建了两个 canvas 实例:Java Modernization Studio 和 Site Studio,并总结了可复用的模式:清晰定义工作流状态、突出关键决策、即时持久化进度和草稿、保留明确的人工审批点。

#GitHub#Copilot#Agent

03:46Hugging Face 博客(RSS)

同一集群利用率提升33个点,只因调整了调度顺序

Hugging Face 博客发布文章,探讨如何在不增加硬件投入的情况下,通过优化 GPU 调度顺序将集群利用率提升 33 个百分点。文章指出,调度顺序的调整是提升利用率的关键,而非单纯增加资源。作者分享了具体的实践方法,包括如何分析现有调度策略、识别瓶颈,以及如何通过重新排序任务来最大化 GPU 利用率。这一案例为 AI 基础设施团队提供了可复用的优化思路,强调在资源有限时,通过软件层面的调度优化同样能带来显著收益。

#Hugging Face#GPU调度#集群优化

19:21meng shao

AI Agent 五要素测试:判断什么业务该做成 Agent

Greg Isenberg 提出「AI Agent 五要素测试」框架,评估哪些业务适合构建为 Agent。五要素包括:重复的触发器(高频任务才值得)、稳定的输入(结构化数据)、明确的工具集(动作边界清晰)、可衡量的终点(有验收标准)、中间需要判断力(每次运行有差异需实时决策)。核心洞察:前 4 条回答「能否自动化」,第 5 条区分「Agent 还是普通自动化」。Automation 是规则驱动、路径固定;Agent 在流程中段存在决策点,需理解上下文、权衡选项、处理例外。以客户退款申请为例,前 4 条使其可自动化,第 5 条(边缘案例判断)使其必须是 Agent。

#Agent#选型框架#自动化

10:00InfoQ 中国(RSS)

盘古训练与推理通信优化实践:亲和昇腾平台的性能探索

本文是AICon深圳的演讲内容,聚焦盘古大模型在昇腾平台上的训练与推理通信优化实践。作者分享了亲和昇腾平台的性能探索经验,包括通信拓扑感知、梯度压缩、流水线并行等优化手段,以及如何通过软硬协同设计提升大规模训练效率。文章强调通信优化在千卡级集群中的关键作用,并给出了具体的调优参数与工程取舍,为在昇腾平台上进行大模型训练的开发者提供了可复用的方法论。

#盘古#昇腾#通信优化

往期存档