跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 23 事件 · 覆盖 8 家信源
今日头条 · Lead

阿里发布GUI智能体基座模型,对标业界旗舰

今日,阿里巴巴正式推出Qwen-UI-Agent,以真实世界为中心的GUI智能体基座模型,在移动端、电脑端及浏览器任务上全面对标甚至超越业界旗舰,标志着国产大模型在智能体应用层的重要突破。与此同时,OpenAI与Anthropic的IPO进程加速,AI行业商业化与资本运作进入新阶段;阿里财报显示AI相关产品收入持续高增,国产大模型API价格告别白菜价,行业正转向分层定价。

17:45IT之家(RSS)

阿里发布 Qwen-UI-Agent,让模型真正会用每一块屏幕

阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端及深度搜索环境。在 GUI 任务上全面对标乃至超越业界旗舰模型:移动端 MobileWorld 82.1%,真机基准 MobileWorld-Real 92.2%,AndroidDaily 97.5%;电脑端 OSWorld-Verified 79.5%,OSWorld-v2 Partial 40.0%,相比基线节省 58% 执行步数;浏览器 WebArena 73.6% 位列第一,BrowseComp-ZH 75.0%;

#阿里#Qwen-UI-Agent#GUI智能体

01

模型发布/更新

Model Releases1

06:23MarkTechPost(RSS)

Superwhisper 发布 462MB 开源文本规范化模型 S1-mini

Superwhisper 发布 S1 系列模型,包括云端语音转写模型 S1-Voice、云端指令跟随模型 S1-Language,以及开源权重模型 S1-mini。S1-mini 是 0.6B 参数的文本规范化器,基于 Qwen3-0.6B 微调,用于将 ASR 原始转录文本清理为规范书面文本:去除填充词、修正自我纠正、添加标点和大小写,并将口语数字、日期、货币和邮箱地址转为书面形式。模型通过固定系统提示词加三轴控制行(风格、结构、上下文)进行控制,仅支持英文。Q4_K_M GGUF 文件仅 462MB,可在笔记本 CPU 上运行。

#Superwhisper#S1-mini#文本规范化

02

产品发布/更新

Products2

18:28Chubby♨️

OpenAI Codex 用一周半完成 Asana 五年迁移工程

Asana 工程师原本预估需五年、约 600 万美元人力才能完成的 Enzyme 测试框架迁移,被 OpenAI 的 Codex 智能体用约一周半完成。该迁移需移除过时的 React 测试框架 Enzyme,它曾阻碍前端升级且无人敢碰。最多四个 Codex 智能体基于五句话的提示,在代码库的独立副本上并行工作,工程师每天两次审查其提案。整个项目模型与基础设施成本约 1.2 万美元。

#OpenAI#Codex#AI编程

03

行业动态

Industry8

08:17IT之家(RSS)关联 2

消息称 OpenAI 最迟 2027 年上市,CFO 已告知员工

据 CNBC 报道,OpenAI 首席财务官萨拉·弗里亚尔在全员大会上表示,公司将于 2027 年完成上市,若业务持续向好可能更早。她称 IPO 是另一种形式的融资,并提及 3 月完成 1220 亿美元融资。OpenAI 已于 6 月向 SEC 秘密提交 IPO 招股书,尚未公开具体时间表。弗里亚尔称 Anthropic 可能在未来几周解除保密状态、9 月上市,但 OpenAI 按自己节奏推进。会上数据显示,本季度 OpenAI 整体年化营收增长 35%,企业级业务增长 50%,AI 编程与办公产品周活跃用户突破 2000 万。此前多名高管相继离职,总裁格雷格·布罗克曼淡化影响。

#OpenAI#IPO#上市

06:04华尔街见闻(RSS)

Anthropic拟冲击史上最大IPO,规模或超SpaceX

据彭博援引知情人士透露,Anthropic正筹划IPO,规模预计追平甚至超越SpaceX创下的历史纪录,最快将于本月底公开递交文件。SpaceX此前以750亿美元首发规模创下史上最大IPO纪录,计入超额配售权后达862亿美元。Anthropic第二季度初步营收超115亿美元,年化营收运行率已达650亿美元,但2025年全年净亏损约420亿美元,较上年扩大约五倍。今年5月,Anthropic完成650亿美元融资,估值达9650亿美元。IPO由摩根士丹利、高盛和摩根大通联合承销,公司还考虑引入超级投票权架构以增强创始人控制力。

#Anthropic#IPO#融资

22:12华尔街见闻(RSS)

阿里电话会:AI产品ARR破495亿,平头哥芯片下半年放量

阿里巴巴在2027财年第一季度业绩电话会上披露,AI相关产品年化收入(ARR)突破495亿元人民币,占阿里云外部商业化收入35%,毛利率显著高于云产品平均水平。阿里云外部收入同比增长45%,创22个季度新高,AI相关产品收入连续第12个季度三位数增长。基于新一代平头哥芯片真武M890的超节点实例已上线阿里云并开始规模化销售,下半年将持续放量,可运行超2万亿参数大模型推理。截至8月初,真武芯片已服务超650家客户。资本开支方面,三年3800亿元投资计划已累计投入约1900亿元,管理层预计AI算力资产约三年可回收成本,未来有望缩短至2.5年。

#阿里巴巴#阿里云#平头哥

17:5021世纪经济报道

国产大模型告别白菜价:DeepSeek领涨,行业转向分层定价

8月17日起,DeepSeek-V4 API新定价生效,实行分时定价:高峰时段输出价格升至27元/百万tokens,为此前4.5倍;缓存未命中价格升至9元/百万tokens,为此前3倍;缓存命中价格上调至0.30元/百万tokens,为此前12倍;空闲时段价格为高峰时段一半。此前数月,智谱、月之暗面、MiniMax等独立模型厂商已相继上调API价格,而阿里、字节、腾讯等自有算力大厂按兵不动或变相调价。摩根士丹利统计显示,2026年二季度中国大模型平均API输入价格升至4.9元/百万tokens,输出价格升至21.9元,较2025年一季度分别上涨约48%和80%。

#DeepSeek#大模型#API定价

17:45华尔街见闻(RSS)

阿里Q2营收增9%超预期,AI投入推高资本开支

阿里巴巴公布2027财年第一季度(2026自然年Q2)财报,营收2689.53亿元,同比增长9%,略超预期。但利润承压,经营利润同比下降57%至151.61亿元,非GAAP净利润同比下降38%至207.15亿元。阿里云外部商业化收入同比增长45%,增速创22个季度新高;AI相关产品季度收入123.76亿元,连续12个季度三位数增长。AI云与算力服务分部经调整EBITA同比增133%,利润率升至12%。本季度资本性支出676.78亿元,同比增长75%,自由现金流净流出446.70亿元。

#阿里巴巴#财报#AI云

17:23The Decoder(RSS)

宇树科技IPO暴涨460%,被曝AI循环融资模式

宇树科技(Unitree Robotics)在上海IPO首日股价大涨460%,估值达到约500亿美元。然而据英国《金融时报》报道,其机器人需求很大一部分来自国有培训中心:这些机构购买机器人,再将运行产生的数据回售给制造商,形成一种循环商业模式。该模式与英伟达在美国受到的批评如出一辙,被指为中国版的“AI循环融资”。

#宇树科技#IPO#AI循环融资

19:10经济观察报

DeepSeek开源DSH,V4-Pro高峰涨价350%

8月13日,DeepSeek发布V4-Pro正式版模型,同时将智能体运行框架DSH的开发者预览版开源。8月17日新版API价格生效,首次引入峰谷分时计价:工作日高峰时段价格为其余时段2倍,旗舰模型V4-Pro高峰时段每百万Tokens输出价升至27元,较调价前上调约350%。DSH主打"一切皆插件",面向开发者,需自行搭建插件,自由度与定制空间大。截至8月18日,DSH仓库收藏突破15万、Fork逾1.6万。

#DeepSeek#DSH#开源

05:21华尔街见闻(RSS)

博通拟融资逾600亿美元,为Anthropic等提供AI芯片基础设施

据彭博社援引知情人士消息,博通正与黑石和阿波罗全球管理洽谈,计划为一项AI芯片融资交易筹集逾600亿美元债务,受益方包括Anthropic及其他公司。根据讨论方案,融资结构或包含约600亿至700亿美元的优先担保档和约300亿美元的次级债务档,合并计算总规模或高达1000亿美元。该融资拟通过特殊目的载体发行债务,博通将为优先担保档部分金额提供担保。三方已于今年6月达成合作伙伴关系,此次拟议交易与该框架下首笔已落地的350亿美元债务协议模式相近。对Anthropic而言,此举旨在提前锁定芯片资源,确保模型训练与推理端的算力;对博通而言,意在扩大芯片及数据中心设备销售,强化对英伟达的挑战。

#博通#Anthropic#融资

04

论文研究

Research2

04:18Rohan Paul关联 2

陶哲轩新论文:AI 将颠覆数学实践与价值体系

数学家陶哲轩发表新论文,探讨 AI 对数学领域的深远影响。他认为,AI 可能使证明生成变得极为丰富,而数学界尚未适应这种丰富性。陶哲轩指出,数学正进入一个类似过往的动荡时期,但此次被压力测试的不是数学真理的基础框架,而是数学价值与实践的隐性框架:什么算作贡献、奖励什么、什么被视为已理解,以及谁(或什么)被视为完成了工作。他主张,必须将这些数学界不成文的目标变得更加明确。

#陶哲轩#AI 数学#学术实践

10:34华尔街见闻(RSS)

SK海力士在《自然·电子学》发表CPO路线图,拟将光延伸至内存接口

8月20日,SK海力士与弗吉尼亚大学等机构在《自然·电子学》联合发表论文,系统阐述共封装光学(CPO)技术在高性能计算与AI领域的发展路线图,系该公司首次在该级别期刊公开AI互联架构技术蓝图。论文指出,HBM解决了芯片内部内存瓶颈,但AI集群扩展至数千块GPU后,机架间数据传输成为新制约,即“带宽墙”。论文提出“以光为中心”架构,通过光子中介层将处理器资源池与内存资源池直接相连,使多个AI加速器共享大容量内存,并设定每节点带宽超100 Tb/s、能耗低于1 pJ/bit、芯片间延迟低于10纳秒的指标。

#SK海力士#CPO#光互联

05

技巧与观点

Tips7

01:57Hacker News Best(web_list)

125M 端侧模型实时续写钢琴曲,关键在 MIDI 表示与数据清洗

作者训练了一个 125M 参数的 Transformer,在 iPhone 15 上以约 108 音符/秒的速度实时续写钢琴演奏,并开源了免费应用 RollTab。文章重点分享了几个关键工程决策:将 MIDI 事件表示为 NOTE(pitch, delta_onset, duration, velocity) 的复合 token,每个字段有独立词表与 embedding,模型每步只生成一个完整音符,避免 note-off 漂移并减少自回归步数;延音踏板在预处理阶段被烘焙进音符时长;数据集经过清洗、去重与按作品分组,规模扩到 5 倍反而变差,说明数据质量比数量更重要;

#端侧模型#MIDI#Transformer

12:48歸藏(guizang.ai)关联 2

冯骥发黑神话钟馗预告,附十条做产品工作原则

《黑神话:钟馗》制作人冯骥(尤卡)发布预告时,分享了十条做游戏的工作原则,做产品做内容均可参考。原则包括:首先打动自己,把自己与团队当作最优先目标用户;再找外部交集,先找到与自己个性相近的人;发现亮点先于消灭缺陷,先满足喜欢你的人;可体验的版本胜过满纸雄文,更相信跑起来后的感受;好玩是目标也是底线;美无定式,追求认真创造的陌生感;走投无路时提升已验证亮点的有效密度;起点看最高、终点当领跑,研究标杆并建立自己的尺度;难能可贵,护城河本质是难以被轻易取代的价值;理念是廉价的,但贯彻理念的行动是可贵的,行是知的前提。

#冯骥#游戏科学#产品方法论

04:59Latent Space(RSS)

Matt Pocock 发布 /wayfinder 技能

Latent Space 采访了 Matt Pocock,其“AI Skills for Real Engineers”项目在 GitHub 上拥有超 22 万星标,YouTube 频道有 34.7 万订阅者。Pocock 近期发布了新技能 /wayfinder,旨在帮助用户和 Agent 处理最终状态不明确的项目,即“战争迷雾”中的规划。他提到,此前规划阶段很繁重,需要不断管理上下文窗口和会话。wayfinder 作为一个编排层,可将规划拆分为多个线程,进行原型制作和研究,再汇总结果。其核心概念包括“地图”(已做出的决策)、“工单”(具体任务)和“会话”。

#Matt Pocock#Agent#技能

23:28meng shao

拆解 Agent Harness:模型变 Agent 的关键四件套

Pi 团队发文厘清被滥用的概念 Harness:Model 不等于 Agent,让模型能'做事'的正是 Harness,可简化为 Agent = Model + Harness。Harness 由四部分组成:System Prompt 是随对话注入的操作手册,约束模型行为;Tools 是供模型调用的代码能力,由模型自行判断调用时机;Agentic Loop 是行为骨架,模型在循环中自主决定重做与收尾,这是 agentic 区别于一次性问答的本质;Translation Layer 让同一 Harness 对接 Anthropic、OpenAI 或开源模型,支持能力混用与用户主权。

#Harness#Agent#架构

05:31Sydney Runkle

用Stagehand与DeepAgents构建浏览器Agent实战指南

作者分享使用Browserbase的Stagehand和LangChain的DeepAgents构建浏览器Agent的实战经验。Agent需完成复杂网页导航任务:在“Map Tap”游戏中,根据给定城市名,拖拽地图、缩放并点击尽可能接近目标城市的位置,按接近度得分。首次尝试时,Agent仅凭Browserbase和LangChain文档一次性完成,得分约300/1000;随后作者让编码Agent审查追踪记录,优化速度(使用更小模型)和准确性(提高得分);10分钟后,追踪记录中出现了满分截图。文章末尾附有构建自有浏览器Agent的指南链接。

#Browserbase#LangChain#Stagehand

00:29Chubby♨️

开源与前沿模型之争:DataCamp CEO 谈生产环境选型

DataCamp 联合创始人兼 CEO CornelissenJo 与首席 AI 官 Yusuf Saber 接受访谈,分享在服务超 1900 万学习者的平台上构建 AI 原生导师时,对开源与前沿模型的实际选型经验。讨论涵盖:哪些模型在生产环境中真正可用、开源模型是否真的便宜 10 倍、隐藏的基础设施与工程成本、缓存、延迟、质量与幻觉问题、隐私、数据驻留与供应商锁定,以及开源模型目前仍无法做到的事情。这是一场关于 AI 从演示走向真实用户、真实成本与真实失败模式的务实对话。

#DataCamp#开源模型#前沿模型

16:51MarkTechPost(RSS)

用TRL和LoRA在HH-RLHF上审计偏好偏差并微调DPO模型

本教程设计了一个端到端的偏好学习工作流,使用Anthropic HH-RLHF数据集和直接偏好优化(DPO)。首先准备Colab环境,加载并解析chosen-rejected响应对,审计数据集的结构和长度偏好偏差。然后运行词汇捷径诊断,检查表面语言模式是否能区分偏好与拒绝响应,准备带tokenizer感知长度过滤的对话数据,并构建版本鲁棒的DPO训练流程(含TRL和可选LoRA适配)。最后微调Qwen2.5-0.5B-Instruct模型,评估奖励准确率和训练行为,分析各HH-RLHF子集表现,检查潜在长度偏差,生成示例响应并保存策略。

#DPO#TRL#LoRA

往期存档