跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 11 事件 · 覆盖 4 家信源
今日头条 · Lead

阿里发布2.4万亿参数MoE模型Qwen3.8-Max

阿里今日发布2.4万亿参数MoE模型Qwen3.8-Max,在Terminal Bench等多项基准上超越Opus 4.8,并展现仅凭论文自主编程的能力;DeepMind飓风模型研究本周四发表于《自然》,可平均多提供一天预警时间;英伟达拟30亿美元入股电力商Lancium,锁定AI数据中心电力,算力压力正从GPU向CPU蔓延。

12:05Rohan Paul

阿里发布Qwen3.8-Max:2.4万亿参数MoE

阿里巴巴发布Qwen3.8-Max,2.4万亿参数稀疏混合专家模型,每token激活约950亿参数。上下文窗口100万token,单次回复最长131,072 token,思考预算262,000 token。定价每百万输入token 2美元,输出6美元,缓存读取0.17美元。Terminal Bench 2.1得分86.6,高于Opus 4.8的84.6,低于GPT-5.6 Sol的88.8;PaperBench 93.0,GPQA Diamond 92.6。技术报告显示,模型能自主编程:仅凭论文和GPU,5天写约7600行代码复现6项发现;

#阿里#Qwen#模型发布

01

模型发布/更新

Model Releases1

19:05Ars Technica AI(RSS)

DeepMind 飓风模型为预报员多争取一天预警时间

2025 年 10 月,加勒比海形成一场风暴,各天气模型对其路径预测不一。由 Google DeepMind 与 Google Research 开发的 AI 模型 WeatherNext 预测该风暴将增强并袭击牙买加,在登陆前五天以 80% 的置信度预测其将以五级飓风强度登陆。飓风梅丽莎随后在牙买加造成灾难性洪水和山体滑坡,但 AI 模型帮助预报员提前向受影响社区发出预警。本周四发表于《自然》的研究显示,WeatherNext 预测气旋的准确率空前,平均比现有模型多提供一天的预警时间,即其三天的预测准确度相当于现有模型两天的水平。

#Google DeepMind#WeatherNext#模型发布

03

行业动态

Industry3

11:32华尔街见闻(RSS)

英伟达拟30亿美元入股电力商Lancium,锁定AI数据中心电力

英伟达正将投资触角延伸至AI基础设施最底层的电力供应。据The Information报道,英伟达已同意向Blackstone支持的电力基础设施开发商Lancium投资20亿美元,换取约20%股权,并承诺在达成额外电力接入里程碑后追加10亿美元,届时持股比例将升至约30%。该交易对Lancium的企业价值估值约100亿美元。Lancium是OpenAI与Oracle在德克萨斯州Abilene建设的“星际之门”AI园区背后的电力基础设施提供商,已锁定4吉瓦电力,另有15吉瓦待接入项目。英伟达此举旨在为其芯片客户提前卡位稀缺电力资源。

#英伟达#Lancium#AI基础设施

12:07华尔街见闻(RSS)

Canva主动降速、Figma自吞推理成本,AI应用公司毛利承压

设计软件公司Canva与Figma的财报揭示AI转型的成本压力。Canva向投资者预警,年度营收增速将放缓至20%,因主动叫停一项AI功能铺开计划,需求旺盛但服务成本超预期。Figma预计第三季度营收增速从48%降至36%,坦承多款AI工具仍处测试阶段,推理成本由公司自担,无消费收入抵消,毛利率受压。消息公布后Figma股价单日跌约15%。两家公司均加大自研AI模型投入以降低成本,但自研模型建设周期与市场即时业绩要求存在时间差。分析认为,AI产品受欢迎不等于单位经济模型健康,推理费用正侵蚀毛利空间。

#Canva#Figma#AI应用

11:48华尔街见闻(RSS)

AI Agent爆发引发AWS CPU短缺,算力压力蔓延

据The Information报道,AWS高管今年5月召集工程师开会,要求尽一切可能节省算力资源,以确保EC2云服务器业务能满足未来客户需求,这一要求不仅涵盖AI芯片,也指向传统CPU服务器。随着AI Agent普及,CPU需求急剧攀升,算力紧缺从GPU蔓延至整个计算基础设施。知情人士称,AWS已设定截止期限削减计算资源占用,工程师获取CPU服务器资源从数小时延长至数天。AWS回应称仍能满足绝大多数客户需求。外部客户受影响有限,但竞价实例已愈发难以大批量获取,预示云计算成本上行压力。

#AWS#AI Agent#算力

05

技巧与观点

Tips6

09:19meng shao

Databricks 四大杠杆控 AI 编码成本

Databricks 团队基于自身实践及与 Stripe、Coinbase、Uber、Ramp 等企业基础设施负责人的交流,提出规模化部署 AI 编码工具时控制成本的四大杠杆。核心概念是区分“效率前沿”与“智能前沿”:日常编程只需“够好”的模型,而效率前沿(同等智能下价格最优)几乎每周推进,因此最大成本杠杆是持续将用量迁移到更高智能/价格比的新模型。四大杠杆包括:迁移到开源和低成本模型(需自建评测,如 Stripe 测出 Opus 4.7 质平价升而拒绝上线);动态请求与任务路由(实测成本降 30%+,质量持平);采用可见性、绊线与渐进式摩擦而非硬预算;

#Databricks#成本优化#AI编码

04:54MarkTechPost(RSS)

Shepherd:开源 Python 运行时,让 Agent 运行可分支回放

东北大学和斯坦福大学的研究人员发布了 Shepherd,一个开源的 Python 运行时基底,可将 Agent 的执行记录为类似 Git 的类型化事件轨迹,从而支持对任意历史状态进行分支和回放。与 Git 不同,Shepherd 的提交同时覆盖 Agent 进程和文件系统(写时复制),因此分支携带的是实时状态,而不仅是文件。研究团队报告,Shepherd 分支 Agent 进程和文件系统的速度比 Docker 快 5 倍,且由于分支点之前的提示前缀未变,回放时提示缓存复用率超过 95%。该框架围绕任务、效果、运行和工作区四个概念组织,权限在签名中声明,并在原生系统调用沙箱中强制执行。

#Shepherd#Agent#开源

18:33Rohan Paul

AI代理8小时让SQLite提速59%,成本不到150美元

一个名为KISS Sorcar的AI代理在不到8小时内,以不到150美元的成本,将SQLite性能提升了59%。SQLite是经过近20年优化的成熟代码库,该代理在事务处理、分析查询和blob I/O等场景中发现了多处默认配置的额外开销,通过修改代码和配置、基准测试并自我审查,最终在官方speedtest1上获得2.06倍加速,TATP上1.90倍,Star Schema Benchmark上1.30倍,kvtest上1.25倍,且超过100万项SQLite测试仍然通过。

#AI代理#SQLite#性能优化

16:41Avi Chawla

8种LLM精度格式详解:从FP32到NF4

本文用图示清晰解释了8种LLM精度格式。背景:浮点数由符号位、指数位和尾数位组成,减少指数位导致大值溢出,减少尾数位导致邻近值合并。FP32占4字节/参数,默认保留优化器状态。BF16和FP16同为16位,BF16保留8位指数,转换不溢出;FP16保留10位尾数,范围小,小梯度会清零,因此FP16训练需缩放损失。TF32在张量核心内计算,不改变存储。FP8有两种布局:E4M3用于权重和激活,E5M2用于梯度。INT8和INT4均匀量化,但离群值会破坏精度,LLM.int8和SmoothQuant用于解决。NF4非均匀分布,使QLoRA能以4位冻结基座模型。量化减少内存,但需权衡指数或尾数位。

#LLM#量化#精度格式

01:35宝玉

用Claude Design先做原型再开发,保持设计与功能一致

开发者分享工作流:开发项目第一版先用Claude Design设计UI原型,打磨后存本地,配合Baoyu-Design Skill维护。每次开发新功能前,先修改本地原型,确认后再改功能。规则写入Agents.md/claude.md后,只需说修改或增加功能,默认先改原型,确保原型与实际功能始终一致。好处是低成本验证产品与UI设计;Claude Design产出React代码和结构化JSON,通过git diff清晰查看版本变更,功能确定后agent参考diff实现代码更易。

#Claude#工作流#原型设计

09:58宝玉

用好 Agent 的 /goal 功能:目标、验证与停止条件

很多人不知道如何用好 Agent 的 /goal 功能,即给 Agent 一个目标,让它长时间运行直到完成。关键在于明确目标、验证结果和停止条件。以性能优化任务为例,作者用 Fable 5 将视频转录性能优化了 2 倍多。提示词先让 Agent 用 Moss 模型测试大视频转录,建立基准,再分析瓶颈并优化,直到认为没有优化空间。注意主要任务是分析、编排和验证,具体任务交给 subagent(Opus5)执行。停止条件设为“没有优化空间”,而非具体指标,避免过早结束或过度优化。此外,可用 worktree 验证新方案是否有效,无提升则放弃。

#Agent#/goal#提示词

往期存档