跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 22 事件 · 2 一手信源 · 覆盖 10 家信源
今日头条 · Lead

Grok 4.6发布,智能体测试力压GPT-5.6,定价减半

今日AI领域迎来多款重磅模型:SpaceXAI发布Grok 4.6,在多项智能体测试中超越GPT-5.6与Claude Fable 5,API定价仅为其他前沿模型一半;阿里开源Qwen3.8-Max,DeepSeek V4 Pro正式版上线。同时,谷歌Gemini月活突破10亿,腾讯、Nebius等加大AI基础设施投入,行业竞争与资本开支同步升温。

03:07华尔街见闻(RSS)关联 3

Grok 4.6发布:智能体测试力压GPT-5.6,定价减半

美东时间8月12日,SpaceXAI发布新一代大模型Grok 4.6,重点强化长时间运行的智能体、复杂编程、知识工作及视觉任务。在SpaceXAI公布的测试中,Grok 4.6在GDPVal-AA v2取得1753 Elo,超过GPT-5.6 Sol Max的1728分和Claude Fable 5的1741分;在Artificial Analysis Intelligence Index中与GPT-5.6 Sol Max持平,均为61分。API起售价为每百万输入Token 2美元、每百万输出Token 6美元,约为其他前沿模型的一半。

#SpaceXAI#Grok 4.6#模型发布

01

模型发布/更新

Model Releases2

04:26Hacker News Best(web_list)

Qwen3.8-2.4T-A95B 开源,首次开放 Max 级模型

阿里 Qwen 团队发布 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen 开源系列首次引入 Max 级模型。模型总参数 2.4T,激活参数 95B,采用混合架构,原生上下文长度 262,144,可扩展至 1,010,000。官方称其在编程、专业工作、研究与长程 Agent 任务上较前代有显著提升,并支持推理深度调节与历史推理上下文保留。基准测试显示,Qwen3.8-Max 在 PaperBench、AndroidBench 等多项 Agent 基准上超越 Claude Opus 4.8 与 GPT-5.6 Sol。

#Qwen#模型发布#开源

23:54华尔街见闻(RSS)关联 3

DeepSeek V4 Pro正式版上线,逼近Fable 5

北京时间8月12日深夜,DeepSeek官网API文档更新,模型版本从V4-Pro预览版切换至DeepSeek-V4-Pro-0813,API价格暂未上调。该模型支持1M上下文、最高384K输出,并支持JSON Output、Tool Calls、Responses API、Anthropic API及FIM等功能。据官方群流出的评测表,新模型在多项智能体测试中逼近Anthropic的Claude Fable 5,部分项目甚至超过,相比预览版提升明显。但官方尚未发布正式更新日志,评测数据非官方披露。

#DeepSeek#模型发布#V4 Pro

02

产品发布/更新

Products1

09:20华尔街见闻(RSS)关联 3

马斯克旗下xAI推出AI代理Grok Bot,对标Anthropic与Open

马斯克旗下xAI(文中称SpaceXAI)于8月11日发布AI代理产品Grok Bot,目前处于早期测试阶段,支持Windows桌面端和iOS,面向SuperGrok Heavy、Cursor Ultra及Cursor Teams Premium订阅用户开放,企业用户可加入候补名单。Grok Bot定位为“永远在线的AI队友”,拥有独立云端计算机,可登录用户现有工具(包括无API接口的平台)像真人一样操作,任务完成后返回汇报。多个Bot可并行运作、共享上下文。该产品已在xAI内部用于销售、财务、运营、工程等场景,据称可提升效率2-3倍。

#xAI#Grok Bot#AI代理

03

行业动态

Industry8

10:15华尔街见闻(RSS)关联 5

Gemini月活破10亿,追平ChatGPT成谷歌增速最快产品

谷歌CEO皮查伊8月12日宣布,AI助手Gemini月活跃用户突破10亿,成为谷歌史上增速最快产品,也是谷歌第14款月活达10亿的产品。此前7月底财报披露Gemini月活为9.5亿,不足一个月即跨越里程碑。OpenAI CFO表示ChatGPT已拥有逾10亿活跃用户及逾200万企业客户,两大AI平台几乎同步跨过十亿门槛。谷歌披露,Gemini iOS平台活跃用户超1亿,63%用户直接通过Gemini应用交互,63%用户使用语音交互,每日生成图像超1.5亿张,可跨40余款应用执行自动化操作。分析认为,ChatGPT仍是用户规模更大的平台,但Gemini增速更快。

#谷歌#Gemini#ChatGPT

00:49华尔街见闻(RSS)

Nebius Q2营收暴增454%,AI云销售额飙升514%

AI云计算基础设施公司Nebius公布二季度财报,营收同比增长454%至5.823亿美元,超市场预期,股价盘中大涨逾23%。AI云业务销售额同比暴增514%至5.75亿美元,占总营收约98%。公司签署四笔核心AI云合同,客户包括Reflection、Cohere等,每笔平均价值超10亿美元,总价值较上季度接近翻两番。算力定价走强,首次容量拍卖成交价较Blackwell GPU最高历史报价高15%。调整后EBITDA达2.362亿美元,去年同期亏损2100万美元,利润率升至41%。资本支出约57亿美元,用于GPU采购和数据中心扩建。公司将2026年底签约用电容量目标上调至5吉瓦。

#Nebius#AI云#算力

17:24华尔街见闻(RSS)

腾讯Q2营收增11%超预期,AI算力采购推资本开支至528亿

腾讯控股2026年第二季度营收同比增长11%至2048亿元,略超市场预期;净利润同比增长0.7%至560亿元,低于预期。资本支出大幅跳升至528亿元,远超预期的321亿元,较上年同期191亿元近翻三倍,导致本季录得138亿元负自由现金流。公司称,若剔除AI算力采购预付款项,自由现金流为376亿元。管理层将支出定性为对AI基础设施的战略性投入,用于支持混元Hy模型升级、WorkBuddy及CodeBuddy推理需求、微信AI举措及外部云服务需求。国内游戏收入473亿元,同比增17%。营销服务收入435.7亿元,超预期2.9%,AI广告推荐模型Rank Up已全量上线。

#腾讯#财报#资本开支

02:51Rohan Paul

Cognition洽谈超400亿美元估值,3个月内翻倍

据彭博社报道,AI编程公司Cognition正洽谈新一轮融资,估值可能超过400亿美元,而3个月前其估值刚达到260亿美元。新融资规模可能超过10亿美元。Cognition的年化收入运行率已接近10亿美元,估值约为年化收入的40倍。今年5月,Cognition报告的年化运行率为4.92亿美元,同时Devin的企业使用量连续6个月环比增长50%。若达到10亿美元,意味着其收入运行率自5月以来增长约103%。

#Cognition#融资#估值

10:08meng shao

前千问负责人林俊旸官宣创业,成立Pragmatik Labs

前阿里千问大模型负责人林俊旸正式官宣创业方向,成立新公司 Pragmatik Labs(语用科技),简称 p7k。公司研究方向横跨数字世界与物理世界,覆盖软件层面的数字 Agent 与面向真实物理环境的具身智能。本轮融资由高榕创投与红杉中国联合领投,腾讯与上海未来产业基金跟投。据 The Information 此前报道,融资规模达数亿美元,投后估值约 20 亿美元。

#林俊旸#Pragmatik Labs#创业

08:53IT之家(RSS)关联 2

面壁智能启动IPO,办理辅导备案登记

证监会网站披露,北京面壁智能科技股份有限公司于2026年8月11日在北京证监局办理辅导备案登记,拟首次公开发行股票并上市,辅导券商为中信证券。辅导备案报告显示,该公司无控股股东,第一大股东为北京清语启航科技中心(有限合伙),持股比例16.45%。面壁智能(ModelBest)2022年孵化自清华大学NLP实验室,专注于高效端侧大模型和开源生态,标志性产品为MiniCPM端侧系列大模型。

#面壁智能#IPO#端侧大模型

05:43Ars Technica AI(RSS)

LiteLLM供应链攻击致海量凭据泄露,波及微软亚马逊等巨头

安全公司CloudSEK和Hudson Rock于周二和周三披露,开源AI开发工具LiteLLM遭遇供应链攻击,导致数TB凭据泄露,涉及微软、亚马逊、思科、三星、Salesforce等众多大型敏感组织。攻击发生在3月,受害者从Python包索引官方位置下载了被篡改的LiteLLM版本,攻击者在40分钟内窃取了云密钥、仓库令牌、SSH密钥、Kubernetes密钥、包发布凭据、环境变量及AI提供商密钥,可能使攻击者访问超过2500个组织。Hudson Rock在分析一个195TB的文件时发现此事件,但两家公司均未确认信息来源。

#LiteLLM#供应链攻击#安全

08:32华尔街见闻(RSS)

存储长协从三大厂扩散至闪迪长鑫,合约期拉长至五年

全球存储芯片供应紧张,长期供应协议(LTA)已从三星、SK海力士与美光三大厂扩散至闪迪和中国长鑫存储。苹果曾试图与长鑫商谈更低DRAM采购价,但遭拒绝,因华为、小米等本土企业已通过长期合同锁定其产能。行业合约期限从一年拉长至五年为主,三星以五年为基础并设逐年滚动续约,SK海力士覆盖前十大LTA客户,美光已与16家战略客户签约,闪迪八家客户加权平均合约期超四年。预付款机制全面落地:美光预计收到约220亿美元现金定金,闪迪披露逾110亿美元财务担保及165亿美元违约保护,三星已收取约四分之一预付款。高盛称预付款机制是本轮LTA周期最显著区别。

#存储芯片#LTA#长鑫存储

05

技巧与观点

Tips8

02:26Hacker News Best(web_list)

Tailscale 追查 SQLite 16 年 WAL 重置 bug 始末

Tailscale 在去年底至今年初遭遇多次服务中断,根源是一个存在于 SQLite 中长达 16 年的 WAL 重置 bug。其控制平面采用分片架构,每片使用单一 SQLite 数据库,自 2022 年起作为主数据库。去年 8 月首次发现备份数据库损坏,此后六个月内共发生 19 次损坏。损坏仅影响配置元数据,不涉及私钥或流量,但导致受影响 tailnet 的控制平面中断,恢复时间从最初的一小时以上逐步缩短。团队排查了近期变更、代码审查、寻找共性因素均无果,最终借助 SQLite 开发者的专业支持,通过部署被动取证遥测逐步排除多种理论,定位到该 bug 并修复。

#Tailscale#SQLite#故障排查

02:20elvis

CLAUDE.md为何不断膨胀:指令累积的实证研究

一项针对CLAUDE.md和AGENTS.md文件的研究揭示了其无限增长的原因:追加指令成本低,而删除指令需要指数级验证成本,导致无人清理。研究分析了1867个仓库中247694条指令的生命周期,发现提示词在生命周期内增长超过三倍,每次提交平均净增4.9条指令,且指令越旧越难被删除。提出的解决方案是在指令旁添加注释,记录其存在理由,在可验证环境中可消除99.3%的多余指令,并将真实智能体指令遵循能力提升最高23.1%。该研究为AI工程实践提供了可操作的优化建议。

#CLAUDE.md#AGENTS.md#工程实践

02:00GitHub 博客(RSS)

AutoGPT 如何管理 AI 生成的 PR:从拒绝到引导

AutoGPT 创始 AI 工程师 Nicholas Tindle 分享了维护开源项目时应对 AI 生成 PR 的经验。AutoGPT 拥有超 18 万 star 和约 150 个开放 PR,其中大量由 Copilot、OpenClaw 等代理编写。他们发现改进文档无效,因为代理不会主动阅读,于是将指令放在代理可见的位置,如 AGENTS.md 和技能文件。他们设置了有效门禁:强制 PR 模板、要求测试计划、将 CI 作为硬性检查、用 CLA 签名作为人类检测器、要求解决审查线程时提供提交 SHA。他们还关闭了自动评论失败的 CI 功能,以避免噪音。最后提醒注意 AGENTS.

#AutoGPT#开源维护#AI代理

01:37MarkTechPost(RSS)

Tulu 3 后训练教程:SFT、DPO、GRPO 全流程

本教程基于 AllenAI 的 Open Instruct 框架,构建了一个端到端的后训练流水线,用于训练紧凑型指令微调语言模型。教程涵盖三个主要训练阶段:监督微调(SFT)、直接偏好优化(DPO)以及使用 GRPO 的可验证奖励强化学习(RLVR),并将原始的多 GPU Tulu 3 技术栈适配到 16 GB 运行时环境。作者克隆 Open Instruct 仓库,选择性加载其原生损失函数和工具函数,配置 LoRA 适配器,为每个训练阶段准备 GSM8K 数据,并使用确定性验证器评估生成的数学答案。

#AllenAI#Open Instruct#后训练

10:31华尔街见闻(RSS)

AI宠物芙崽如何养成:对话超40分钟,记忆召回低于100毫秒

AI陪伴机器人“芙崽”由珞博智能推出,自2025年7月国内开售以来累计销量近30万台,活跃用户日均对话超40分钟。创始人孙兆治在与华尔街见闻对谈中透露,产品采用全云端架构,模型、Agent和长期记忆运行在云端,每轮对话记忆召回耗时控制在100毫秒以内。实时对话优先使用响应更快的模型,而长周期任务(如梳理话题、写日记)则调用推理更强的模型。公司已完成亿元级Pre-A轮融资,芙崽已进入日本市场,众筹金额超8300万日元,计划今年第四季度进入美国。孙兆治认为行业壁垒在于IP构建、AI应用和消费电子级硬件能力,并强调出海需深度本地化,如日本版经过近一年准备,对角色性格、声音等做了多轮调整。

#珞博智能#AI陪伴#长期记忆

00:24Hacker News Best(web_list)

AI正在移除软件工程的中产阶级

作者认为,AI 让缺乏工程文化的项目更快失败。过去,团队会先讨论再实施,而现在开发者可以直接让 AI 代理生成大量代码并提交 PR,导致代码库迅速变得混乱复杂。文中描述了 2026 年一个典型场景:工程师面对 25000 行的 PR,无法解释数据来源,只能依赖 Claude 对话记录。作者指出,虽然技术债务一直存在,但 AI 加速了其积累,使得修复成本极高。他认为,AI 将拉大工程师薪资差距:优秀工程师因 AI 而更有价值,而平庸工程师则面临被淘汰的风险。核心观点是,判断力成为最稀缺的能力,能够评估 AI 输出的人将获得更高回报。

#AI工程实践#软件工程#技术债务

21:01Interconnects(RSS)

AI 教科书作者反思:长文非虚构写作仍是模型短板

Interconnects 作者 Nathan Lambert 在完成新书《基于人类反馈的强化学习》后撰文反思,认为尽管 LLM 在编码、数学等任务上进步神速,但在长文非虚构写作上却停滞不前。他指出,模型能写好单句,却难以组织整章内容,常出现措辞混乱、结构松散和概念错误。他观察到 GPT 模型擅长校对,而 Claude 模型更擅长编辑,能提供有品味的建议。他认为写作能力与模型擅长的其他技能正交,缺乏针对性训练数据是主因,并担忧这会影响模型自主解决开放科学问题的能力。他分享了利用 Claude Code 处理编辑意见、采纳少量 AI 生成句子的实操经验,强调人类作为引导者的必要性。

#AI写作#LLM#工程实践

10:00InfoQ 中国(RSS)

蚂蚁AI驱动的生产级软件交付基建与实践

在AICon深圳大会上,蚂蚁集团分享了其AI驱动的生产级软件交付基建与实践。该实践围绕代码生成、代码评审、测试生成、缺陷定位等环节,构建了覆盖研发全流程的AI辅助工具链。蚂蚁通过自研的代码大模型,结合企业级知识库与工程数据,实现了对代码生成质量的持续优化,并在实际业务中落地。同时,蚂蚁还建立了AI生成代码的安全与合规审查机制,确保交付质量。此次分享为软件研发领域的AI应用提供了可参考的工程化路径。

#蚂蚁集团#AI工程实践#软件交付

往期存档