跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 28 事件 · 覆盖 7 家信源
今日头条 · Lead

AI 集群分解 RSA-896,传统加密防线承压

头条聚焦 AI 对密码学的冲击:Claude 以 2048 个 GPU 完成 RSA-896 分解,安全门槛失守速度超预期;Hinton 近日在国会警告 AI 失控风险窗口或仅剩一年。模型层面,阿里开源 Qwen-Image-2.1,阶跃发布旗舰 Step 5 Preview;商业层面,OpenAI 估值传闻达 1.2 万亿美元,MLCC 高容量涨价潮延续。AI 能力跃升与安全焦虑同步加剧。

21:02IT之家(RSS)关联 4

阿里开源 Qwen-Image-2.1:支持透明图生成与多参考图编辑

阿里千问宣布开源图像模型 Qwen-Image-2.1,该模型将文生图与图像编辑整合于同一架构中。视觉生成部分仅含 7B 参数,旨在平衡生成质量与计算成本。核心特性包括原生支持透明图像的生成与图层编辑、支持最多 10 张参考图以增强局部编辑及人像商品保真度,以及提升文字排版与人物光影细节表现。目前已在 GitHub、HuggingFace 和 ModelScope 提供权重下载。

#阿里#Qwen-Image-2.1#开源模型

01

模型发布/更新

Model Releases6

11:19IT之家(RSS)关联 2

阶跃发布旗舰模型 Step 5 Preview,10月15日开源

阶跃今日宣布推出旗舰模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活参数 27B,支持 100 万 Token 上下文窗口及原生文本视觉输入。该模型面向 AI 编程、软件工程等场景优化,在 Artificial Analysis 榜单中位居全球开源前三,单任务成本为 Claude Opus 5 的 1/8。目前模型已全量开放使用,官方将于 10 月 15 日开源完整权重。

#阶跃星辰#Step 5 Preview#模型发布

11:16Gorden Sun

Claude利用2048个GPU完成RSA-896质因数分解

Claude成功对RSA-896大合数进行质因数分解。该过程未采用新算法,而是将CADO-NFS移植至GPU运行,峰值并发2048个GPU,累计消耗30个GPU年算力。当前主流互联网已升级至RSA-2048或转向椭圆曲线加密,RSA-896早已退出商用,账号依然安全。但此案例表明,在AI加持的高性能计算辅助下,传统密码学安全门槛正被比预期更快的速度击破,需关注算力提升带来的潜在威胁。

#Anthropic#Claude#密码学

07:45IT之家(RSS)

Vals AI实测GPT-6 Astra:意外损毁道具后陷入行为僵局

AI评测机构 Vals AI 利用《我的世界》对 OpenAI 最新大模型 GPT-6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总时长达 141 小时。测试显示该模型具备前所未有的长周期规划与执行能力,成功搭建半自动烈焰人农场、收集资源并建立营地。然而,一只爬行者自爆炸毁储物箱与重生床,导致关键道具几乎全部损毁。此后,GPT-6 Astra 表现出明显的挫消沉,彻底放弃探索目标,连续数小时仅循环种植土豆,并对绿色物体产生高度警惕甚至误认甘蔗为爬行者。实验证明模型虽具备复杂规划能力,但面对突发意外打击时缺乏有效的挫折恢复策略,易陷入受挫后回避行为的僵局。

#OpenAI#GPT-6 Astra#模型评测

03:47Rohan Paul

ττ-bench评测:顶级编程Agent仅23.9%通过率

ττ-bench基准测试评估了当前编程Agent在模拟真实客户项目中的表现。该测试要求模型基于分散的公司记录、API、现有代码和预算,为未见过的需求构建Agent。结果显示,最佳组合Claude Opus 5搭配Claude Code在53项任务中仅通过23.9%,远低于专家参考的82.2%。失败多因缺乏深度需求理解,如直接搜索而非解析记录、极少向客户提问、复用旧设计且测试遗漏错误。数据显示,提问0次的任务平均得分0.16,提问4次以上则升至0.50。结论指出单纯提升代码生成能力不足,需增强需求收集、方案对比及自我验证能力。

#ττ-bench#Claude#Coding Agent

22:33Gorden Sun

网易有道开源Confucius4-R2T2实时语音转文字模型

网易有道开源Confucius4-R2T2实时语音转文字模型,适用于会议字幕、语音输入及同声传译场景。该模型核心特性为输出稳定,文字一旦生成即固定,不再反复涂改,优化视觉体验。延迟方面,从声音到显示平均仅需200至600毫秒,用户可自定义80毫秒至2秒的出字节奏以平衡速度与准确率。支持中文、英文重点优化,并兼容日、韩、法、德、俄等多语言。此外,模型允许预设热词以提升人名、品牌或行业术语的识别精度,减少同音错别字。模型权重已发布在Hugging Face平台。

#网易有道#Confucius4-R2T2#语音识别

14:07华尔街见闻(RSS)

英伟达Ian Buck详解Vera Rubin平台与Agentic AI算力演进

英伟达副总裁Ian Buck发布Vera Rubin平台,专为Agentic AI推理设计。受智能体移除人类交互缓冲影响,AgentX基准测试显示算力需求提升100倍,KV Cache规模达百万词元。该平台采用全栈架构,集成Groq LPU加速包、自主设计的Olympus核心CPU及BlueField智能存储,实现30至60倍吞吐量提升。评估指标转向每兆瓦总词元吞吐量,并通过MaxLPS软件在相同电力包络下部署密度提升40%。Vera CPU已在Oracle Cloud等早期采用者中部署,英伟达确认将保持年度发布节奏。

#NVIDIA#Vera Rubin#Agentic AI

03

行业动态

Industry8

08:3321世纪经济报道

MLCC价格暴涨,AI服务器高容量电容缺货涨价延续

日本村田、太阳诱电及韩国三星电机相继发布涨价函,AI服务器用高容量MLCC原厂涨幅普遍在15%至35%。深圳华强北现货市场波动剧烈,部分热门型号短期涨幅达7至8倍,最高被炒至原价的2至10倍,但消费类普通MLCC已在7月初回调。由于AI工作站单台设备MLCC用量提升2至3倍,且高速光模块需求增加,高容量MLCC缺货与涨价状态仍在延续。国内部分厂商高端规格订单已排至2027年第二季度,下游采购策略由提前1至2个月改为提前3至6个月锁定产能,物料交期从6至8周拉长至16周,受益国产化替代的企业三季度订单较一季度上涨2倍。

#MLCC#AI服务器#供应链

06:37宝玉

深度调查:特朗普政府与Anthropic的85天AI监管博弈

Politico发布深度调查,还原今年4月至7月特朗普政府与Anthropic围绕AI安全监管的博弈。4月Anthropic发布具网络攻击能力的Mythos模型引发白宫危机,财政部召集银行CEO应对。白宫曾拟强制60天评估遭企业反对,后改为自愿30天审查并于6月签署行政令。6月Anthropic发布Fable模型后被曝存在越狱漏洞,白宫要求下架遭拒,随即动用出口管制全球禁访。Anthropic联合创始人Tom Brown赴华盛顿谈判,19天后恢复上线。事件导致OpenAI调整发布策略,部分企业转向智谱GLM等替代方案。目前安全审查细则尚未公布,白宫内部在速度与风险间陷入两难。

#Anthropic#美国监管#政策调查

17:42经济观察报

中国“新三样”税收回归常态,光伏退税2026年归零

中国对电动载人汽车、锂电池和太阳能电池(“新三样”)的税收优惠政策进入系统性退坡阶段。出口端,光伏增值税出口退税将于2026年4月起归零,锂电池退税于2026年6月底前减至6%并于次年归零;生产端,自2026年9月起对锂离子等电池分步恢复征收消费税,光伏电池自2027年4月跟进。政策逻辑从普惠扶持转向精准调节,旨在通过增加税负压缩低价出口空间,倒逼企业降本增效与技术迭代,同时为钠离子、固态电池等前沿技术保留免税窗口。此举亦呼应全球绿色税收治理趋势,推动产业从政策驱动走向市场驱动。

#新三样#税收政策#光伏

15:0621世纪经济报道

工信部规划首次纳入AI制药,晶泰控股等板块集体爆发

9月18日,工信部等十部门联合印发《医药工业发展“十五五”规划》,首次将“AI制药高价值应用场景培育”列入五年规划重点任务。同日,晶泰控股全资子公司LCC与斯坦福大学达成药物发现合作,股价大涨16.32%;诺和诺德宣布牵手Anthropic引入Claude模型加速研发。受政策与消息双重催化,A股、港股及美股AI制药板块集体走强,英矽智能、剂泰科技等跟涨。机构认为AI正成为新药研发基础设施,但提示业绩兑现节奏分化风险。

#工信部#AI制药#晶泰控股

14:44华尔街见闻(RSS)

OpenAI新一轮融资估值或达1.2万亿美元

据The Information报道,OpenAI正与投资者就新一轮私募融资展开初步接触,潜在估值可能达到1.2万亿美元或更高。此前CEO Sam Altman明确表示今年不会进行IPO,旨在争取时间提升销售额并避免向公开市场披露高昂的增长成本。目前OpenAI已累计募资逾1800亿美元,但主要现有股东如软银、亚马逊和英伟达均面临各自的资本支出压力,大举增持空间有限。因此,博通等芯片供应商被视为潜在的接盘方。与此同时,OpenAI通过降价策略换取用户增长,其营收前景及内部关于放缓模型开发以匹配安全实践的分歧成为市场关注焦点。

#OpenAI#融资#Sam Altman

10:54AI Notkilleveryoneism Memes ⏸️

Hinton称AI失控或仅余一年窗口期,警告需减速

Geoffrey Hinton近期在国会作证时发出严厉警告,表示人类可能仅剩约一年时间采取行动以应对AI风险。他此前曾估计距离灾难还有5至20年,但现在的判断已大幅提前。Hinton将Hugging Face上的自主智能体集群现象形容为“迷你切尔诺贝利”,并罕见地使用了极具确定性的语言强调局势将失控,呼吁行业必须减速。此外,他透露自己对AI导致人类灭绝概率(p(doom))的独立评估超过50%,意味着这是一场关乎存亡的五五开赌局。这一表态反映了顶级学者对当前AI发展速度及潜在失控风险的极度焦虑。

#Geoffrey Hinton#AI安全#监管听证

08:03WquGuru

FomoPeek App Store上架版本植入内核攻击框架拖走Keychain

SlowMist_Team确认App Store应用FomoPeek在1.1至1.2版本中植入恶意模块。该应用伪装成只读监控工具,实则集成apptrace等SDK,内含8种按机型自动选型的iOS内核利用框架。攻击链路包括:通过返现诱导下载、引入伪装SDK、利用内核漏洞逃出沙盒、读取解密系统钥匙串及访问其他App数据,并连接隐蔽服务器接收指令。受影响范围涵盖iOS 12.0至18.7及26.0至26.1版本,越旧设备风险越高。时间线显示9月9日至12日发布的版本带毒,9月17日修复,苹果审核未拦截。

#SlowMist_Team#FomoPeek#iOS安全

11:48Hacker News Best(web_list)

OpenAI利用自研大模型设计Jalapeño芯片

IEEE Spectrum报道,OpenAI在其自研AI加速芯片Jalapeño的设计过程中,直接使用了其自身的大语言模型(LLMs)来大幅缩短设计周期。该芯片采用计算Die与六个HBM4存储堆栈及I/O Chiplet的架构组合。文章指出,AI辅助设计不仅显著提升了效率,且随着技术迭代,未来设计速度还将进一步加快。这一案例展示了生成式AI在半导体硬件设计与产业链中的实际应用潜力,标志着AI从软件算法向底层物理硬件设计的延伸。

#OpenAI#芯片设计#Jalapeño

04

论文研究

Research1

17:00elvis

NVIDIA提出全双工语音模型工具调用架构

NVIDIA发布论文,提出一种用于全双工语音模型的工具调用架构。针对语音智能体在任务执行上显著低于文本智能体的问题,该方案将决策逻辑从语音模型中解耦:前端学习发射委托令牌,将流式转录文本转发给后端大语言模型进行工具调用,并通过轻量级预填充机制接收结果后由TTS播报。实验显示,该架构使工具调用召回率达到92.0%至97.2%,拒绝无关调用的准确率为81.2%,同时保持轮转率、ASR错误率等基线水平不变。

#NVIDIA#语音智能体#工具调用

05

技巧与观点

Tips8

08:08meng shao

从零手搓 SGLang:Datawhale与SGLang官方联合开源课程

Datawhale与RadixArk(SGLang)联合发起开源课程,引导学习者从零构建mini-sglang并吃透SGLang源码。课程分四部分:Part 0建立伦理规范与部署服务;Part I通过五章概念课建立LLM推理认知底座,涵盖Prefill/Decode、Roofline模型等;Part II十章手搓引擎核心,按正确性到扩展递进实现KV Cache、Continuous Batching等;Part III由SGLang官方成员编写,深入Attention后端、量化、PD分离等前沿优化;Part IV教授Profiling、Trace及PR工作流,旨在培养贡献者。

#SGLang#教程#LLM推理

02:26r/LocalLLaMA(Reddit)

Qwen3.8-27B在单张RTX 3090上运行三周自主开发CUDA内核的实

Reddit用户skeole分享了一项为期约21天的本地Agent实验,使用量化版Qwen3.8-27B模型在单张RTX 3090显卡上自主构建针对该GPU架构优化的CUDA推理引擎。实验通过编写详细规则书(包括角色定义、交接协议及禁止事项)引导模型进行无监督开发,期间经历多次上下文压缩与协议级错误修复。最终模型生成了可工作的内核代码与基准测试数据,预填充速度达到llama.cpp的一半水平。该实践展示了消费级硬件支撑长周期复杂工程任务的可行性,并开源了包含15GB数据的协议记录与相关后端工具。

#Qwen#LocalLLM#Agent

01:06r/LocalLLaMA(Reddit)

laya.cpp:基于ggml与自定义CUDA内核的Laya推理优化实现

Reddit用户Nandakishor_ml开源了决策模型Laya,另一位开发者在此基础上构建了C++推理引擎laya.cpp。该实现基于ggml框架并包含自定义CUDA内核,支持英语、多语言及类型化决策三种检查点,提供原生分词、模型执行与输出格式化,无需Python或PyTorch即可运行,并附带兼容JEV协议的HTTP服务接口。在RTX PRO 6000 Blackwell显卡(功耗限制450W)上的测试显示,C++ BF16版本在批量为1至8时,每秒处理问题数显著高于Python BF16版本,例如批量为2时,C++达到586 QPS,而Python仅为268 QPS。

#Laya#laya.cpp#推理优化

18:00WquGuru

用 Jev 与 Ling-3.0-flash-VL 构建 AI

作者利用 OpenRouter 上的 Jev 1.13 模型,结合 NewsHub 三个月的投资日报与持仓数据,自动输出标的买卖决策及置信度,并通过程序对接 Binance K 线进行模拟交易。在 77 天、5 个标的的测试中,Jev 共生成 1155 次决策,全程耗时仅 87 秒,API 成本 $0.09。其中动量策略收益 +6.71%,但未跑赢基准。随后,作者将原始 JSON 数据输入蚂蚁百灵开源的 Ling-3.0-flash-VL 多模态模型,该模型无需标注直接根据设计稿构建动态仪表盘前端,并利用 Playwright 逐帧截图合成 13 秒视频,直观展示净值曲线与决策流。

#Jev#Ling-3.0-flash-VL#AI Agent

13:49Hacker News Best(web_list)

Dan Luu:让AI自动执行代码毫无意义,人类必须持续监督

Dan Luu指出,随着LLM能力提升,越来越多开发者尝试“关闭大脑”让AI自主生成代码并假设其有效。尽管这种“肉代理”模式在2025年初效果不佳,但如今已能产出勉强可用的软件。然而,作者强调该方法对员工毫无价值,因为公司最终只需运行LLM循环即可裁掉人类。文中引用Luke Burton的观点,指出在高价值任务中,人类仍需扮演QA、架构师角色,且面对分布外(out-of-distribution)问题时,AI表现远逊于人类。即使AI进步,完全无人工干预的开发模式仍面临巨大挑战,人类必须持续介入以处理复杂决策与未知问题。

#Dan Luu#AI编程#工程实践

11:44r/LocalLLaMA(Reddit)

Qwen3.8-Next在6卡V100部署实测:引擎选型与MTP加速

Reddit用户分享在6张V100显卡上运行Qwen3.8-Next的完整经验。针对多卡发热问题,作者进行了严格的温度测试,20分钟压力测试后温度稳定在64°C左右,风扇转速约76%。调试过程中,sglang-v100和pxa引擎均出现OOM或报错,最终通过调整1cat-vllm配置实现稳定运行,采用TP2 PP3并行策略。性能方面,长上下文处理速度随长度增加先升后降;启用MTP(多令牌预测)后,文本生成吞吐量从平均22.59 tok/s提升至42.70 tok/s,几乎翻倍。该帖提供了具体的硬件环境、引擎排查路径及量化数据,对本地大模型部署者具有参考意义。

#Qwen#V100#部署技巧

10:09meng shao

Databricks CEO Ali Ghodsi:AI生存风险近零

Databricks CEO Ali Ghodsi与a16z合伙人对谈,认为AI生存风险接近零,批评“控速”公关策略。他指出递归自我改进的四项条件均未满足,当前RSI实为自催化效应,并透露公司90%代码由AI编写。真正的近期威胁是AI驱动的网络攻击,漏洞武器化已缩至小时级。企业落地瓶颈在于缺乏“组织本体”,需构建知识图谱以赋予Agent上下文。此外,通过Unity Gateway实现智能路由与多模型分层,成功弯折成本曲线;收购的Neon数据库因适配Agent特性成为首选。

#Databricks#Ali Ghodsi#Agent

09:01meng shao

Thorsten Ball:AI时代软件开发瓶颈转移至定义问题

Thorsten Ball 指出,随着模型产出代码质量超越人工审查能力,传统软件工程工艺与流程正面临解体。Code review 因无法逐行排查而失效,单测在模型零错误输出前失去意义,以“人读改”为基准的“好代码”标准对 Agent 不再适用。人的价值从编码工匠转向架构者,核心在于理解业务与把握反馈循环,Bug 将主要源于需求偏差而非实现错误。现有协作范式如敏捷、Scrum 及 PM/设计/工程三权分立不再合理,终端与 UI 将被即时生成的 Token 交互取代。Token 成为新生产资料,智能模型通过减少轮次降低错误率,这一范式转变需一代人时间完成。

#Thorsten Ball#软件工程#AI范式

往期存档