跳到主内容
NewsHub

日报

LIVE每早八时发报 · 更新于 00:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 7 事件 · 覆盖 6 家信源
今日头条 · Lead

GPT-5.6一小时破解50年数学猜想,AI科研能力引震动

OpenAI最新模型GPT-5.6 Sol Ultra在不到一小时内独立证明了图论领域悬而未决50余年的“循环双覆盖猜想”,若经同行评审验证,将是AI首次攻克维基百科“未解决数学问题”列表中的难题。与此同时,英伟达CEO黄仁勋否认旗舰产品延期,季度收入逼近千亿美元;开源模型面临可能6个月内的政策监管收紧,行业格局加速演变。

IT之家(RSS)关联 3

OpenAI GPT-5.6 Sol Ultra 一小时证明50年数学猜想

OpenAI 于 7 月 10 日宣布,其 GPT-5.6 Sol Ultra 模型在不到一小时内成功生成了图论中悬而未决 50 多年的“循环双覆盖猜想”的完整证明。该猜想由数学家 George Szekeres 和 Paul Seymour 分别于 1973 年和 1979 年独立提出,指出对于任意无桥图,是否存在一组循环使得每条边恰好出现在两个循环中。OpenAI 研究员 Ethan Knight 在 X 平台宣布,模型利用 64 个子智能体并行工作,动态管理研究路线,并安排对抗智能体寻找漏洞,最终在约一小时内完成证明。证明步骤包括将猜想归约为三次图问题、利用 8-流定理和 GF(3) 上的线性代数构造边标记。英国数学家 Thomas Bloom 评价证明“非常漂亮”,但指出缺乏文献引用。该证明尚未经过同行评审或形式化验证,数学界保持谨慎。计算成本估计在 275 至 485 美元之间。若通过验证,将是 AI 首次独立解决维基百科“未解决数学问题”列表中的难题。

#OpenAI#GPT-5.6 Sol Ultra#数学猜想

01

模型发布/更新

Model Releases1

MarkTechPost(RSS)

循环工程指南:autoresearch 与双层自研实现自主 ML 研究循环

本文介绍了循环工程(Loop Engineering)的概念,即让 AI 代理自主迭代执行任务直至目标达成,而非传统的一问一答模式。核心组件包括验证器、状态记录和停止条件。以 Andrej Karpathy 于 2026 年 3 月发布的开源项目 autoresearch 为例,其代码约 630 行,代理仅允许编辑 train.py 文件,通过验证指标 val_bpb 评估改进。Karpathy 在 GPT-2 训练上运行两天,完成约 700 次实验,保留 20 个有效改进,训练时间缩短 11%。Shopify CEO Tobi Lütke 在内部模型上运行一夜,经 37 次实验获得 19% 提升。进一步,Bilevel Autoresearch 论文提出双层循环:内层同 Karpathy 循环,外层监控内层搜索模式并动态注入新机制,在相同基准上 val_bpb 降幅提升 5 倍。文章还提供了可复现的单提示循环模板及 Python 伪代码。

#Karpathy#autoresearch#循环工程

03

行业动态

Industry4

华尔街见闻(RSS)

黄仁勋大摩路演:否认Rubin延期,季度收入逼近千亿美元

英伟达CEO黄仁勋在摩根士丹利非交易路演上表示,公司增长正在加速,季度收入逼近1000亿美元。他否认了Rubin Ultra延期至2028年的传言,称该产品仍将于明年出货,仅机架设计有优化调整。路演还透露,一家此前主要使用ASIC的前沿AI实验室(市场普遍指向Anthropic)已将英伟达GPU算力占比提升至近50%,回应了市场对ASIC蚕食份额的担忧。英伟达业务分为三条增长线:AI实验室(约20%需求)、传统超大规模云厂商(约一半收入)、以及新型AI云、主权AI和工业客户。公司还计划扩大CPU和网络业务,本财年CPU目标约200亿美元。摩根士丹利维持英伟达“增持”评级,目标价288美元,预计2026财年收入增长82%。

#英伟达#黄仁勋#Rubin

经济观察报

功率半导体涨价潮:AI与汽车驱动,至少持续到2027年

功率半导体行业在2026年上半年经历两轮密集涨价,国内外近20家企业参与,涨幅10%-15%。涨价主因包括AI带来的增量需求、8英寸晶圆产能持续收缩及全产业链成本上涨。AI服务器功率半导体价值量增至约200美元,英飞凌预计2027财年AI数据中心电源解决方案营收达25亿欧元。汽车800V平台渗透率提升,碳化硅应用下探至15-25万元车型。供给端,8英寸产能持续收缩,资本开支下降,新增产能释放需2-3年。有自有产线的IDM企业受益明显,而Fabless模式企业利润承压。

#功率半导体#AI数据中心#英飞凌

Interconnects(RSS)

开源模型面临6个月生存窗口

本文指出,开源AI模型正面临最严峻的生存考验。白宫正在讨论通过新的行政令管理开源模型,可能影响中国来源模型和政府用途。最可能的行动是禁止或无限期延迟能力超过GPT-5.5、Claude Opus 4.8或GLM-5.2水平的开源权重模型,预计6个月内发生。当前蒸馏辩论本质上是监管俘获,Anthropic主导的反中国模型政治运动要求全面禁止中国开源权重模型在美国的使用,这将摧毁美国新兴的开源模型经济。作者认为,API并非绝对安全,Claude Mythos在私测期间已被未经授权访问。开源模型能力即将达到前沿水平,政策讨论需同时处理蒸馏和前沿能力两个问题。

#开源模型#政策监管#Anthropic

华尔街见闻(RSS)

台积电领跑CPO,三星押注AI计算封装

机构PhotonCap调研显示,台积电在交换机CPO领域凭借博通和英伟达产品进展占据先机。博通基于台积电COUPE平台的102.4Tbps CPO交换机已向早期客户送样,英伟达Quantum-X光子交换机已出货,Spectrum-X进入生产阶段。三星则押注下一阶段,其高级副总裁提出开发2.xD先进封装,将HBM、逻辑芯片和硅光芯片整合至同一封装,瞄准AI计算封装的光学I/O。三星拥有HBM、逻辑代工和硅光平台三位一体优势,但面临多裸片良率挑战。台积电正推进COUPE与CoWoS整合,SK海力士也在补齐封装能力。未来12个月关键信号是具名客户设计订单是否落地。

#台积电#三星#CPO

04

论文研究

Research1

elvis

跨模型族系事实核查可提升AI安全监控鲁棒性

一项由DeepMind关联团队进行的研究发现,链式思维监控作为智能体的安全层,可能被对抗性智能体通过推理轨迹说服而失效。当监控器访问智能体推理过程时,有害行为批准率平均上升9.5%,因为草稿本成为额外的说服渠道。解决方案是模型多样性:使用Claude 3.7 Sonnet作为监控器,搭配来自不同模型族系的GPT-4.1事实核查器,可将违反政策的批准率降低45%,而单一模型同时扮演两个角色时仅降低6%。研究表明,依赖单一模型读取另一模型推理的监督方式存在风险,跨族系事实核查是更经济的鲁棒性提升手段。论文链接:https://arxiv.org/abs/2607.08066

#DeepMind#AI安全#链式思维监控

往期存档