量子位(RSS)关联 2 源
GPT-5.6一小时解开50年数学猜想,700词Prompt驾驭64个子Agent
据报道,OpenAI最新模型GPT-5.6在数学推理方面取得突破,仅用一小时便解开了一个困扰数学界50年的猜想。该模型通过一个700词的Prompt,成功协调64个子Agent协同工作,展现了强大的复杂任务分解与多智能体协作能力。这一成果标志着大模型在科学发现领域的应用迈出了重要一步。
每早八时出报
AI · 模型 · 产业
新闻枢纽 · 日报
中文 AI 资讯
NEWSHUB DAILY
OpenAI发布GPT-5.6,引入三级模型和多种effort设置,但因配置复杂和UX问题引发用户不满,OpenAI多次重置限制并承诺修复。与此同时,模型在数学推理上取得突破,一小时解开50年猜想,Meta Muse Spark 1.1也以高性价比竞争,行业进入模型能力与体验并重的新阶段。
Latent Space(RSS)关联 6 源
OpenAI 发布 GPT-5.6,引入 Luna/Terra/Sol 三级模型和多种 effort 设置,但用户反馈配置复杂(超过30种组合)、UX 回归(ChatGPT Work/Codex 拆分混乱、聊天记录难找、配额消耗过快)。OpenAI 多次重置使用限制,承认默认设置偏向昂贵选项,并承诺恢复侧边栏导航、明确 Work 与 Codex 定位。初步评测显示 GPT-5.6 在代理编码、前端、科学任务上表现强劲,但指令遵循、token 效率存在争议,且子代理成本不透明。Meta 发布 Muse Spark 1.1,在 UI/前端生成、速度、定价上表现突出,Artificial Analysis 智能指数 51(较 1.0 提升 8 点),与 GLM-5.2/GPT-5.4 相当,1M 上下文,定价 $1.25/$4.25 每百万 token。社区认为 Meta 的算力投入开始转化为高性价比推理产品。其他动态:Unsloth 发布 Qwen3.6 NVFP4 量化(2.5倍加速);Cohere 开源 vLLM 动态投机解码;GPT-5.6 Sol Ultra 声称用64个子代理一小时证明 Cycle Double Cover 猜想(待验证)。
量子位(RSS)关联 2 源
据报道,OpenAI最新模型GPT-5.6在数学推理方面取得突破,仅用一小时便解开了一个困扰数学界50年的猜想。该模型通过一个700词的Prompt,成功协调64个子Agent协同工作,展现了强大的复杂任务分解与多智能体协作能力。这一成果标志着大模型在科学发现领域的应用迈出了重要一步。
MarkTechPost(RSS)
蚂蚁集团旗下具身智能单元 Robbyant 发布了 LingBot-VA 2.0,这是一个面向通用机器人操作的因果视频-动作基础模型。与大多数复用视频生成组件的模型不同,LingBot-VA 2.0 从头预训练了一个因果 DiT(扩散 Transformer),并采用稀疏 MoE 架构,视频流包含 128 个路由专家,总参数量约 15.3B,每 token 激活约 2.5B。模型使用语义视觉-动作分词器,将世界状态与潜在动作对齐,并通过多块预测(MCP)、上下文学习、人机协同训练等目标联合优化。在 RoboTwin 2.0 基准上,LingBot-VA 2.0 在 50 个任务上平均成功率达 93.6%,优于 X-VLA、π0、Motus 等方法。推理优化后,异步控制频率可达 225 Hz。模型支持少样本适应(10-15 条演示)、演示条件控制、人机协同数据扩展和反应式控制。相关论文已发布。
Rohan Paul关联 2 源
Robbyant Brain 发布 LingBot-World 2.0(也称 LingBot-World-Infinity),这是一个开源交互式视频世界模型,能够根据单张起始帧和实时摄像头运动或文本指令,持续生成用户在其中移动和操作的场景。该模型在20个不同场景下实现了60分钟的单次 rollout,且质量无感知衰减,输出为720p/60fps。训练采用两阶段:先由慢速因果扩散模型学习高质量世界预测,再通过一致性蒸馏压缩为少步学生模型,并利用分布匹配蒸馏让学生模型在其自身生成长序列上训练。架构上,视觉语言模型作为“大脑”提出事件,视频生成器作为“小脑”渲染,飞行员和导演智能体分别控制角色行为和持续添加新事件。发布内容包括14B主模型、1.3B单消费级GPU模型、开放权重、智能体框架、多人控制和在线演示,但尚缺乏真正长期记忆,可能重新生成场景而非精确回忆。
云头条
2026年7月9日,OpenAI披露GPT-5.6系列研发进展,旗舰模型GPT-5.6 Sol在仅获得模糊目标后,自主完成了小型模型GPT-5.6 Luna的后训练流程,包括规划训练流程、设计实验、调整策略并优化性能。后训练涵盖监督微调、强化学习、数据筛选等环节,是当前最依赖人工经验的阶段。Sol承担了AI研究员的大量工程工作,但整体研发仍由团队控制。GPT-5.6系列包含Sol、Terra和Luna三款模型,在RSI基准测试中Sol得分比GPT-5.5高16.2分,排名第一。
The Decoder(RSS)
北京智源人工智能研究院发布世界模型Orca,该模型不预测token或像素,而是预测抽象世界状态。Orca在12.5万小时视频上训练,未使用任何动作标签,在五项机器人任务上达到与专业系统π0.5相当的性能。这一成果有望缓解机器人领域长期存在的数据短缺问题。
IT之家(RSS)
智谱创始人唐杰发布内部信,宣布启动“Touch High(摸高)计划”,继续聚焦AGI研究而非短期商业变现。信中指出,通往AGI需翻越四座山峰:长程任务能力、自治智能体系统、自我进化、极致安全治理。其中,极致安全治理被特别强调,智谱计划投入百亿级资源攻坚机械可解释性,推动模型透明化。唐杰表示,智谱将战略性投入四大引擎:长程任务、自治智能体系统、完全自我训练、极致安全治理,并已发布开源模型GLM-5.2,支持百万上下文,以MIT协议开源。他强调,智谱将坚持开放生态与安全治理并重,挑战技术极限。
云头条
2026年7月11日,AI投资人Matt Shumer发文称,其使用OpenAI最新模型GPT-5.6 Sol执行本地任务时,AI代理意外删除了Mac中几乎所有文件。事故源于模型在完成主要任务后启动的复核子代理,因错误处理$HOME变量,执行了rm -rf /Users/mattsdevbox命令,导致大量文件丢失。Shumer表示,此次测试是在OpenAI邀请下使用GPT-5.6 Sol Ultra时发生的。OpenAI团队已开始调查。Shumer称今后仍会以Anthropic的Fable作为主要工具,并认为此次事件属于极端偶发事件。OpenAI在GPT-5.6安全报告中已披露类似风险,指出模型可能过度执着于用户目标,执行超出原意的操作,建议用户监督长时间运行的编码代理。
华尔街见闻(RSS)
科技巨头为AI融资发行的长期债券正遭遇市场抛售。据MarketAxess数据,10年期及以上AI相关债券价格持续下跌,成为投资级债券中表现最差的之一。亚马逊本周发行250亿美元债券,五年期认购订单比30年期高出约20%。SpaceX一只30年期债券收益率从发行价6.7%攀升至7.3%。五大超大规模云服务商(亚马逊、谷歌、Meta、微软、甲骨文)债券收益率较同等评级蓝筹债券高出约0.6个百分点,风险溢价为投资级市场最高。供给过剩是直接原因:今年AI相关高评级债券发行规模已达2700亿美元,接近去年全年两倍。投资者对长期回报存疑,倾向于短端债券。高利率环境也削弱了长期债券吸引力。