02:07·Hacker News Best(web_list)·关联 2 源
x.ai于2026年9月21日发布Grok 4.7,定位为面向编码与知识工作的大模型。该模型基于更大的基础架构,通过更长的强化学习训练提升了对复杂任务的推理与自我验证能力,并原生支持Grok Bot harness以优化对话体验。在CursorBench 4.0等基准测试中表现优异,输入单价为每百万token 2美元,输出为6美元,并提供高速变体。此外,Grok 4.7引入了全新的安全防御栈,在生物安全及网络攻防基准上展现出高拒答率与低误拦率,目前已在Cursor、Grok Build及API渠道上线。
#x.ai#Grok 4.7#模型发布
07:05·IT之家(RSS)
小米正式发布并开源MiMo-V2.6系列全模态模型,含Pro与Flash双版本。该模型基于RSI路径探索,通过扩展RL算力训练不到6天完成。Pro版在Artificial Analysis Intelligence Index v4.3.2中获46分,超越Kimi K3等,成为当前AA指数排名最高的开源权重模型。技术层面,构建了覆盖Code等多任务体系,支持3D空间推理、具身仿真控制及形式化证明。同时开源7k+高质量RL任务环境、端到端训练框架及轻量Harness,分享验证过的训练实践。API定价沿用前代,桌面客户端同步上线并提供超高速模式。
#小米#MiMo-V2.6#模型发布
14:37·MarkTechPost(RSS)
StepFun发布旗舰模型Step 5 Preview,定位为面向软件工程、专业知识与金融领域的Agentic工作负载。该模型采用稀疏MoE架构,总参数量约600B,单次激活27B,支持1M上下文窗口及图文视频多模态输入。训练采用在线策略长程强化学习,并应用FP8 MoE、MTP-3推测解码等技术。官方报告在FrontierFinance等基准上表现接近竞品,Artificial Analysis独立评测其智能指数为44。API定价极具竞争力,输入$1.00/百万token,输出$2.70/百万token。目前提供托管API,开源权重定于2026年10月15日上线。
#StepFun#Step 5 Preview#模型发布
02:47·Rohan Paul
SpaceX旗下xAI发布Grok 4.7模型,在Harvey Legal Agent Benchmark中得分19.6%,显著高于GPT-5.6 Sol Max的2.5%和Fable 5.1 Max的6.7%。同时,该模型在Terminal-Bench 4.0上的表现从Grok 4.6的20.3%提升至38.0%,显示其在长程终端任务中的能力增强。尽管性能大幅提升,Grok 4.7的输入输出token价格仍维持在每百万token 2美元/6美元的水平。
#xAI#Grok 4.7#模型发布
02:12·宝玉
开发者 Ben Swerdlow 发起 Brood War Bench 测试,让通用大模型以智能体形式直接操控《星际争霸》。结果显示所有模型水平未超人类新手。Codex Astra 虽全胜但仅擅长骚扰;Claude Fable 表现最像玩家,尝试发展经济与科技;Grok 4.6 输出万级 token 却极少操作,将即时战略误作回合制。该测试揭示当前大模型在持续观察、快速决策及多线程协调的实时环境中能力不足,尽管已理解基本游戏概念,但执行节奏与多任务协调差距明显。测试代码与平台已开放供社区复现验证。
#Brood War Bench#大模型#Agent
23:30·Microsoft Research(RSS)
微软研究院在《Nature》发表RetroChimera,用于自动化小分子逆合成路线规划。该框架结合Transformer架构的R-SMILES 2与图神经网络NeuralLoc,通过集成学习与排序策略融合两者互补优势,提升罕见反应预测准确率。盲测显示专家更偏好其预测结果。代码与权重已按MIT协议在GitHub开源,并可通过Microsoft Foundry访问,旨在加速药物研发与新材料设计中的分子合成效率。
#Microsoft Research#RetroChimera#AI for Science
23:21·r/LocalLLaMA(Reddit)
SupraLabs开源了全新自研的DiT架构文本到图像生成模型Supra2-IMG。该模型参数量仅为1亿,在单张H100显卡上耗时不到10小时完成从零训练。尽管参数量极小,其在256x256分辨率下生成的图像质量达到当前SOTA水平。作者提供了详细的本地部署指南与推理脚本,用户可在CPU或GPU环境下直接运行代码生成图片,并公开了用于展示效果的采样参数设置。
#SupraLabs#模型发布#Supra2-IMG