MarkTechPost(RSS)
美团发布了LongCat-2.0,这是一个大规模混合专家(MoE)语言模型,总参数量达1.6万亿,每个token激活约480亿参数。该模型专为智能体编程设计,支持原生100万token上下文窗口,并采用LongCat稀疏注意力机制将长上下文计算成本从二次降至线性。训练和推理完全运行在国产AI ASIC超算集群上(5万张卡),未使用Nvidia硬件。据美团测试,LongCat-2.0在SWE-bench Pro上得分为59.5,超过GPT-5.5(58.6);Terminal-Bench 2.1得分70.8,SWE-bench Multilingual得分77.3。模型采用MIT许可,权重即将开源。API已通过LongCat平台、OpenRouter等提供,定价为每百万输入token 0.75美元,输出2.95美元。
#美团#LongCat-2.0#MoE
MarkTechPost(RSS)
前阿里Qwen技术负责人林俊阳(Junyang Lin)于2026年3月3日离职,现以独立研究员身份发布长文,回顾Qwen系列模型(QwQ-32B、Qwen2.5-Max、Qwen3等)并阐述其核心观点:AI领域正从“训练模型”转向“训练Agent”。他详细解释了Qwen3混合思考模式(thinking/non-thinking)的技术难点——思考模式与指令模式在训练目标上存在冲突,导致两者兼顾时性能下降,因此后续版本(2507)改为分别提供Instruct和Thinking变体。林俊阳对比了“推理思考”(如o1、DeepSeek-R1)与“Agent思考”的区别:前者依赖确定性奖励信号(数学、代码),后者需在交互环境中制定计划、使用工具、根据反馈修正。他认为Agent时代的基础设施挑战更大,需解耦训练与推理,并优化环境质量而非数据多样性。文章还提供了Qwen3思考模式切换的代码示例(enable_thinking参数)。
#Qwen#Agent#混合思考
华尔街见闻(RSS)
OpenAI计划于7月7日发布GPT-5.6,精准卡点Claude Fable 5限额方案失效日。代码泄露显示,GPT-5.6包含Sol、Terra、Luna三大子模型,并引入"速度拨盘"功能。内测对比显示,GPT-5.6在效率和响应速度上优于Fable 5,且价格更具竞争力,Sol Ultra有望以更低价格媲美Fable 5性能。
#OpenAI#GPT-5.6#模型发布
Chubby♨️
微软研究院AI Frontiers部门合伙人研究经理Ahmed Awadallah接受专访,介绍了其团队在小型设备端智能体方面的最新进展。他们开发了Fara1.5系列模型,其中9B参数的计算机使用模型在网页导航任务上性能较前代几乎翻倍;27B参数的模型则能与Operator和Gemini 2.5 Computer Use等大型模型相抗衡。Awadallah讨论了为小模型构建智能体时的权衡、智能体何时应暂停并请求人类指令,以及智能体在个人笔记本电脑上运行的前景。
#微软#Fara1.5#设备端智能体
Rohan Paul
CAIS 和 Scale 发布的远程劳动指数(RLI)显示,Fable 5 模型在真实远程工作项目中实现了 16.1% 的自动化率,约为 Opus 4.8(8.3%)的两倍,GPT-5.5 为 6.3%。RLI 测试 AI 能否完成付费自由职业工作并获得客户接受,任务涵盖 CAD、建筑、动画、音频、数据分析和 Web 应用等复杂工具场景。Fable 5 在环形建模、动画和浴室设计等任务上表现最强。但自动评判系统对 GPT-5.5 和 Opus 4.8 的评分分别高估了约 2.9 倍和 2.3 倍。报告指出,AI Agent 的进步不仅来自模型本身,更来自更强的工具使用、完整桌面环境、专业软件、更长运行时间和工人-评论家循环等 Agent 设置。
#Fable 5#CAIS#Scale