07:00·elvis
一项针对Claude Code插件生态的实证研究显示,自初始发布后的六个月内,涉及插件的代码提交活动增长了8.8倍。研究团队分析了1,926个托管插件市场的仓库,涵盖8,351个插件和77,773次提交。数据显示,这些是持续维护的工件而非一次性文件,功能提交占比达39.6%,远高于传统开源项目的17.2%。软件工程任务占所有插件的61.3%,且Claude参与了数据集中34.9%的提交。此外,自然语言说明文件与实现脚本呈现协同演化特征,78%的共同变更在功能上紧密耦合,表明文本与代码已成为版本控制的单一单元。
#Anthropic#Claude Code#插件生态
05:58·Rohan Paul
一项研究指出,大语言模型的排名很大程度上由评估选择决定,而非模型本身的性能差异。在固定模型与3679道题目的前提下,仅调整提示格式、选项顺序和评分方法等常规评估参数,即可导致Gemma4-31b的得分在31%至89%之间剧烈波动,且12款模型中至少有4款能在特定有效设置下登顶榜首。数据显示,相邻模型间平均分差的95.7%源于那些对评估设置敏感的题目,其中评分方式(生成式回答与最高概率选项选择)是造成结果不稳定的最大因素。
#LLM#评测基准#学术研究
22:02·Rohan Paul
字节跳动发布新论文 Chain-of-Experience,提出在测试时通过保留模型早期的尝试过程与反馈信息来提升性能。实验显示,将杂乱的历史记录直接保留在上下文中的效果优于将其压缩为整洁的记忆摘要。在数学、代码和知识类基准测试中,引入自我反馈机制使平均正确率达到 71.0%,高于无反馈的迭代求解(66.8%);若结合正确性或执行器反馈,准确率可进一步提升至 79.3%。该方法在提升整体性能 5.6% 的同时,API 调用成本降低 19%。研究指出这属于上下文适应而非持久学习,且在需要外部搜索的任务中自我反馈可能产生负面影响。
#ByteDance#Chain-of-Experience#Agent
20:24·Rohan Paul
亚马逊新论文指出,KV缓存策略不仅是推理优化,更应改变训练范式。当大模型在推理时因稀疏注意力机制丢失部分历史上下文时,若微调阶段仍使用全注意力机制,会导致行为错乱。实验显示,在128k token测试中,全注意力微调的模型常产生冗长无意义的回答;而采用与推理相同的KV缓存策略进行微调的模型,能正常作答并适时停止。该方法支持任意缓存策略,且能在单张40GB A100上完成4B模型的梯度计算,使策略匹配训练具备工程可行性。
#Amazon#Long Context#KV Cache
03:20·elvis
腾讯发布论文ContextPilot,旨在解决长周期任务中Agent工作上下文无限增长的问题。该方法引入全局规划、长期记忆与自适应软压缩机制,使Agent能主动卸载信息而非简单丢弃。训练层面,区别于标准强化学习将最终轨迹奖励平均分配给所有中间编辑,ContextPilot利用上下文与熵的变化识别关键编辑决策,在这些节点采样分支并估算动作级优势。实验显示,在长上下文问答与深度搜索任务中,该方法在保持更紧凑工作上下文的同时,优于多个基座模型上的现有基准。代码已开源。
#Tencent#Agent#强化学习
02:12·Rohan Paul
论文提出CREST方法,解决标准强化学习中长会话整体奖励模糊单步成败的问题。该方法为每轮交互分配独立验证信用,并利用模型自身作为教师,在不覆盖验证器判断的前提下,增加对不确定决策的学习权重。在Qwen3-4B-Instruct上的实验显示,其BFCL V3平均准确率达52.0%,优于最强RL基线的49.25%。该研究通过分离方向与幅度优化,提升了多步LLM Agent的训练效率与稳定性。
#Agent#强化学习#多轮对话
01:03·Rohan Paul
论文提出 Memory-Augmented Compression,一种无需训练的链式思考压缩方法。其核心是将已解决的示例蒸馏为可复用的推理记忆,在查询时检索相关模式并注入提示词,引导模型生成更短的推理过程。该机制将部分计算从自回归解码阶段转移至并行预填充阶段,从而降低延迟。实验显示,在 Qwen2.5-7B 上应用该方法后,GSM8K 准确率恢复 21.4 分,MATH 恢复 28.0 分,且模型延迟分别比标准 CoT 快 1.49 倍和 1.14 倍。
#Chain-of-Thought#推理优化#Qwen2.5
22:30·elvis
Google发布WikiSkill论文,提出一种让AI Agent从运行经验中自动提取知识并构建持久技能库的框架。该机制通过持续积累和演化技能,解决Agent在复杂任务中的复用与调优问题。研究证实该方法具有模型无关性,跨不同模型与任务均有效,且演化后的技能可迁移至小模型甚至超越大模型表现。这为构建企业级持久知识库、提升Agent长期能力提供了新思路,展示了持久化知识对增强Agent效率与准确性的关键作用。
#Google#WikiSkill#Agent