跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 56 事件 · 6 一手信源 · 覆盖 22 家信源
今日头条 · Lead

Meta AI助手Muse登顶应用商店,股价大涨13%

今日AI领域动态密集:xAI正式发布Grok 4.7,编码与长程终端任务能力显著提升;Meta AI助手Muse上线六天登顶苹果与谷歌免费榜,带动股价大涨13%。TypeSafe的决策模型Jev以极低成本和高速度引发开发者热议,而亚马逊同日封锁Muse购物通道,AI代理与传统平台的规则博弈进一步升级。

07:09Simon Willison 博客(RSS)关联 2

TypeSafe AI发布决策模型Jev:输出概率而非文本

TypeSafe AI推出首款“System One”(决策)模型Jev,输入文本但输出浮点数、置信度及分类结果,涵盖Yes/No、多选与评分三类问题。其API按输入计费,每百万token仅0.042美元,输出免费且支持并行评估,速度极快。Simon Willison指出该模型适用于垃圾邮件检测、标签建议等分类任务,并尝试用于搜索重排序。但他也警告其为黑盒系统,缺乏可解释性,存在潜在偏见风险,需依赖严格评估。社区已出现基于开源模型的复刻项目如Kev,以及JevBench基准测试。

#TypeSafe AI#Jev#决策模型

01

模型发布/更新

Model Releases7

02:07Hacker News Best(web_list)关联 2

x.ai发布Grok 4.7:强化编码与长任务能力

x.ai于2026年9月21日发布Grok 4.7,定位为面向编码与知识工作的大模型。该模型基于更大的基础架构,通过更长的强化学习训练提升了对复杂任务的推理与自我验证能力,并原生支持Grok Bot harness以优化对话体验。在CursorBench 4.0等基准测试中表现优异,输入单价为每百万token 2美元,输出为6美元,并提供高速变体。此外,Grok 4.7引入了全新的安全防御栈,在生物安全及网络攻防基准上展现出高拒答率与低误拦率,目前已在Cursor、Grok Build及API渠道上线。

#x.ai#Grok 4.7#模型发布

07:05IT之家(RSS)

小米开源MiMo-V2.6双版本模型,AA指数开源第一

小米正式发布并开源MiMo-V2.6系列全模态模型,含Pro与Flash双版本。该模型基于RSI路径探索,通过扩展RL算力训练不到6天完成。Pro版在Artificial Analysis Intelligence Index v4.3.2中获46分,超越Kimi K3等,成为当前AA指数排名最高的开源权重模型。技术层面,构建了覆盖Code等多任务体系,支持3D空间推理、具身仿真控制及形式化证明。同时开源7k+高质量RL任务环境、端到端训练框架及轻量Harness,分享验证过的训练实践。API定价沿用前代,桌面客户端同步上线并提供超高速模式。

#小米#MiMo-V2.6#模型发布

14:37MarkTechPost(RSS)

StepFun发布Step 5 Preview:600B MoE模型

StepFun发布旗舰模型Step 5 Preview,定位为面向软件工程、专业知识与金融领域的Agentic工作负载。该模型采用稀疏MoE架构,总参数量约600B,单次激活27B,支持1M上下文窗口及图文视频多模态输入。训练采用在线策略长程强化学习,并应用FP8 MoE、MTP-3推测解码等技术。官方报告在FrontierFinance等基准上表现接近竞品,Artificial Analysis独立评测其智能指数为44。API定价极具竞争力,输入$1.00/百万token,输出$2.70/百万token。目前提供托管API,开源权重定于2026年10月15日上线。

#StepFun#Step 5 Preview#模型发布

02:47Rohan Paul

Grok 4.7法律与终端任务大幅跃升,定价不变

SpaceX旗下xAI发布Grok 4.7模型,在Harvey Legal Agent Benchmark中得分19.6%,显著高于GPT-5.6 Sol Max的2.5%和Fable 5.1 Max的6.7%。同时,该模型在Terminal-Bench 4.0上的表现从Grok 4.6的20.3%提升至38.0%,显示其在长程终端任务中的能力增强。尽管性能大幅提升,Grok 4.7的输入输出token价格仍维持在每百万token 2美元/6美元的水平。

#xAI#Grok 4.7#模型发布

02:12宝玉

主流大模型打星际争霸:均不及人类新手,暴露实时决策短板

开发者 Ben Swerdlow 发起 Brood War Bench 测试,让通用大模型以智能体形式直接操控《星际争霸》。结果显示所有模型水平未超人类新手。Codex Astra 虽全胜但仅擅长骚扰;Claude Fable 表现最像玩家,尝试发展经济与科技;Grok 4.6 输出万级 token 却极少操作,将即时战略误作回合制。该测试揭示当前大模型在持续观察、快速决策及多线程协调的实时环境中能力不足,尽管已理解基本游戏概念,但执行节奏与多任务协调差距明显。测试代码与平台已开放供社区复现验证。

#Brood War Bench#大模型#Agent

23:30Microsoft Research(RSS)

微软发布RetroChimera:Nature论文开源分子逆合成模型

微软研究院在《Nature》发表RetroChimera,用于自动化小分子逆合成路线规划。该框架结合Transformer架构的R-SMILES 2与图神经网络NeuralLoc,通过集成学习与排序策略融合两者互补优势,提升罕见反应预测准确率。盲测显示专家更偏好其预测结果。代码与权重已按MIT协议在GitHub开源,并可通过Microsoft Foundry访问,旨在加速药物研发与新材料设计中的分子合成效率。

#Microsoft Research#RetroChimera#AI for Science

23:21r/LocalLLaMA(Reddit)

SupraLabs发布1亿参数文生图模型Supra2-IMG

SupraLabs开源了全新自研的DiT架构文本到图像生成模型Supra2-IMG。该模型参数量仅为1亿,在单张H100显卡上耗时不到10小时完成从零训练。尽管参数量极小,其在256x256分辨率下生成的图像质量达到当前SOTA水平。作者提供了详细的本地部署指南与推理脚本,用户可在CPU或GPU环境下直接运行代码生成图片,并公开了用于展示效果的采样参数设置。

#SupraLabs#模型发布#Supra2-IMG

02

产品发布/更新

Products8

11:11华尔街见闻(RSS)关联 4

ChatGPT联合创始人Diogo Almeida新模型Jev爆火

ChatGPT联合创始人Diogo Almeida主导开发的决策模型Jev在开发者社区迅速走红。该模型由TypeSafe发布,放弃文本生成,专注于分类、路由与打分等判断任务,宣称实现“零幻觉”。测试数据显示其速度比现有大模型快193倍,成本低444倍,输入每百万Token仅0.042美元且输出免费。Jev采用并行采样与RLCD训练方法,提供概率置信度以支持自动化工作流的分层处理。目前API已开放注册并赠送5美元额度。公司同步宣布完成4000万美元种子轮融资,由DCVC领投。

#TypeSafe#Jev#Diogo Almeida

02:59华尔街见闻(RSS)

Meta AI助手Muse登顶应用商店,股价大涨13%

Meta旗下全新AI助手Muse上线六天下载量超90.2万次,超越前代产品并登顶苹果与谷歌免费榜。该助手定位为可执行数字任务的个性化AI代理,支持读取Facebook Marketplace和Instagram社交内容,并接入Gmail、日历等第三方服务。分析师指出,这一成绩标志着Meta数千亿美元AI投资开始兑现,有望通过广告、订阅及交易分成开辟新变现空间。受此消息提振,Meta股价盘中一度上涨13%,市值增加约2000亿美元,AMD、英特尔等核心供应商股价亦同步大幅上涨。

#Meta#Muse#AI Agent

21:00Cloudflare 博客(RSS)

Cloudflare Python Workers 正式 GA

Cloudflare 宣布 Python Workers 进入一般可用阶段(GA),Python 成为其开发者平台的一等语言。此次更新实现了 Python 代码与 Cloudflare 平台绑定(如 R2、D1、Queues)的原生无缝对接,无需手动类型转换。同时,通过内置的 workers.asgi 和 workers.wsgi 连接器,FastAPI、Django 和 Flask 等主流 Web 框架可直接运行于 Workers 环境。

#Cloudflare#Python Workers#产品发布

21:16IT之家(RSS)

谷歌联合五大厂商发布首批 Googlebook 笔记本

9月21日,谷歌与宏碁、华硕、戴尔、惠普、联想合作正式发布首批五款Googlebook笔记本电脑,即日起开启预售,10月4日上架。起售价899至1299美元,对标MacBook Air等轻薄本,每台附赠12个月Google AI Pro会员及5TB云存储。系统融合安卓与ChromeOS元素,支持手机应用运行、跨设备无缝协作及Gemini Nano v3端侧AI功能,承诺提供最长10年系统更新。

#Google#Googlebook#AI PC

05:42MarkTechPost(RSS)

AWS发布Strands Harness开源Agent框架,成本降低28%

AWS Strands Agents团队发布Strands Harness,这是一个面向开发者的通用型开源Agent框架,采用Apache 2.0协议,支持Python和TypeScript。该框架将模型循环、工具调用、上下文处理与记忆管理等核心组件封装为开箱即用的默认配置,旨在解决开发者从原型到生产部署的痛点。官方基准测试显示,在6项评测中,其准确率与竞品相当,但Token成本降低28%。效率提升主要得益于三项上下文管理策略:超过1500 Token的工具结果截断、85%使用率触发压缩以及窗口溢出时的循环内恢复。

#AWS#Agent框架#开源

03:25OpenAI(YouTube)

Figma设计师实测GPT-6 Astra:2小时构建完整原型

OpenAI发布视频展示Figma设计师使用GPT-6 Astra完成设计任务的过程。该模型表现出高自主性,能在接收简短指令后自行规划并执行复杂工作流。视频中,Astra在2小时内从零开始构建了一个单人直升机飞行控制系统的完整原型,涵盖品牌系统、组件复用及多屏幕交互流程。设计师反馈模型具备深度思考能力,能准确调用Figma各项功能并保持设计一致性,显著提升了从概念探索到原型验证的效率,展示了Agent在专业设计工具中的集成潜力与工作流加速效果。

#OpenAI#GPT-6 Astra#Figma

15:59meng shao

腾讯开源T-Mem:用联想触发器突破长对话记忆检索盲区

腾讯团队开源T-Mem,旨在解决现有长期记忆架构仅依赖相似度检索导致的联想性召回盲区。该方案引入认知科学中的“情景未来思维”,在写入时生成Entity、Bridge等四类Trigger,解耦记忆的可达性与证据路径。构建流程包含离线切分Scene、Topic归组、Item抽取及Trigger生成;检索采用自上而下的三级瀑布与多视图编码,且Trigger召回不受Topic预过滤限制。实验显示,T-Mem在LoCoMo基准总准确率超HyperMem 3.25个点;在剥离词汇重合的Cognitive子集上以74.81%大幅领先,证明其有效填补了邻域外线索的检索空白。

#腾讯#T-Mem#长上下文记忆

10:00Hacker News Best(web_list)

Google开源AX:面向AI Agent的声明式执行编排平台

Google DeepMind团队开源AX,这是一个专为AI Agent设计的声明式控制平面与执行运行时。AX旨在解决传统微服务或批处理编排器在处理状态化、突发型Agent工作负载时的成本与效率问题。该平台提供Task(隔离执行)、Workspace(环境配置)、Gateway(网络策略)和Model(模型配置)四大核心原语,支持沙箱隔离、秒级挂起与恢复以及高密度资源复用。AX基于Agent Substrate构建,可支撑单集群数十亿并发任务,并集成生成式AI以简化环境搭建。

#Google#Agent#开源工具

03

行业动态

Industry8

00:04华尔街见闻(RSS)关联 5

亚马逊封锁Meta旗下Muse AI购物代理,规则之争升级

9月21日,亚马逊切断Meta旗下个人AI代理Muse代表用户在Amazon购物的通道,提示未经授权的AI代理访问违反使用条款。此前亚马逊曾要求Meta排除该服务未果。争议焦点在于授权、身份披露与账户安全,亚马逊认为Muse未主动披露身份且处理交易接触数据,相当于未经授权第三方进入用户账户。尽管双方有云端合作,但此次冲突转向基于合同与服务条款的博弈。亚马逊此举旨在保护广告收入及交易入口控制权,此前已起诉Perplexity并限制谷歌、OpenAI代理。Muse上线一周即登顶美国App Store免费榜,其快速增长加速了AI代理与传统平台间的规则博弈。

#亚马逊#Meta#AI Agent

19:28华尔街见闻关联 4

黄仁勋:AI毁灭人类概率为0%,不惧加州亿万富翁税

英伟达创始人黄仁勋在CBS News专访中明确表态,2030年AI终结人类的概率为0%,称此类叙事戏剧化且无科学依据。他主张尽可能快推进AI,认为行业正从实验室转向产品化,应优先执行现有网络安全与产品责任法律,无需新增专门监管框架。针对加州第40号提案,黄仁勋表示愿意缴纳约80亿美元税款,并留下“我不害怕纳税,我只害怕贫穷”的金句。他将数据中心定义为“AI工厂”,强调其作为新型制造业将推动美国重新工业化,为蓝领工人创造数十年来罕见的就业机会。

#NVIDIA#黄仁勋#AI监管

10:19The Kobeissi Letter关联 3

软银拟发行超110亿美元垃圾债投资OpenAI

据彭博社报道,软银计划通过发行超过110亿美元的垃圾债券进行融资,这笔交易将成为历史上规模最大的垃圾债发行之一。此次融资的主要目的是为对 OpenAI 的后续投资提供资金。作为今年其整体筹资活动的一部分,软银已出售约150亿美元的票据,使其成为2026年迄今为止债券市场上最大的高收益评级借款人。目前市场正经历前所未有的债务市场活动,以支持人工智能领域的资金投入。

#SoftBank#OpenAI#融资

04:22宝玉关联 2

OpenAI称模型解决纳维-斯托克斯方程,27位菲尔兹奖得主联名反对

OpenAI宣布其8月28日启动训练的内部模型已解决千禧年难题之一的纳维-斯托克斯方程,并攻克超100个长期未解数学问题。此举引发数学界强烈反弹,9月11日包括陶哲轩在内的27位菲尔兹奖得主联名发表公开信,批评AI将开放问题视为跑分项目,跳过方法提炼与论文撰写环节,可能切断知识代际传递。对此,OpenAI宣布成立独立顾问组AGMAI,挂靠普林斯顿高等研究院,成员含Timothy Gowers等顶尖学者,规定其不拿OpenAI资金且可公开批评公司,但明确边界为不负责建议放慢研发节奏。

#OpenAI#数学#行业争议

13:3621世纪经济报道关联 2

硅基流动完成B+二期及C轮融资,年内累计近29亿元

9月20日,硅基流动披露近期完成B+轮二期和C轮融资,系6月30日向港交所递交上市申请后首次新增融资。公司2026年以来累计融资金额近29亿元,投资方超二十家,其中国网投、国新基金、中国移动链长基金等国资序列成为主力,资本结构从市场化VC转向战略型耐心资本。资金将投向推理引擎、异构算力调度、模型与芯片适配等核心技术研发,以及Token供应平台建设和全球市场拓展。作为Frost & Sullivan数据认定的中国最大独立生态Token供应商,硅基流动截至2026年4月注册用户超1000万,企业客户超1.3万家,日均Token吞吐量约5785亿次。

#硅基流动#融资#港股18C

18:18The Verge AI(RSS)关联 2

联合国报告警告:AI监管不能等待完全确定性

联合国科学小组发布首份关于人工智能的重大评估报告,警告各国政府需在充分理解风险前遏制日益强大的AI代理。报告提及今年初OpenAI黑客攻击Hugging Face事件,强调全球外交议程中AI地位的确立。联合国秘书长古特雷斯呼吁各国合作应对AI威胁,反对“逐底竞争”。该报告正值各国领导人在纽约参加联合国大会及中美举行AI会谈之际发布,旨在推动建立预防性原则下的AI安全框架。

#联合国#AI政策#AI安全

21:02IT之家(RSS)

Nscale冲刺IPO:1030亿美元订单高度依赖微软与Anthropic

英国AI基础设施公司Nscale计划本周在纽约上市,目标估值最高达350亿美元。其招股书披露过去三年签约量激增千倍,合同总额达1030亿美元,其中85%来自微软和Anthropic两大客户。Nscale与英伟达深度绑定,后者既是主要股东又供应芯片,并为其租赁义务提供担保。尽管营收增长迅速,但公司上半年净亏损高达10.2亿美元,且尚未为Anthropic项目落实融资。OpenAI已退出合作,分析师建议“卖出”,指出新云厂商面临高昂成本与客户集中风险。

#Nscale#IPO#数据中心

20:00MIT Technology Review AI(RSS)

美墨边境AI监控塔失效致人死亡,MIT调查建议四项整改

MIT Technology Review联合圣地亚哥时报发布深度调查,揭露美国墨西哥边境“虚拟墙”AI监控系统的系统性缺陷。调查显示,多名移民在先进AI监控塔覆盖区域未被发现且死亡数周或数月后才被找到,暴露出设备故障、算法漏检及人员响应缺失等问题。文章针对美国海关和边境保护局(CBP)提出四项建议:开展全面审计以掌握真实死亡数据;修复移民死亡追踪系统;记录技术辅助抓捕情况以评估有效性;将边境死亡事件作为潜在监控失败进行调查。该设施由Anduril等公司承建,预计2034年前耗资10亿美元扩建。

#MIT Technology Review#AI监控#边境安全

04

论文研究

Research5

07:00elvis

Question's Gambit:优化检索首步提升深度研究Agent性能

论文提出 Question's Gambit,在 Agent 搜索前将问题拆分为线索并生成互补搜索,池化结果后重排序放入上下文。该机制使 GPT-5.5 在 BrowseComp-Plus 得分从 83.1% 升至 90.5%,GPT-5.4-mini 从 68.1% 升至 79.0%,DeepSeek-v4-pro 从 71.4% 升至 76.9%,同时显著降低校准误差。错误分析显示多数错误源于后续证据使用而非检索缺失。该方法每问增加 2.3 至 5.3 次工具调用,展示了优化初始检索上下文对深度研究智能体效能的关键作用。

#Question's Gambit#Agent#检索增强

02:15elvis

EvoOntology:让Agent通过自演化本体层提升数据查询能力

论文提出EvoOntology,为Agent构建自演化本体层以解决数据源语义扩展难题。该方案通过专用Agent构建本体,并作为MCP Server提供Schema、内容与工具层服务,供数据Agent在运行时查询。本体编辑采用小步 typed 模式,仅当配对评估显示对基础模型有帮助时才保留修改。实验显示,引入本体后GPT-5.5在DDR-Bench上准确率提升26.7分,六款模型平均提升17.8分;BIRD执行准确率提升7.4分,其中工具层演化贡献了57%的收益。

#EvoOntology#Agent#本体层

00:46r/Rag(Reddit)

RAG幻觉评测:Gemini在知识缺失问题上全数回答,OpenAI表现最佳

作者发布论文《Why RAGs Hallucinate》,对三个商业RAG系统(含其所在公司系统)进行评测。在1000文档知识库上,三者准确率均为97-98%。但在测试答案明确缺失于语料库的问题时,Gemini系统42题全部作答,另一系统仅答对2/14。研究指出传统基准无法区分“不知道”与“自信猜测”,采用基于OpenAI论文的评分策略(正确+1、拒绝0、错误-4)后,质量排名显现:OpenAI RAG得分+0.862,Gemini RAG +0.793,CustomGPT .ai RAG +0.767。该研究揭示了高准确率下RAG系统的幻觉风险差异。

#RAG#幻觉评测#Gemini

16:52Rohan Paul

FrogNano:4B编码智能体SWE-bench达61.5%无需蒸馏

论文介绍FrogNano,基于Qwen3.5-4B通过强化学习在约1500个合成软件工程任务上训练。核心在于在线任务合成机制:随着模型能力提升,系统生成既具挑战性又可学习的动态问题,实现课程自动优化。同时简化工具接口至5个关键操作,使基础模型在SWE-bench Verified上的得分从8.3%跃升至37.2%。经过5轮迭代,该4B参数规模的编码智能体最终达到61.5%的解决率,且未使用前沿模型蒸馏技术。这一结果展示了小模型通过自适应合成数据与精简交互设计实现能力突破的路径。

#FrogNano#Coding Agent#强化学习

15:33Rohan Paul

Ecdysis:LLM Agent运行时通过模式学习而非单点修复提升性能

论文提出Ecdysis框架,针对LLM Agent在运行时的错误处理机制进行优化。传统方法倾向于对每次失败进行即时修补,这可能导致将特定模型的错误习惯硬编码到系统中。Ecdysis主张跨任务聚合 recurring failures(重复性故障),识别系统性问题模式后再决定是否需要修复运行时Harness本身。该方法旨在避免过度拟合单次失误,通过关注失败模式而非单纯计数来提升训练效率与准确性。实验表明,该策略能实现更快的训练速度、更高的准确率以及更强的跨模型迁移能力,为Agent系统的鲁棒性提供了新的工程思路。

#Ecdysis#LLM Agents#Runtime Harness

05

技巧与观点

Tips8

02:36r/Rag(Reddit)

Chonks:跨语言代码库的无LLM检索工具

开发者mgonzalez01发布开源项目Chonks,专为跨语言代码库设计。该工具将C++、C#、Python等10种语言的AST节点索引至本地SQLite文件,通过MCP协议供Claude Code等Agent调用。核心创新在于全流程无LLM参与,摒弃摘要与重排序,采用混合语义加BM25搜索,并构建类型化交叉引用图以沿真实符号边扩展结果。在Loc-Bench基准测试中Acc@5达64%,Godot引擎测试显示加入图扩展后特征集覆盖率从0.678提升至0.843。作者指出图结构虽增加内存开销,但对解析C++模板等复杂调用关系至关重要,而纯Python场景下其作用有限。

#Chonks#Code RAG#MCP

11:26r/LocalLLaMA(Reddit)

开发者在8GB显存笔记本上训练动态增长MoE模型

Reddit用户volotat分享其开源项目mini-AGI,旨在解决消费级硬件无法从头训练大模型的痛点。该模型采用稀疏混合专家(MoE)架构,支持训练过程中动态添加和剪枝专家模块,仅加载当前所需部分以节省显存;同时使用Batch 1连续流式学习,无需存储大规模随机批次及其梯度。目前模型参数量约530M并在持续增长,基于78亿字符语料库进行训练,已在单台8GB显存笔记本电脑上成功运行并展示初步效果。作者表示权重尚未发布,预计数周后完成首个阶段训练,项目代码已开源供社区复现与观察。

#mini-AGI#MoE#持续学习

04:41PyTorch 博客(RSS)

PyTorch发布TinyTorch:从零手写ML框架的开源课程

PyTorch官方博客发布TinyTorch,这是一个纯Python实现的机器学习框架教学项目。该课程包含20个模块,覆盖从张量操作到Transformer的完整构建流程,无需GPU即可在普通笔记本上运行。其核心设计理念包括从第一天引入系统思维、渐进式披露复杂概念(如通过运行时猴子补丁实现autograd),以及通过重现67年ML历史里程碑来验证代码正确性。该项目旨在帮助学习者建立对计算图、内存分配和梯度传播的底层心智模型,从而更深刻地理解PyTorch内部机制。目前已被部分企业用于新员工入职培训及针对性调试工作坊,是深入掌握AI系统工程的优质实操指南。

#PyTorch#教程#TinyTorch

04:02Rohan Paul

Salesforce研究:微调Agent模型需保留原有工作流适配

Salesforce AI 针对 Qwen3-Coder-30B-A3B 在 7 个企业任务上的 Agent 表现开展研究。初始调优后成功率从 29.2% 升至 78.0%,而 Gemini 在该配置下可达 93.6%。研究对比了两种提升路径:直接让 Qwen 模仿 Gemini 的完整运行轨迹,导致成功率降至 63.1%,因强模型的规划方式与弱模型原有的 Agent 设置不兼容;另一种方案是保留 Qwen 自身的失败案例,仅用 Gemini 修正其出错步骤,成功率回升至 79.7%。结论表明,优化模型时应避免破坏已适配的 Agent 工作流,针对性修复比全面迁移更强模型的行为更有效。

#Salesforce#Agent#模型微调

03:44r/MachineLearning(Reddit)

Jayce:基于原型记忆的本地LLM即时纠错框架,速度超反向传播4倍

开发者 Loophole-LLC 开源了名为 Jayce 的无框架原型学习器,旨在解决本地大模型微调时的灾难性遗忘问题。该方案采用自适应原型记忆(APM)机制,不修改模型权重,而是将 LLM 原始上下文向量存入固定大小的原型池;当模型出错时,通过数学方式将最近的原型向新数据偏移以实现即时纠错。实验显示,其训练更新速度比标准 Adam 反向传播快 1.6 至 4 倍,且在 MNIST 等顺序测试中表现出极高的样本效率。项目完全基于 NumPy 和原生 Java 实现,无需 PyTorch 或 TensorFlow,可在消费级硬件上离线运行,支持 Qwen3-4B GGUF 模型。

#Jayce#原型记忆#本地LLM

00:03elvis

用 Jev 整理 2300 篇 AI 论文:成本 14 美分耗时 83 秒

作者使用 Jev 对约 2300 篇 AI 研究论文进行重新分类与标签整理,总花费仅 0.14 美元,耗时约 83 秒。此前使用 DeepSeek V4 Flash 模型处理旧标签时,因置信度不足且微调 Few-shot 成本过高而放弃。Jev 首先对所有论文进行重打标,其中 75% 与原有标签一致,并识别出约 579 个高置信度的主题变更。作者通过人工标注 30 个分歧样本进行验证,确认了 Jev 的分类可靠性,并将所有变更应用于生产环境。该案例展示了结合 System One 和 System Two 模型优化数据处理流程的有效性,显著提升了论文组织的效率与发现层价值。

#Jev#AI论文整理#工程实践

21:44Hugging Face 博客(RSS)

像物理学家一样剪枝大模型:将块移除建模为伊辛优化问题

Hugging Face 博客发布 Multiverse Computing 与 CAI 合作的研究,提出一种基于物理启发的 LLM 剪枝方法。该研究将神经网络中的关键模块(blocks)移除过程转化为伊辛模型(Ising Model)的优化问题,利用量子退火或经典模拟退火算法寻找最优的子网络结构。这种方法旨在通过精确的结构化剪枝,在保持模型性能的同时显著降低计算成本与推理延迟。文章详细阐述了从模型分析到伊辛哈密顿量构建的技术路径,展示了该方法在多个主流大语言模型上的实验结果,证明了其在模型压缩领域的有效性与通用性。

#Hugging Face#LLM剪枝#模型压缩

17:09r/LLMDevs(Reddit)

Qwen3.8-Flash-Next Engram表免权重注入100条事实的工

作者利用 Qwen3.8-Flash-Next 模型内置的 Engram(n-gram)查找表机制,在不修改任何模型权重的情况下,通过训练仅 9 MB 的叠加层文件,成功向模型注入了 100 条关于虚构地点的事实。该方法在 llama.cpp 引擎上验证,基于 Quail 测试集,意大利语精确回答率达到 0.841,远超基线模型的 0.005。实验还发现该机制不具备跨语言迁移能力,且随着注入事实数量增加,对中性文本的 KL 散度损伤会缓慢增长。作者开源了完整的代码、配置及结果文件,并指出当前方法在组合多事实生成和重述泛化方面仍存在局限。

#Qwen#Engram#工程实践

往期存档