跳到主内容

日报

LIVE每早八时发报 · 更新于 08:00NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 44 事件 · 3 一手信源 · 覆盖 17 家信源
今日头条 · Lead

谷歌推Gemini 3.8 Live,实时交互AI激战

谷歌正式发布Gemini 3.8 Live并透露Gemini 4进入后训练阶段,Meta则以Muse Charm加码个人Agent,OpenAI据悉正备战Aeon应战。阿里达摩院食管癌筛查模型登上《自然·医学》,DeepSeek确认75亿美元融资推进。模型迭代、Agent入口与算力融资多点并进,实时交互与端侧智能成为当日主线。

00:20Google DeepMind 博客(RSS)关联 2 源

Google DeepMind 发布 Gemini 3.8 Live

Google DeepMind 官方博客宣布推出 Gemini 3.8 Live,这是其最新一代多模态模型系列的重要更新。该版本重点强化了实时交互能力,并同步引入了 Live Avatar 功能,旨在通过低延迟的语音与视觉生成技术,实现更自然、更具沉浸感的人机对话体验。此次发布标志着 Google 在构建具备实时感知与响应能力的 AI 代理方面迈出关键一步,为开发者提供了新的 API 接口与工具集,以支持下一代智能应用的原型开发与部署。

#Google DeepMind#Gemini 3.8#模型发布

01

模型发布/更新

Model Releases7 篇

13:27MarkTechPost(RSS)关联 2 源

Contrastive-LM发布CLM-8B:比Jev快9倍的开源Agent评

Contrastive-LM发布CLM-8B,这是首个对比语言模型(CLM)类别的开源模型。与生成文本不同,该模型用于对候选动作进行评分并返回概率,旨在对标TypeSafe AI的专有System One模型Jev。其架构基于冻结的Qwen3-8B骨干网络加上20M参数的可训练投影头,采用双向InfoNCE损失进行训练。在零样本测试中,CLM-8B在T-Rex游戏等任务上速度比Jev快9倍,且能部署于单张NVIDIA GPU。微调后的版本在DeepSWE和Terminal-Bench 2.1基准上展现出优于Jeb的验证能力,为Agent循环提供了低延迟的状态-动作匹配方案。

#Contrastive-LM#CLM-8B#Agent

08:34Hacker News Best(web_list)

GPT-6 Astra在驾驶基准测试中表现领先

drivingbench.com 展示了多个模型在自动驾驶模拟环境中的性能对比。GPT-6 Astra(使用 Codex medium)在三次尝试中取得了最佳进展,其中第二次尝试以5分22秒完成全程,进度达到100%。相比之下,Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol 均未完成全程,最佳进度分别为45%、11%和6%。该榜单记录了各模型的尝试次数、行驶距离、耗时、命令调用数及Token成本等详细数据,直观反映了不同模型在复杂驾驶任务中的能力差异与效率。

#drivingbench#GPT-6 Astra#Benchmark

11:35Rohan Paul关联 3 源

Google DeepMind负责人称Gemini 4进入后训练阶段

Google DeepMind负责人Koray Kavukcuoglu向The Information透露,下一代大模型Gemini 4目前已进入后训练(post-training)阶段,即将发布。他计划在今年年底前更早地推出一个早期后训练版本,并在此基础上进行快速迭代。该消息确认了Gemini 4的研发进度已进入收尾阶段,但尚未公布具体的发布日期、技术细节或性能基准数据。

#Google DeepMind#Gemini 4#模型进展

22:00NVIDIA 博客(RSS)

NVIDIA联合DeepMind开源2800种病毒蛋白复合物结构数据

NVIDIA加入由Google DeepMind、EMBL-EBI等组成的全球研究联盟,通过AlphaFold Database公开超过2800种病毒的蛋白质复合物3D预测结构。该数据集利用AlphaFold2模型及NVIDIA BioNeMo推理运行时生成,旨在加速未来大流行病的疫苗与药物研发。约30%的蛋白相互作用为科学界首次发现。同时,NVIDIA开源了BioNeMo结构预测流水线,供研究人员将蛋白质序列转化为预测的3D结构。此举被视为应对潜在新发传染病的重要知识储备。

#NVIDIA#Google DeepMind#AlphaFold

13:22IT之家(RSS)

阿里达摩院发布食管癌AI模型,平扫CT即可筛查

9月24日,阿里达摩院联合四川省肿瘤医院等机构发布食管癌筛查AI模型DAMO EAGLE。该模型无需插管和造影,仅凭胸部平扫CT即可识别早期及癌前恶性病变,已在3个国家8万多病例上获得验证。相关论文于9月22日发表于《自然·医学》。在机会性筛查场景下,模型对食管癌的敏感性达90%,对癌前病变敏感性为52.5%,特异性高达99.2%。达摩院算法专家姚佳文介绍,团队通过将内镜报告与增强CT病灶位置配对到平扫CT上进行训练。目前达摩院已跑通“平扫CT+AI”技术路线,有望通过一次检查筛查多种高发癌症。

#阿里达摩院#医疗AI#食管癌

00:32r/LocalLLaMA(Reddit)

UkisAI发布Swift系列27B模型,推理Token减少63%

UkisAI发布基于Qwen的Swift高效推理LLM家族,通过惩罚病态过度思考模式并结合RL与OPD技术训练。包含Swift1.5 27B、Flash Next和Bonsai 2三个版本。Swift1.5 27B思考Token减少58.5%,Terminal Bench 2.1得分略高于基座;Flash Next减少63.4%思考Token,速度提升1.8倍;Bonsai 2减少39.8%思考Token。提供GGUF、NVFP4等量化格式及Research API。另有9B变体即将推出。

#UkisAI#模型发布#Swift

02

产品发布/更新

Products7 篇

13:39华尔街见闻(RSS)关联 5 源

Meta Connect大会:Muse接入眼镜与Mac,全面押注个人Agent

9月23日Meta Connect大会上,扎克伯格宣布将AI智能体Muse作为消费AI核心战略,定位“个人超级智能”。Muse已接入Ray-Ban Meta智能眼镜、Mac桌面及独立邮箱,支持后台持续执行任务。硬件方面发布多款新眼镜及1299.99美元的VR Glasses(2027年上市),并推出手持设备Muse Charm。商业化上,Meta计划通过交易佣金盈利,已与沃尔玛、Stripe等合作,开发者平台开放一周获超1500份申请。元宇宙优先级降低,底层模型为Muse Spark多模态模型。

#Meta#Muse#个人Agent

09:08IT之家(RSS)关联 2 源

Meta发布AI硬件Muse Charm,前苹果设计师打造

9月24日Meta Connect大会上,扎克伯格发布基于AI助手Muse的实体设备Muse Charm。该设备由前苹果界面设计主管Alan Dye领导的新设计实验室打造,外观类似电子宠物,配备2英寸OLED屏、5G调制解调器及前后摄像头,支持离线访问Muse并具备虚拟形象互动功能。产品计划于2026年12月前发售,售价接近智能手表水平,具体价格与运营商细节待定。同时Meta宣布Muse新增AI化身视频通话及独立邮箱功能。

#Meta#Muse Charm#AI硬件

18:06华尔街见闻

高通骁龙峰会:发布双旗舰芯片,布局个人AI智能体生态

高通在骁龙峰会上发布第六代骁龙8至尊版与超级至尊版、第二代骁龙音频平台至尊版及骁龙X2系列PC平台,构建面向智能体时代的跨终端AI底座。超级至尊版通过更新传感器中枢、Oryon CPU与Hexagon NPU分工,支持端侧持续推理与低功耗感知;音频平台强化语音交互并集成Wi-Fi;PC平台拓展Linux系统以支持复杂生产力任务。高通同时联合万事达卡、阶跃星辰等伙伴,通过Modular工具降低跨端开发成本,推动个人AI从手机向全场景设备延伸。

#高通#骁龙峰会#AI Agent

12:01IT之家(RSS)

Anthropic Claude Code 云会话正式上线

Anthropic 宣布 Claude Code 云会话功能结束预览并正式上线。该功能允许用户在关闭本地设备后,让编码任务在云端继续运行,并通过浏览器、手机或桌面应用查看和接管。云会话面向 Pro、Max、Team 及 Enterprise 用户开放,现有订阅用户可领取一次性体验额度,其中 Pro 用户为 100 美元,Max 用户为 250 美元,领取截止时间为太平洋时间 10 月 7 日。技术上,云会话支持在 Anthropic 托管环境或组织自托管环境中运行,提供隔离虚拟机与沙箱安全机制,并集成 GitHub 仓库克隆、PR 创建及 CI 自动修复能力。

#Anthropic#Claude Code#云会话

14:31Alibaba Cloud

阿里发布 Qwen Intelligence 三款移动端 Agent 及基准测试

阿里云推出 Qwen Intelligence,包含 Mobile Planner、Mobile-Use 与 Mobile Creative 三款 SOTA Agent。Planner 在 MobilePA-Bench 等榜单第一;Mobile-Use 采用 API 优先策略,端到端成功率达 90%;Creative 生成图片仅需 3 秒,速度约为同行两倍。同时开源 MobilePA-Bench、MobileWorld 等基准测试套件,覆盖规划、跨应用执行及安全维度,并提供模型 API 接入入口。

#阿里云#Qwen Intelligence#Agent

09:22meng shao

Cloudflare 发布 Worker Previews

Cloudflare 推出 Worker Previews,旨在解决 AI Agent 快速迭代中测试环境与生产环境不一致的痛点。该功能为每个 Git 分支自动创建包含独立代码、配置、URL 及可观测性的生产级隔离环境。核心突破在于状态隔离:通过为每次 Preview 创建全新的 Durable Objects 命名空间,防止预览分支中的破坏性变更影响生产数据。开发者可通过 npx wrangler preview 触发,结合 Browser Run 和 Observability MCP server 实现从部署、访问到诊断的完整闭环验证。

#Cloudflare#Worker Previews#AI Agent

11:54华尔街见闻(RSS)

OpenAI备战个人Agent Aeon,Grok Bot与Muse抢占入口

AI助手赛道正从聊天问答向个人Agent跃迁。SpaceX AI的Grok Bot上线逾月周活达41.8万,Meta Muse登顶App Store免费榜。OpenAI被指紧急备战代号Aeon的个人Agent产品,最快本周推出,旨在对标Grok Bot并回应Muse竞争。据The Information报道,OpenAI计划将现有Codex和ChatGPT中的智能体技术重新包装品牌化,而非从零构建。内部暂称Codex Bot,基于开源框架OpenClaw构建,其创始人Peter Steinberger已加入OpenAI负责下一代个人智能体打造。

#OpenAI#Grok Bot#Meta Muse

03

行业动态

Industry8 篇

04:08Rohan Paul关联 4 源

Google Project Suncatcher:拟发射4颗TPU卫星组网

Google启动Project Suncatcher计划,拟将4块TPU部署至太空。SpaceX负责通过Transporter-18拼车任务执行发射。后续步骤包括2027年发射两颗卫星,利用激光链路实现分布式AI算力协同,以解决太空环境下的数据中心级带宽需求。卫星间通过光束直接传输数据,模拟无缆光纤通信。Google实验室系统单向速率已达800Gbps,旨在构建类似巨型地面数据中心的太空网络架构。

#Google#TPU#太空计算

20:47华尔街见闻(RSS)关联 2 源

甲骨文援引不可抗力致Project Jupiter延期,盘前股价大跌

甲骨文向Blue Owl Capital旗下子公司Stack Infrastructure发出正式通知,援引不可抗力条款以推迟付款义务。此举针对为OpenAI提供3000亿美元算力的Project Jupiter数据中心项目,该项目原定2028年上线,但因监管阻碍与反对声音面临延期风险。市场反应迅速,甲骨文、Blue Owl Capital及供能商Bloom Energy盘前股价分别下跌4%、2.3%和4.4%,显示融资链压力向周边扩散。尽管甲骨文发言人坚称项目按计划推进,但这一防御性操作加剧了外界对项目落地的疑虑。

#Oracle#OpenAI#算力基建

18:40华尔街见闻(RSS)关联 2 源

黄仁勋:AI安全是工程问题,算力正成新型资产类别

9月23日,英伟达CEO黄仁勋在The Ezra Klein Show播客中回应AI安全与行业趋势。他驳斥“末日论”,强调安全是对齐等工程问题,反对以失控为由寻求监管豁免,并指出当前研发资源应更多投入验证而非能力拓展。关于算力需求,他预测生成式计算范式将带来十亿倍增长,且英伟达架构因高回报率正演变为类似商用飞机的“资产类别”。针对就业焦虑,他认为AI自动化具体任务但保留职业核心目标,过去半年5000亿美元风投涌入AI原生企业印证了岗位创造。此外,他支持开源生态作为网络安全策略,并认为AI投资将推动核能等能源转型。

#Nvidia#Jensen Huang#AI安全

15:28IT之家(RSS)

DeepSeek确定75亿美元融资,年化营收突破10亿美元

据 The Information 报道,DeepSeek 已确定进行第二轮融资,目标募资约 75 亿美元(约合 504.2 亿元人民币),估值目标为 5,000 亿元人民币。知情人士透露,该公司年化营收已突破 10 亿美元,较数月前不足 5 亿美元实现翻倍增长,主要得益于 API 定价上调及大模型市场热度。DeepSeek 计划在 10 月底前完成本轮融资,并筹备在上交所上市。创始人梁文锋向投资者表示,公司超 70% 的算力资源分配给新模型训练,内部测试显示其轻量化模型可在游戏显卡上稳定运行,且调价未造成客户流失。

#DeepSeek#融资#营收

00:04Epoch AI(RSS)

Epoch AI:华为AI芯片性能与产能落后英伟达约四年

Epoch AI发布报告评估中美AI算力差距,指出华为在2026年总算力产出仅为英伟达的1/25。单卡性能上,华为Ascend 950吞吐量约为英伟达B300的1/7、H100的一半;产能方面,华为预计年产150万片,不及英伟达600万的1/4。尽管华为通过扩大芯片面积、优化低精度架构及垂直堆叠等路线图试图追赶,但受限于SMIC制程与出口管制,其软件生态CANN仍远落后于CUDA。报告预测至2030年,华为在芯片性能与算力生产上将持续落后英伟达三至四年。

#Epoch AI#华为#英伟达

22:49The Zvi(RSS)

AI周报187:Opus 5.5发布、美国反ASI法案与军事误报事件

Anthropic发布Opus 5.5模型,OpenAI推出更便宜的Sol和Luna版本。美国参议员Bernie Sanders与Greg Casar正式提出《禁止人工智能超智能法案》,MIRI表示支持该法案以应对灭绝威胁。内容涵盖多项行业动态:小米称MiMo-v2.6-Pro模型将新材料研发效率提升10倍;CNN报道美军因AI错误识别中国船只物资险些引发国际事故;OpenAI遭黑客入侵及Mistral被黑等安全事件;AOC讨论AI实验室是否大到不能倒;以及各国签署前沿AI模型控制呼吁等议题。

#The Zvi#Opus 5.5#反ASI法案

19:06IT之家(RSS)

软银发行111亿美元债券创纪录,全力押注OpenAI

软银集团完成总额111亿美元的美元和欧元计价债券发行,创下全球高收益企业债券发行规模纪录。该融资旨在为对OpenAI的巨额投资提供资金,软银已承诺向OpenAI投入646亿美元,持股比例预计达约13%。此外,软银近期还斥资54亿美元收购ABB机器人业务及31亿美元收购DigitalBridge。受AI驱动债务发行激增影响,软银债券收益率显著上升,其5年期信用违约掉期利差已超过400个基点。尽管OpenAI推迟IPO引发市场对其财务状况的审视,但分析师认为Arm股价表现支撑了其信用质量。

#软银#融资#OpenAI

18:12华尔街见闻(RSS)

高盛上调数据中心表后供电预测至67GW,燃料电池居首

高盛团队发布报告,将2030年全球数据中心表后供电装机预测由40GW上调至67GW。受电网接入排队时间拉长影响,电力成为部署硬约束。报告对比燃气轮机、燃料电池与往复式发动机,按交付速度与可用性重新配权后,燃料电池以76.6分居首。尽管其平准化电价较高,但模块化交付快、无需并网。预计2030年燃料电池对应全球约18GW装机,市场约550亿美元。供给端Bloom Energy扩产仍存缺口,需多家厂商协同。受益标的包括Ceres Power、潍柴动力、台达电子及GE Vernova等。

#高盛#数据中心#燃料电池

04

论文研究

Research5 篇

04:46Rohan Paul

斯坦福与Together AI论文:Agent协作优于辩论投票

斯坦福大学与Together AI联合发布新研究,指出AI Agent团队通过互相检查工作而非简单辩论投票,能解决单个模型无法独立解决的问题。传统方法多让模型辩论后投票,仅选出已有答案;新方法由一个模型回顾过往对话并优化团队“剧本”,如分配检查者与反驳者角色。仅需15个练习问题即可完成学习。在数学和物理测试中,3模型团队平均准确率达66.7%,显著高于最佳单模型的48.8%,甚至超越了从各模型答案中择优的效果,证明协作能生成全新正确答案。建议跳过辩论脚本,赋予明确角色并利用历史运行数据优化流程。

#Stanford#Together AI#AI Agents

23:34r/MachineLearning(Reddit)

将多速率DSP原理应用于LLM的层级语义声码器架构

eladwf提出一种结合数字信号处理多速率理论的LLM新架构,旨在解耦文本生成中的长程语义与局部语法。该模型包含慢速Planner(基于压缩语义嵌入预测句子级连续向量)和快速Vocoder(GPT处理高频局部语法)。通过交叉注意力计算Logits delta进行融合。在TinyStories数据集上,该架构验证损失降至0.61,显著优于基线GPT的2.37。作者同时指出存在条件过度依赖导致的暴露偏差问题,以及因PyTorch掩码实现导致的显存未真正节省的工程瓶颈,并开源了参考代码。

#LLM架构#语义声码器#多速率处理

21:01Rohan Paul

Agent权限记忆篡改导致授权洗白,修复需验证写入

论文指出长运行Agent中权限变更易被压缩进持久化记忆,导致撤销或缩小的权限被错误记忆为有效。在测试中,虚假授权出现在50.2%的未授权请求里,执行器据此行动的比例高达98.6%。将记忆修正为准确状态可将违规降至零。研究认为核心故障点在于记忆而非执行器,提出应在写入前验证权限、保留来源并追踪变更。该发现揭示了Agent长期运行的安全隐患。

#Agent#安全#权限管理

19:58Rohan Paul

SkillSonar:通过运行时安全技能防御Agent恶意插件攻击

论文提出SkillSonar,一种针对AI Agent的安全技能,旨在解决恶意技能在安装时看似安全、仅在任务执行期间才触发危险行为的问题。传统预安装扫描无法捕捉此类时序风险,SkillSonar通过在运行时检查敏感操作并决定允许、限制或重新规划来提供防护。在GLM-5模型上的测试显示,该机制将已知攻击成功率从48.2%降至10.4%,未知风险家族从60.6%降至11.5%。关键发现是仅安装安全技能无效,必须显式指示Agent在行动前咨询它。研究建议结合预扫描、运行时检查及底层沙箱权限控制构建纵深防御体系。

#Agent安全#Runtime Safety#SkillSonar

18:52Rohan Paul

论文揭示LLM推理内部结构,可监测思维过程

该研究通过机械解释学方法发现,大语言模型的推理能力具有超越生成文本的独立内部结构。研究人员追踪了提取事实、分解、回忆、演绎、代数及计算等八种常见推理步骤,发现每种操作在模型中层都会产生独特的内部激活模式。即使相同Token在不同推理任务下表现不同,且错误推理仍保留正确操作的签名,表明模型能表征推理意图而非仅输出结果。这一发现为从模型内部监控和验证推理过程提供了新路径,有助于提升AI系统的透明度与可靠性。

#Mechanistic Interpretability#LLM Reasoning#Chain-of-Thought

05

技巧与观点

Tips8 篇

02:26GitHub 博客(RSS)

GitHub Security Lab发布AI自动化Fuzzing工具Task

GitHub Security Lab开源了基于LLM的自动化模糊测试管道Fuzzing Taskflow。该工具通过Taskflow Agent框架,针对C/C++项目实现从代码分析、Harness编写到覆盖率反馈与崩溃分类的全流程自动化。系统采用LLM决策与MCP工具执行分离架构,利用SQLite管理状态,并通过指数级时间预算与平台检测机制优化探索效率。内置结构感知模糊测试能力,支持JSON/XML等格式字典及源码级自定义变异器,旨在减少人工干预并提升漏洞发现率。

#GitHub#AI Fuzzing#Security Lab

02:02r/LLMDevs(Reddit)

Jive:基于System One模型重构Agent执行循环的开源框架

Reddit用户分享开源项目Jive,旨在通过引入Jev等System One模型重构传统LLM Agent循环。该框架摒弃传统的“调用-工具”工作流,采用图调用机制,将执行流程建模为包含bash和Jev节点的DAG,允许节点间存在依赖与输出引用。其核心逻辑是让模型利用完整算力进行复杂推理与规划,随后以低成本方式快速执行既定步骤,从而减少冗余LLM调用。作者提供了与Codex、Claude Code在多项工程任务上的对比数据,显示Jive在速度与Token消耗上具有显著优势,并开放代码库邀请社区讨论与贡献。

#Jive#Agent架构#System One

01:29r/LLMDevs(Reddit)

利用CPT与RAG训练本地LLM及评估实战复盘

作者基于Qwen 3.5 4B模型,通过Unsloth进行CPT和SFT LoRA训练,系统演示了如何向本地大模型注入新领域知识。实验分为四个阶段:首先探讨如何通过选择泛化性强的训练集进行持续预训练;其次对比内部化知识与RAG注入内容的推理性能差异;接着提出将CPT与RAG结合而非对立的实用方案;最后展示包含严格Schema输出约束的综合评估策略。该实践提供了从数据准备、混合架构设计到自动化评估的完整可复现流程,适合需要构建垂直领域本地模型的开发者参考。

#LLMDevs#CPT#RAG

22:11r/Rag(Reddit)

RAG Guardrails 实战:8 个关键陷阱与工程取舍

作者分享构建 RAG 护栏(Guardrails)的实战经验,指出单纯依赖提示词无法保障安全。核心建议包括:使用轻量模型进行 PII、意图和范围检查以降低成本;在数据与动作层而非仅提示词层执行权限控制;根据内外网暴露程度平衡延迟、成本与安全;确保可观测性日志不泄露脱敏数据;通过限制工具调用次数和用户配额防止静默失败;验证 OCR 提取质量而非仅校验 JSON 格式;结合受众文化设定安全阈值;以及异步并行执行独立检查但同步等待关键决策。文章提供了 GitHub 实现指南链接及性能预算参考。

#RAG#Guardrails#工程实践

21:34r/LLMDevs(Reddit)

实测6款代码索引工具:Token节省宣称未兑现

Reddit用户Repowise开发者对CodeGraph、Serena、Graphify等6款AI编程Agent代码索引工具进行基准测试。在SWE-bench的48个Django问题上,对比Codex与本地模型表现。结果显示,此前宣称的60-90% Token节省并未实现;Codex环境下最佳节省约31.6%,且需承担索引时间成本。Claude Code因MCP加载机制导致工具调用率极低。质量评估显示各工具无显著差异,确定性检索与调用图精度方面Repowise表现较好。作者公开了完整数据与方法论,旨在纠正行业过度营销现象。

#LLMDevs#代码索引#基准测试

20:40meng shao

阿里开源 AI Code Review:确定性工程与 Agent 混合架构实战

阿里开源内部使用两年的官方 AI Code Review 项目 OpenCodeReview,采用“确定性工程 pipeline + AI Agent”混合架构解决通用 Agent 漏审、定位漂移问题。核心设计包括精确文件选择、智能捆绑分治、54 种细粒度规则匹配及独立的重定位反思模块;Agent 侧通过生产轨迹蒸馏专用工具集并优化场景 Prompt。功能覆盖多平台插件(Claude Code/Cursor 等)、断点恢复及 SARIF 输出,支持 Delegation 模式解耦模型能力。项目具备高标准安全威胁模型与严苛贡献规范。

#阿里#AI Code Review#开源项目

18:43meng shao

斯坦福CS336从零构建语言模型公开课:18讲视频与作业开源

斯坦福大学推出 CS336 研究生课程「从零构建语言模型」,由 Tatsunori Hashimoto 和 Percy Liang 联合讲授。该课程提供完整的 18 讲教学视频以及配套的开源作业资源,旨在帮助学习者以零成本的方式系统掌握大语言模型的底层构建原理与技术细节。课程内容覆盖从基础理论到实际工程实现的完整链路,适合希望深入理解模型架构、训练流程及优化策略的开发者与研究人员进行自学与实践。

#斯坦福#教程#LLM

17:12r/LLMDevs(Reddit)

用Pi和Decider 1构建自定义Agent安全网关

Elvis Saravia撰文介绍基于开源框架Pi与meraGPT决策模型Decider 1构建自定义Agent执行环境。该方案通过三个概率判断门控优化流程:路由层根据任务复杂度选择轻量或深度模型;安全层在Shell命令执行前评估删除覆盖及网络风险,阈值超0.5即拦截;完成层校验回答是否具体且完整,未达标则要求重试。文章详述TypeSafe SDK集成代码、真实运行数据及关键踩坑经验,如状态隔离对判断准确性的影响,为开发者提供可复用的Agent控制与安全防护实践。

#Pi#meraGPT#Agent开发

往期存档