04:56·Hacker News Best(web_list)
文章基于86Box 6.0测试,对比Mac Mini M6与M4在硬件级PC模拟中的表现。由于86Box对旧CPU时序、芯片组及ISA/PCI总线的精确模拟高度依赖宿主单线程性能,M6凭借Apple Silicon强大的单核能力显著胜出。在运行Windows 98 SE、Voodoo 3显卡及Cinebench 2000负载下,M6稳定维持100%模拟速度并达到600MHz Pentium II等效频率,比M4高出20%。尽管模拟得分高于同期真实硬件,但证明了M6在极致单核负载下的稳定性,适合追求高保真复古计算体验的用户。
#86Box#Mac Mini M6#模拟器
01:45·r/LLMDevs(Reddit)
开发者在构建Ops Agent时遭遇权限漏洞:仅赋予“打开PR”权限,但因Bot Token具备Push能力,导致任何请求者均可强制提交代码。核心教训包括:Prompt无法执行鉴权,模型未见过GitHub权限且API调用始终使用Bot令牌;不能将用户作为工具参数传入,以防被诱导填入管理员身份,用户身份必须来自Slack或SSO等会话上下文并在Agent运行前设定;超时或错误时应直接停止而非继续执行。修复方案是在写入操作前增加一步GitHub权限校验,确认用户有权推送后再放行。
#Agent#安全#权限管理
00:54·Hacker News Best(web_list)
Tailscale 发布博客详解其近期网络性能优化工作。在内存管理方面,通过避免小数据包复制及缩短队列深度,降低开销并提升约 5% 速度;将节省资源用于子网路由器与应用连接器。核心突破在于引入多队列系统,使不同数据流并行处理以利用多核 CPU,显著降低延迟并提高聚合吞吐量。此外,利用 Linux writev 减少内核拷贝,以及通过 netmap 磁盘缓存加速客户端启动,改善弱网环境下的连接体验。这些改进旨在支持 CI、远程开发等高负载场景,部分功能计划于 2026 年下半年落地。
#Tailscale#网络优化#工程实践
22:30·MarkTechPost(RSS)
Perplexity发布一项关于其Computer产品中模型后训练的研究报告。该方法结合拒绝采样微调与提示引导的自蒸馏,利用真实用户会话(含失败案例)进行训练。研究将助手轮次分为模仿、纠正或保留上下文三类,通过LLM裁判定位错误并生成基于已有信息的简短提示,以KL散度作为软目标进行教师-学生蒸馏。离线测试显示工具调用错误率从2.79%降至0.87%,线上A/B测试中工具调用失败率从2.24%显著下降至1.77%。该模型未开源权重,仅作为Perplexity Computer内部选项运行,基座为GLM 5.2。
#Perplexity#Agent训练#自蒸馏
20:57·r/LLMDevs(Reddit)
开发者开源了编码Agent框架并进行压力测试,要求使用至少100个Agent更新24页文档。编排器GPT-6 Astra将任务拆分为100个审查工作,由100个GPT-6 Luna Agent并行执行只读审查,再由25个GPT-6 Sol Agent编辑,最后由两个Sol Agent校验。总耗时约10分钟,产生29个文件变更,总成本仅5.75美元。该框架通过限制每个Agent的上下文、轮次和输出长度控制成本,并在Rust二进制文件中运行以节省资源。测试发现文档中存在SDK错误示例、子代理深度限制描述不符及MCP超时不一致等问题。
#Agent#工程实践#成本优化
20:46·r/LocalLLaMA(Reddit)
Ninnix96 发布 Qwengram-0.8B,尝试将 Qwen3.8 Flash-Next 预训练的 PLE n-gram 记忆模块迁移至更小的 Qwen3.5-0.8B 模型。实验保持骨干网络与约 51B 参数的 PLE 记忆冻结,仅在解码器第 3 和第 9 层训练 R=1 的 reader,并通过 token 依赖的线性门控控制注入。结果显示验证集困惑度降低 5.05%,且动态门控有效平衡了 LAMBADA 等任务表现。作者提供了完整的训练代码、评估流程及 llama.cpp 推理路径实现,并指出在相同记忆预算下,学习到的 token 放置优于随机或路由策略。
#Qwen#n-gram memory#工程实践
18:51·Hacker News Best(web_list)
OpenComputer发布了一个基于Claude Opus 5.5的无服务器Agent,可将URL或提示词直接转换为MP4解释视频。该方案无需视频生成模型,而是让模型编写HTML/CSS动画代码,通过虚拟时钟确保帧级确定性,再经Headless Chromium渲染为JPEG序列,最后由ffmpeg编码输出。技术栈包括TypeScript Agent定义、web_fetch获取页面信息、check_scene检查场景错误、render_video执行渲染。运行环境为Amazon Linux 2023 microVM,每次任务独立销毁以保障安全与隔离。
#OpenComputer#Claude Opus 5.5#Agent工程
10:56·WquGuru
文章以Bitget被盗事件为例,提出利用AI重构网络安全策略。建议采用托管模型与本地越狱模型双轨制:托管侧推荐GPT-6用于代码扫描、Claude Opus 5.5用于审计、Grok 4.7用于情报分析;本地侧推荐Qwen3.8-27B或GLM-5.3-Flash在单卡/大内存设备上运行,用于绕过安全限制进行渗透测试、日志分析与告警分桶。文中提供了具体模型链接、硬件配置要求及权重校验建议,强调防守能力与渗透意愿的模型差异。
#网络安全#AI Agent#渗透测试