13:57·r/LLMDevs(Reddit)
本文通过三个案例说明在LLM实验中如何避免不必要的GPU重跑。首先,Qwen3.8-Flash-Next的测试显示,人名位置(句首vs句中)导致显著性能差异,该数据已存在于发布的结果文件中,无需重新运行即可发现混淆变量。其次,调整提示词顺序将本地Qwen准确率从89%提升至100%,通过分析已有运行的逐案例差异定位到干扰项位置问题。最后,RAG评估中发现裁判仅读取前600字符导致偏差,通过固定输出重新评分揭示了截断对长文档的影响。核心建议是:在发起新运行前,先检查结果文件是否记录了输入细节(如位置、长度、模板ID),通过重评分固定输出来隔离生成噪声,从而以零算力成本验证假设。
#LLM实验#Prompt Engineering#RAG
20:28·Hacker News Best(web_list)
NobodyWho发布一篇技术博文,演示如何用25行Python代码在本地实现被称为“Jev”的AI范式。该方案基于Qwen3-0.6B-GGUF模型,通过llama-cpp-python加载权重,提取特定token的logits并转换为概率分布,从而对输入文本进行多选项分类(如垃圾邮件检测)。文章强调该方法无需调用API、不产生合成数据、无需强化学习校准,具备快速、本地隐私保护及低资源消耗特点。文中附带完整代码示例,展示从模型加载、Prompt构建到Logits处理的全流程,旨在提供可复现的轻量级本地推理实践。
#NobodyWho#Jev#本地部署
08:00·Cursor 博客(web_list)
Cursor 发布技术博客,详解如何通过优化 Agent Harness 提升 Token 效率并降低用户成本。主要措施包括:1. 精简 System Prompt,随模型能力提升移除冗余指令,削减约 66% 的提示词长度;2. 动态加载工具定义,将低频内置工具移至动态上下文,使静态上下文 Token 减少 60%,MCP 工具调用会话总 Token 降 46.9%;3. 优化缓存复用,利用 GPT-5.6 显式断点功能及调整请求结构,冷缓存未命中率降低 20%;4. 压缩文件读取,行号仅每十行标注,缓存读取 Token 降 1.6%;5.
#Cursor#Agent工程#Token优化
20:28·Hacker News Best(web_list)
Trail of Bits发布长文,系统回顾SAML协议从诞生到衰落的历程。文章指出SAML因基于复杂的XML且由委员会设计,导致规范臃肿。其核心缺陷包括XML签名验证的固有脆弱性、XML实体扩展与XXE等安全漏洞,以及规范化(Canonicalization)引发的签名绕过攻击。作者结合在Duo Security开发Access Gateway的工程经验,剖析了SAML在应对现代SaaS认证需求时的结构性失败,并论证了向OpenID Connect迁移的必要性。该文为身份认证协议的设计与选型提供了深度的工程复盘与安全视角。
#Trail of Bits#SAML#安全工程
03:36·Chubby♨️
用户利用 Claude Code 在约一小时及消耗 7% 周额度内,使用 Opus 5.5 模型完成了一部关于 AI 发展史的三分钟短片。该作品完全由代码渲染,未使用任何素材库或图像视频生成器。制作过程涉及约 7400 行 React/TypeScript 代码(基于 Remotion),所有画面均通过 SVG 和 Canvas 绘制,配音采用开源 TTS 语音,配乐则在 Python 中合成。此案例展示了利用编程环境直接生成多媒体内容的工程实践路径。
#Claude Code#Opus 5.5#Remotion
03:17·ClaudeDevs
Claude官方发布博客,详细复盘了如何在两周内将claude.ai前端性能提升三倍。文章公开了具体的优化方法论与实操细节,包括如何利用Claude自身进行性能测量、代码调试及改进。内容涵盖了完整的提示词(Prompts)与实施方法,展示了AI辅助工程优化的具体工作流。对于从事Web应用开发、Agent平台构建或关注AI工程效率的团队而言,这是一份极具参考价值的实战指南,提供了可复用的性能调优思路与工具链配置经验。
#Claude#性能优化#工程实践
22:37·WquGuru
本文分享Qwen-Image-2.1(写实)与Anima(二次元)的本地部署实操。Qwen-Image-2.1推荐Mac使用MLX 4bit或GGUF格式,需搭配专属VAE与文本编码器;关键参数为cfg=1、步数40,避免构图崩坏。Anima基于Cosmos-Predict2架构,约2B参数,支持Danbooru标签与自然语言,提供Base、Aesthetic、Turbo三种版本,需单独配置qwen_3_06b文本编码器与Qwen-Image VAE方可运行。此外提及Illustrious系列适合角色一致性与海量LoRA训练。文末强调安全规范:仅下载.
#Qwen#Anima#本地部署
11:01·meng shao
SpaceX AI 发布 Grok Bot 客户支持实践案例,在工单量增长 175% 的情况下实现零招聘,将单次解决成本降至 0.20-0.30 美元。其部署采用“爬—走—跑”方法论:初期仅接入 Plain 和 Linear 系统写内部备注并需人工批准;建立 trace 与评估机制形成反馈闭环;从简单工单开始逐步放权直接面对客户。Grok Bot 承担四层工作:单票解决(预调查、联动 Datadog 发现后端错误、自动新建 issue 或录屏复现 bug);队列实时管理(监控进件量、动态调整优先级、跨工单识别模式宣告事故、监控 X 情绪信号);
#xAI#Grok Bot#Agent实践