14:15·meng shao
本文基于 Anthropic 官方博客,讲解如何最大化 Claude Code 会话价值。token 单价由模型大小、输入输出(输出约为输入 5 倍,thinking token 占大头,可用 MAX_THINKING_TOKENS=0 关闭)及提示词缓存(缓存读取 0.1×,写入最高 2×)决定。切换模型、/effort、开启 Fast mode、/compact 等会击穿缓存导致全价 prefill。会话 token 量方面,进入上下文的内容每轮重发,需注意探索成本、命令输出(超 3 万字符自动落盘)及轮次累积。Subagent 可隔离上下文,适合产出大量无需保留输出的任务。
#Claude Code#成本优化#缓存
01:52·MarkTechPost(RSS)
本教程基于 docTR 库,演示如何构建端到端的文档智能流水线。内容包括:生成逼真的合成发票文档,通过 DocumentFile 加载图像与 PDF,构建支持 GPU 的 OCR 预测器,并对不同检测-识别架构组合进行速度与精度基准测试。教程深入解析 Document 内部层级结构,可视化置信度感知的边界框,使用独立的检测与识别模型,对低置信度词实施两遍识别,调整检测阈值,并引入自定义流水线钩子用于框过滤与填充。同时处理旋转与倾斜文档,实验版面检测与 KIE,重建阅读顺序与表格信息,提取结构化发票字段,并将结果导出为文本、JSON、hOCR、合成文档图像及可搜索 PDF。
#docTR#OCR#文档智能
09:55·Lee Robinson
Grok Bot 产品负责人分享其设计背后的四项关键技术决策:1. 最佳 UI 即无 UI,界面极简,专为当前前沿模型能力设计,随模型进步仍易用;2. 客户端薄壳、服务端厚壳,客户端仅负责消息传递,复杂度移至服务端,保证桌面与移动端流畅;3. 常驻云端电脑,每个 bot 连接专属持久化文件系统,无需为每次对话新建虚拟机,支持在持久环境中运行 agent;4. bot 可使用浏览器,结合代码编写与浏览器操作,可自动化几乎任何计算机任务,并支持录制操作生成可重复流程。
#Grok#Agent#产品设计
15:27·InfoQ 中国(RSS)
本文复盘 KMP(Kotlin Multiplatform)在鸿蒙系统上的工程实践。团队将业务逻辑用 Kotlin 编写并编译为 ArkTS 字节码,实现跨平台复用,同时针对鸿蒙运行时做深度优化:用 ArkUI 声明式 UI 与 KMP 解耦,渲染任务下沉原生层以减少桥接开销;通过内存池复用、对象生命周期管理与 GC 参数调优,显著降低渲染内存占用与 GC 卡顿率。实测渲染内存峰值降约 95%,GC 卡顿率降约 90%。文章还分享了鸿蒙上调试 KMP、处理 ArkTS 与 Kotlin 类型映射差异、构建打包流程的踩坑经验,为其他团队提供可复用参考。
#KMP#鸿蒙#性能优化
00:00·GitHub 博客(RSS)
GitHub 博客作者分享了在 GitHub Copilot 中使用 canvases 的实践。Canvases 为开发者和 Agent 提供持久、共享的工作表面,使工作进展可见、可引导、可审批,解决了纯聊天界面中上下文丢失、审查耗时、多 Agent 编排困难等问题。作者构建了两个 canvas 实例:Java Modernization Studio 和 Site Studio,并总结了可复用的模式:清晰定义工作流状态、突出关键决策、即时持久化进度和草稿、保留明确的人工审批点。
#GitHub#Copilot#Agent
03:46·Hugging Face 博客(RSS)
Hugging Face 博客发布文章,探讨如何在不增加硬件投入的情况下,通过优化 GPU 调度顺序将集群利用率提升 33 个百分点。文章指出,调度顺序的调整是提升利用率的关键,而非单纯增加资源。作者分享了具体的实践方法,包括如何分析现有调度策略、识别瓶颈,以及如何通过重新排序任务来最大化 GPU 利用率。这一案例为 AI 基础设施团队提供了可复用的优化思路,强调在资源有限时,通过软件层面的调度优化同样能带来显著收益。
#Hugging Face#GPU调度#集群优化
19:21·meng shao
Greg Isenberg 提出「AI Agent 五要素测试」框架,评估哪些业务适合构建为 Agent。五要素包括:重复的触发器(高频任务才值得)、稳定的输入(结构化数据)、明确的工具集(动作边界清晰)、可衡量的终点(有验收标准)、中间需要判断力(每次运行有差异需实时决策)。核心洞察:前 4 条回答「能否自动化」,第 5 条区分「Agent 还是普通自动化」。Automation 是规则驱动、路径固定;Agent 在流程中段存在决策点,需理解上下文、权衡选项、处理例外。以客户退款申请为例,前 4 条使其可自动化,第 5 条(边缘案例判断)使其必须是 Agent。
#Agent#选型框架#自动化
10:00·InfoQ 中国(RSS)
本文是AICon深圳的演讲内容,聚焦盘古大模型在昇腾平台上的训练与推理通信优化实践。作者分享了亲和昇腾平台的性能探索经验,包括通信拓扑感知、梯度压缩、流水线并行等优化手段,以及如何通过软硬协同设计提升大规模训练效率。文章强调通信优化在千卡级集群中的关键作用,并给出了具体的调优参数与工程取舍,为在昇腾平台上进行大模型训练的开发者提供了可复用的方法论。
#盘古#昇腾#通信优化