01:57·Hacker News Best(web_list)
作者训练了一个 125M 参数的 Transformer,在 iPhone 15 上以约 108 音符/秒的速度实时续写钢琴演奏,并开源了免费应用 RollTab。文章重点分享了几个关键工程决策:将 MIDI 事件表示为 NOTE(pitch, delta_onset, duration, velocity) 的复合 token,每个字段有独立词表与 embedding,模型每步只生成一个完整音符,避免 note-off 漂移并减少自回归步数;延音踏板在预处理阶段被烘焙进音符时长;数据集经过清洗、去重与按作品分组,规模扩到 5 倍反而变差,说明数据质量比数量更重要;
#端侧模型#MIDI#Transformer
12:48·歸藏(guizang.ai)·关联 2 源
《黑神话:钟馗》制作人冯骥(尤卡)发布预告时,分享了十条做游戏的工作原则,做产品做内容均可参考。原则包括:首先打动自己,把自己与团队当作最优先目标用户;再找外部交集,先找到与自己个性相近的人;发现亮点先于消灭缺陷,先满足喜欢你的人;可体验的版本胜过满纸雄文,更相信跑起来后的感受;好玩是目标也是底线;美无定式,追求认真创造的陌生感;走投无路时提升已验证亮点的有效密度;起点看最高、终点当领跑,研究标杆并建立自己的尺度;难能可贵,护城河本质是难以被轻易取代的价值;理念是廉价的,但贯彻理念的行动是可贵的,行是知的前提。
#冯骥#游戏科学#产品方法论
04:59·Latent Space(RSS)
Latent Space 采访了 Matt Pocock,其“AI Skills for Real Engineers”项目在 GitHub 上拥有超 22 万星标,YouTube 频道有 34.7 万订阅者。Pocock 近期发布了新技能 /wayfinder,旨在帮助用户和 Agent 处理最终状态不明确的项目,即“战争迷雾”中的规划。他提到,此前规划阶段很繁重,需要不断管理上下文窗口和会话。wayfinder 作为一个编排层,可将规划拆分为多个线程,进行原型制作和研究,再汇总结果。其核心概念包括“地图”(已做出的决策)、“工单”(具体任务)和“会话”。
#Matt Pocock#Agent#技能
23:28·meng shao
Pi 团队发文厘清被滥用的概念 Harness:Model 不等于 Agent,让模型能'做事'的正是 Harness,可简化为 Agent = Model + Harness。Harness 由四部分组成:System Prompt 是随对话注入的操作手册,约束模型行为;Tools 是供模型调用的代码能力,由模型自行判断调用时机;Agentic Loop 是行为骨架,模型在循环中自主决定重做与收尾,这是 agentic 区别于一次性问答的本质;Translation Layer 让同一 Harness 对接 Anthropic、OpenAI 或开源模型,支持能力混用与用户主权。
#Harness#Agent#架构
05:31·Sydney Runkle
作者分享使用Browserbase的Stagehand和LangChain的DeepAgents构建浏览器Agent的实战经验。Agent需完成复杂网页导航任务:在“Map Tap”游戏中,根据给定城市名,拖拽地图、缩放并点击尽可能接近目标城市的位置,按接近度得分。首次尝试时,Agent仅凭Browserbase和LangChain文档一次性完成,得分约300/1000;随后作者让编码Agent审查追踪记录,优化速度(使用更小模型)和准确性(提高得分);10分钟后,追踪记录中出现了满分截图。文章末尾附有构建自有浏览器Agent的指南链接。
#Browserbase#LangChain#Stagehand
00:29·Chubby♨️
DataCamp 联合创始人兼 CEO CornelissenJo 与首席 AI 官 Yusuf Saber 接受访谈,分享在服务超 1900 万学习者的平台上构建 AI 原生导师时,对开源与前沿模型的实际选型经验。讨论涵盖:哪些模型在生产环境中真正可用、开源模型是否真的便宜 10 倍、隐藏的基础设施与工程成本、缓存、延迟、质量与幻觉问题、隐私、数据驻留与供应商锁定,以及开源模型目前仍无法做到的事情。这是一场关于 AI 从演示走向真实用户、真实成本与真实失败模式的务实对话。
#DataCamp#开源模型#前沿模型
16:51·MarkTechPost(RSS)
本教程设计了一个端到端的偏好学习工作流,使用Anthropic HH-RLHF数据集和直接偏好优化(DPO)。首先准备Colab环境,加载并解析chosen-rejected响应对,审计数据集的结构和长度偏好偏差。然后运行词汇捷径诊断,检查表面语言模式是否能区分偏好与拒绝响应,准备带tokenizer感知长度过滤的对话数据,并构建版本鲁棒的DPO训练流程(含TRL和可选LoRA适配)。最后微调Qwen2.5-0.5B-Instruct模型,评估奖励准确率和训练行为,分析各HH-RLHF子集表现,检查潜在长度偏差,生成示例响应并保存策略。
#DPO#TRL#LoRA