Reward AI发布机器人基础模型OM-1,仅从人类操作数据学习
Reward AI 发布了机器人基础模型 OM-1,核心卖点是:只从人类操作数据中学习,不需要遥操作,不需要机器人专属数据,训练完直接部署到桌面机械臂、工业机械…
机器人领域的新范式尝试,绕开昂贵的遥操作数据采集,直接从人类自然行为中学习操控能力,对具身智能开发者极具参考价值。
Reward AI 发布了机器人基础模型 OM-1,核心卖点是:只从人类操作数据中学习,不需要遥操作,不需要机器人专属数据,训练完直接部署到桌面机械臂、工业机械臂、人形机器人上,不用针对每种机器人做微调。
Reward AI 脱胎于斯坦福大学的 DexCap 项目。DexCap 是一套便携式人手动作捕捉系统,能记录人在日常操作中手指的精细动作。OM-1 在此基础上更进一步,设计了一套叫 Omnibody Hand 的 7 自由度可穿戴设备,让人戴着它正常工作、做饭、整理东西,设备会同步采集视觉、触觉、力度等多模态数据。换句话说,人照常干活,数据自动录好,机器人直接从这些数据里学会怎么操控物体。
这条路线和当前主流做法不一样。大多数机器人基础模型(比如 Physical Intelligence 的 π0、Figure AI 的 Helix)依赖大量遥操作数据,需要人远程控制机器人做示范,再从示范中学习。遥操作数据采集成本高、效率低,而且跟具体机器人硬件绑定。OM-1 绕开了这个瓶颈,直接从人手动作学习,数据采集更快,理论上也更容易规模化。
从演示视频看,OM-1 能完成手机包装(四臂协作)、调酒、叠衣服、拔网线这类任务,都是实时速度,没有加速。拔网线这个任务看着简单,其实需要精确按压卡扣才能拔出来,属于精细操作。官方称学会一个全新任务只需不到 30 分钟的人类演示数据。
OM-1 还展现了一些自发行为:多臂协作时一只臂会自动补偿另一只臂的失误,遇到外部干扰会重试,环境变化太大时会主动停下。
目前 OM-1 处于研发展示阶段,Reward AI 没有公布商业化时间表和定价。对于机器人行业来说,如果"从人类数据直接学习"这条路能跑通并规模化,将大幅降低机器人技能训练的门槛,让新机器人硬件一出厂就能继承已有的操作能力,而不用从头采集训练数据。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力