乐享科技发布具身大模型以太,参数仅4B
从演示走向实景,以太大模型探索机器人通用“大脑”
4B参数零真机数据训练的具身大模型,直接挑战行业高成本痛点,技术路线具有显著参考价值,建议关注其后续落地进展。
一场街头烧烤直播,成为检验机器人自主能力的“开放场景”考题。
9月16日,乐享科技在上海举办机器人户外实景直播,在直播中人们看到:烧烤机器人在炉前完成烤串作业,两台服务机器人配合,完成点单、烤制、传菜、上菜任务;有顾客临时提出“少放辣”要求,前台接待机器人转身向负责烧烤的同伴提醒;等待出餐时,它还需要给顾客送水、递纸,同步烧烤进度,继续处理尚未完成的订单……
点单、烧烤、上菜这一连串任务,考验着机器人在动态环境中的连续决策与协作能力。顾客临时提出要“少辣”,接待机器人需要将新要求同步给负责烧烤的同伴;点单被取水需求打断后,还要记住进度,在送水后继续完成服务。
这些动作并非事先编程,而是具身大模型实时决策的结果。相较常见的机器人Demo,现场各类突发状况不断发生,面对这些需要自主完成的高难度非标准化操作,机器人均有效响应,顺利完成全部作业。近一小时的街头烧烤,把具身智能大模型的长时真实环境公开验证,提升到新的高度。
支撑起这场烧烤派对顺利完成的,是乐享科技自主研发的跨本体通用具身大模型——“以太”(Aether)大模型。
没有走可预演的实验室路线,乐享科技把模型直接放进无法提前编排的真实生活场景里检验。用一场极致考验临场应变的技术秀,完成了一场没有彩排的技术大考。
在“混乱”中完成任务
在烧烤现场,6名人类嘉宾可以临时改变诉求,也可以挪动物品、打断正在进行的工作。原定参与测试的一名观众未能到场,主办方还从围观人群中随机邀请了一名观众补位,直接进行现场互动。
这些变动让机器人面临的任务持续变化,刚刚确认的订单可能需要修改,原本计划好的送餐顺序可能被新需求打断,物品位置的变化又可能影响机器人的抓取。机器人需要在保留原有任务目标的同时,不断同步更新对现场的判断。
机器人在点单过程中被打断要求送水,处理完新需求后,又继续完成点单,看似自然的动作,实际上要求系统同时处理两件事,响应眼前的请求,并保存尚未完成的工作,避免临时任务结束后丢失进度。
多机器人协作进一步增加了任务的复杂度,负责接待的机器人需要将顾客要求传给负责烧烤的同伴,后者完成烹制后再交接成品,由服务机器人送至餐桌。信息与物品需要在不同机器人之间准确流转,局部变化也需要及时传递给后续环节。
直播中,机器人也出现了操作不够顺利的情况,面对调料瓶,机器人出现了没有夹稳的情况,但观察总结后,经过一次尝试,调整了抓取方式,最后抓起调料瓶继续撒料。这也意味着,以太大模型即使在面对没有见过的事物时,在初次动作失败后,仍能依据现场反馈自行修正。
这种面对陌生事物,想办法寻找解决方案的表现,正是以太大模型的核心能力。
8月底,一段约10分钟的家庭整理视频引发关注,两台不同本体的机器人,共用同一套模型协作收拾房间,这一模型以代号MVP的名字进入公众视野。9月10日,乐享科技正式认领MVP,并揭晓其正式名称以太大模型(Aether)。
这段视频令人印象深刻的地方是,两台不同机器人只接受一个高层指令,就能自主协作完成收拾房间任务,全程无遥操、无剪辑。当物品在高处够不到时,机器人尝试寻找箱子垫脚;发现玻璃怎么擦都不干净,又判断污渍可能在外侧,转而伸手到外侧擦拭。当一台机器人遇到困难时,另一台还会主动上前帮忙。
从收拾房间到户外烧烤,两类场景所要求的能力具有共通之处:识别执行结果与预期之间的差距,调整方法,再继续完成任务。
长期以来,具身智能受困于一道难题:环境与任务始终在变化,物品位置被挪动、用户需求临时改变、操作结果偏离预期,都要求机器人重新调整策略,并继续完成工作。这考验着模型对环境变化的适应能力,以及感知、记忆、决策与行动之间的持续协同。
以太大模型通过以神经元分配为核心的能量驱动架构,让感知、记忆、推理、运动控制和物理反馈收束进同一条连续闭环,来回应这一挑战。从居家整理演示到户外烧烤直播,以太大模型展示了任务被打断后接续执行、操作受阻后调整方法,以及不同机器人之间协作的能力。
这些探索为具身智能从受控环境测试走向真实场景应用提供了一种新的思路,也将后续验证的重点指向具身机器人在更长时间运行中的适应能力和稳定性。
探索具身智能架构新可能
让机器人处理好一个临时需求,背后实际涉及从理解指令到实际行动的多层协同。
在设计上,以太大模型的高层系统理解人类意图、规划任务和调用记忆,感知环节负责空间定位与多模态信息融合,运动控制环节则承担动作规划和误差修正,各环节通过双向信息流连接,使感知、思考、行动与反馈形成闭环。执行过程中,现场有可能发生变化,系统还需要重新调整。
乐享科技对以太大模型的设计,正是围绕这些环节的贯通展开。
首先,任务完成度、物理约束与动作可行性需要被放进统一的评估体系。机器人采取什么行动,既取决于目标,也取决于现场条件与自身能力,当执行反馈发生变化,后续判断随之更新。
为实现这一点,以太大模型在功能设计上借鉴了从人类大脑到脊髓的分层机制。高层负责理解意图、规划长任务和调用情景记忆;运动规划环节负责动作生成、轨迹调整与误差修正。最后,接近硬件的底层处理力与位置控制,在碰撞、外力扰动等情况下快速响应。
这些层次通过双向反馈相互连接。比如,抓取时物体发生移位,底层需要及时调整力度;如果多次尝试仍无法完成,上层就需要重新评估物体状态和操作方式。思考影响行动,行动结果又反馈到系统,成为下一次判断的依据。
这套设计也让主动感知具备了具体意义。当机器人看不清目标,或现有信息不足以支持决策时,可以转头、移动身体、改变观察角度,主动补充线索。根据乐享科技介绍,以太大模型能够融合视觉、听觉、力反馈等信号,帮助机器人理解物体位置与交互状态。
例如,在烧烤服务中,机器人需要持续保存订单与任务进度,让眼前变化与此前工作建立联系。而在做家务的过程中,机器人被闹钟打断,按掉闹钟后会继续执行前序任务。
乐享科技将这一机制称为“流式记忆”:机器人持续记录环境交互、任务经历和人类指令,形成可调用的情景记忆,为后续任务提供参考。
与理解外部环境同样重要的,是机器人能否判断自己掌握的信息是否充分、身体条件能否支持下一步操作。以太大模型的元认知能力,就是评估自身对环境的理解程度与任务可行性,在信息不足时主动补充线索,在原方案受限时调整策略。
承认自己“不知道”,对大模型是一种宝贵的能力。对要在物理世界里执行任务的机器人,这一点更有实际价值。一次缺少依据的判断,就可能把任务打断,先识别信息缺口,再观察、判断并行动,是机器人从响应指令走向可靠完成任务的重要一步。
主动感知、多模态理解、流式记忆、运动动力学共同构成了以太大模型的能力基础,并进一步自我迭代:通过现实交互反馈,持续修正认知与运动策略,让经验在后续任务中发挥作用。
值得注意的是,据乐享科技披露,以太大模型参数规模仅为4B,使用约200小时人类视频训练,真机数据为零。
对仍高度依赖真机数据训练的具身智能行业来说,行业成本账,可能被重新算一遍。路径一旦跑通,机器人学习新技能、适应新场景所需的采集和训练成本有望下降;同一套模型能适配不同本体,则意味着智能可以在更多硬件上复用,减少重复开发与适配。对乐享科技而言,通用具身“大脑”也才有机会延伸到更多厂商和场景。
持续进化的智能体,是AI产业的重要探索方向
把机器人放进烧烤摊做直播,也给具身模型能力提供了一种更接近真实用途的衡量方式。
机器人连续完成从理解顾客需求、任务规划到烧烤、上菜的完整流程,重点展示长时序任务执行、环境变化应对、失败恢复、自主决策等能力和不同机器人的跨本体协作能力。
以太大模型的跨本体能力意味着,同一套模型可以适配不同机器人,有望减少针对不同硬件重复开发智能系统的投入。
如果任务理解、记忆与规划等能力能够在不同本体上复用,开发者有机会减少重复开发,本体厂商可以围绕具体用途优化硬件,模型则通过适配进入更多机器人,支持更多场景。
不同本体共用同一套模型,也为多机自主协作提供了可能。正如我们在直播中看到的,烧烤机器人完成烹制后,传递完成烹制的信息并将成品交给服务机器人,再由后者送至餐桌。不同机器人通过分工与任务交接,共同完成从烧烤到上菜的服务流程。
对乐享科技而言,打造通用“大脑”的潜在应用空间,将随着可适配的本体和任务增加而扩展,如果模型积累的能力能够有效迁移,接入新设备、进入新场景所需的开发和调试成本就有望下降,为规模化部署创造条件。
具身智能的探索仍处于早期。就在几天前,OpenAI首席科学家Jakub Pachocki在“An Alien Mind”一文中,写下了一种能自我改进、越来越难被人类完全理解的机器心智的理念,与乐享科技此前已经公开的技术理念,以及落地中的模型,几乎落在同一层叙述上。
技术理念不谋而合,共识已经产生,创新很困难,将创新理念转化为可持续迭代的技术与产品,更需要长期投入。共识之外,对乐享科技而言,仍需要不断颠覆自己,在真实场景中持续检验自有路线,根据实际反馈修正产品。
从居家演示走向户外烧烤直播只是一步,接下来仍需在更多真实场景中检验模型、修正不足,让具身机器人自主判断、持续学习的技术目标逐步转化为可靠的工作能力。最后,无论是具身智能产业,还是乐享科技,都会迎来广阔增长空间。而驱动力,则来自于创新。
作者: 21世纪经济报道
查看原文 →
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力