从“预测”到“求解”:乐享以太大模型重塑 Physical AI 解题范式。 作者丨幸丽娟 编辑丨董子博 具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻,未必长得像 ChatGPT。 决定这个时刻的,不是机器人会聊天,也不是机器人学会了几个动作,而是在不确定环境里,机器人能不能自主思考、判断和执行,在无序的事件中,持续完成任务。 过去两年,行业积累的几乎全是“能力上限”的展示:选好场景、选好时机、反复调试,再拍出一条完美的Demo。 上限可以“被编辑”出来展示。真实效果如何,却少有人敢公开测。 但机器人真正进入现实世界,考验的不只是最好时能做到什么,更是环境不断变化时,它还能不能把事情做下去。 9 月 16 日傍晚。上海闵行一家烧烤店门口,乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时,它们要接单、烤串、上菜。 这场直播的规则,测的正是机器人在这种真实环境里的应变能力。 没有剪辑,没有遥控,没有预设脚本。 更绝的是,观众可以实时干预:随机出题,自由改造场地布局,随手改道具摆放位置,临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务,就是“干扰”,看机器人能不能像人一样自己“圆场子”。 而就在不久前,这家公司刚刚站在了一场舆论风暴的中心。 故事线是这样的: 7 月,乐享上线以太大模型官网并公开完整技术路线;8月26日,一段机器人协作收拾房间的10分钟一镜到底 Demo,在具身圈传开。 9 月 3 日,OpenAI 上线 GPT-6 Astra 官网;三天后,首席科学家 Jakub Pachocki 发表万字长文《异星心智》。 9 月 10 日,乐享创始人郭人杰发文,三问 OpenAI:技术理念为何高度重合?概念表述为何如出一辙?官网设计为何似曾相识?他称对方“像素级搬运”“直接蒸馏”,并称法律团队已启动程序。 舆论随之分成两派。一派说这是硬实力,另一派说这是“蹭热度”、“demo造假”。 面对这些质疑声,乐享决定让搭载以太大模型的机器人自己上场回应。于是,这场户外烧烤直播来了。 被推到台前的,还有一组更根本的追问:当计划被打破、条件被临时改写、任务被中途打断,机器人还能不能重新收敛到目标?如果能,又凭什么能? 乐享敢把场子开放出来,就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点,在近一个小时的直播里看得最清楚。 01 开放环境直播: 一次可被干扰的硬核测试 炉子支起来,名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐,一台负责守炉。 整条任务链是:接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。 为了证明现场没有遥操,创始人郭人杰把摄像机带进后厨,翻转镜头拍现场人员,又掀开背景幕布,展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是,完全没有人遥操的空间。 他在开场直言直播的仓促:“我们周日才跟烧烤店老板聊好,花几万块钱租下这块场地。” 然后,机器人的五项核心能力在这场直播中,被反复测试: 主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后,会注意顾客的等餐时间,当感知到顾客等候较久,会主动上前询问出餐进度。 更细致的一个瞬间是:在没有人开口要求的情况下,它想到吃烧烤的顾客会需要纸巾,主动把纸巾送了过去。 多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人,它需要理解这句话的语义,同时结合视觉信息确认顾客指的是哪一份订单,然后将新要求转身传递给负责烧烤的同伴。 烧烤机器人收到调味指令后,精准识别食物位置,均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。 流式记忆。一个小时的直播被打散来做:3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链,能把进度推进到收尾。 更直观的一幕是:服务机器人正在给顾客点单,突然被要求“拿瓶水”。它停下点单,先去递水,再接着把单点完。整个过程没有犹豫,也没有等下一条指令。 这件事看起来简单,但对机器人来说不是。打断一次,上下文就可能被覆盖,任务状态归零,它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言,这几乎是不可能完成的任务。 动力学建模。烧烤机器人自主为食材刷涂酱汁,这个过程非常考验空间感知和力度控制,因为模型需要理解物体的物理属性,结合动力学模型输出符合物理规律的动作。 另一个更能说明问题的瞬间是翻面:机器人第一次给食材翻面时没有翻好,食材掉落炉架。第二次调整了抓取和翻转姿势,成功了。 这背后,是动力学建模在实时求解:系统不是从记忆里检索一个“标准翻面动作”,而是在当前的重心偏移、摩擦系数和夹持条件下,重新解出了一组能让动作成立的力矩参数。 持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间,同样是模型持续自我迭代能力的直接写照。这种并不完美的过程,恰恰能让人直观地看到模型是如何通过失败反馈,自主进化,最终顺利完成任务。 这五项能力,看似在测五个不同的维度,实际上指向模型从数字世界走向物理世界的真正门槛:机器人能不能在约束不断变化的情况下,依旧能把事情做对。 过去,这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了,模型在不同的约束条件下,靠自主智能就可以把“对的动作”解出来。 这两台机器人默契完成协作任务的画面,很容易让人想到八月底那段在具身圈刷屏的视频。10分钟,一镜到底。狭小的空间里,两台不同品牌和型号的机器人,全程自主协作收拾房间。 视频里发生了这些事,值得反复琢磨—— 一台机器人用刮水器擦玻璃,有一处怎么都擦不干净。它重复几次后停下来,判断脏东西可能在玻璃外面,于是把刮水器伸出窗外; 接着,它收拾桌面,双手被占满时,另一台主动拿起桌上的围巾挂到它脖子上,发现围巾太长,还用双手把围巾捧起来,被帮助的机器人看懂了,弯下了腰......双方通过自主协同,完成了这次物品“迁徙”; 随后,较矮的机器人要把围巾放进柜子上方隔层,可它只有 1.3 米,够不到。它找到旁边的箱子推到地上,想弯腰搬起来垫脚,却发现自己弯不下腰,于是它选择用脚踢过去; 箱子踢歪了,机器人又开始琢磨怎么把箱子回正,这时候,身高 1.7 米的另一台机器人走了过来:它似乎看出了同伴的困境,放下了手上的活,主动帮忙把围巾放到目标位置。 中途闹钟响了,两台机器人转去处理桌面和冰箱收纳任务,做完再回来接着做没做完的事,进度没被清零。 一个在室内,一个在户外;一个做家务,一个要烤串上菜。展示的却是同一件事:以太大模型可以让机器人自主思考,自主决策,并在试错中完成自我进化,以及实现跨本体协作。 这背后,还有一个更深层的追问:它凭什么做到? 要回答这一点,得先看市面上现有的具身智能主流方案为什么做不到。 02 VLA 和 WAM ,绕不开“预测”这道坎 当前具身智能有两条主流路线:VLA 和 WAM。 2026年4月,英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告:VLA 已死,WAM 当立。这番论断将两条路线的争论推到了台前。 但无论是哪条路线,两者的底层逻辑却是同一件事:预测。 ▎VLA 预测动作分布 从 RT-1、RT-2 到 OpenVLA,再到 Π0 系列,VLA 的思路是:把图像和语言指令编码进一个多模态主干,直接解码出动作序列。 数学上,它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l,输出动作 a。 这条路的好处很直接:快。链路短,延迟低,能接高频控制;语言模型的语义能力可以直接复用,机器人“听得懂”开放词汇的指令。 但随着模型走向更加开放的真实环境,一些结构性缺陷也开始暴露。 第一个缺陷,是语言被架空。ICML 2026上的一篇论文(LangForce)给这个缺陷起了一个学术名字:信息坍缩。在目标驱动的数据采集范式下,语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”,看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零,模型实际上忽略了语言,退化成了一个纯粹的视觉策略。 在 RoboCasa 基准上,一个完全忽略语言指令的纯视觉模型,成功率与接收完整语言指令的模型几乎相同。 这意味着,VLA 学到的不是“理解指令然后行动”,而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是:分布外的新场景、新任务,泛化会显著下滑。 第二个缺陷,是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变,只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题,因为它压根没在算这件事。 ▎WAM 预测未来世界状态与动作 WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构:先预测动作执行后世界状态会如何变化,再反推最优控制指令。 数学上,它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l,同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。 这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”,这种物理知识比语义知识更通用。 但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上,语言指令在其中的权重依然很低。它补了物理,没补语义。 而且代价很大。基于视频扩散 Transformer 的 WAM,推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积,最终误导决策。 VLA 快,但语言被架空、不做动力学;WAM 补了物理,但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作,一个预测世界状态。 而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预,这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里:分布外,没有高概率样本可取。 也就是说,预测范式依赖的是训练数据里见过的情形。分布外没有数据,模型就没有可参照的概率分布,决策也就失去了依据,预测出“下一个对的动作”更是无从谈起。 那还有别的解法吗? 乐享没有执着于在“预测”这道题上找最佳答案,而是直接换一个题: 不预测“下一个最可能的动作”,求解的是“约束条件下,什么状态会更接近目标”。 03 以太大模型:从“预测”到“求解” 作为机器人的大脑,以太大模型的核心机制是 Energy-Driven(能量驱动),底层由神经元分配来支撑。 两者各回答一个问题:用什么来判断一个状态是不是“对的状态”,以及这个判断在哪里被计算出来。 ▎能量驱动:用什么来判断“对的状态” “能量”这个词容易让人联想到物理能量,但它在以太大模型里是一个数学对象:任务完成度、物理约束、记忆状态和动作可行性,被整合进一个统一的能量函数。 每个项都是一个数字,描述当前状态在某个维度上“有多好”或“有多差”。加起来,得到一个总分。总分越低,状态越好。 机器人的决策过程,就是在这个能量地形上找低点。哪个行动能让总分降得更多,就执行哪个。 对比来看,VLA 和 WAM 的底层都是概率对象,都受同一个数学性质的约束:分布是归一化的,所有可能结果的概率加起来必须等于 1。 这就带来一个限制:两个分布无法直接加在一起,得到一个新的合法分布。“把杯子拿起来”是一个分布,“不要碰到旁边的碗”是另一个分布。把这两个分布相加,在数学上无法构成一个新的合法分布,更不可能自动获得“拿起杯子同时不碰碗”的语义。 从机制上看,这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束,要么往训练集里加数据,要么加一个适配模块。约束进的是训练集,不是目标函数。 而能量是标量,标量天然支持复合:任务目标是一个能量项,物理约束是另一个能量项。加起来,就得到一个新的目标函数。不需要重新训练,不需要为每个任务单独微调。 这是能量驱动和预测范式最根本的分野:预测范式把约束塞进数据,能量范式把约束写进目标。 决策方式也跟着变了。拟合分布的模型本质上在做条件检索:给定当前观测,从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因,分布外没有高概率样本可取。 而能量最小化是一个优化过程:它在当下的具体环境里当场找一个低能量解,而且求解自带剪枝,能量高的候选会被迅速淘汰,不必把成千上万条路径都推演完。 回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”,不会主动把手伸出窗外,因为“伸出窗外”从未与“擦玻璃”配对过。 但在能量框架下,“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”,物理约束包括“污渍可能在任一侧”,内侧达不到目标,系统自然搜索到外侧。 搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子,够不到,它就找到箱子,想搬起来垫脚,但发现自己弯不下腰。试了几次之后,它一脚把箱子踢到了柜子边。 这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作,VLA 和 WAM 都不会主动做这件事。 但在能量框架下,“目标物不可达”是一个能量项,“箱子可以承重”是一个物理约束,“弯不下腰”是一个本体约束,“脚可以推动箱子”是另一个物理约束。系统在当下环境里,用这些约束解出了一条可行路径。 它判断下一步行动的方式,不是从记忆里翻答案,是当场“解题”:在约束不断变化的当下,重新解出什么才是对的状态。 ▎神经元分配:“对的状态”在哪里被算出来 能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”,但还有一个工程问题没解决:这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型,算力根本撑不住实时闭环。 以太大模型的解法是神经元分配。它按需调度计算资源,不让整个模型始终处于活跃状态。 架构上,它搭了一条仿生神经通路:前额叶皮层负责意图解析和长时序规划,角回与内嗅皮层负责流式长时记忆,顶上小叶与上丘负责主动感知,运动皮层与小脑负责运动规划与动态补偿,脊髓层负责力位控制与本能反射。 这套架构真正的关键,不在分层本身,而在分层之间的运行方式: 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体,躯体的传感器反馈回传上层认知。脑子在想的时候,身体已经在响应;身体遇到突发扰动的时候,认知也在同步更新。 时间尺度被解耦了。 高层推理是慢的,它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应,下沉到脊髓层,不走完整的高层推理。 主动感知是“能量项”,不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰:信息不足意味着不确定性高,而不确定性本身就是一项能量,所以“去看一眼”是降低能量的自然解,不需要额外写一条“探索策略”。 直播里,机器人面对陌生调料瓶花了几次尝试才摸到合适抓法,翻面在失败一次后重新调整姿势后成功。 这些瞬间背后都是同一个机制:不是每个决策都走完整推理,抓取打滑下沉到脊髓层快速响应,高层认知同时判断要不要换一种抓法。 而自我思考、自主进化的关键,也藏在这个机制里。 机器人尝试失败后,通过实时调整策略取得成功,这个过程里,模型参数没有变,变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好,在干活的过程中就能持续修正自己。 这也许才是“自进化”在工程层面的真实含义:不是预先训练出来的,而是运行中当场“解”出来的。 Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话,恰好点到了同一件事:如果机器人经过预先训练才完成任务,那只是在套用“配方”。这不是智能,只是陈述性知识和技能的堆积。 因此,真正的智能,不是在见过的情形里做对,而是在没见过的时候,依然有办法。 ▎监督信号从哪来:物理后果本身就是评分 这套机制里还有一个很少被展开、但很关键的差异:监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。 VLA 想进化,需要动作标签。而动作标签的高质量来源,目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。 WAM 想变强,需要未来画面。人类视频可以用,但视频里没有动作标签,所以它只能学“世界怎么变”,再反推该做什么。 能量驱动的模型不一样:能量值本身就是评分。 执行结果和预期不符、物理约束被违反、任务完成度没到,这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”,环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。 这套逻辑,在学术上已有验证。 2023年,Google DeepMind 发表了一项关于能量模型作为机器人策略的论文,证伪了“高维连续空间中的能量模型不可训练”的长期说法,并给出了可用的训练目标。 EBT-Policy 则进一步验证:用标量能量做机器人策略,部分任务上两步推理就收敛,相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下,能从失败动作序列中零样本恢复。 回到那三个数字。 200 小时人类视频,一个人要连续 8 天才能看完;0 小时真机数据,意味着没有一条遥操作轨迹;4B 参数,是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。 行业对 Scaling 的默认假设是能力来自数据和参数的堆叠,所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。 重点是:模型从什么东西里学。 过去,机器人要学会一个动作,需要有人告诉它“看到这个场景,手脚应该怎么动”。这个“告诉”的过程,就是标注。标注越细,成本越高。 Aether 换了一种学法:它不看人怎么动,看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败,结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。 人类视频里确实没有动作标签,但充满了结果:重力让东西下落,接触让物体移动,工具被使用后会留下痕迹,污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律,可以从结果里反推出来。 所以数据需求下降,是换了一种学法之后自然发生的事。 ▎跨本体成为“水到渠成的结果” VLA 学的是动作空间,而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形,关节维度和构型都不一样,所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。 但能量函数定义在任务状态和物理约束这一层,是本体无关的。换一台机器人,不变的是目标项和物理项,变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。 这也解释了以太的 Self Model(自我模型)为什么要显式表征“本体能力边界”:它不是要表示自己是什么形状,而是要表示“哪些动作在我这个身体上不可行”。 正是有了这个自我模型,同一个“大脑”进入不同的身体,只需要重新求解一次能量最小化。 户外烧烤直播里,烤串和上菜由两台不同的机器人完成,烤到什么程度该出餐、顾客改了口味该怎么同步,没有一步是提前设定的,是两台机器人在现场根据彼此的任务状态实时协调出来的。 来自两家互为竞品厂商的机器人,身高不同,构型不同,共用一套模型,自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头,这些细节反过来也是它“了解自己身体”的证据。 回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力,都并非从数据集中训练而来,是这四个底层机制里涌现出来的。 跨本体不是一个需要额外攻克的工程模块,它是能量函数定义在本体之上的一个水到渠成的结果。 一个烧烤摊,比任何一间实验室都难。风一吹,炭火忽大忽小;烤串在炉子不同位置,火力不一样,得挪来挪去;地面不平,端着盘子走的时候会晃;顾客站在旁边,随时改主意。 如果这些它都能应付,那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo,而是一台真真切切在户外干起了活的机器人。 04 重塑具身智能的“解题范式” 200 小时人类视频、0 小时真机数据、4B 参数,在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现,在具身圈是地震式的。 它的意义不仅仅是,在 VLA、WAM 之外,开辟了Physical AI的第三条路,更在于它重新定义了具身智能的整套“解题范式”。 具身模型过去的问题是:机器人下一步该做什么?模型学的是一套从观测到动作的映射,遇到没见过的场景,就只能靠检索、靠猜。 以太大模型直接换了一个问题:当前状态下,机器人做什么才是对的? 问题一换,跨本体、长时序、自进化这些原本各自为战的能力,就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型,更是一条截然不同的解题思路。 这套“解题范式”对于整个具身行业的意义,具体体现在三个方面。 第一,“大脑”和“身体”的关系变了。 过去两年具身智能的默认假设是:先有一个聪明的通用模型,再想办法适配到机器人上。 这个路径下,“跨本体”永远是一个后置的工程问题:不同身体构型不同、动作空间不同,模型要重新适配,成本永远降不下来。 而能量驱动的做法把目标定义在本体之上:同一个“大脑”可以进入不同的身体,跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。 这件事如果成立,行业的价值链会重新排布:大脑和本体解耦之后,“谁的模型能上更多的身体”,会比“谁的身体更灵巧”更关键。 第二,机器人能力的评价标准要换。 如果核心竞争力是“动作库有多大”,那比的是数据和算力。谁的数据多、算力大,谁就领先。这是资源竞赛,大玩家有天然优势。 如果核心竞争力是“计划被打乱之后能不能自己找回来”,那比的是架构。架构对了,小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队,能在现在这个时间点,做出以太大模型这样硬核的具身大模型的原因。 第三,“智能从哪儿来”这个问题从根本上被重构。 从 Transformer 到大模型时代,主流叙事一直是从视觉或语言出发。 “以太”这个名字本身就是一种表态:乐享认为能量比语言更本质。在单细胞生物阶段,没有视觉、没有语言,能量就已经在引导动作和交互。 虽然这条路线还在早期,但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案,会在更多真实场景的迭代中被解开。 而这场直播已经证明了一件事:当环境不再可控、计划不断被打断,一台机器人可以不等指令、不靠检索,靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网 从公开质疑OpenAI“像素级搬运”,到把机器人推到上海闵行烧烤店门口直播,背后是乐享对自身技术路线的笃定,也是中国具身智能从“追随”走向“定义”的一次突围。