ai china

Robo-ValueRL 教会人形机器人判断哪些练习值得信赖

7 条来源 4 条一手来源 已翻译 2026年8月11号

正文
四台黑白配色的天工人形机器人在实验室铺有绿色台垫的精密操作工作台前作业。

四台天工人形机器人在北京人形机器人创新中心进行精密操作测试,照片随 Robo-ValueRL 于 2026 年 7 月 10 日发布。北京人形机器人创新中心 / 美通社。[6]

四台人形机器人分别站在四张实验室工作台前。一台用夹爪把小型元件悬在夹具上方,另一台守在电路板后。眼前像是一堂灵巧操作课,更难的问题却出现在动作完成之后:这次练习里,哪些部分值得下一台机器人模仿?

人类演示给出的答案带着杂质,其中夹杂着犹豫、生硬的调整、高效的补救和失败尝试。机器人的在线执行轨迹同样混合了有用探索与重复错误。如果策略对记录下来的每个动作一视同仁,它复制数据集的能力会有所提高,完成任务的能力却未必随之改善。

Robo-ValueRL 于 2026 年 7 月由中国人民大学、北京人形机器人创新中心及合作机构的研究人员发布,在数据与策略之间引入了一个学习型判断器。参考历史观测的价值估计器读取近期视觉信息,估计任务进度,再把估计值的变化转化为动作质量标签。这些标签参与离线策略训练;系统部署后,它们还会决定哪些执行轨迹片段可以用来训练轻量在线修正模块。[1][3]

截至 2026-08-11T09:35:58Z UTC,这次发布已经超出一篇论文的范围。团队公开了代码、模型检查点、一份记录 240 小时离线演示和 3,000 多条在线执行轨迹的数据集卡,以及两项任务的实机视频。[2][3][4][5] 这些材料让中国 AI 领域的一项重要转向可以接受检验:瓶颈正从收集更多机器人影像,移向判断哪些经验值得写入策略。不过,醒目结果仍受研究条件限制,尚不足以证明人形机器人的普遍可靠性,也不代表产品已能直接进入工厂。

判断器位于数据与策略之间

在 Robo-ValueRL 中,“价值”指对任务成功完成进度的归一化预测。单张相机画面往往含义不明:夹爪在接近芯片、悬停于芯片上方或从一次偏差中恢复时,看起来几乎相同。因此,估计器会读取头部相机、腕部相机的一小段视觉历史以及当前观测,并给出进度估计。随后一段时间内的估计值变化,会成为动作片段有帮助、无明显作用或有害的判断依据。[1]

这一差别很重要,因为整条演示轨迹即使最终成功,局部动作仍会很笨拙。人类操作员会先对准芯片,随后越过目标,退回,再完成插入。普通行为克隆会把这条成功轨迹中的每个动作都纳入模仿目标;Robo-ValueRL 则尝试保留推进任务的动作,并压低绕行动作的权重。

团队还检验这个判断器能否真正承担判断工作。全局指标考察估计进度在整条轨迹中的排序是否正确;局部指标关注流畅运动期间的估计是否平滑,以及错误开始后是否出现持续下降。论文的消融实验显示,五帧历史取得了最强的综合指标和最佳下游策略;不使用历史或使用 30 帧历史,表现都更差。上下文增加之后,效果没有自动上升。长窗口会带入过时或干扰性信息,单帧又会遗漏理解姿态所需的运动线索。[1]

这个奖励模型的适用范围很具体。它的训练目标主要根据距离任务完成的剩余时间推导,并对失败轨迹施加惩罚。这种设计便于实践和检查,但如果任务存在速度较慢却更安全的路线,它会把速度与质量混在一起。就这些工作流程而言,它是一种学习型任务进度测量工具;其对机器人动作“好坏”的衡量也以这些流程为限。

一次端到端跃迁被拆成三道关卡

第一道关卡处理已经记录的经验。Robo-ValueRL 为异质离线数据中的动作片段赋予质量条件,再训练视觉—语言—动作策略,使生成的动作既符合指定任务,也贴近较高质量的行为。发布的流水线基于 openpi 和 LeRobot,其质量生成脚本会对预测剩余时间的变化排序,将动作划为优质、中等和较差三档。[1][3]

第二道关卡取决于任务。对于毫米级芯片插装,严格筛选器偏向能在短间隔内带来即时进展的片段,并剔除犹豫的微小修正。对于积木拆解,较宽松的筛选器会保留更长、变化更多的序列,因为有用进展也包括暂时放下物体或换手。论文显示,严格策略在插装任务中表现最佳,较宽松的策略则在拆解任务中领先。因此,数据清洗阈值要随任务调整;何谓有用动作,取决于观察它的时间跨度。[1]

第三道关卡在在线改进阶段开启。预训练策略保持冻结,轻量残差适配器从经过价值筛选的真实执行轨迹中学习修正;学习型门控器的设计目标,是让适配器在容易发生错误的阶段介入,熟悉动作则继续沿用原策略。对芯片插装而言,机器人可以保留已经熟练的抓取,只调整最后的对准动作。这套架构刻意保持保守:新经验只改动修正层,完整离线策略维持原样。[1]

人工干预仍留在循环之中。操作员修正执行轨迹,价值模型再从这些修正中选出有用片段。这与缺少监督的自主自我改进存在实质差别。系统要做的是从成本高昂的人工纠正中择取片段,纠正内容仍由操作员提供。

86% 对应的任务范围

核心结果来自中心的双臂天工平台上的两项实体任务。芯片插装要求机器人抓取并放置 PCB,调整其姿态,拿起芯片,再把芯片嵌入毫米级间隙。积木拆解要求机器人在随机布局下用双臂完成分离,并按颜色放置。传感器包括一台头部相机和两台腕部相机。[1][3]

在芯片插装任务中,表现最强的离线策略起始成功率为 46%。经过三轮在线训练,每轮收集 500 条执行轨迹,报告的成功率升至 86%。作为对照,DAgger 把人工修正的轨迹统一视为正向监督,结果反而下降到接近行为克隆基线。积木拆解任务报告的最佳最终结果为 84%。作者的解释具有合理性:纠正轨迹中仍含低质量动作,未经排序便加入训练,存在拖累策略的风险。[1]

论文还给出第二组可供核对的数据。在连续、一镜到底的补充实验中,机器人完成了 35 次中的 30 次芯片插装和 70 次中的 58 次积木拆解,成功率分别为 85.7% 和 82.9%。论文同时披露,插装实验运行期间,Orbbec Gemini 336 相机软件丢帧引发了间歇性停顿。[1][2] 这种长时间运行影像比精彩片段集锦更有证明力,相机故障也正是机器人发布经常略去的运行细节。

同样需要关注的是结果范围。两项任务都来自同一团队、同一机器人系列和同一实验室配置。成功率衡量的是预先定义的桌面作业,开放式工厂班次还会面对不断变化的夹具、光线、磨损、人员和生产公差。论文中的 240 小时和 3,000 多条执行轨迹描述了经验量,任务与环境的覆盖面仍然有限。截至目前,尚无独立团队证明同一组价值指标能在另一种机器人、任务或相机栈上选出更好的数据。

计算资源同样是结果的一部分。论文称,完整视觉—语言—动作模型在 32 块 A100 GPU 上训练了 50,000 步。公共仓库记录了一套每节点八块 GPU 的训练方案,以及一种双机部署方式:GPU 策略服务器可在一张 RTX 4090 上运行推理,机器人主机则流式传送观测并执行动作片段。[1][3] 开放代码降低了审查门槛,训练路径仍然庞大,机器人接口也要经过适配才能移植。

发布物已经开放审查,复用条款仍待补齐

发布仓库覆盖发布时列出的四个阶段:价值估计器训练、价值标注与质量生成、离线预训练和在线残差适配。仓库还提供天工专用的环境封装、基于 socket 的部署脚本、模型配置,以及转换为 LeRobot 数据格式的工具。模型中心分别提供芯片任务离线策略、积木任务离线策略、芯片任务在线策略、积木任务在线策略和价值估计器检查点;数据集中心则开放两项任务的实机回合文件。[3][4][5]

这是一份体量可观的发布,顺畅复现仍有不少阻力。安装脚本会直接修改当前 transformers 软件包中的文件,一些旧版实验配置保留了原始绝对路径,硬件流程也只在天工机器人及其三相机观测约定上完成了明确验证。谨慎的采用者需要隔离环境、固定依赖版本、为不同机器人本体编写适配器,并通过测试确认动作维度、时序和安全限制在移植后依然完整。[3]

各处许可证信息也不一致。Hugging Face 模型元数据标明 MIT,模型卡却引导读者查看 GitHub 仓库中的许可证文件;当前仓库根目录没有项目许可证。数据集卡没有声明许可证,同时指向同一个仓库。与此同时,中文发布公告称该系统全面开源,不设商业授权壁垒。[3][4][5][6] 这些情况不影响代码和权重已经发布这一事实,但代码、模型检查点和数据集的复用条件仍有不同的清晰度。补充根目录许可证并写明数据集条款,才能把开放主张变成可用的契约。

这为什么是一个中国 AI 信号

北京在 2026 年 6 月征集人形机器人“实景实训”项目,文件描述了从现场实践到数据积累、产品迭代和规模化部署的循环。征集范围涵盖工业、服务和特种用途,并把真实作业环境视作改进具身模型的基础设施。[7] Robo-ValueRL 回答了这套政策逻辑中的一个技术问题:现场实践产生质量混杂的数据后,训练系统需要一套有依据的办法,判断哪些内容应该被学入策略。

两者之间的契合仍有明确限度。发布照片呈现的是实验室工作台,公开评估也仍是一项实验室研究。团队的发布材料指向半导体和精密装配应用,却没有提供工厂节拍、零件损伤率、人工干预频率、正常运行时间或生产部署信息。[6] 该项目显示研究栈正日趋完整,其中包括机器人本体、相机、离线数据、价值模型、VLA 策略、在线修正和公共发布物;工业验收阶段仍缺相应证据。

下一次发布需要三类证明。第一,外部团队应复现训练,并在新本体和未见任务上评估价值指标。第二,团队应公布干预率、失败分母、相机和网络故障、作业周期,以及长班次运行后的表现,任务成功率只是其中一项。第三,仓库、模型和数据集应采用彼此一致的许可证,提供锁定版本的环境,并发布带版本标签、与论文计算资源及预处理流程相匹配的复现方案。

Robo-ValueRL 最具持久性的贡献,未必落在 86% 这个终点上。它把策略改进之前的判断器公开出来,并检验这个判断器的可靠性是否能够预测机器人会学到什么。更多演示很容易计数;判断哪些练习值得信赖,才是规模扩展中更难的问题。

来源

  1. Wenke Xia 等,《Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning》,arXiv:2607.09866(2026 年 7 月 10 日;方法、消融实验、硬件、任务结果及一镜到底实验附录)。
  2. Robo-ValueRL 研究团队,官方项目页(发布物、任务说明、结果摘要和实机视频)。
  3. Open-X-Humanoid,官方 Robo-ValueRL GitHub 仓库(公共流水线代码、发布说明、硬件要求、部署拓扑和仓库许可证状态)。
  4. X-Humanoid,Hugging Face 上的 Robo-ValueRL 模型仓库(已发布的价值估计器、离线与在线策略检查点、模型卡和 MIT 元数据)。
  5. X-Humanoid,Hugging Face 上的 Robo-ValueRL 数据集仓库(数据集范围、任务文件、卡片元数据和所称的许可证引用)。
  6. 北京人形机器人创新中心,《从“不知其所以然”到“明辨是非”:Robo-ValueRL 开源框架正式发布》(2026 年 7 月 10 日;中文一手发布信息及实验室照片来源页)。
  7. 北京市人民政府,《关于征集 2026 年人形机器人和具身智能实景实训项目的通知》(2026 年 6 月 12 日;官方政策范围和实地训练循环)。
Previous 中国算力统计已达 2,185 EFLOPS,缺少的指标是有效工作量

Recommended In ai china

Matched by subject and format