机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能
AI技术研报 2026-07-23 16:34
+5136 阅读

记得何同学做过一个超复杂的流水线项目吗?


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能

内容来源:老师好我叫何同学


这个视频发布于 2024 年 1 月,当时要实现自动叠纸盒,把礼物放进纸盒的自动化操作,正是这样一个机械臂和自动化编程组合成的流水线。


如果有一个能像人一样灵活的机器手来折叠包装,长时间批量地工作,何同学团队耗费心力打造的庞大流水线的功能,就能够被两个小体积的灵巧手给完美实现。


并且也不需要考虑各种流水线上的稳定性,灵巧手自己就能够解决遇到的位置偏移,变形等问题,全面自主。相比复杂的机械臂和自动化,灵巧手的自由度和泛用性显然是其不可比拟的。


这很难,但和人类双手接近的灵巧手,已经出现了。


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能


这一对双臂灵巧手,在精细操作、长程任务和泛化性上均展现出了亮眼的成绩,而它来自于灵初智能


在这两个灵巧手准确协同,实现精巧操作的背后,是一套灵初智能与北大 - 灵初联合实验室共同发布并开源的技术范式,称为 EgoSteer,是一套双灵巧手通用操作大模型和全栈系统。


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能


  • 论文链接:https://egosteer.github.io/EgoSteer.pdf
  • 项目主页:https://egosteer.github.io/#/


到目前为止,业界能跟随自由语言指令、还能在全新场景里泛化的模型少之又少。


π0.7、DreamZero 这些近期在通用性上取得突破的工作,把机器人能干的活儿从「一个任务」推到了「一批任务」,但它们大多依赖昂贵的真机数据。但我们知道,具身灵巧手最好的数据,必然来自人类的双手。


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能


EgoSteer 是一个里程碑式的进步。它能跟随开放式的自然语言指令,完成一百多种语义各异的灵巧操作任务,还能用少量示范快速学会复杂的长程任务。该全栈系统已完整开源代码、模型权重,数据也将近期开源,为双灵巧手通用操作开究提供了一套高质量、可复现、可迭代的全栈基线


数据,模型和系统,深度技术拆解


下面我们从三个层面把它拆开:数据、模型和系统闭环。这三块拼在一起,才能真正被称为「全栈」系统。


近万小时人手视频,变成训练数据


先说一个反直觉的事实:制约灵巧手大模型的瓶颈,往往落在数据上。但数据本身其实并不稀缺,稀缺的是能拿来训练的数据。


第一人称人类视频,也就是戴着相机以人的视角拍下的操作画面,是天然的富矿。全网这类可用素材大约有 11.6 万小时,人手在里面拧、捏、递、叠,蕴含着海量的交互知识。问题在于,这些视频原始状态下噪声大得惊人:镜头剧烈晃动、双手频繁被遮挡、既没有可靠的语言标注,也没有精确的动作标注。直接拿去训练,模型学到的是一堆彼此矛盾的监督信号,下游策略只会被带偏。


灵初把处理这些视频的管线单独做成了一个系统,叫 EgoSmith。它是一条四阶段的全自动流水线,目标是把视频变成带精细语言和动作标注的可训练数据


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能

EgoSmith 概览:EgoSmith 能够将噪声较大的第一视角视频整理为高质量的灵巧操作 VLA 数据,为语言驱动的机器人预训练提供可规模化的人手交互先验。


第一阶段是预过滤。用简单但有效的启发式规则先做一遍粗筛:在 128 个采样点的网格上算平均光流,光流大的往往对应人在走动、并没有在操作,直接丢掉;再用 YOLO 检测画面里手的数量、尺度和位置,靠几何规则剔除严重遮挡或有旁人乱入的帧,只留下手部操作清晰可见的片段。


第二阶段是 4D 运动估计,把头和手的运动还原到真实物理空间里。EgoSmith 用更轻更稳的 DPVO 做相机跟踪和关键帧深度,用 Any4D 做逐帧的度量尺度深度预测,两者对齐尺度比之后,恢复出更准确的相机轨迹,再把相机坐标系下的手部运动转换到统一的世界坐标系。


第三阶段是多层级语言标注,这是「听懂人话」的基础。先用 Qwen3.5-VL-Plus 把那些没有实质手物交互的片段再滤掉一批,剩下的每一段都生成从粗到细的五级语言指令:L1 是动词加宾语这样的原子指令,L2 是要点摘要,L3 以物体为中心,L4 以手为中心区分左右手分工,L5 则细到分步动作。


第四阶段是后过滤,做多级质量控制。episode 级看相机平移分布剔除离群、用硬阈值丢掉头部运动过大的片段;chunk 级把手腕姿态转到中间帧、把手指关键点投影到逐帧手腕系,剔除坐标空间的离群值;frame 级算相机、手腕、手指的帧间差分,用硬阈值滤掉突变跳变。一层层筛下来,那些因为三维重建漂移、尺度不准、跳帧而变得不可靠的片段被系统性地清除。


最终产出是一个标准化的数据集:横跨 12 个开源数据集,9.6K 小时、209 万个片段、10.4 亿帧,覆盖 8969 个不同的物体名词和 623 个动作动词


让 VLA 学会「想象」:只在训练时出现的世界模型


有了干净的数据,接下来就是最重要的训练模型环节。


EgoSteer 的模型本体是一个基于流匹配(flow matching)的 VLA,但它最有意思的设计,是给这个 VLA 挂了一个世界模型专家,而这个专家只在训练时存在,推理时直接丢掉,不带来任何额外的计算负担。


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能

EgoSteer 概览:一种结合世界模型增强的 VLA 模型,用于实现可控的灵巧操作。


要理解这个设计的巧思,得先看清模型的骨架。EgoSteer 由三部分组成,共享一个视觉语言主干:


第一部分是主干,用的是预训练视觉语言模型 Qwen3-VL(2B 规模),采用因果注意力,负责把图像、语言、状态这些多模态输入编码成表示。


第二部分是动作专家,一个基于 DiT 的模块,约 3 亿参数,通过流匹配来生成动作块(action chunk)。它采用联合注意力,既看自己,也看主干的表示。


第三部分是世界模型专家,一个轻量的 4 层 Transformer,约 7000 万参数。它干的事听起来有点抽象:给定当前要执行的动作和相应的相机运动,去预测未来那一帧画面的 DINOv3 特征。


为什么要预测未来?团队的洞察是,VLA 天生擅长视觉和语言的理解,却缺乏对「下一秒会发生什么」的想象,而这种想象的缺失,恰恰限制了动作生成的精度。


世界模型专家正是在这一环节进行补强。训练时,它拿真实动作、相对相机运动和一串可学习的查询 token 作为输入,去回归未来帧经 DINOv3 编码后的语义特征。


这里有两个值得说的细节。一是它选择回归 DINOv3 特征,而放弃直接预测像素,因为语义特征天然过滤掉了光照变化和背景噪声,比在像素空间里预测图像提供的梯度更稳定、更直接。二是这个专家只有 4 层,且以固定间隔去注意主干的层。


它存在的价值,是让「预测未来」这个目标产生的梯度回流到主干,主干对世界的理解变强了,动作专家的精度自然跟着水涨船高。到了推理阶段,这个专家功成身退,一点推理开销都不留。


EgoSteer 用一套统一的动作空间:手腕位姿用 3D 位置加 6D 旋转表示,手部姿态用五根手指指尖在手腕坐标系下的位置表示,双臂双手加起来是 48 维。人手数据和机器人数据被强行拉到同一种表示格式下。人类操作的宝贵数据,就是通过这套统一表示,平滑地流向机器人。


最后一个工程细节关乎「流畅」。机器人真机推理时,如果每生成一个动作块就停顿一下等下一次推理,动作会一顿一顿的。为此, EgoSteer 采用了训练时的 Real-Time Chunking(RTC)技术:训练时喂给模型一段干净的、带随机延迟的动作前缀作为已知条件,只让它去噪后续动作,以覆盖推理延迟。


人在闭环:「无缝接管」失败机器人


数据和模型之外,全栈系统的第三块是机器人系统 Robot-Stack。它把遥操作数据采集、模型推理部署、人在闭环纠偏这三件事,融进了同一套底层控制里。


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能


这套设计的第一层价值是一致性。无论机器人是在自主跑模型,还是人戴着数据手套在手动遥操作,底层共用完全相同的控制环路和 FK/IK 计算逻辑,跑在同一批 ROS2 节点上。


真正精彩的是「人在闭环纠偏」的接管机制。想象一个场景:机器人在执行任务,眼看要失败了,一位专家需要立刻接管。这个接管的瞬间是个大坑,如果直接把人手的绝对姿态映射到机器人上,机器人的状态会在交接的一刹那突变,物理上就是一个剧烈的抖动,轻则任务失败,重则损坏器件。


灵初的解法非常巧妙,称之为「相对动作映射」。操作员踩下脚踏板发出接管信号的那一刻,系统记录下机器人当前的末端姿态和人手当前的姿态作为各自的基准。


此后,系统只把操作员手部的相对运动量叠加到机器人的当前状态上。直观地说,操作员只要顺着机器人当下的姿势去比划,就能平滑地接过控制权,全程没有突变抖动。纠正完成后再踩一次脚踏板,控制权无缝交还给模型。接管成功率超过 85%。


这套机制的妙处在于,它让在线纠偏的数据收集变得极其低门槛。专家可以在机器人失败的任意状态下丝滑接管、示范正确做法,而且只有这些「介入片段」会被留下来作为纠偏训练数据。


灵初用三轮 DAgger 迭代,在 56 个任务上一共只采集了 3.7K 条轨迹、8.3 小时的纠正数据。靠这套控制栈,团队以极低的人力成本,采集了覆盖 193 个桌面操作任务、187 小时的高质量真机数据,涵盖从简单抓放到非抓握、重定向、双手协作、接触密集等 7 大类操作。


把数据、模型、系统三块串起来,EgoSteer 的训练遵循三个阶段。第一阶段用 9.6K 小时的人类第一人称数据做预训练,只用头部相机,在 128 张 A800 上训了 175K 步、约 164 小时。第二阶段用 187 小时多样化的真机数据做后训练,加上胸部相机形成双视角,学习率降到原来的十分之一。第三阶段是多轮人在闭环 DAgger 纠偏。


实验结果


EgoSteer 的评测拆成了几个彼此独立的维度,每一个都在回答一个具体的疑问:它到底能不能听懂话、能不能应付没见过的场景、那些精巧的模块是不是真的有用、近万小时人手数据最终换来了什么。


可操控性与泛化


EgoSteer 全程只用一个共享模型,不为任何单一任务做专门微调,所有动作都由开放式的自由语言指令直接驱动。评测覆盖 7 大类操作,从简单抓放(PnP)到非抓握推拨、物体重定向、双手协作、接触密集型任务,一共 40 个日常复杂任务,每个任务在随机杂乱的场景里试验 10 次。


最终的整体平均成功率是 75%


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能

EgoSteer 在涵盖 7 个类别的 40 项任务中的可控操作性能。它能够稳健地遵循自由形式的语言指令完成任务,实现总体 75% 的成功率,展现出良好的泛化能力。


EgoSteer 把评测任务切成了三档难度。


第一档是训练时见过的任务,模型表现稳定。第二档是组合泛化,指令把已知技能重新拼装,这类需要理解指令结构、重新编排子技能的任务,成功率 65%。第三档最难,是语义上完全没见过的新任务,成功率 62%


一个模型在没见过的语义任务上还能保住六成的成功率,说明它学到的是一套可以迁移的操作先验,并没有停留在对特定指令的死记硬背。


数据规模


这个实验证明了,人手数据的规模在具身智能模型中依旧非常宝贵。


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能


这是一条清晰的 scaling 曲线。团队用从零训练、3K、6K、9.6K 小时四个预训练规模跑了对照,随着数据量上去,预训练损失收敛得更低,真机成功率也稳步爬升,到 9.6K 小时时达到 60%,而完全从零训练的模型只有约 30%。三十个百分点的差距,几乎全部来自预训练数据。


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能


横向和同期工作比,在一组 10 个相对容易的任务上,EgoSteer 平均成功率 74%,同期的 Being-H0.5 是 39%,π0.5 是 22%。论文的分析是,这两个对比模型都吃亏在预训练和后训练阶段的动作表示不一致、输入分辨率更小、缺少部署优化,所以只能应付最基本的抓放,指令跟随弱、泛化有限、执行也不够精准。


预训练价值的终极检验


最后一问,也是最能体现预训练价值的一问:一个在人手视频上预训练好的模型,能不能只用少量示范,就快速学会一个全新的、跨本体的、复杂的长程任务。


两个实验给了答案。在 RealMan 机器人上,仅用 120 条示范,EgoSteer 就在一个 18 步、耗时 40 秒的折纸盒任务上做到了 75% 成功率。在换了一套本体的 AgiBot G1 机器人上,仅用 200 条示范,在一个 9 步、耗时 1 分钟的拆蛋糕盒任务上做到了 83%


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能


对照组的结果近乎残酷。同样的数据量下,传统模仿学习方法 Diffusion Policy 和 IMLE、以及没有做过预训练的同架构模型,在这两个长程任务上的成功率全部是 0%。真正让「少样本学会一个长程任务」成为可能的,是近万小时人手视频攒下的操作先验,而不单单是模型架构本身。


更多技术信息,请参阅原论文。


用双手创造未来


具身智能已经是一片火热的研究领域,行业内仍有一座座难以攀登的技术高峰。怎么把噪声漫天的人手视频洗成能训练的数据,怎么让模型在动手之前先预演下一帧,怎么让一个人类专家丝滑地接管一台机器人,这些问题是各类具身智能研究者,尝试通过不同的路径去解决的瓶颈。


灵初智能显然在技术领域默默耕耘,埋头在数据管线、预训练范式和真机闭环这些看不见的地方较劲,用 EgoSteer 把数据、模型、系统三头一起补齐。


机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能


灵初智能成立于 2024 年 9 月,总部在上海,首席科学家杨耀东是北大助理教授,领衔北大 - 灵初联合实验室。创始团队年龄跨度从 70 后一路排到 00 后,既有在黑莓、Sonos、达闼、京东摸爬滚打近二十年的产业老兵王启斌,也有天才少年陈源培


就在今年,这家成立才一年半的公司宣布完成 20 亿元人民币的天使轮加 Pre-A 轮融资,国开金融、上海徐汇资本等一众国资和产业资本进场。它此前推出的 Psi R 系列,是业内首个端到端强化学习具身模型,也是最早做出能完成长程任务的具身模型的团队之一。从那时起,它的技术路线就和行业主流的「夹爪加仿真」拉开了距离,一门心思押在「强化学习加人手数据加灵巧手」这条更难走的路上。


真正能往前推进具身智能行业进化的,未必是最高最炫的机器人,而是那些愿意花力气去清洗数据、去打磨闭环、去把一条完整链路跑通并开源出来的团队。


灵巧的手,终究要接住琐碎而真实的人间事务。具身智能的双手,也能创造未来。


文章来自于"机器之心",作者 "冷猫"。

1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

添加客服微信openai178,进AITNT官方交流群