HOMIE Gen2全新发布!解锁人类经验的Scaling Law

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

HOMIE Gen2全新发布!解锁人类经验的Scaling Law
AI资讯 2026-08-31 13:56
+9756 阅读

机器人没有迎来 GPT 时刻,关键缺口不在模型,而在于可以规模化的经验。Ropedia 以 HOMIE Gen2 为入口,为世界解锁 Physical AI 的 Experience Scaling Law,让人类经验成为具身智能的核心生产力。


HOMIE Gen2全新发布!解锁人类经验的Scaling Law


Ropedia 最新发布的 HOMIE Gen2


机器之心获悉,总部位于新加坡的 Physical AI 公司 Ropedia 今日正式发布新一代多模态采集系统 HOMIE Gen2,并将在全球多地公开发售。这是该公司十二个月里的第四代采集硬件,也是继今年 3 月旗舰数据集 Xperience-10M 之后的又一次公开发布。


据了解,HOMIE Gen2 要做的,是把真实世界里的人类经验,规模化地变成机器人可以直接学习的训练数据。Ropedia 将这背后的判断,称之为 Human Experience Scaling Law:机器人能力,将随着高质量人类经验的规模化增长而持续提升。


为什么是 “经验”,而不是普通的数据?Ropedia 联合创始人兼 CEO 陈昭熹有一个直观的比喻:“学做一道菜,只看别人做的视频,你可能知道最后成品长什么样;但真正亲手做过,才会知道什么时候下锅、该用多大力、食材发生了什么变化。” 对机器人来说也是一样:它真正需要学习的,不只是 “看见” 发生了什么,还要同步感知动作、环境与外界反馈的变化,并理解自己的每一个动作如何影响环境。如果说过去十余年 AI 的规模化进步建立在模型规模与数字数据规模之上,那么 Physical AI 下一阶段需要解决的,就是现实世界经验的规模化 —— 这也正是 Ropedia 一直在做的事情。


「读了万卷书,却没走过一里路」:机器人缺的不是模型,而是经验


现在的 AI 有一种奇怪的分裂。感知模型可以准确理解场景,讲出一套流畅的冲咖啡教程;生成式模型可以合成一段以假乱真的冲咖啡视频;可一旦进入物理世界,同样的智能却常常连一次可靠的抓取都完成不了。能听懂指令,也能想象画面,为什么就是做不好?


Ropedia 联合创始人兼首席科学家,南洋理工大学副教授刘子纬在近期一场公开演讲中给出了他的解释:“AI 读过一切,却几乎没有经历过任何事情。它从未真正冲过一杯咖啡,自然也不知道该怎么做。”


这也是 Ropedia 对 Experience Scaling Law 的核心判断:缺的不是更大的模型,而是可供学习的完整经验。


HOMIE Gen2全新发布!解锁人类经验的Scaling Law


刘子纬教授在新加坡演讲的现场照片


「采的不是画面,而是经验」:Ropedia 的一个核心判断


在 Ropedia 看来,学习来源定义了智能的上限,而经验不是视频,也不是 RGB、动作捕捉或深度中的任何单一模态,甚至不是把它们简单地叠在一起;只有当动作、意图、环境、时序上下文与多模态信息同时在场、互相对齐,一段记录才称得上真正的人类经验。


放到模型的视角,这条定义会更直观:语言模型学习的是人类写下的内容,而 Physical AI 要学习的,是人类做了什么、世界如何回应,以及接下来发生了什么。竞争的焦点,也随之从「采得够不够多」转向「采得够不够完整」。


就在不久前,Generalist AI 发布了具身基础模型 GEN-1.5:把几秒钟的人类演示放进上下文,机器人不经重新训练就能上手新任务,这被称为 physical prompting,演示即提示。它证明经验片段可以像提示词一样直接驱动模型,而提示有多准确、包含了多少信息,决定了模型能学到多少。把普通视频当作提示,模型无法将动作与现象建立联系,物理技能淹没在像素中,全景全模态的经验则相当于把物理世界的 “思维链” 写出来,模型理解物理因果就容易得多。所以在 Ropedia 看来,谁能够持续、高质量地获取、组织并交付人类经验,谁就拥有下一阶段 Physical AI 的核心竞争力。HOMIE Gen2 正是为此而来。


「一台为采集经验而生的设备」:HOMIE Gen2 的三个关键词


HOMIE Gen2 佩戴示意图


三个关键词,概括来看:


  • 沉浸式人类经验4 目全景 360° + 4 路空间音频全覆盖,采下的不只是画面,还有人与任务、环境之间的完整关系;
  • 丰富的多模态理解:十余种模态在同一时间轴、同一坐标系,共同还原一次完整的人类行为;
  • 箱即用的训练级数据:空间定位相对误差约千分之二,深度误差 <2.5%,手部动捕误差 4.68 mm,动作语义准确率 96%,拿到即可进入训练,无需二次处理。


HOMIE Gen2全新发布!解锁人类经验的Scaling Law


HOMIE Gen2 的三个关键词


① 沉浸式人类经验


HOMIE Gen2 通过 4 目全景实现 360° 全视角覆盖,并以 4 路空间音频补充声场信息,形成与第一视角行为同步的环境记录。这里的「沉浸式」,重点不在画面更宽,而在于尽可能保留一次真实行动发生时的上下文。


硬件本身也为 “随时随地采经验” 做好了准备:整机约 380g,支持约 13 小时连续采集,多传感器之间的同步精度达到 50µs,不需要任何外部布置,可以在家庭、工厂、商场等开放环境里全天候、自然地工作。


据 Ropedia 介绍,相比上一代方案,它的部署速度提升约 10 倍,采集成本约为过去的 1/12.5;多台 HOMIE Gen2 还可以同步作业,从不同的人、不同的视角记录同一个环境,把一个场景一次性采全。


HOMIE Gen2全新发布!解锁人类经验的Scaling Law


Ropedia HOMIE GEN2 Demo


② 丰富的多模态理解


机器人理解世界,从来不靠单一传感器。以 HOMIE Gen2 为入口,Xperience 体系提供了一份完整的多模态清单:校正后的 pinhole 双目视频、深度图、相机位姿、手部 21 关键点、全身 52 关键点、Main task / Sub task / Current action 三层文本标注、3D 高斯、场景 Mesh、2D 物体检测、3D 检测感知与 4D 物体跟踪。


关键不只是模态数量,而是这些信息被统一到同一时间轴和同一坐标系中:不同传感器看到的是同一次动作、同一处环境、同一个时刻,模型才能把 “看见什么、做了什么、环境如何变化” 对应起来。


③ 开箱即用的高精度训练级数据


客户最终拿到的不是原始数据,而是经过采集、同步、重建、标注与质量控制、可以直接进入模型训练的数据。


据 Ropedia 基于 HOMIE Gen2 Gold Standard Sample Dataset(金标准样本集)的精度测试:空间定位平均绝对误差仅为千分之二,深度范围误差低于 2.5%,手部 21 关键点动捕平均误差 4.68 mm,动作语义标注准确率 96.0%。


在 Ropedia 的定位里,产品的价值在于帮客户建立稳定、持续的数据生产能力,而不是做一次性的采集工具。


「几十亿人,就是最大的采集网络」:无本体采集如何改写数据的成本结构


经验要从哪里来?传统的答案是遥操作:一个人配一台机器人,逐条示范动作。这条路线的问题出在成本结构上:机器人本体价格高昂,数据产能又被锁死在机器人保有量上,场景多样性也随之受限。机器人数据之所以长期稀缺且昂贵,其根源就在于此。


无本体采集改写的,正是这个成本结构:遥操作的数据产能,绑定在机器人保有量上;而 HOMIE 的数据产能,绑定在人类数量上。


这意味着数据产能不再直接受机器人保有量约束。公开研究已经表明,即便只用单摄像头采集的第一视角视频,从两万小时扩展到百万小时,数据规模扩大仍能持续带来收益。但这只是 “经验” 的最低配:既然最低配已经显示出规模效应,上限就取决于谁能把经验采得更完整。


其实最庞大的采集队伍早就存在,就是每天都在与物理世界打交道的几十亿人。用刘子纬教授的话说:“人类不是要被过滤掉的噪声,而是最能理解丰富的物理世界的老师。”


「十二个月,四代硬件」:从 3D 打印的 “竹蜻蜓”,到 Human Experience Engine®


为什么一家数据公司要从硬件做起?Ropedia 的回答是:采集那一刻丢掉的信息,后续任何算法都补不回来,硬件决定了整套体系的数据上限。过去十二个月,他们据此把采集设备迭代了四代。


2025 年 6 月,团队用 3D 打印结构件搭出第一台第一视角采集原型机,称之为 “竹蜻蜓”;同年 10 月,R-Ego 改进相机布局与头戴结构,完成第一笔硬件销售;2026 年 1 月,HOMIE Gen1 走向产品化,支撑了今年 3 月 Xperience-10M 的发布;而今天发布的 HOMIE Gen2,不仅仅是一台更好的采集设备 —— 它让人类经验的大规模工业化生产成为可能。


据 Ropedia 介绍,凭借这条路线,他们成为业界首家推出专用第一人称空间数据采集设备的公司。在他们的定义里,这系列产品不属于相机,也不属于常规意义上的穿戴设备,而是一个新的品类:Human Experience Engine®。它位于物理世界与基础模型之间:向下感知真实世界,中间把原始信号加工成完整经验,向上以可训练的形式交付并验证。


HOMIE Gen2全新发布!解锁人类经验的Scaling Law


硬件迭代时间线图(“竹蜻蜓” 原型 → R-Ego → HOMIE Gen1 → HOMIE Gen2)


「不做数据商,要做基建方」:Ropedia 的经验飞轮要通向哪里


真实世界的经验,没办法像网页一样被爬取:大多数物理经验从未被记录,传感器与环境高度异构,采集需要硬件、人员和现场运营。刘子纬教授对此的判断很干脆:“如果经验是稀缺资源,那么就必须有人把它工业化。”


正因如此,在 Ropedia 的产品体系中,HOMIE 只是入口。据陈昭熹介绍,Ropedia 在构建的,是一套会自我演进的基础设施,自下而上分为三层:硬件采集经验,数据基础设施加工经验,模型理解经验并反哺整个系统,最终以 Xperience Dataset 的形式向客户交付。


HOMIE Gen2全新发布!解锁人类经验的Scaling Law


Ropedia 自研的自我演进基础设施


在这三层里,硬件是入口;数据基础设施用智能体驱动的流水线,把处理从手工调参推进到自动化;模型层则在自有数据上训练统一多模态模型,既自动标注新流入的经验,也部署回硬件,为下游策略模型提供能力。


这套体系已经有了可检验的产出。此前发布的旗舰数据集 Xperience-10M,包含约 1,000 万个真实世界交互片段、1 万小时带音频的第一视角视频、28.8 亿个 RGB 帧、5.76 亿个动作捕捉帧和 35 万个物体,总规模接近 1PB。


这些环节最终合上,成为一个闭环:采集、结构化、模型、行动、学习,模型的能力缺口,反过来决定下一轮采集什么。“数据集可以被复制,但经验飞轮会不断复利。” 刘子纬这样解释。


这个越转越快的飞轮,最终把 Ropedia 带向哪里?CEO 陈昭熹对公司的定位很清晰:“Ropedia 绝不只是一家数据采集公司,数据采集只是第一步。” 在他看来,人类行动数据会先于机器人的大规模部署到来,正是点燃行业新时代的 “点火阶段”;三到五年后,他希望 Ropedia 成为一家机器人学习基础设施公司,涵盖数据、硬件、基础设施与模型。


刘子纬教授对行业的判断与此呼应:“不要只是构建更大的大脑,而要构建更好的经验闭环。” 如果说互联网数据解锁了大语言模型的智能,那么规模化的人类经验,将解锁 Physical AI 的智能。而 HOMIE Gen2,会是一个重要的里程碑。


机器人的经验百科全书,从 Ropedia 开始书写。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群