AI工具导航

Pegasus 1.6 by TwelveLabs

将自我中心视频转化为机器人训练数据

Pegasus 1.6 by TwelveLabs 是什么?

Pegasus 1.6 是 TwelveLabs 推出的视频理解模型,专为机器人与物理 AI 团队处理第一人称视角视频而设计。它能精准识别画面中的实体,并在不同片段间保持一致的元数据,显著提升标注质量。只需将原始的遥操作或可穿戴设备拍摄的视频直接输入,即可自动输出带有时间戳、已完成标注的机器人训练数据,无需人工二次标注流程。

产品详细介绍

将自我中心视频转化为机器人训练数据

Pegasus 1.6 是 TwelveLabs 推出的视频理解模型,专为机器人与物理 AI 团队处理第一人称视角视频而设计。它能精准识别画面中的实体,并在不同片段间保持一致的元数据,显著提升标注质量。只需将原始的遥操作或可穿戴设备拍摄的视频直接输入,即可自动输出带有时间戳、已完成标注的机器人训练数据,无需人工二次标注流程。

定价方案

需要付费
官网查看
定制方案
  • ✓

    暂未采集到具体套餐,价格以官网为准

创始人评论

[
[REDACTED]创始人

大家好,我是 Aiden,TwelveLabs 的联合创始人兼 CTO。今天非常兴奋地与大家分享 Pegasus 1.6。

我们接触过的每一个机器人和物理 AI 团队都面临同样的问题:积累了数小时的第一人称视频,这些是动作标签和下一步动作预测的原始素材,但市面上没有任何真正为理解这类视频而构建的基础模型。通用视频模型都是在广播级和第三人称视频上训练的,把它们对准可穿戴设备或机器人自身的摄像头时,它们就无法识别实际发生的事情。

Pegasus 1.6 就是我们的答案。它是 TwelveLabs 首款专为自我中心(第一人称)视频理解而构建的模型。Pegasus 1.6 在 Pegasus 1.5 的基于时间元数据(TBM)功能基础上进行了扩展——该功能可从自定义模式中提取带时间戳的结构化元数据——新增了对自我中心视频和任务叙事的支持。同时,我们还增强了对手部、工具和物体交互的精细识别能力,并提升了高体量视频工作负载的处理速度。

作为对 1.5 功能的更新,我们还在深度元数据提取和基于上下文的实体识别(根据视频中的上下文线索为角色命名)方面提升了性能。

具体来说,对于机器人和数据团队而言,这意味着:将 Pegasus 直接对准原始的自我中心片段,即可返回结构化的动作标签、合规评分和时间戳,您可以直接在训练流水线中使用这些输出,而无需再进行成本约为每小时的4–22美元的人工标注环节。

物理 AI 对我们来说是一个全新领域,因此如果您正在处理自我中心(人类操作或远程操作)数据并遇到了极端情况,我希望听到您的反馈。谢谢!

创始团队

[
[REDACTED]创始团队
Hwigeon Oh
Hwigeon Oh.