AI工具导航

Jockey by TwelveLabs

理解你整个素材库的AI视频智能体

Jockey by TwelveLabs 是什么?

Jockey 是由 TwelveLabs 推出的视频 AI 智能体,能够像人一样理解你的整个媒体库,支持按人物、瞬间或场景上下文跨照片和视频进行搜索。依托 TwelveLabs 先进的模型体系,Jockey 会随每次更新自动变得更聪明;你既可以通过 MCP 将其接入 Claude 或 ChatGPT,也能利用开放 API 快速搭建自定义应用,让海量影像资料瞬间变得可检索、可调用。

产品详细介绍

理解你整个素材库的AI视频智能体

Jockey 是由 TwelveLabs 推出的视频 AI 智能体,能够像人一样理解你的整个媒体库,支持按人物、瞬间或场景上下文跨照片和视频进行搜索。依托 TwelveLabs 先进的模型体系,Jockey 会随每次更新自动变得更聪明;你既可以通过 MCP 将其接入 Claude 或 ChatGPT,也能利用开放 API 快速搭建自定义应用,让海量影像资料瞬间变得可检索、可调用。

定价方案

有免费方案
Free/免费
Free
  • ✓

    5GB knowledge store

  • ✓

    Basic rate limits

Contact us/custom
Plus
  • ✓

    100GB knowledge store

  • ✓

    Higher rate limits

Contact us/custom
Pro
  • ✓

    500GB knowledge store

  • ✓

    Highest rate limits

查看官网价格

创始人评论

[
[REDACTED]创始人

我是 Aiden,TwelveLabs 的联合创始人兼 CTO。今天非常激动地向大家介绍 Jockey。

目前大多数媒体搜索仍然是基于元数据的搜索:文件名、时间戳,也许再加上一些来自较早期计算机视觉模型的物体标签。这些都无法捕捉到你素材中真正发生的内容:场景中有谁、他们在做什么、上下文、对白、屏幕上的文字。为此,你需要能够原生理解视频中时间与空间的模型,而不是一堆采样帧的简单堆砌。

这正是我们的技术栈。Marengo 是我们的嵌入模型,它能将"我们差点错过航班的那一刻"这样的查询转化为跨视频和图像的真实检索,而不是关键词匹配。Pegasus 是我们的视频语言模型,它能按照你定义的模式对整个视频进行切分,并返回结构化的、带时间戳的时刻。Jockey 是一个统一的智能体系统,能够跨你的视频和图像进行推理:它由一个推理模型和一个记忆层组成,记忆层能从你的语料库中构建知识库,从而可以分解查询、进行检索、切分,并跨整个内容进行推理。

其核心是一种可在语料库级别进行理解并付诸行动的能力。将 Jockey 指向成千上万的视频和图像,说"给我剪一个集锦"或"挑出最火的爆款片段",它就会返回可直接使用的、带时间戳的剪辑片段。仅靠模型的方式做不到这一点,因为把一个视频塞进上下文窗口只能处理单个文件,单次前向传播很快就会超出容量限制。它能告诉你关于单个视频的内容,却无法跨你的整个目录进行推理,也无法从成千上万个素材中剪辑出集锦。

由于我们持续发布并不断改进模型,Jockey 的推理和检索质量也会随之提升,这意味着你这边无需重新集成。

两种接入方式:

• MCP 服务器:将 Jockey 作为工具接入 Claude,直接查询你的媒体库。ChatGPT 即将支持。

• API:完整的编程接口,用于在你的媒体库上构建自定义的检索或智能体工作流。

这是一个研究预览版,所以如果你遇到边界情况(模糊的查询、检索遗漏、延迟等),我希望听到你的反馈。随时告诉我们!

祝好,

Aiden

创始团队

[
[REDACTED]创始团队
Aiden Lee
Aiden Leecofounder

官网信息

官网https://www.twelvelabs.io/jockey
公司使命

在每一段视频中发现每一个重要瞬间

成立时间

2021