AI工具导航

llm-real-video Pro

你的 LLM 不仅能看到文字,还能理解镜头语言

llm-real-video Pro 是什么?

llm-real-video Pro 能把任意视频转化为大模型可读的结构化上下文,提取镜头运动与节奏、语音情绪、说话人及屏幕文字等信息,既支持本地可视化查看,也能一键生成文字版拆解。基于 MIT 开源的 claude-real-video 构建,一次性付费 29 美元,8 月 31 日前早鸟价仅 19 美元,让你的 LLM 真正"看懂"视频画面而不只是台词。

产品详细介绍

你的 LLM 不仅能看到文字,还能理解镜头语言

llm-real-video Pro 能把任意视频转化为大模型可读的结构化上下文,提取镜头运动与节奏、语音情绪、说话人及屏幕文字等信息,既支持本地可视化查看,也能一键生成文字版拆解。基于 MIT 开源的 claude-real-video 构建,一次性付费 29 美元,8 月 31 日前早鸟价仅 19 美元,让你的 LLM 真正"看懂"视频画面而不只是台词。

定价方案

需要付费
官网查看
定制方案
  • 暂未采集到具体套餐,价格以官网为准

创始人评论

Leo Huang
Leo Huang创始人

嘿 PH,我是来自台湾的 Leo。

先说说背景。上个月我开源了 claude-real-video——一个 CLI 工具,可以将任意视频转换为场景感知的关键帧和带时间戳的文字稿,让大语言模型真正能够"读懂"视频。它登上了 Hacker News 首页,目前在 GitHub 上已获得近 2,000 颗星。该项目保持免费,采用 MIT 协议。

它留下的空白。模型能告诉你说了什么——却无法告诉你镜头是怎么拍的。缓慢的推镜头、卡在节拍上的硬切、说到一半哽咽的声音:这些对文字稿来说完全隐形。

Pro 版本新增内容:

- --motion —— 镜头运动、剪辑节奏、节奏曲线

- --senses —— 声音事件与语音情感

- --speakers —— 谁在说话、何时说话

- OCR —— 逐帧识别屏幕上的所有文字

- 交互式查看器 —— 精确审查模型"看到"的内容

- --ai-report —— 一条命令即可输出完整的文字拆解报告

隐私方面。一切都在你的本机上运行。唯一可能外传的就是可选的 AI 报告,且需通过你自己的 API 密钥调用。

首发优惠。8 月 31 日之前,使用优惠码 PRODUCTHUNT 仅需 19 美元——一次性买断,永久保留该版本,无任何订阅。常规售价 29 美元。

https://leoaido.lemonsqueezy.com

面向智能体流水线、内容拆解以及大规模素材分析场景。欢迎向我提问——尤其是它在哪里会出问题。

60 秒短片:https://youtu.be/sw6_8E-57w4

智能体独立观看:https://youtu.be/xFqPtcju_xo

创始团队

Leo Huang
Leo HuangAI researcher, made claude-real-video