AI工具导航

Podframes

借助会说话的 AI 化身,将一个话题转化为视频播客。

Podframes 是什么?

Podframes 是一款能将单个主题自动生成双主播视频播客的 AI 工具,支持混合 AI 语音、对口型 AI 数字人以及逐词对齐字幕,最终输出 MP4 视频文件。它完全开源,可使用你自己的 API 密钥运行,能通过 CLI 或在线工作室操作,帮你以最低成本快速产出视频播客内容。

产品详细介绍

借助会说话的 AI 化身,将一个话题转化为视频播客。

Podframes 是一款能将单个主题自动生成双主播视频播客的 AI 工具,支持混合 AI 语音、对口型 AI 数字人以及逐词对齐字幕,最终输出 MP4 视频文件。它完全开源,可使用你自己的 API 密钥运行,能通过 CLI 或在线工作室操作,帮你以最低成本快速产出视频播客内容。

定价方案

有免费方案
Free/免费
免费层级
  • ✓

    Speechbase 免费层适用于演示项目

  • ✓

    阵容挑选和上传照片完全免费

  • ✓

    面向 API 提供商的基于使用量的定价模式(Speechbase、Google Gemini、Replicate、fal.ai)

≈$0.02/s @720p · ≈$0.04/s @1080p/usage-based
P-Video(Replicate)
  • ✓

    默认视频提供商

  • ✓

    性价比更高、速度更快的逐帧唇形同步

≈$0.10/s/usage-based
LTX-2.3 (fal.ai)
  • ✓

    更高保真度的替代方案

  • ✓

    静态锁定镜头,提示词扩展已禁用

查看官网价格

创始人评论

Bilal Tahir
Bilal Tahir创始人

我思考这个项目已经有一段时间了,终于能将它正式发布,我感到非常兴奋。我们不仅推出了产品,还将它开源了 🎉

为大家介绍 Podframes → 输入一行文字,即可获得一个可观看的播客:由两位 AI 主持人主持,真实人声,对口型人脸,逐词定时字幕,最终渲染为 MP4 文件。

背景介绍:几周前,我们 Jellypod 发布了 Speechbase:这是我们多年开发 AI 播客过程中积累的所有文本转语音经验,打包成了一个开发工具包。只需一个 API,即可支持 16 个最热门的 TTS 提供商(ElevenLabs、Google、OpenAI、Cartesia、Hume,全都包含)。仅需修改一行字符串即可切换提供商。

但开发工具包是抽象概念,很难直观感受它的能力。展示它所能实现的功能,最好的方法就是用它构建一个此前不可能存在的产品。于是我们打造了 Podframes,这是我们官方的开源示例项目。

输入一个主题后,流程如下:

→ Gemini 生成紧凑的双主持人脚本

→ Speechbase 混合不同提供商的人声(Ada 来自 Google,Theo 来自 ElevenLabs),返回带词级时间戳的整段对话。这为开发带来了更多可能性。

→ Nano Banana 2 生成主持人肖像

→ 每一句台词都会生成对应的对口脸视频片段(使用 P-Video,如果你想要更好效果也可以用 LTX-2.3)

→ 同样的词级时间戳无需额外代码即可驱动卡拉OK字幕和背景镜头定时

→ HyperFrames 渲染出最终带字幕的 MP4

我最喜欢的一点是它的经济高效。所有内容按行计费:编辑脚本中的一行只需要重新购买一行音频和一个片段,无需重新生成整集。工作室会在每次生成前为你显示费用清单。一整集只需要几美元。

而且它在本地运行。无需托管服务,无需注册。克隆仓库,添加你自己的 API 密钥,然后运行一条 CLI 命令,如果你想观看过程也可以点击 5 步工作室向导。

下方的发布视频就是用 Podframes 制作的,主题就是 Podframes。主持人在播客中途发现自己就是演示示例。甚至音乐也是生成的(Lyria 3)。

由于它使用你自己的 API 密钥运行,成本非常低廉。我认为它可能是目前创建自动化视频播客最便宜的方式。

现在就去制作一个你热爱主题的节目吧 🎙️

GitHub:https://github.com/Jellypod-Inc/...

Speechbase:https://speechbase.ai(每月提供 1000 万免费字符供体验)

创始团队

Bilal Tahir
Bilal TahirBuilder of Things

官网信息

官网https://github.com/Jellypod-Inc/podframes
公司使命

将一个话题转化为包含混合配音、口型同步虚拟形象和精准时间字幕的双主播AI播客视频