AI工具导航

KugelAudio

可自行托管的实时文本转语音模型

KugelAudio 是什么?

KugelAudio 是一款可自行部署的实时文本转语音 AI 模型,支持低于 60 毫秒的低延迟推理与语音克隆,可选择本地部署或通过 API 调用。它对语法规则敏感,可以自然处理电话号码、IBAN、地址和药品名称等特殊文本,支持超过 25 种语言、词级时间戳与 IPA 音标,还提供了 LiveKit、Pipecat 和 Vapi 的适配插件,由四人团队在柏林开发。

产品详细介绍

可自行托管的实时文本转语音模型

KugelAudio 是一款可自行部署的实时文本转语音 AI 模型,支持低于 60 毫秒的低延迟推理与语音克隆,可选择本地部署或通过 API 调用。它对语法规则敏感,可以自然处理电话号码、IBAN、地址和药品名称等特殊文本,支持超过 25 种语言、词级时间戳与 IPA 音标,还提供了 LiveKit、Pipecat 和 Vapi 的适配插件,由四人团队在柏林开发。

定价方案

需要付费
€0.0860/per generated minute
Kugel 经典款
  • 适用于品牌语音、旁白和长音频的高质量文字转语音

  • API 费率 €0.0860/分钟

  • 大约 token 成本 ~61 欧元 / 100万文本 tokens

€0.0430/per generated minute
库格尔 Turbo
  • 适用于流式传输、交互式语音应答(IVR)和高并发API使用场景的低延迟文本转语音

  • API 费率 €0.0430/分钟

  • 大约 token 成本 ~31 欧元 / 100万文本 token

Custom quote/custom
企业版
  • 定制定价与部署选项

  • 通过承诺使用量享受更低费率

  • 本地部署托管

查看官网价格

创始人评论

Kajo Kratzenstein
Kajo Kratzenstein创始人

嗨 Product Hunt 👋 我是 KugelAudio 的卡约。我们是一支位于柏林的四人团队,目前在旧金山参加 Y Combinator。我们正在为未来构建产品——我们相信未来是对话式的。

今天我们发布了一款支持声音克隆的实时文本转语音(TTS)模型。哪怕你只有一分钟时间,我也想让你了解这些要点:

你可以通过 30 到 60 秒的音频克隆出任意音色。只需上传一小段音频样本,就能立即得到可用的克隆音色。

我们针对语音代理做了优化,延迟低于 60 毫秒(不含网络延迟),同时支持输入流和输出流。

我们提供本地部署支持,你可以在自己的集群中运行模型,无需调用我们的 API。当数据需要保留在你方网络内时,这一方案非常实用。

我们提供 LiveKit、Pipecat 和 Vapi 适配器,以及 Python、JS 和 Java 版本的开发工具包(SDK)。提供免费套餐,你无需提前沟通即可开始试用。

我们的创始工程师亚历克斯今天就在评论区,准备回答各种硬核问题:模型架构、低延迟是如何实现的、这个版本稳定之前我们踩过哪些坑。尽管提问!

创始团队

Kajo Kratzenstein
Kajo Kratzenstein创始团队
Alexander Netz
Alexander Netz创始团队
Viktor Presber
Viktor Presber创始团队

官网信息

官网https://kugelaudio.com/
公司使命

源自欧洲,服务欧洲的安全语音人工智能——由欧洲开发并托管,支持 40 多种语言的自然语音,完全符合 GDPR 合规要求

所在地

Europe