- ✓
适用于品牌语音、旁白和长音频的高质量文字转语音
- ✓
API 费率 €0.0860/分钟
- ✓
大约 token 成本 ~61 欧元 / 100万文本 tokens
KugelAudio
可自行托管的实时文本转语音模型
KugelAudio 是什么?
KugelAudio 是一款可自行部署的实时文本转语音 AI 模型,支持低于 60 毫秒的低延迟推理与语音克隆,可选择本地部署或通过 API 调用。它对语法规则敏感,可以自然处理电话号码、IBAN、地址和药品名称等特殊文本,支持超过 25 种语言、词级时间戳与 IPA 音标,还提供了 LiveKit、Pipecat 和 Vapi 的适配插件,由四人团队在柏林开发。
产品详细介绍
可自行托管的实时文本转语音模型
KugelAudio 是一款可自行部署的实时文本转语音 AI 模型,支持低于 60 毫秒的低延迟推理与语音克隆,可选择本地部署或通过 API 调用。它对语法规则敏感,可以自然处理电话号码、IBAN、地址和药品名称等特殊文本,支持超过 25 种语言、词级时间戳与 IPA 音标,还提供了 LiveKit、Pipecat 和 Vapi 的适配插件,由四人团队在柏林开发。
定价方案
需要付费- ✓
适用于流式传输、交互式语音应答(IVR)和高并发API使用场景的低延迟文本转语音
- ✓
API 费率 €0.0430/分钟
- ✓
大约 token 成本 ~31 欧元 / 100万文本 token
- ✓
定制定价与部署选项
- ✓
通过承诺使用量享受更低费率
- ✓
本地部署托管
创始人评论
嗨 Product Hunt 👋 我是 KugelAudio 的卡约。我们是一支位于柏林的四人团队,目前在旧金山参加 Y Combinator。我们正在为未来构建产品——我们相信未来是对话式的。
今天我们发布了一款支持声音克隆的实时文本转语音(TTS)模型。哪怕你只有一分钟时间,我也想让你了解这些要点:
你可以通过 30 到 60 秒的音频克隆出任意音色。只需上传一小段音频样本,就能立即得到可用的克隆音色。
我们针对语音代理做了优化,延迟低于 60 毫秒(不含网络延迟),同时支持输入流和输出流。
我们提供本地部署支持,你可以在自己的集群中运行模型,无需调用我们的 API。当数据需要保留在你方网络内时,这一方案非常实用。
我们提供 LiveKit、Pipecat 和 Vapi 适配器,以及 Python、JS 和 Java 版本的开发工具包(SDK)。提供免费套餐,你无需提前沟通即可开始试用。
我们的创始工程师亚历克斯今天就在评论区,准备回答各种硬核问题:模型架构、低延迟是如何实现的、这个版本稳定之前我们踩过哪些坑。尽管提问!