- ✓
暂未采集到具体套餐,价格以官网为准
Cekura Bench
语音到语音模型在实时电话通话中的基准测试
Cekura Bench 是什么?
Cekura Bench 是一个面向语音 AI 模型的公开评测平台,通过真实电话通话场景对 GPT Realtime 2.1、Gemini Live、Grok 等 9 个实时语音模型进行测试,覆盖 82 个场景并从可靠性、响应时间、成本等维度进行排名。目前平台已上线语音代理和 STT 评测基准,所有通话记录均公开可查,TTS 基准也即将推出。
产品详细介绍
语音到语音模型在实时电话通话中的基准测试
Cekura Bench 是一个面向语音 AI 模型的公开评测平台,通过真实电话通话场景对 GPT Realtime 2.1、Gemini Live、Grok 等 9 个实时语音模型进行测试,覆盖 82 个场景并从可靠性、响应时间、成本等维度进行排名。目前平台已上线语音代理和 STT 评测基准,所有通话记录均公开可查,TTS 基准也即将推出。
定价方案
需要付费创始人评论
大家好,我是来自 Cekura 的 Sidhant。
今天,我们正式发布语音转语音基准测试。我们在同一个开源 Pipecat 电话代理中,将 9 个实时语音模型作为完整代理运行,使用相同的提示词、工具和电话线路。每个模型在诊所预约流程和 Medicare 登记流程中各运行 82 个场景,每个场景测试三次。只有当代理达到正确结果并正确保存每个字段时,该通话才算通过。
结果:
最可靠:GPT Realtime 2.1,79.3% 的场景在三次运行中全部通过
速度最快:Phonic v1,中位响应时间 1.60 秒
成本最低:GPT Realtime 2.1 Mini,每分钟 0.020 美元
级联基线(Flux、GPT-4.1、ElevenLabs Flash)得分为 82.9%,高于所有实时模型
每次通话都关联到其转录文本、工具调用和评分,代理和测试用例均已在 GitHub 开源。
我们非常重视您的反馈,尤其是关于接下来应该加入哪些模型。