Cekura Bench:基于真实通话的语音转语音模型基准测试
基于真实通话的语音转语音模型基准测试
Cekura Bench 提供可验证的语音 AI 基准测试数据。全新语音转语音基准测试涵盖 9 款实时语音模型,包括 GPT Realtime 2.1、Gemini Live、Grok 和 Phonic,将其作为完整电话代理在真实通话中进行评估:共 82 个场景,每个场景运行三次。模型将根据可靠性、数据准确性、通话卡顿率、响应时间及成本进行排名,所有通话转录文本均公开透明。此外,Cekura Bench 还提供语音代理基准测试与语音识别(STT)基准测试,语音合成(TTS)基准测试即将上线。
小编简评: 在语音大模型快速迭代的当下,Cekura Bench 为开发者与企业决策者提供了一套极具参考价值的性能标尺。与传统仅依赖静态数据集的评测不同,该平台直击行业痛点,将 GPT Realtime 2.1、Gemini Live 等主流模型置于真实的电话通话场景中,通过 82 个高频业务场景的反复实测,全面还原模型在弱网环境、多轮交互及复杂指令下的真实表现。其核心优势在于极高的透明度与可验证性:从系统可靠性、端到端延迟到单次调用成本,各项关键指标均有据可查,且全部通话转录文本完全公开,彻底打破了技术黑盒。对于正在选型智能语音坐席或自动化外呼系统的团队而言,Cekura Bench 不仅是一份详尽的横向对比报告,更是降低研发试错成本、加速产品商业落地的关键基础设施。随着语音合成基准测试的即将上线,该平台有望进一步巩固其在语音 AI 领域的权威地位,成为开发者不可或缺的效率加速器。
用户评价:
“终于不用靠猜选模型了,真实通话数据太有说服力!”
“延迟和卡顿率排得明明白白,帮我们省了不少测试时间。”
“开源透明的做法很良心,企业采购直接拿报告去汇报。”
“期待TTS榜单上线,现在看语音合成效果全靠听感。”
关键词:#Cekura Bench #SaaS #Developer Tools #Artificial Intelligence #开发者工具 #人工智能
官方网站: Cekura Bench
英文介绍: Speech-to-speech model benchmarks on live phone calls
Cekura Bench publishes voice AI benchmarks you can verify. Our new speech-to-speech benchmark tests 9 realtime voice models, including GPT Realtime 2.1, Gemini Live, Grok and Phonic, as complete phone agents on live calls: 82 scenarios, three runs each. Models are ranked on reliability, data accuracy, stalled calls, response time and cost, and every call transcript is public. Cekura Bench also covers voice agent benchmarks and STT benchmarks, with TTS benchmarks coming soon.
以下是产品图片:





官方网站: Cekura Bench
您觉得这个产品怎么样?有什么亮点或不足?可以分享给您的朋友一起探讨!
每天下午16:00,实时同步 Product Hunt 精选榜单,用中文呈现全球顶级开发者、创业者的奇思妙想,准时链接全球创意!欢迎持续关注~~~