
Nari Labs 9 月 14 日文章引用的 Coval 语音生成榜单快照。横轴是用户等到第一段声音的时间,越靠左越快;纵轴是生成语音被重新听写后的错词比例,越低越好。榜单会持续变化,这张图只反映当时结果。 来源:Nari Labs 官方文章中的 Coval 榜单图
语音助手最容易让人出戏的时刻,不一定是说错话,而是问完以后沉默好几秒。Nari Labs 想解决的就是这段等待:开发语音客服、口语陪练或通话助手的团队,可以把文字交给它生成语音,也可以把用户说的话转成文字。团队把开源的 Qwen3 语音模型接到自己重写的运行引擎上,再通过在线接口提供给开发者。
先把人和机器之间那段沉默缩短
Nari Labs 在 9 月 14 日公开了新的语音榜单进展。这里有两件事:TTS 是把文字变成声音,例如让客服把回答念出来;ASR 是把声音变成文字,例如先听懂用户说了什么。两步都可能拖慢一轮对话,任意一步等待太久,用户就会觉得对面没有反应。
团队的做法不是再训练一套更大的语音模型,而是围绕开源的 Qwen3-TTS 和 Qwen3-ASR 重写运行引擎。可以把模型想成厨师,把运行引擎想成后厨的接单和出餐安排:菜谱没变,但什么时候准备、怎样同时处理多张订单,会直接影响第一口菜多久端上来。
开发者不用先搭一整套语音机房
Nari Labs 把这套能力做成在线调用入口。开发者把一段文字发给语音生成接口,收到可以播放的声音;把一段录音发给语音识别接口,收到转写文字。这样,小团队可以先把语音接进客服、陪练或通话产品,再决定是否需要自己管理显卡和服务。
团队也公开了 Qwen3-TTS 的一部分服务代码和测试方法。仓库说明,这套开源版本需要 NVIDIA H100 这类专用高性能显卡,提供普通和边生成边播放两种调用方式,目前主要测试英语。自行部署的硬件门槛不低,但公开代码把团队怎样安排模型运算展示出来,方便其他开发者检查和改进。
榜单能看速度和错词,不能替你判断声音好不好听
Coval 的独立榜单会持续用相同方法测试多家语音服务。9 月 15 日读取的近 30 天结果中,Nari 的 Qwen3 TTS Fast 和 Qwen3 ASR Fast 都排在速度与错词表现较靠前的位置。榜单每隔一段时间就会加入新样本,页面数值会变化;Nari 9 月 14 日文章里的单日快照与当前页面也已有轻微差别,因此不应把某个瞬间的名次当成长期结论。
错词比例的含义也要说清楚。Coval 会把生成的声音交给固定的听写模型,再比较听写结果和原文,因此更接近“话有没有被听清”,并不等于音色自然、情绪合适或中文表现优秀。Coval 还提醒,不同口音、电话压缩和房间回声会让结果变化,开发团队仍要拿自己的真实场景测试。
小团队不一定造新模型,也能从运行环节切进去
创始人 Toby 在公开发布帖中回顾,团队此前做过开源语音项目 Dia,后来把注意力转向模型怎样更快、更便宜地运行。Nari Labs 从 2026 年初开始为 Qwen3-TTS 开发专用引擎,随后又把相同思路扩展到语音识别。这个项目展示了一条创业路线:基础模型已经有人开放,小团队仍可以从部署、速度和调用体验中找到产品位置。
目前两项在线接口仍处于公测阶段。语音识别免费版有每天调用次数和同时处理数量限制,团队明确不保证免费服务的在线时间或速度;语音生成的开源版本也有显卡和语言范围。对准备接入的团队来说,下一步值得看的不是榜单名次能否长期保持,而是正式收费后,服务能否在自己的语言、口音和高峰流量下稳定工作。
想继续了解
• Nari Labs 语音榜单进展
• Nari Qwen3-TTS 发布说明
• Nari Qwen3-ASR 公测说明
• Nari Labs 产品入口
• Nari Qwen3-TTS 开源服务代码
• Nari Qwen3-TTS 测试方法与结果
• Coval 独立语音榜单
• 创始人 Toby 的 Hacker News 发布帖

交流讨论
最新评论
查看全部评论(2)