AI 语音总让人等半天?Nari Labs 把开源模型做成实时接口

Nari Labs 面向开发语音客服、陪练和通话助手的团队,把开源的 Qwen3 语音模型做成可以直接调用的在线接口。团队没有重新训练更大的模型,而是重写了模型运行时的调度方式,并开放了部分服务代码。


Nari Labs 9 月 14 日文章引用的 Coval 语音生成榜单快照。横轴是用户等到第一段声音的时间,越靠左越快;纵轴是生成语音被重新听写后的错词比例,越低越好。榜单会持续变化,这张图只反映当时结果。 来源:Nari Labs 官方文章中的 Coval 榜单图


语音助手最容易让人出戏的时刻,不一定是说错话,而是问完以后沉默好几秒。Nari Labs 想解决的就是这段等待:开发语音客服、口语陪练或通话助手的团队,可以把文字交给它生成语音,也可以把用户说的话转成文字。团队把开源的 Qwen3 语音模型接到自己重写的运行引擎上,再通过在线接口提供给开发者。

先把人和机器之间那段沉默缩短
Nari Labs 在 9 月 14 日公开了新的语音榜单进展。这里有两件事:TTS 是把文字变成声音,例如让客服把回答念出来;ASR 是把声音变成文字,例如先听懂用户说了什么。两步都可能拖慢一轮对话,任意一步等待太久,用户就会觉得对面没有反应。

团队的做法不是再训练一套更大的语音模型,而是围绕开源的 Qwen3-TTS 和 Qwen3-ASR 重写运行引擎。可以把模型想成厨师,把运行引擎想成后厨的接单和出餐安排:菜谱没变,但什么时候准备、怎样同时处理多张订单,会直接影响第一口菜多久端上来。

开发者不用先搭一整套语音机房
Nari Labs 把这套能力做成在线调用入口。开发者把一段文字发给语音生成接口,收到可以播放的声音;把一段录音发给语音识别接口,收到转写文字。这样,小团队可以先把语音接进客服、陪练或通话产品,再决定是否需要自己管理显卡和服务。

团队也公开了 Qwen3-TTS 的一部分服务代码和测试方法。仓库说明,这套开源版本需要 NVIDIA H100 这类专用高性能显卡,提供普通和边生成边播放两种调用方式,目前主要测试英语。自行部署的硬件门槛不低,但公开代码把团队怎样安排模型运算展示出来,方便其他开发者检查和改进。

榜单能看速度和错词,不能替你判断声音好不好听
Coval 的独立榜单会持续用相同方法测试多家语音服务。9 月 15 日读取的近 30 天结果中,Nari 的 Qwen3 TTS Fast 和 Qwen3 ASR Fast 都排在速度与错词表现较靠前的位置。榜单每隔一段时间就会加入新样本,页面数值会变化;Nari 9 月 14 日文章里的单日快照与当前页面也已有轻微差别,因此不应把某个瞬间的名次当成长期结论。

错词比例的含义也要说清楚。Coval 会把生成的声音交给固定的听写模型,再比较听写结果和原文,因此更接近“话有没有被听清”,并不等于音色自然、情绪合适或中文表现优秀。Coval 还提醒,不同口音、电话压缩和房间回声会让结果变化,开发团队仍要拿自己的真实场景测试。

小团队不一定造新模型,也能从运行环节切进去
创始人 Toby 在公开发布帖中回顾,团队此前做过开源语音项目 Dia,后来把注意力转向模型怎样更快、更便宜地运行。Nari Labs 从 2026 年初开始为 Qwen3-TTS 开发专用引擎,随后又把相同思路扩展到语音识别。这个项目展示了一条创业路线:基础模型已经有人开放,小团队仍可以从部署、速度和调用体验中找到产品位置。

目前两项在线接口仍处于公测阶段。语音识别免费版有每天调用次数和同时处理数量限制,团队明确不保证免费服务的在线时间或速度;语音生成的开源版本也有显卡和语言范围。对准备接入的团队来说,下一步值得看的不是榜单名次能否长期保持,而是正式收费后,服务能否在自己的语言、口音和高峰流量下稳定工作。

想继续了解
Nari Labs 语音榜单进展
Nari Qwen3-TTS 发布说明
Nari Qwen3-ASR 公测说明
Nari Labs 产品入口
Nari Qwen3-TTS 开源服务代码
Nari Qwen3-TTS 测试方法与结果
Coval 独立语音榜单
创始人 Toby 的 Hacker News 发布帖
0
一起维护这篇内容

发现链接失效、信息过时或内容有误,可以提交更新建议。

我要更新

交流讨论

发表评论

最新评论

引用 柠檬精本精 2026-9-15 12:12
重写运行引擎这操作真狠,不堆模型堆调度
引用 路过打酱油 2026-9-16 18:10
卧槽,H100门槛是真劝退。

查看全部评论(2)

返回顶部