
双引擎 ASR 详解:SenseVoice 与 Whisper
3rd August 2026
为什么需要双引擎
不同语言对识别模型的侧重点不同:亚太语言需要「快而准」的小模型,全球语系则需要「覆盖广」的大模型。Tontrans 同时内置两套,可按视频内容随时切换。
SenseVoice-Small:亚太极速
- 擅长 中、英、日、韩、粤 语
- 模型小、延迟低,句级识别在停顿时即可快速回显
- 适合直播、视频会议等对实时性要求高的场景
Whisper-Small:全球高精度
- 覆盖 全球近百种语言(法、德、西、意、俄、葡、越、泰等)
- 精度更高,但模型较大,建议 GPU(CUDA)加速以保持实时
- 适合法文教学、德文演讲、西班牙影集等非亚太语系内容
如何切换
在插件设置面板的「语音识别引擎」下拉中选择 SenseVoice(极速模式) 或 Whisper-Small(多国语言/GPU 加速);后端也可在 Web 后台启用/禁用单个模型,仅启用一个时客户端固定使用。
底层
两套引擎都基于 Sherpa-ONNX 本地运行,配合 Silero VAD 做流式断句——说话停顿达设定值(默认 0.5s)自动切句,交给模型解码,因此无需整段上传即可逐句出字幕。