Article Image

双引擎 ASR 详解:SenseVoice 与 Whisper

3rd August 2026

为什么需要双引擎

不同语言对识别模型的侧重点不同:亚太语言需要「快而准」的小模型,全球语系则需要「覆盖广」的大模型。Tontrans 同时内置两套,可按视频内容随时切换。

SenseVoice-Small:亚太极速

  • 擅长 中、英、日、韩、粤
  • 模型小、延迟低,句级识别在停顿时即可快速回显
  • 适合直播、视频会议等对实时性要求高的场景

Whisper-Small:全球高精度

  • 覆盖 全球近百种语言(法、德、西、意、俄、葡、越、泰等)
  • 精度更高,但模型较大,建议 GPU(CUDA)加速以保持实时
  • 适合法文教学、德文演讲、西班牙影集等非亚太语系内容

如何切换

在插件设置面板的「语音识别引擎」下拉中选择 SenseVoice(极速模式)Whisper-Small(多国语言/GPU 加速);后端也可在 Web 后台启用/禁用单个模型,仅启用一个时客户端固定使用。

底层

两套引擎都基于 Sherpa-ONNX 本地运行,配合 Silero VAD 做流式断句——说话停顿达设定值(默认 0.5s)自动切句,交给模型解码,因此无需整段上传即可逐句出字幕。

© 2026 Tontrans 智造实验室 · 保留所有权利

65545@163.com