指南

如何选择本地语音识别模型

从语言和任务入手,然后考虑硬件条件和可用内存,接着确认是否需要时间戳、标点、翻译或说话人分离等功能,最后检查模型许可证。没有放之四海皆准的最佳模型,正确选择取决于具体需求。目录中每个模型都标注了推荐量化方案。请访问模型页面查看最新的可用情况、确切大小、校验和与性能数据。

第一步
确定语言和任务
第二步
评估硬件和内存
第三步
确认功能需求
第四步
检查许可证

第一步:语言和任务

不同模型系列覆盖的语言不同。有些模型支持数十种语言,有些则专注于更窄的语言范围。首先明确需要转写的语言,以及任务是转写、翻译还是两者兼有。

签名目录涵盖 Whisper、Qwen3-ASR、Parakeet-TDT、FireRed-AED、SenseVoice、Moonshine、Cohere Transcribe、X-ASR、Dolphin 和 Hy-MT2 语音翻译等系列,以及说话人分离和中文标点等能力包。

第二步:硬件和内存

模型大小和量化方案会带来不同的内存、存储、速度和精度取舍,模型更大并不必然意味着效果更好。目录中每个模型都标注了推荐量化方案。较小的量化方案会减小包体积,但可能牺牲一定精度。

请在模型页面查看确切的包大小和实测字段,确认模型适合可用内存与存储空间。

第三步:功能需求

考虑是否需要词级时间戳、自动标点、语音翻译或说话人分离。并非每个模型都支持所有功能,选择前应查看模型详情页。

第四步:许可证

目录中的模型使用不同的许可证。有些允许商业使用,有些仅限研究或非商业用途。在将模型用于生产环境之前,请先在模型页面确认许可证。