模型与模型包
OpenASR 的公开模型目录来自开源仓库中的 model-registry/catalog.json。CLI 只会信任通过签名校验的目录内容。模型页面是该目录的静态展示,可查询当前模型的量化版本、文件大小、校验值和许可证。
目前收录的模型系列
Section titled “目前收录的模型系列”- Whisper:包含 tiny、base、small、medium、large-v3 和 large-v3-turbo,提供纯英文和多语言版本
- Qwen3-ASR:多语言模型,提供 0.6B 和 1.7B 两种规模
- Parakeet-TDT:NVIDIA 的多语言语音识别模型(parakeet-tdt-0.6b-v3),覆盖 25 种欧洲语言
- FireRed-AED:FireRedTeam 出品的中英双语语音识别模型(firered-aed-l-v2)
- SenseVoice:来自 FunAudioLLM 的多语言语音识别模型(sensevoice-small),覆盖中文、粤语、英语、日语和韩语
- Moonshine:面向英文识别的轻量模型
- Cohere Transcribe:多语言语音识别模型
- X-ASR:中英双语模型
- Dolphin:一个多语言语音识别系列,包括通用多语言模型(dolphin-base、dolphin-small, 覆盖南亚/东南亚/中亚约 40 种语言以及中文)和专门的中文方言模型 (dolphin-cn-dialect-base、dolphin-cn-dialect-small,针对各地方言优化)
- Hy-MT2:语音翻译模型,不是普通的语音转写模型
- 能力扩展包:包括说话人分段和声纹匹配嵌入模型,以及 FireRed 标点恢复模型
(中文标点恢复,firered-punc);在使用需要它们的 CLI 参数(例如
--diarize)时会按需拉取
多数语音识别模型提供多个量化版本,例如 fp16、q8_0 和 q4_k;语音翻译、说话人分离等能力包可能只有一个版本。目录会为每个模型标记 recommended_quant。可用量化版本会随发布更新,请以 openasr search 或模型页面为准,不建议在程序中写死。
.oasr 文件是什么
Section titled “.oasr 文件是什么”每个模型都以单个 .oasr 文件分发。它内部基于 GGUF,并以 GGUF 魔数开头,但 .oasr 是唯一面向用户的模型包格式;裸 .gguf 文件不能直接作为运行输入,也不会由导入工具生成。
你可以在不下载任何内容、不运行推理的情况下检查本地模型包:
openasr verify /path/to/model.oasropenasr show /path/to/model.oasr模型包损坏、格式不正确或不支持所请求的能力时,原生后端会明确失败,不会尝试输出不完整结果。
安装并使用模型
Section titled “安装并使用模型”openasr search whisper # 搜索模型目录openasr pull whisper-small # 下载并校验模型包openasr list # 查看已安装模型openasr transcribe audio.wav --model whisper-smallopenasr pull 是明确的手动下载入口。常规转写、批量处理、性能测试、API 和 serve 流程都不会在 CLI 可见的确认提示之外自动下载模型(见目前支持情况)。
自行构建模型包
Section titled “自行构建模型包”openasr model-pack import 是面向项目维护者的源码工作流,用于从源权重构建模型包。需要自行打包时,请参考仓库 README 中的 Building model packs 一节。