跳转到内容

模型与模型包

OpenASR 的公开模型目录来自开源仓库中的 model-registry/catalog.json。CLI 只会信任通过签名校验的目录内容。模型页面是该目录的静态展示,可查询当前模型的量化版本、文件大小、校验值和许可证。

  • Whisper:包含 tiny、base、small、medium、large-v3 和 large-v3-turbo,提供纯英文和多语言版本
  • Qwen3-ASR:多语言模型,提供 0.6B 和 1.7B 两种规模
  • Parakeet-TDT:NVIDIA 的多语言语音识别模型(parakeet-tdt-0.6b-v3),覆盖 25 种欧洲语言
  • FireRed-AED:FireRedTeam 出品的中英双语语音识别模型(firered-aed-l-v2)
  • SenseVoice:来自 FunAudioLLM 的多语言语音识别模型(sensevoice-small),覆盖中文、粤语、英语、日语和韩语
  • Moonshine:面向英文识别的轻量模型
  • Cohere Transcribe:多语言语音识别模型
  • X-ASR:中英双语模型
  • Dolphin:一个多语言语音识别系列,包括通用多语言模型(dolphin-base、dolphin-small, 覆盖南亚/东南亚/中亚约 40 种语言以及中文)和专门的中文方言模型 (dolphin-cn-dialect-base、dolphin-cn-dialect-small,针对各地方言优化)
  • Hy-MT2:语音翻译模型,不是普通的语音转写模型
  • 能力扩展包:包括说话人分段和声纹匹配嵌入模型,以及 FireRed 标点恢复模型 (中文标点恢复,firered-punc);在使用需要它们的 CLI 参数(例如 --diarize)时会按需拉取

多数语音识别模型提供多个量化版本,例如 fp16q8_0q4_k;语音翻译、说话人分离等能力包可能只有一个版本。目录会为每个模型标记 recommended_quant。可用量化版本会随发布更新,请以 openasr search模型页面为准,不建议在程序中写死。

每个模型都以单个 .oasr 文件分发。它内部基于 GGUF,并以 GGUF 魔数开头,但 .oasr 是唯一面向用户的模型包格式;裸 .gguf 文件不能直接作为运行输入,也不会由导入工具生成。

你可以在不下载任何内容、不运行推理的情况下检查本地模型包:

bash
openasr verify /path/to/model.oasr
openasr show /path/to/model.oasr

模型包损坏、格式不正确或不支持所请求的能力时,原生后端会明确失败,不会尝试输出不完整结果。

bash
openasr search whisper # 搜索模型目录
openasr pull whisper-small # 下载并校验模型包
openasr list # 查看已安装模型
openasr transcribe audio.wav --model whisper-small

openasr pull 是明确的手动下载入口。常规转写、批量处理、性能测试、API 和 serve 流程都不会在 CLI 可见的确认提示之外自动下载模型(见目前支持情况)。

openasr model-pack import 是面向项目维护者的源码工作流,用于从源权重构建模型包。需要自行打包时,请参考仓库 README 中的 Building model packs 一节。