跳转到内容

桌面应用

OpenASR Desktop 让你不必配置命令行,就能在界面中使用本地语音识别。现已支持 macOS(Apple silicon)和 Windows(x64,10 及以上),可以从下载页获取。

桌面应用的引导、界面、打包、签名和自动更新部分不开源;实际处理音频的能力来自与命令行相同的 Apache-2.0 开源核心,代码位于 GitHub。桌面版没有另一套隐藏的转写通道。

平台最低系统版本架构备注
macOS13.3(Ventura)Apple silicon已使用 Developer ID 签名并经 Apple 公证。
WindowsWindows 1064 位 x64由 Caelum Inc. 通过 Azure Trusted Signing 签名。安装程序会在缺少 WebView2 时自动获取。

目前不支持 ARM 架构的 Windows 设备。Linux 桌面版尚未发布,Linux 用户可通过命令行快速上手使用开源引擎。

首次启动时,应用会依次说明并申请麦克风权限和 macOS 辅助功能权限,随后可以跟着提示试用一次听写快捷键。

这些步骤可以跳过。之后第一次使用相关功能时,应用仍会再次请求所需权限,不会因为跳过引导而无法进入主界面。

OpenASR Desktop 最多会用到三项 macOS 权限。它不会申请“输入监控”:全局听写快捷键通过 NSEvent 监听,只需要辅助功能权限,不需要更底层的键盘事件权限。

使用听写或从麦克风生成实时字幕时需要。可以在 系统设置 → 隐私与安全性 → 麦克风 中随时开启或关闭。

如果首次引导时跳过,第一次开始听写或麦克风字幕时,系统会再次弹出授权提示。

听写功能需要这项权限,原因有两个:在系统范围内识别按住或切换式快捷键,以及把识别结果输入到当前正在使用的应用。

没有授权时,OpenASR 仍可能完成录音,但无法把文字自动填入其他应用。

前往 系统设置 → 隐私与安全性 → 辅助功能,找到 OpenASR Desktop 并开启。如果列表中没有,可以点击 +,从 /Applications 添加。授权后回到 OpenASR,应用会在几秒内重新检查,通常不需要重启。

只有在为通话、视频等电脑内部声音生成实时字幕时才需要。仅使用麦克风字幕不会触发这项授权。

系统音频捕获基于 Core Audio process tap,需要 macOS 14.2 或更高版本。第一次点击开始系统音频字幕时,macOS 会请求权限;之后可以在 系统设置 → 隐私与安全性 的系统音频或屏幕录制相关项目中管理。

打开“模型”页面即可浏览可用模型和量化版本。首次使用和新手引导会推荐一个默认模型,也可以根据语言、速度和体积自行更换。

下载的每个模型都是经过校验的 .oasr 模型包。只有你明确选择下载时应用才会联网,不会静默安装其他模型。可以先到模型目录了解各模型的用途;如果下载时间、磁盘空间或校验过程有问题,请查看常见问题

听写适合把刚说的话直接输入到当前应用。根据你的快捷键设置,可以按住说话、松开后输入,也可以按一次开始、再按一次结束。自动输入文字需要辅助功能权限。

实时字幕会在本机持续识别麦克风或系统音频,并把结果显示在可拖动的小浮窗中。除非你在高级设置中主动开启远程计算,否则音频不会离开这台电脑。

应用启动后不久会向 dl.openasr.org 检查新版本;也可以在设置中手动点击“检查更新”。检查更新不会自动安装,下载、安装和重新启动都需要你确认。

设置中还可以选择 stable 稳定版或 preview 预览版更新通道。

  1. 退出 OpenASR Desktop。
  2. 删除 /Applications/OpenASR Desktop.app
  3. 如需同时清除设置和模型,再删除 ~/.openasr/。这里保存配置、已安装模型,以及你曾设置的 Hugging Face Token;普通卸载无需删除。
  4. 如果启用过开机启动,请在 系统设置 → 通用 → 登录项 中移除 dev.openasr.desktop。若仍有残留,也可以删除 ~/Library/LaunchAgents/dev.openasr.desktop.plist

麦克风、辅助功能和系统音频权限由 macOS 按应用签名身份保存。以后重新安装同一签名的版本时,通常不必单独重置权限。

听写、麦克风或应用启动异常时,可直接查看常见问题