桌面应用
OpenASR Desktop 让你不必配置命令行,就能在界面中使用本地语音识别。现已支持 macOS(Apple silicon)和 Windows(x64,10 及以上),可以从下载页获取。
桌面应用的引导、界面、打包、签名和自动更新部分不开源;实际处理音频的能力来自与命令行相同的 Apache-2.0 开源核心,代码位于 GitHub。桌面版没有另一套隐藏的转写通道。
| 平台 | 最低系统版本 | 架构 | 备注 |
|---|---|---|---|
| macOS | 13.3(Ventura) | Apple silicon | 已使用 Developer ID 签名并经 Apple 公证。 |
| Windows | Windows 10 | 64 位 x64 | 由 Caelum Inc. 通过 Azure Trusted Signing 签名。安装程序会在缺少 WebView2 时自动获取。 |
目前不支持 ARM 架构的 Windows 设备。Linux 桌面版尚未发布,Linux 用户可通过命令行快速上手使用开源引擎。
首次启动时,应用会依次说明并申请麦克风权限和 macOS 辅助功能权限,随后可以跟着提示试用一次听写快捷键。
这些步骤可以跳过。之后第一次使用相关功能时,应用仍会再次请求所需权限,不会因为跳过引导而无法进入主界面。
为什么需要这些权限
Section titled “为什么需要这些权限”OpenASR Desktop 最多会用到三项 macOS 权限。它不会申请“输入监控”:全局听写快捷键通过 NSEvent 监听,只需要辅助功能权限,不需要更底层的键盘事件权限。
使用听写或从麦克风生成实时字幕时需要。可以在 系统设置 → 隐私与安全性 → 麦克风 中随时开启或关闭。
如果首次引导时跳过,第一次开始听写或麦克风字幕时,系统会再次弹出授权提示。
听写功能需要这项权限,原因有两个:在系统范围内识别按住或切换式快捷键,以及把识别结果输入到当前正在使用的应用。
没有授权时,OpenASR 仍可能完成录音,但无法把文字自动填入其他应用。
前往 系统设置 → 隐私与安全性 → 辅助功能,找到 OpenASR Desktop 并开启。如果列表中没有,可以点击 +,从 /Applications 添加。授权后回到 OpenASR,应用会在几秒内重新检查,通常不需要重启。
只有在为通话、视频等电脑内部声音生成实时字幕时才需要。仅使用麦克风字幕不会触发这项授权。
系统音频捕获基于 Core Audio process tap,需要 macOS 14.2 或更高版本。第一次点击开始系统音频字幕时,macOS 会请求权限;之后可以在 系统设置 → 隐私与安全性 的系统音频或屏幕录制相关项目中管理。
选择和下载模型
Section titled “选择和下载模型”打开“模型”页面即可浏览可用模型和量化版本。首次使用和新手引导会推荐一个默认模型,也可以根据语言、速度和体积自行更换。
下载的每个模型都是经过校验的 .oasr 模型包。只有你明确选择下载时应用才会联网,不会静默安装其他模型。可以先到模型目录了解各模型的用途;如果下载时间、磁盘空间或校验过程有问题,请查看常见问题。
听写和实时字幕
Section titled “听写和实时字幕”听写适合把刚说的话直接输入到当前应用。根据你的快捷键设置,可以按住说话、松开后输入,也可以按一次开始、再按一次结束。自动输入文字需要辅助功能权限。
实时字幕会在本机持续识别麦克风或系统音频,并把结果显示在可拖动的小浮窗中。除非你在高级设置中主动开启远程计算,否则音频不会离开这台电脑。
应用启动后不久会向 dl.openasr.org 检查新版本;也可以在设置中手动点击“检查更新”。检查更新不会自动安装,下载、安装和重新启动都需要你确认。
设置中还可以选择 stable 稳定版或 preview 预览版更新通道。
- 退出 OpenASR Desktop。
- 删除
/Applications/OpenASR Desktop.app。 - 如需同时清除设置和模型,再删除
~/.openasr/。这里保存配置、已安装模型,以及你曾设置的 Hugging Face Token;普通卸载无需删除。 - 如果启用过开机启动,请在 系统设置 → 通用 → 登录项 中移除
dev.openasr.desktop。若仍有残留,也可以删除~/Library/LaunchAgents/dev.openasr.desktop.plist。
麦克风、辅助功能和系统音频权限由 macOS 按应用签名身份保存。以后重新安装同一签名的版本时,通常不必单独重置权限。
听写、麦克风或应用启动异常时,可直接查看常见问题。