适合哪些场景
多人会议、一对一或多人访谈、长通话录音,读起来最难的往往不是“有没有字”,而是“这句话是谁说的”。
说话人分离把连续音频拆成按人分段的文稿;再配合声纹 ID,文稿可以直接带上姓名,方便检索、纪要和引用。
桌面里怎么用
在 Desktop 中进行文件转写时启用说话人分离即可。即使尚未登记任何人,MOSS 也会给出匿名说话人标签,会议内容仍可按人阅读。
若需要真实姓名,先在支持声纹 ID 的模型上登记短音频样本,再转写。模型市场会标出支持声纹 ID 的模型。
- 本机处理音频,默认不外传
- 内置 MOSS,面向多人会议与访谈
- 可选声纹 ID,把匿名标签换成姓名
开源内核中的对应能力
同一套 Apache-2.0 开源内核也暴露给 CLI 与本地 HTTP API。命令行可用 openasr transcribe --diarize;可用 speaker enroll 登记声纹;服务端提供 /v1/speakers API。
CLI 路径的分离依赖 WeSpeaker 等能力包。首次使用 --diarize 时,若能力包尚未安装,需按提示完成安装;公共目录中没有对应包时会报错退出,不会静默跳过。
本地优先与边界
无需注册。常规转写不会静默自动下载缺失模型;用户会看到并确认每一次下载。CLI 的 --offline 在缺模型时直接失败。
目前提供 macOS 与 Windows 桌面应用,没有原生 Linux 桌面应用。Linux 用户可使用预编译 CLI/服务器或自行源码构建。声纹 ID 是标注便利功能,不是身份认证。