说话人分离

本地会议与访谈说话人分离应用

OpenASR Desktop 是面向 macOS 与 Windows 的本地语音转文字应用。文件转写可使用内置 MOSS 说话人分离,把多人会议和访谈按人分开。登记声纹后,还可用声纹 ID 标出姓名。转写默认在本机运行,无需账号,无遥测,也没有中央云转写后端。

桌面平台
macOS 与 Windows
内置分离
MOSS
命名能力
声纹 ID
账号要求
不需要

适合哪些场景

多人会议、一对一或多人访谈、长通话录音,读起来最难的往往不是“有没有字”,而是“这句话是谁说的”。

说话人分离把连续音频拆成按人分段的文稿;再配合声纹 ID,文稿可以直接带上姓名,方便检索、纪要和引用。

桌面里怎么用

在 Desktop 中进行文件转写时启用说话人分离即可。即使尚未登记任何人,MOSS 也会给出匿名说话人标签,会议内容仍可按人阅读。

若需要真实姓名,先在支持声纹 ID 的模型上登记短音频样本,再转写。模型市场会标出支持声纹 ID 的模型。

  • 本机处理音频,默认不外传
  • 内置 MOSS,面向多人会议与访谈
  • 可选声纹 ID,把匿名标签换成姓名

开源内核中的对应能力

同一套 Apache-2.0 开源内核也暴露给 CLI 与本地 HTTP API。命令行可用 openasr transcribe --diarize;可用 speaker enroll 登记声纹;服务端提供 /v1/speakers API。

CLI 路径的分离依赖 WeSpeaker 等能力包。首次使用 --diarize 时,若能力包尚未安装,需按提示完成安装;公共目录中没有对应包时会报错退出,不会静默跳过。

本地优先与边界

无需注册。常规转写不会静默自动下载缺失模型;用户会看到并确认每一次下载。CLI 的 --offline 在缺模型时直接失败。

目前提供 macOS 与 Windows 桌面应用,没有原生 Linux 桌面应用。Linux 用户可使用预编译 CLI/服务器或自行源码构建。声纹 ID 是标注便利功能,不是身份认证。

常见问题

OpenASR Desktop 能做说话人分离吗?

能。文件转写可使用内置 MOSS 说话人分离,把多人会议和访谈按人分开。还可选声纹 ID,在分离结果上标出姓名。

一定要联网吗?

转写与分离本身在本地完成,不依赖中央云转写后端。联网主要用于你确认后的模型或能力包下载,以及桌面更新检查等明确场景。

没有登记声纹也能用吗?

可以。未登记时,结果使用匿名说话人标签(如说话人 0、说话人 1)。登记后,匹配成功的片段会显示你设定的姓名。

和命令行为什么看起来不一样?

桌面走内置 MOSS 与声纹 ID 产品路径;CLI/服务器走 --diarize、speaker enroll 与 /v1/speakers API,底层使用 WeSpeaker 等能力包。目标一致:本地区分并可选命名说话人。

支持 Linux 桌面吗?

不提供原生 Linux 桌面应用。Linux 上可使用开源 CLI 与服务器。桌面应用目前覆盖 macOS 与 Windows。

分离结果能当身份鉴定吗?

不能。说话人分离与声纹 ID 用于让转写更好读、更好整理,属于标注便利能力,不是身份认证或司法鉴定。