声纹 ID

什么是 OpenASR 声纹 ID?

声纹 ID 是 OpenASR Desktop 的主打能力:用一段短音频登记声纹后,转写结果可以标出说话人姓名,而不是只显示“说话人 1”“说话人 2”。它与内置的 MOSS 说话人分离配合使用,适合多人会议和访谈。登记与匹配默认在本机完成;声纹 ID 是说话人标注便利功能,不是身份认证。

桌面版本
0.1.21 起
说话人分离
内置 MOSS
默认运行位置
本机
功能定位
说话人标注,非身份认证

解决什么问题

多人录音里,仅把说话人分开还不够。匿名标签能让轮次可读,但读稿时仍要反复对照谁是谁。

声纹 ID 在分离结果之上补上姓名:同一人在长文件里再次开口时,尽量继续使用已登记的名字,而不是不断冒出新的匿名标签。

如何登记

用对方的一段短音频完成登记,大约十秒通常就够。常见格式可用:mp3、m4a、aac、wav。

登记失败时会给出明确原因,而不是静默失败。姓名可事后修改,第一次不必一次定死。

  • 在模型市场选择标有声纹 ID 支持的模型
  • 为需要点名的人登记短音频样本
  • 转写时启用说话人分离,匹配到的片段显示姓名

与 MOSS 说话人分离的关系

MOSS 负责在转写过程中把不同说话人分开;即使尚未登记任何人,会议和访谈也能按人阅读。

声纹 ID 负责把分离结果与已登记的人对应起来。分离保证可读,登记让结果带上真实姓名。两者默认都在本机完成。

命令行与服务端路径

桌面之外,开源内核也提供说话人相关能力:CLI 可用 --diarize 做分离,用 speaker enroll 登记声纹,服务端提供 /v1/speakers API。这些路径基于 WeSpeaker 能力包。

命令行登记目前要求 16 kHz 单声道 PCM16 WAV,并包含足够时长的语音;格式不符时需先转换。

边界与隐私

声纹 ID 用于转写标注,不能当作门禁、登录或法律意义上的身份核验。

OpenASR 无需账号,无遥测,无中央云转写后端。常规转写不会静默自动下载模型;音频默认留在本机。

常见问题

声纹 ID 和说话人分离有什么区别?

说话人分离把音频按不同人切开并标成匿名标签;声纹 ID 在此基础上,把匹配到的人显示为你登记过的姓名。桌面内置 MOSS 负责分离,声纹 ID 负责命名。

登记需要多长的音频?

大约十秒清晰语音通常就够。桌面支持 mp3、m4a、aac、wav 等常见格式。命令行登记路径要求 16 kHz 单声道 PCM16 WAV,并包含足够时长的语音。

声纹会不会上传到云端?

默认不会。登记与匹配在本机完成。OpenASR 不提供中央云转写后端,也没有遥测。只有你主动选择会联网的路径(例如确认下载模型)时才会访问网络。

是不是所有模型都支持声纹 ID?

不是。支持声纹 ID 的模型会在应用市场里标出。请先选带标记的模型,再登记需要点名的人。

声纹 ID 能当身份认证用吗?

不能。它是转写里的说话人标注便利功能,用来让稿子更好读,不用于身份核验、门禁或法律取证。

没有桌面应用也能用吗?

可以。开源内核提供 CLI 的 --diarize、speaker enroll,以及服务端 /v1/speakers API。桌面应用目前提供 macOS 与 Windows 版本,没有原生 Linux 桌面应用;Linux 可用 CLI 或自行部署服务端。