解决什么问题
多人录音里,仅把说话人分开还不够。匿名标签能让轮次可读,但读稿时仍要反复对照谁是谁。
声纹 ID 在分离结果之上补上姓名:同一人在长文件里再次开口时,尽量继续使用已登记的名字,而不是不断冒出新的匿名标签。
如何登记
用对方的一段短音频完成登记,大约十秒通常就够。常见格式可用:mp3、m4a、aac、wav。
登记失败时会给出明确原因,而不是静默失败。姓名可事后修改,第一次不必一次定死。
- 在模型市场选择标有声纹 ID 支持的模型
- 为需要点名的人登记短音频样本
- 转写时启用说话人分离,匹配到的片段显示姓名
与 MOSS 说话人分离的关系
MOSS 负责在转写过程中把不同说话人分开;即使尚未登记任何人,会议和访谈也能按人阅读。
声纹 ID 负责把分离结果与已登记的人对应起来。分离保证可读,登记让结果带上真实姓名。两者默认都在本机完成。
命令行与服务端路径
桌面之外,开源内核也提供说话人相关能力:CLI 可用 --diarize 做分离,用 speaker enroll 登记声纹,服务端提供 /v1/speakers API。这些路径基于 WeSpeaker 能力包。
命令行登记目前要求 16 kHz 单声道 PCM16 WAV,并包含足够时长的语音;格式不符时需先转换。
边界与隐私
声纹 ID 用于转写标注,不能当作门禁、登录或法律意义上的身份核验。
OpenASR 无需账号,无遥测,无中央云转写后端。常规转写不会静默自动下载模型;音频默认留在本机。