产品发布
OpenASR Desktop 0.1.21:声纹 ID
为常用说话人登记声纹,转写结果可以直接标出是谁在说。配合内置的 MOSS 说话人分离,多人会议与访谈不仅能分开,还能对上真实姓名。全程本地完成。

Desktop 0.1.21 上线声纹 ID。录一段短音频完成登记,MOSS 负责把人分开,声纹负责写上名字。音频默认留在本机。
OpenASR Desktop 0.1.21 现已发布。这一版的重点是声纹 ID:登记一次声纹,转写结果就能标出具体是谁在说话——不只是「又换了一个人」。
它和应用里已有的 MOSS 说话人分离一起用。多人录音不再是一堵字墙,而是一段能顺着读下去的对话。
声纹 ID
会议、访谈、长通话有一个共同的问题。「说话人 1」「说话人 2」能把轮次分开,却说不出这两个人是谁。声纹 ID 补上这一环。
用一段对方的短音频完成登记——大约十秒,系统通常会自动结束。常见格式都能用:mp3、m4a、aac,不限于 wav。登记不成功时会给出明确原因,而不是默默失败。名字之后还能改,第一次随便起一个也没关系。
模型市场里,支持声纹 ID 的模型会带上对应标签。选一个支持的模型,把常打交道的人登记好,下一次转写就可以带上他们的名字。
谁说了什么
另一半是说话人分离。转写文件时,MOSS 会标出谁在说话;即使还没登记任何人,会议或访谈里的轮次也能分开。
加上声纹 ID 之后,长录音里同一人跨片段会尽量保持同一个名字——不会每次又冒出新的「说话人 3」。分离让对话读得懂,登记让名字对得上。默认都在本机完成。除非你主动选择会离开设备的路径,音频不会离开这台电脑。
0.1.21 还有这些
- 听写——连按,或松开再按,不再误报忙碌,也不再丢音频。
- 更多音频格式——包括 ADPCM wav。文件大到内存装不下时,会提前拒绝,并给出容量说明(在 Apple 芯片上会把 swap 算进去)。
- 升级保留原有设置——已安装的模型会保留;启动更稳;默认 CUDA 覆盖更广,包括 Turing 一代显卡。
- 模型市场新增——Fun-ASR-Nano,以及 Granite Speech 4.1 2B。
Desktop 0.1.21 搭载引擎 0.1.27。
下载
请前往下载页获取 OpenASR Desktop,也可以直接使用:
底层语音引擎是 Apache-2.0 开源内核。可以读源码、用命令行跑,也可以直接打开应用开始用。