果核Pulse
AI产品发布语音技术

Meta发布实时转写模型,边说边出字还能分谁在说

Meta发布实时转写模型,边说边出字还能分谁在说

Meta发布了Muse Voice Transcribe,这是它的首个实时音频感知模型。过去的语音转写大多是录完再处理,这个模型在说话的同时出字。流式语音识别、说话人分离、端点检测被做进了一个流程里,省掉了单独的后处理步骤。

它能实时转写,能把录音里20多个说话人分开,还能判断一句话什么时候说完。转写结果分得清谁讲了什么,会议录音不会混成一团。

Mac上已经能用。Meta AI的macOS应用上线了这个功能,这个应用最近还拿到了有限的CarPlay支持。另一款产品Muse Code也集成了同样的听写。在Mac上按住Fn键,就能在任何应用里听写——系统级的入口,不限于Meta自己的软件。

模型在70多种语言上训练,发布时验证了25种。音频超过一小时也能处理,还支持句内或句间的代码切换——一句话中间可以换语言。语言、关键词和上下文偏置还能提高识别率。相当于用户可以告诉模型:这个词更可能被说到。

速度与准确度之间,Meta没有选一个固定折中。模型根据语音难度决定听多久再输出每个词,Meta管这叫“自适应延迟”。简单的话出字快,难的话多听一会儿。按照Meta的说法,截至9月1日,它在Artificial Analysis的流式语音转文字排行榜上排名第一。

开发者现在可以通过Meta Model API把转录接进自己的应用。价格是每1000音频分钟3美元,也就是一小时0.18美元。

Meta没有公布25种验证语言的具体名单,中文在不在里面,目前不清楚。API定价是否覆盖所有语言,也没有说明。这些细节决定了它离中文用户有多远。

相关话题 # 产品发布
原文来源 9to5Mac

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部