果核Pulse
AI语音识别

苹果给Mac加了个离线转录引擎,比付费服务更准更快

mjtsai.com

用户为Otter.ai每年支付约100美元订阅费,最终取消了这笔开销。原因是Mac上出现了更好的替代方案:MacWhisper,一款基于OpenAI Whisper技术的离线转录工具。免费模型已能满足日常需求,升级到大模型则更精良。转录准确性超过了此前用过的Rev.com和Otter.ai。

Whisper还有一个优势:几乎支持所有语言,而Otter只处理英语。对需要转写外语会议或播客的用户,这个差异很关键。

另一款Mac工具Audio Hijack直接利用了Whisper框架,可以在录音的同时生成文字转录。过去完成这个流程需要多个工具并来回调试,现在只需拖一个模块到工作流即可。如果录了多个音频源,它还能分别标记每个来源——不过,同一个输入中的多个说话人(比如Zoom通话的另一端),它无法区分。

Apple自己拿出了更强的方案。名为SpeechAnalyzer的设备端语音引擎,在测试中击败了所有Whisper模型(包括Whisper Small),是当前最准确的离线方案。数据对比很清楚:在干净语音上,词错误率从9.02%降至2.12%;在嘈杂语音上,从16.25%降至4.56%。同一段一分钟的录音,错误减少了四分之三。

速度上,SpeechAnalyzer比Whisper Small快约三倍。所有五个引擎在M2 Pro芯片上都远远快于实时播放速度——以12倍到40倍的速度运行,一小时音频只需1.5到5分钟就能转完。而且SpeechAnalyzer输出的是带标点和大小的文本,旧引擎的产出则比较粗糙。

综合来看,苹果的新引擎既快又准,还完全在设备端运行。对用户来说,隐私性更强——录音和转录都不需要上传到云端。

SpeechAnalyzer提供了一个叫fastResults的选项,降低功耗换取更低延迟,适合需要快速预览的场景。开发者在笔记应用中嵌入录音功能时,录音容器必须使用PCM in CAF格式,不能用m4a或AAC-in-CAF,否则重要录音可能丢失。对用户来说,一场会议记录丢了是最糟糕的事。另外,AVAudioEngine的inputNode会静默忽略用户选择的设备,可能录到错误的声音来源。

还有一个限制:Foundation Models的token上限是4096,不足以支持设备端的长文本摘要。所以目前还不能完全离线完成会议自动摘要。

Mac上的语音转文字,从付费在线服务到免费离线方案,再到苹果原生引擎,这一轮变化已经让用户有了完全不同的选择。

相关话题 # 语音识别
原文来源 mjtsai.com

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部