果核Pulse
AI语音开发谷歌

Google新语音模型边对话边执行操作,支持97种语言

Google新语音模型边对话边执行操作,支持97种语言

Google 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。两款模型都面向实时语音场景,已接入 Gemini API 和 Google AI Studio。开发者可以去 ai.studio/live 试用,也能克隆 GitHub 示例应用。还可以通过 live api skill 接入。

Gemini 3.8 Live 是原生语音到语音模型。它能在保持对话的同时,在后台执行函数调用、调用 API 或查询工具。音频响应会继续流回给你。你让它调用某个工具时,不用等它处理完一整轮才能说下一句。它还能基于实时视觉输入对话,把看到的画面纳入上下文。

它支持字母数字精确解析,能处理确认码、索赔号、技术数据。增量内容更新则把实时音频和结构化数据拼在一起返回。

复杂请求交给 Gemini 3.8 Live Extended Thinking。它在 Artificial Analysis 的语音到语音排行榜上排第一。它支持可配置思考:多步推理放在后台,主对话里继续回应或叙述进度。

Gemini 3.8 Live 支持 97 种以上语言,并保持口音一致。

配套的 Gemini 3.5 Transcribe 是专门的语音转文字模型。它支持 85 种以上语言,流式模式下平均词错误率 4.0%,非流式 2.6%。它适合亚秒级字幕、呼叫中心代理和实时音频分析这类无状态任务。它还能自动处理句内和句间代码切换,最多可传入 1000 个术语的自定义词汇表。智能转录模式会去掉填充词和自我纠正,输出更干净的文本。通过 Interactions API,它能转录最长 1 小时的音频文件,并给出时间戳和说话人标签。

定价通过 Live API:音频输入每分钟 0.005 美元,音频输出每分钟 0.018 美元。

开发者也能通过 Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel 和 Vision Agents 接入。

同系列还有几个音频模型。Gemini 3.5 Live Translate 支持 70 多种语言的语音到语音翻译。Gemini 3.1 Flash TTS 用于可配置语音生成。Lyria 3.5 用于音乐生成。

不过还有几个细节没明说:视觉上下文具体支持哪些输入源,Extended Thinking 的思考深度怎么配置,97 种语言和 85 种转录语言具体包含哪些,以及这些模型何时会进入 Google 的消费级产品。

相关话题 # 谷歌
原文来源 @GoogleAIStudio on 𝕏

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部