Gemini Enterprise Agent Platform重要能力增强2026-06-17
Gemini 3.1 Flash TTS 模型支持流式语音生成
Gemini 3.1 Flash TTS Model Gains Streaming Speech Generation Support
EVENT SUMMARY
事件摘要
Google 宣布 gemini-3.1-flash-tts-preview 模型现已支持流式语音生成输出。开发者可通过 streamGenerateContent 方法以及 Interactions API 中的 stream: true 参数实现流式 TTS 调用。该能力显著降低语音生成的端到端延迟,对实时语音助手、对话式 AI 和直播等需要低延迟语音输出的场景具有直接影响。此举增强了 Gemini API 在语音合成领域的竞争力,但流式 TTS 的具体延迟指标、并发限制及首次字节时间(TTFB)等性能数据尚未披露。
ANALYST VIEW
中立分析
为什么重要
流式 TTS 能力使语音生成延迟显著降低,对实时语音助手、对话式 AI 和直播场景竞争力产生直接影响。其他平台若未提供类似能力将被拉开体验差距。
影响对象
影响使用 Gemini API 进行语音合成的开发者,尤其是需要低延迟、实时语音输出的对话式应用和语音助手产品。
证据说明
来源直接证明了该模型已支持流式生成,并提供了两个 API 入口点(streamGenerateContent 和 Interactions API stream: true)。
不确定性
尚不清楚流式 TTS 的延迟指标、并发限制以及首次字节时间(TTFB)等性能数据。
SOURCES