信号图谱
Gemini Enterprise Agent Platform重要能力增强2026-06-17

Gemini 3.1 Flash TTS 模型支持流式语音生成

Gemini 3.1 Flash TTS Model Gains Streaming Speech Generation Support

EVENT SUMMARY

事件摘要

Google 宣布 gemini-3.1-flash-tts-preview 模型现已支持流式语音生成输出。开发者可通过 streamGenerateContent 方法以及 Interactions API 中的 stream: true 参数实现流式 TTS 调用。该能力显著降低语音生成的端到端延迟,对实时语音助手、对话式 AI 和直播等需要低延迟语音输出的场景具有直接影响。此举增强了 Gemini API 在语音合成领域的竞争力,但流式 TTS 的具体延迟指标、并发限制及首次字节时间(TTFB)等性能数据尚未披露。

ANALYST VIEW

中立分析

为什么重要

流式 TTS 能力使语音生成延迟显著降低,对实时语音助手、对话式 AI 和直播场景竞争力产生直接影响。其他平台若未提供类似能力将被拉开体验差距。

影响对象

影响使用 Gemini API 进行语音合成的开发者,尤其是需要低延迟、实时语音输出的对话式应用和语音助手产品。

证据说明

来源直接证明了该模型已支持流式生成,并提供了两个 API 入口点(streamGenerateContent 和 Interactions API stream: true)。

不确定性

尚不清楚流式 TTS 的延迟指标、并发限制以及首次字节时间(TTFB)等性能数据。

SOURCES

来源