信号图谱
Gemini Enterprise Agent Platform重要新发布4 个来源2026-08-15 → 2026-08-15

Google 发布 Gemini 3.1/3.5 系列多模态 Preview 模型,覆盖语音、翻译与图像生成

Google Releases Gemini 3.1/3.5 Multimodal Preview Models Covering Audio, Translation, and Image Generation

EVENT SUMMARY

事件摘要

2026年8月15日,Google 在 Gemini Enterprise Agent Platform 上同步发布多款多模态 Preview 模型,全面扩展语音、翻译与图像生成能力。Gemini 3.1 Flash Image(代号 Nano Banana 2)及其 Lite 版引入原生图像生成并采用按 token 计费模式,标准输出 $60/百万 token(约 $0.067/张),Lite 版 $30/百万 token,Batch 模式再享五折,挑战传统按张计费的图像 API 模式。Gemini 3.1 Flash Live Preview 是低延迟音频对话模型,首次在付费层支持 Google Search Grounding,音频输入定价 $3.00/百万 token。Gemini 3.1 Flash TTS Preview 提供可控语音生成,标准输出 $20/百万音频 token(25 token/秒),Batch 模式 $10。Gemini 3.5 Live Translate Preview 支持 70+ 语言的实时语音翻译,输入 $3.50/百万 token、输出 $21.00/百万 token。此次发布将语音交互、语音合成、实时翻译与图像生成统一纳入 token 计费体系,完善了语音 Agent 工具链,但所有模型均处于 Preview 状态,存在速率限制与稳定性风险,尚未适合大规模生产部署。

ANALYST VIEW

中立分析

为什么重要

此次集中发布标志着 Google 在多模态 AI 基础设施上采取全栈推进策略,将语音、翻译、图像生成统一纳入 token 计费体系,降低了多模态应用的成本可预测性与集成复杂度。按 token 计费的图像生成模式对传统按张计费的竞品(如 DALL·E、Midjourney API)构成定价模式挑战。但 Preview 状态限制了短期市场冲击力,实际商用影响需等待 GA 版本。

影响对象

语音助手与 Agent 开发者可获得更完整的工具链(实时检索+语音合成+翻译+图像生成),适合原型验证与小规模试点。跨境客服、会议同传、大规模素材生产等场景有了新选项。但生产环境用户需评估 Preview 模型的稳定性风险、速率限制及 Grounding 延迟影响,暂不宜直接替代成熟服务。

证据说明

四条 source 均来自同一平台同日更新,明确标注各模型的 Preview 状态、详细定价(含 token 与分钟双维度换算)、Batch 折扣比例及功能边界。id=337 提供了图像分辨率与 token 消耗的对应表;id=340 明确标注 Grounding 支持状态;id=338 列出 25 tokens/sec 的换算基准。

不确定性

四款模型的具体 GA 时间均未公布;Gemini 3.1 Flash Image 的代号 'Nano Banana 2' 含义未解释;Live Translate 支持的 70+ 语言具体列表未提供;Search Grounding 在语音流中的延迟影响未量化;各 Preview 模型的速率限制具体阈值未说明;图像生成质量与竞品的对比数据缺失。

SOURCES

来源(4 条报道)