信号图谱
Gemini Enterprise Agent Platform重要新发布2026-06-15

Gemini 3.5 Flash 强化学习微调进入 Public Preview

Gemini 3.5 Flash Reinforcement Learning Fine-Tuning in Public Preview

推理效果提升

EVENT SUMMARY

事件摘要

Google Cloud 宣布强化学习(RL)微调现已可用于 gemini-3.5-flash 模型(Preview 阶段)。模型微调限制在 us-central1 和 europe-west4 区域,服务限制在 us 和 eu 多区域端点。RL 微调能力的开放使 Google 在模型定制化方法上从 SFT 扩展到 RL,与 OpenAI 和 Anthropic 的微调路线形成差异化竞争。该功能面向需要在特定任务上通过强化学习优化模型行为的高级 AI 开发者,尤其是需要模型自主决策优化的场景。RL 微调的具体定价、训练数据格式要求、收敛效率及与 SFT 微调的对比效果尚未披露。

ANALYST VIEW

中立分析

为什么重要

RL 微调能力在 Gemini 3.5 Flash 上开放,使 Google 在模型定制化方法上从 SFT 扩展到 RL,与 OpenAI 和 Anthropic 的微调路线形成差异化竞争。

影响对象

面向需要在特定任务上通过强化学习优化模型行为的高级 AI 开发者,尤其是需要模型自主决策优化的场景。

证据说明

来源为 Google Cloud 官方发布说明,明确 RL 微调状态、支持模型和区域限制。

不确定性

RL 微调的具体定价、训练数据格式要求、收敛效率、与 SFT 微调的对比效果尚未披露。

SOURCES

来源