Gemini Enterprise Agent Platform重要新发布2026-06-15
Gemini 3.5 Flash 强化学习微调进入 Public Preview
Gemini 3.5 Flash Reinforcement Learning Fine-Tuning in Public Preview
推理效果提升
EVENT SUMMARY
事件摘要
Google Cloud 宣布强化学习(RL)微调现已可用于 gemini-3.5-flash 模型(Preview 阶段)。模型微调限制在 us-central1 和 europe-west4 区域,服务限制在 us 和 eu 多区域端点。RL 微调能力的开放使 Google 在模型定制化方法上从 SFT 扩展到 RL,与 OpenAI 和 Anthropic 的微调路线形成差异化竞争。该功能面向需要在特定任务上通过强化学习优化模型行为的高级 AI 开发者,尤其是需要模型自主决策优化的场景。RL 微调的具体定价、训练数据格式要求、收敛效率及与 SFT 微调的对比效果尚未披露。
ANALYST VIEW
中立分析
为什么重要
RL 微调能力在 Gemini 3.5 Flash 上开放,使 Google 在模型定制化方法上从 SFT 扩展到 RL,与 OpenAI 和 Anthropic 的微调路线形成差异化竞争。
影响对象
面向需要在特定任务上通过强化学习优化模型行为的高级 AI 开发者,尤其是需要模型自主决策优化的场景。
证据说明
来源为 Google Cloud 官方发布说明,明确 RL 微调状态、支持模型和区域限制。
不确定性
RL 微调的具体定价、训练数据格式要求、收敛效率、与 SFT 微调的对比效果尚未披露。
SOURCES