4
里程碑
19
重要更新
7
常规动态
Azure Content Understanding 新增同步 API、GPT-5 支持及 Agentic 工作流
Azure Content Understanding 服务迎来重大更新,推出用于实时处理的同步 API,新增对 GPT-5 模型系列的支持,并引入将非结构化企业内容转换为结构化数据的新 Agentic 工作流能力。配套发布的技术指南详细说明了如何在企业文档处理场景中选择 GPT-5 系列模型,并针对 Grounding 准确性和置信度评分进行了具体改进与校准。此次升级显著增强了企业级文档解析与数据接地能力,为构建更可靠的 Agentic 应用提供了底层支撑。
Azure AI Foundry 推出 Toolboxes 和 Routines 以规模化 Agent
微软宣布 Azure AI Foundry 推出 Toolboxes 和 Routines 新能力。Toolboxes 帮助发现、管理和保护生产级 Agent 的工具,并简化用户身份委托(如通过 Entra 保护的 MCP 服务器);Routines 将多个工具组合为可重复的工作流。此产品化方案直接影响 Agent 工具管理和编排能力。
Azure AI Foundry 增强 Agent Memory 实现从失败中学习
微软宣布 Foundry Agent Memory 增强,Agent 不仅需要记住事实,还要能应用所学来一致地遵循流程、从重复失败中恢复、更自信地完成任务,使记忆更可靠、透明且生产就绪。
Azure AI Foundry 推出 Agent Optimizer 私有预览
微软推出 Agent Optimizer(当前处于私有预览),帮助托管 Agent 弥合从部署到生产就绪的差距,解决 Agent 在生产中忘记必要步骤等可靠性问题,让 Agent 从“能用”升级到“生产就绪”。
Azure AI Foundry 发布 Managed Compute 统一托管开源模型
微软发布 Foundry Managed Compute,这是一个新的 GPU 平台即服务,用于托管开源和自定义 AI 模型。该服务使开源模型与前沿商业模型共享同一端点、SDK 和账单体系,实现多模型统一管理。
Azure Translator 在 Foundry 中扩展文档翻译能力
Azure Translator 新增文档翻译能力并在 Foundry Tools 中可用,支持图像、PDF、Office 文件、DITA、XLIFF 等格式翻译,未来将支持 LLM 驱动的文档工作流。
Azure AI Foundry 提供端到端 AI Agent 可观测性能力
微软宣布 Foundry 的端到端 Agent 可观测性能力,覆盖生产环境中的准确性、安全性和问责性,解决 Agent 行为漂移问题,为任意框架的 AI Agent 提供从可观测性到 ROI 的全链路监控。
Azure AI Foundry 推出 Foundry Local 加速边缘 AI 开发
微软推出 Foundry Local,解决边缘 AI 开发中的模型打包、运行时碎片化和硬件差异等挑战,面向需要本地控制、隐私和低延迟的应用和设备场景。
微软将 Foundry 组件定位为结果驱动的企业强化学习系统
微软发布概念性整合文章,回顾 Build 2026 发布内容(hosted agents、Toolboxes、Foundry IQ、Memory、Managed Compute 等),将其定位为结果驱动的企业强化学习系统组件。
Microsoft Foundry 2026年6月更新汇总及 Claude GA
微软发布 2026 年 6 月更新汇总,宣布 Claude 在 Foundry 正式 GA,并涵盖 autopilot agents、Toolboxes 和 Routines 扩展、Agent Optimizer 私有预览等多项 Agent 生态与运行时更新。
在 Foundry 中使用 Toolboxes 构建代表用户执行操作的 Agent
Microsoft Foundry 推出“Toolboxes”以简化 Agent 的用户委托机制,使其能够通过集成受 Entra 保护的 MCP 服务器和 Work IQ 等托管服务,在保持身份上下文的同时安全地代表用户执行操作。
GPT Realtime 2.0 概念文档发布
微软发布了 GPT Realtime 2.0(预览版)的概念文档,预示了下一代语音交互架构的重大升级。Realtime 2.0 首次将深度推理(Reasoning)能力引入实时语音流,并引入了全新的响应阶段控制机制,使 Agent 能够在对话中展现“思考”过程。此外,模型具备更严格的指令遵循能力。文档还同步介绍了专为实时多语言活动设计的新 Translate 模型,以及用于极低延迟流式转录的优化版 Whisper 模型,全面拓宽了实时语音 AI 的应用边界。
GPT-Realtime-1.5 和 GPT-Audio-1.5 模型发布
微软正式上线 gpt-realtime-1.5 与 gpt-audio-1.5 两款新一代实时语音模型。此次更新重点强化了 Voice Agent 落地所需的核心能力:大幅提升了指令遵循的精准度,确保模型在复杂对话中不偏离预设人设与规则;增强了多语言环境下的理解与生成表现;并深度优化了工具调用(Function Calling)的稳定性与响应速度。在实现上述能力跃升的同时,模型依然保持了毫秒级的超低延迟实时交互体验,为构建高拟真、强执行力的企业级语音助手奠定了坚实基础。
GPT-4o-mini 系列语音与实时模型集中更新
微软集中更新了多款 mini 语音与实时交互模型:gpt-4o-mini-transcribe 在英语基准上词错误率降低约 50%,多语言性能显著提升且静音幻觉减少 4 倍;gpt-realtime-mini 在指令遵循和函数调用方面实现了与完整版模型的功能对齐,保障了低成本下的 Agent 能力;gpt-4o-mini-tts 则树立了多语言语音合成的新标杆,语音更自然且说话人相似度更高。此次更新全面强化了轻量级模型在语音场景的实用性。
GPT-image-1.5 模型现已可用
Microsoft Azure AI Foundry 现已上线 OpenAI 最新的图像生成模型 GPT-image-1.5。相比前代产品,该模型在生成性能与图像质量上实现了显著跃升,尤其在精细化编辑控制方面表现优异。它具备极强的人脸特征保留能力,确保在多次迭代或风格化转换中人物身份的一致性;同时,在图像编辑模式下展现出极高的输入保真度,能够精准理解并执行局部重绘、背景替换等复杂指令,为广告设计、电商素材生成及数字内容创作提供了更强大的生产力工具。
PII 检测内容过滤器上线
Microsoft Azure AI Foundry 现推出内置的个人身份信息(PII)检测内容过滤器。该功能可作为平台级的安全防护层,自动识别并拦截大语言模型(LLM)输入与输出中可能包含的敏感个人数据(如身份证号、信用卡号、电话号码等)。通过将其作为原生内容安全组件提供,企业开发者无需在应用层额外集成第三方合规审查工具,即可轻松满足 GDPR、HIPAA 等严格的数据隐私合规要求,有效降低了企业级 AI 应用在生产环境中的数据泄露风险。
GPT-4o 音频转录分离模型发布
微软发布全新的 gpt-4o-transcribe-diarize 自动语音识别(ASR)模型,专为复杂多说话人场景设计。该模型不仅支持超过 100 种语言的实时高精度转录,更核心的是内置了强大的说话人分离(Diarization)能力,能够精准区分并标记不同发言者的语音片段。凭借超低延迟的流式处理性能,它能将非结构化的会议或客服录音实时转化为包含角色标签的结构化数据,为会议纪要自动生成、智能客服质检及多轮对话分析等 B2B 场景提供了关键的基础设施支撑。
Realtime API 支持 SIP 协议
Microsoft Azure AI Foundry 的 Realtime API 现已正式支持会话初始协议(SIP)。这一关键基础设施能力的补齐,使得基于 Realtime API 构建的语音 AI Agent 能够直接与企业现有的传统电话系统、呼叫中心 PBX 及 SIP 中继进行无缝对接。开发者无需编写复杂的 telephony 网关代码,即可将大模型的实时语音理解与生成能力注入到标准电话通话中,极大加速了智能语音客服、自动外呼营销及企业总机等存量话务市场的 AI 化升级进程。
GPT-5-codex 模型上线
Microsoft Azure AI Foundry 正式上线 gpt-5-codex 模型,这是专为代码生成与编程辅助场景深度优化的垂直模型。该模型专为 Codex CLI 命令行工具和 VS Code 编辑器扩展量身设计,全面面向现代编码 Agent 工作流。通过在海量高质量代码库与工程上下文上进行针对性微调,gpt-5-codex 在代码补全、跨文件重构、复杂 Bug 修复及自动化测试生成等任务上展现出超越通用大模型的卓越表现,标志着 AI 辅助编程进入专用模型驱动的新阶段。
Realtime API 音频模型正式 GA
OpenAI GPT Realtime API 及其底层 Audio 模型现已正式商用(GA),标志着语音 Agent 进入生产级阶段。此次更新带来了多项关键能力增强:显著改进的指令遵循能力使语音交互更精准;新增多款高质量音色以满足不同场景需求;原生支持图片等多模态输入,拓宽了语音 Agent 的感知边界;更重要的是,引入了异步函数调用(Function Calling)与全新的对话模式,彻底解决了语音交互中工具调用的延迟与中断问题,为复杂企业级语音应用奠定了基础。
预置吞吐量溢出功能正式 GA
Microsoft Azure AI Foundry 的预置吞吐量溢出(Spillover)功能现已正式商用(GA)。该功能允许企业在配置预置部署(Provisioned Throughput)时,自动将超出预置容量上限的超额流量无缝路由至标准的按需部署(Pay-as-you-go)环境中。这一特性有效解决了企业在面对突发流量波动时的 SLA 保障问题,避免了因吞吐量耗尽导致的服务拒绝或请求排队,帮助企业在控制固定成本的同时获得极致的弹性扩展能力。
GPT-5 系列模型上线及 Model Router 适配
Microsoft Azure AI Foundry 正式上线 GPT-5 系列模型(包含 gpt-5、mini、nano、chat 等多款变体),其中核心 gpt-5 模型已支持预置吞吐量功能。与此同时,平台的 Model Router 智能路由功能已全面适配 GPT-5 系列,能够根据每个 Prompt 的具体特征自动选择最佳底层模型。这一组合拳不仅大幅降低了企业用户的模型选型门槛,还显著提升了整体系统的吞吐效率与响应质量,标志着行业大模型推理与对话能力基线的全面重新定义。
GPT-4.1 发布,支持 100 万 Token 上下文
GPT-4.1 和 GPT-4.1-nano 现已可用,GPT-4.1 支持 100 万 Token 上下文限制。
Realtime API 预览版支持 WebRTC
Realtime API 预览版现支持 WebRTC 协议,实现浏览器原生的实时音频流与低延迟交互。
o4-mini 和 o3 推理模型发布
o4-mini 和 o3 推理模型现已在 Azure OpenAI 上线,提供更强的推理质量与性能。
Responses API 与 Computer Use 预览模型发布
新的有状态 Responses API 统一了聊天补全和助手能力,并引入 computer-use-preview 模型支持 GUI 自动化。
Stored Completions API 发布
Stored Completions 允许捕获聊天会话历史,用作评估和微调的数据集。
GPT-4.5 Preview 发布
GPT-4.5 Preview 模型现已在 Azure OpenAI 上线,擅长多种文本与图像任务。
数据区域预置部署上线
新的数据区域预置部署类型允许在微软定义的数据区域内进行预留容量与动态路由,兼顾高吞吐与合规。
偏好微调(DPO)预览版上线
直接偏好优化(DPO)现已对 gpt-4o-2024-08-06 开放公测,提供比 RLHF 更轻量的对齐技术。