信号图谱
MiniMax Platform里程碑新发布2026-07-31

MiniMax 发布 H3 全模态生成模型:统一理解文本、图像、视频与声音

MiniMax Launches H3 Omni-Modal Generation Model: Unified Understanding of Text, Image, Video, and Audio

推理多模态

EVENT SUMMARY

事件摘要

MiniMax 正式发布 H3,一款通用全模态生成模型。H3 支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,并能够输出具备原生双声道的音视频内容,最高支持 15 秒 2K 分辨率视频生成。该模型将文本、图像、视频、音频统一在单一模型架构中,对标 OpenAI GPT-4o 和 Google Gemini 等全模态模型,标志着全模态生成赛道竞争进一步加剧。H3 面向 AI 内容创作者、视频制作者和多模态应用开发者,提供一站式多模态内容生成能力。

ANALYST VIEW

中立分析

为什么重要

全模态生成模型成为行业新前沿,H3 将文本、图像、视频、音频统一在单一模型中,直接对标 OpenAI GPT-4o 和 Google Gemini,推动全模态生成赛道竞争加剧。

影响对象

面向 AI 内容创作者、视频制作者和多模态应用开发者,提供一站式多模态内容生成能力。

证据说明

来源为 MiniMax 官方博客,直接证明了 H3 的发布及其全模态理解与生成能力、原生双声道和 15 秒 2K 规格。

不确定性

未披露模型参数规模、推理延迟、API 定价、是否开源或开放权重,以及具体可用日期。

SOURCES

来源