作者:互联网 时间: 2026-08-03 16:30:56
8 月 3 日,人工智能企业 MiniMax 正式宣布开源其新一代通用视频模型
在生成规格上,H3 支持 4 到 15 秒的时长输出,并提供 24 FPS 帧率以及 32 kHz 立体声。用户不仅可以根据需求选择 21:9、16:9、4:3、1:1 等多种常见宽高比,还能通过默认将较短边设为 768 像素的常规模式进行基础创作。而借助专用的 H3-Regenerate-2K 方案,模型更能输出高达 2K 分辨率的惊艳画面。在多语言交互方面,它能够稳定支持阿拉伯语、中文、英语、法德意、日韩及西葡俄等 11 种主流语言。
为了适应多样化的创作场景,H3 推出了灵活的模型版本与丰富的输入规格。其中,H3-Base-FL2VA 首尾帧模式支持输入 0 到 2 张图像,能够自由灵活地应对文生视频、首帧生视频、尾帧生视频以及首尾帧协同生成的不同任务。而 H3-Base-Ref2VA 全模态参考模式则支持最多 9 张图像、3 段视频(总时长不超过 15 秒)以及 3 段音频的混合输入,文件总数最高可达 12 个,为专业创作者提供了前所未有的精细控制手段。
在系统架构的底层设计上,完整的 MiniMax H3 包含三个核心模块。首先是 H3-Context-IR(上下文中间表示),它能够将复杂的多元指令深度剖析并转化为模型易于理解的结构,是保障高品质输出的关键环节;其次是负责生成 768p 基础音视频的 H3-Base 模块;最后则是通过将初始结果与原始上下文回传实现 2K 超分重构的 H3-Regenerate-2K 模块。这一组合既保留了生动的细节,又极大提升了视觉的保真度。
目前,该模型已基于 MiniMax H3 Community License 正式发布,相关开发者与技术爱好者可以通过