MiniMax H3 多模态视频生成
使用 MiniMax H3 更灵活地控制镜头
MiniMax H3 是一款面向视频创作与编辑的开放通用多模态模型。它能将提示词与图片、视频和音频参考结合,通过首尾帧保持视觉方向,并输出 2K 视频,让 5–15 秒的镜头拥有完整的起承转合。
一个多模态模型,多种创作方式
你可以从文本、首帧、首尾帧组合或一组视听参考开始。MiniMax H3 既能生成新镜头、延展视觉创意,也能编辑已有视频,同时兼顾主体、运动与氛围。
查看 MiniMax H3 官方文档用丰富的参考素材掌控镜头
用首尾帧定义视觉变化;使用参考模式时,单类素材上限为 9 张图片、3 段视频和 3 段音频,但全部参考文件合计不得超过 12 个。MiniMax H3 会综合理解这些信息,让角色一致性、镜头语言、节奏和情绪彼此呼应。
适应不同起点的生成方式
无论你只有一句创意,还是已有需要定向修改的完整视频,MiniMax H3 都能接续现有素材进入创作。
从文本提示词开始,自由探索全新的场景、动作、镜头运动与视觉风格。
用首帧锁定构图,用尾帧明确结局,或同时使用两者,引导更有意图的画面过渡。
将图片、视频和音频参考融入同一份创作说明,或在保留核心创意方向的前提下编辑已有视频。
实用的 MiniMax H3 工作流
清晰的创作说明能让模型把多模态信息转化为连贯运动。先确定最关键的参考素材,再只补充真正有助于镜头的信号。
- 1根据目标素材选择文生视频、帧引导生成、参考生成或视频编辑。
- 2描述一个清晰的主体动作、镜头运动、光线、氛围,以及镜头最终如何收住。
- 3设置 5–15 秒时长并生成镜头,之后每轮只调整一个变量,让每次迭代都有明确目标。
MiniMax H3 适合哪些场景
- 把产品静态图制作成简短揭晓、旋转细节与落地页动态素材。
- 让角色图或人像变成镜头运动明确、可控的微场景。
- 在投入更长制作流程前,快速验证社交视频和营销创意。
如何编写有效的 MiniMax H3 提示词
把提示词当作精简的导演说明。参考素材负责身份与质感,文字则应明确动作、镜头、节奏和结尾。
主体动作
为主体安排一个清晰可读、能在所选 5–15 秒镜头内发展并完成的动作。
镜头方向
明确指定缓慢推进、环绕、跟拍、俯仰或固定机位等运动。
视觉连续性
说明光线、氛围、背景运动和结尾效果,同时保留参考图片的主体身份。
为 MiniMax H3 组合一套重点明确的参考素材
参考素材并非越多越好。选择能明确构图、主体身份、动作、声音和结尾的最小组合,再用提示词消除剩余歧义。
从最少输入开始
从零探索概念时,只用文本即可。若构图或角色外观很重要,再加入首帧;只有当最终姿态、取景或转场必须落在指定位置时,才加入尾帧。
让每份参考素材各司其职
上传前,先在创作说明中写清每张图片、每段视频或音频的用途。参考素材须在支持范围内:最多 9 张图片、3 段视频、3 段音频,合计不超过 12 个文件;音频不能作为唯一输入。
准备清晰的源素材
裁剪静态图,突出需要保留的主体;截取参考视频中真正关键的动作;选择能体现目标节奏或氛围的音频片段。避免相互冲突的叠加元素或无关主体争夺注意力。
检查完整镜头
检查主体是否仍可辨认、动作能否在所选时长内完成,以及运镜是否遵循提示词。若某部分偏离预期,下一轮只修改对应指令或参考素材,以便判断是哪一条信号改善了结果。
每轮只设一个评估目标
把技术达标与创意判断分开。先确认成片是否遵循所选时长、取景和各参考素材的用途,再按创作说明检查主体身份、运动轨迹、节奏、光线、背景变化、声音与结尾。尝试其他版本前,保存效果最佳的提示词和参考素材组合,避免在迭代中丢失有效设置。
MiniMax H3 常见问题
MiniMax H3 是什么?
MiniMax H3 是 MiniMax 推出的开放通用多模态视频模型,可结合文本、图片、视频和音频信息完成视频生成与编辑。
可以使用哪些参考素材?
你可以使用首帧、尾帧或多模态参考来引导镜头。参考模式最多接收 9 张图片、3 段视频和 3 段音频,总数不超过 12 个文件;音频不能作为唯一输入。
MiniMax H3 支持什么分辨率和时长?
V2 API 的 MiniMax H3 支持 2K 输出与 5–15 秒整数时长,可接收文本、首帧和/或尾帧图片,也可使用参考图片、视频与音频。参考模式最多支持 9 张图片、3 段视频和 3 段音频,总文件数不超过 12;音频不能单独提交。
MiniMax H3 可以编辑已有视频吗?
可以。MiniMax H3 不仅能生成新镜头,也能编辑已有视频,并结合文本、图片、视频和音频参考传达需要保留的创作方向。