来源:MiniMax 官方飞书文档(2026-08-04 更新) | 整理:2026-08-07 原文:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh 体验:MiniMax Hub(桌面端免费 3 次)/ 海螺 AI 体验中心 / 开放平台 API
第01章一、模型定位
- H3 = 新一代开放通用多模态视频模型:从“特化任务模型”迈向“通用多模态智能”
- 不以图片/视频/声音的生成、编辑、参考等单一任务为边界,而是面向文本+图像+视频+声音共同构成的多模态上下文,统一理解创作意图
- 持续更新中(8/4 新增 1.2 goodcase、1.3 MG动画、1.6 goodcase)
第02章二、模型功能信息(核心参数)
| 项目 | 参数 |
|---|---|
| 输出帧率 | 24 FPS |
| 输出声音 | 所有结果全部带声音输出,原生双声道 |
| 首/尾帧入口 | 图片 0/1/2 张;宽高范围 [256, 5760];宽高比 5:2~2:5;无图片输入=文生视频模式 |
| 全能参考入口 | 图片 ≤9 张(宽高[256,5760]);视频 ≤3 段(单段[2,15]s,总≤15s,宽高[256,5760],宽高比 5:2~2:5);音频 ≤3 段(须配图片/视频输入,不能单独输入,单段[2,15]s,总≤15s);混合输入总上限 12 个文件;无输入=文生视频 |
| 输入格式 | 视频:H.264/AVC、H.265/HEVC;视频内音频:AAC、MP3;图片:JPG/JPEG/PNG/WEBP/HEIC/HEIF;音频:WAV/MP3 |
| 大小限制 | 视频单个 50MB;图片单个 30MB;音频单个 15MB(限制在单个素材,不限制总数);API 请求体 64MB(推荐 url 传入素材) |
| 提示词字数上限 | 不超过 7000 字符 |
| 语言支持 | 多语言提示词输入输出;TTS 精准覆盖 11 种语言(中/英/日/韩/法/德/西等),可衍生 40+ 语言 |
三大能力阐释:
| 能力 | 阐释 |
|---|---|
| 原生多模态理解与生成 | 支持文字/图片/音频/视频多种输入,理解人物、动作、声音、情绪、镜头、风格与表达意图,自然融合多种参考信息,完成从素材理解到完整视听内容生成的一体化创作 |
| 多模态精准编辑与控制 | 支持对人物、物体、场景、声音与节奏多维度编辑,精细化指令遵循;可在已有内容上持续修改迭代 |
| 商用级多场景内容生成 | 面向影视/广告/品牌/电商/游戏等真实商业场景;兼顾字幕、品牌信息、创意特效、产品展示、UI/UX 动态演示、游戏视觉与风格化表达 |
第03章三、模型亮点能力& 示例
1. 商用级多场景内容生成(8 大场景)
| 场景 | 说明 | 代表案例提示词 |
|---|---|---|
| 1.1 品牌大片与影视 | 电影级预告、品牌广告 | ①望远镜窥视装置(4图连续关键帧+rack focus+转场+双圆镜片遮罩+红字淡入淡出+Wes Anderson 35mm胶片质感+禁止新增元素) ②太空歌剧院线预告(硬切+宽字距标题+克制发光+黑场闪现) ③科幻悬疑(SHOT 1超广角+THE STARS WERE LISTENING标题+Audio音效标注+Hard cut) ④时尚campaign(16:9+氛围/包袋/人物/logo四资产+冷感克制+荒漠公路故事线) |
| 1.2 视觉创意与包装 | 实拍+动画混合 | ①傍晚小厨房+手绘发光动画(智能手机拍摄质感:手抖/对焦犹豫/逆光曝光波动+禁止恐怖元素+声音清单) ②深夜洗衣店(荧光灯频闪+手持纪实感) ③dark-pop/cyber-grunge MV(90s zine拼贴美学:粗颗粒/半色调网点/印刷毛边/硬切) |
| 1.3 动态图形/MG动画/AE特效 | 图形动效、文字动画 | ①绿幕替换(去绿幕+换童话背景+光线匹配) ②TouchDesigner式动态追踪图形(严格保持原视频+矩形框规则:透明度0%/红青双色/闭合矩形/不嵌套) |
| 1.4 AI 剧情创作 | 短剧、漫剧、角色演绎、AI配音 | ①古装武侠悬疑短剧(16:9电影画幅+冷蓝墨绿雪夜竹林+浅景深+正反打+禁字幕/现代元素) ②家庭争吵竖屏短剧(9:16+真实短剧表演+角色语气标注+情绪升级) ③海外吸血鬼爱情短剧(ReelShort/DramaBox感+15秒钩子+禁血腥/万圣节感) |
| 1.5 产品与电商营销 | —(官方文档本节内容未渲染) | — |
| 1.6 数字体验与游戏 | 游戏UI、网页UI、交互演示 | ①赛博朋克游戏UI(角色/UI双参考+时间戳分镜[0-2s][2-4s][4-7s][7-8.5s][8.5-10s][10-15s]+UI元素英文标注) ②产品官网落地页(粗犷无衬线字体+速度感动态光影+悬停放大反转) ③汽车网站UI(标题下滑+文字上划+车灯由暗变红) |
| 1.7 硬件/实体工业/具身智能 | 机器臂操作演示 | ①机器臂下降抓起红色方块移动放下 ②桌面替换为标准办公室工位+背景整体替换 |
| 1.8 动画与风格化影像 | 游戏CG、角色PV、动漫PV、二次元 | ①黏土动画狐狸飞跃熔岩峡谷(慢动作+大动态运镜) ②国风仙侠 3D(4K 16:9+固定人物参考+分镜节奏参考+露脸只能近景特写/远景只能背影) ③乙游男主 PV(严格角色身份参考:脸/发型/体型/服装/材质/乙游CG质感) |
2. 原生多模态理解与生成
- 2.1 多素材联合参考:文字、图片、音频与视频自由组合
- 参考剪辑:图1-6,严格参考示例视频视频1的镜头节奏、转场风格及音乐
- Minecraft 化:保持真实世界风格,仅将树木、轿车转化为 3D 像素/体素积木(Minecraft style),像素化运动轨迹正常,保留真实阴影和透射光
- 动作模仿(DIY表情包):三个西装男替换为三只写实水豚,严格遵循运动轨迹(趴地→跳跃→翻滚→堆叠金字塔)
- 2.2 角色、动作与镜头参考:参考主角形象、人物动作、镜头运动与画面构图;音色迁移与克隆;氛围与剪辑理解(视觉风格/叙事节奏/声音氛围/整体剪辑感)
- 2.3 音色克隆与迁移:
角色说话:Follow the wind, live free. Leave worries behind, enjoy the moment,音色参考音频1
🌍 语言支持:多语言提示词输入输出;TTS 精准覆盖 11 种语言(中/英/日/韩/法/德/西等),可衍生探索 40+ 语言(阿/泰/印尼/印地等)
3. 全能精准编辑与修改
| 维度 | 说明 | 案例 |
|---|---|---|
| 3.1 角色与物体编辑 | 替换/删除/增加人物物体 | ①角色替换+动作参考(街舞) ②增加人物(画面左边增加一个穿着相同团队制服的人,动作与旁人保持一致) ③精准换人换衣(视频1中最后面的小孩换成图1中的金毛狗,最左边小孩的卡其色外套改成图2中的牛仔外套) ④角色替换(男子靠近猫轻吻猫) |
| 3.2 场景与视觉效果 | 替换背景、调整光影、增改特效 | ①绿幕→童话背景(背景元素完全匹配人物动作+光线匹配) ②改光影(参考视频,改变光照,改成夜晚) ③实拍景色替换(视频1窗外的场景改成图1) |
| 3.3 声音/台词/音色 | 替换台词、迁移音色、调整人声 | 台词替换:将视频1女生说的话:“我们之间不可能在一起的,不是不爱,是我们真的走不到最后的”。改成音频1的台词:“别走了,好吗?这一次,我们不要放开彼此”,并略微调整对应的表演 |
| 3.4 高精度指令遵循 | 局部修改+未编辑内容稳定 | — |
第04章三、提示词方法论
1.1 整体公式
完整提示词 = 参考素材说明 + 核心创意 + 画面过程说明1.2 四个要素如何描述
(1) 参考素材说明(告诉 H3 每个素材干什么用):
- 写清素材编号:按上传顺序,如 @图片1、@音频2、@视频3
- 写清每个素材的用途:
- 人物参考(锁定脸/形象)| 物体参考(锁定物体)| 场景参考(锁定场景)
- 关键帧(锁定帧,首帧尾帧需求明确提出)| 音色参考(锁定音色)
- 故事版(根据故事版分镜生成镜头内容)| 风格参考 | 构图参考
- 音频复用(音频直接复用)| 音频部分复用(某个声音轨道/时间段部分复用)
- 动作参考(锁定动作)| 运镜参考(锁定运镜)| 视频编辑(增删改)
- 没有上传素材时整段跳过
- 示例:
@图片1 提供了xx角色的形象(如果有多个角色,需要能指代清楚),@视频2提供了动作参考 - 想保持的特征要明确写出来(一致性更好)
- 音频复刻/部分复刻时,若要求人声对白/歌词保持,强烈建议补充具体歌词文本:
比如@音频1 作为目标视频的音频复刻素材,具体歌词是:“ABCDEFGHIJKLMN”
(2) 核心创意 + (3) 画面过程说明:按镜头拆解(见下)
1.3 镜头怎么拆
- 台词与 shot 长度匹配:台词长短和画面变化内容要合乎每个 shot 的长短逻辑,不要出现 3s shot 说一大段话
- J-cut / L-cut:H3 能响应跨 shot 的台词,明确写出一句台词跨了哪些 shot 即可
- 画内/画外说话人:
- 画面内说话 → 写清楚是哪个角色说的
- 画面外说话 → 写清楚是画外说话人
- 画内外因切镜转化 → 明确写出来。复杂例子:一个画外音响起说:Wake up Wake up。之后切镜到一个中年妇女的近景,她是画外音的主人,她继续说道:It's time to go to school!
- 切镜一致性保持:切镜时明确写出切镜到什么景别、具体主体是之前的哪个角色
1.4 三类模式生视频,提示词分别怎么写
| 模式 | 写法要点 | 示例 |
|---|---|---|
| 多模态参考(上传多素材融合) | 人物图+动作视频+场景图+音乐,每个素材写清角色:@图片1→人物参考(锁脸)、@视频1→动作参考(锁动作)、@音频1→节奏/情绪参考 | @图片1 是人物参考(锁这位女子的脸),@视频1 是动作参考(用里面的舞剑动作),@音频1 是情绪参考(古风配乐)。让这位女子在樱花庭院里按视频里的动作舞剑 |
| 图生视频(上传图片) | 只传 1 张:说清是首帧还是尾帧;传 2 张(首+尾帧):H3 不自动加切镜,只补两帧之间的动作、光影、声音 | @图片1 是首帧参考图:女子持剑站在樱花树下。让她从持剑起势到舞剑完毕,自然衔接,不要切镜 |
| 纯文字生成 | 文字描述要更具体(主体外观、场景细节、动作描述都要写清) | — |
1.5 容易踩的坑
⚠️ 官方文档本节正文未渲染完整,以下干货来自官方评论区回复(8/3-8/6):
防“人物念无意义台词”(官方回复用户):
- 明确写正向约束:
人物全程保持安静,嘴巴自然闭合,没有说话或对话,面部只有轻微自然表情 - 负向约束补充:
无对白、无人声、无念白、无口型变化、无自言自语 - 避免“对着镜头、交谈、讲述、激动表达、嘴唇微动”等易触发说话的描述;少用引号和台词格式
- 给人物安排持续明确的动作(专注观察、低头阅读、转身行走);“站着看镜头”最易自行补出讲话
- 特写不稳定 → 改侧脸、背影或中远景;不需要声音可关闭音频生成或后期静音
音效/音乐时间控制(官方推荐写法):
- 音效:在 integrated_multimodal_description 的对应动作旁写一次,再在 overall_soundscape 中按事件顺序复述
- 配乐:写在 non_diegetic_music,用“某事件之前无音乐—事件发生时进入—某事件后完全停止”
- 音量:用相对混音描述,不要写百分比或 dB
官方数字人唱歌测试提示词(用户问“不能做数字人唱歌”):
女歌手微微前倾靠近复古银色麦克风,眼神半垂,嘴角带着一丝笑意,轻声吟唱 neo soul 歌曲 “Baby, slow down, let the night hold us close. Your love hums soft, like honey on my soul. Stay right here, let the world fade to gold.”。双手在 Rhodes 电钢琴键上缓慢滑动,肩膀随慢拍轻轻摇摆。唱到 “honey on my soul” 时头微微一偏,闭眼陶醉,尾音拖长。暖橘色舞台灯打在脸上,背景贝斯手和鼓手轻轻伴奏,虚焦。
已知限制(用户反馈+官方回应):
- 视频扩图+字幕消除:不支持
- 首尾帧相同无法实现严格循环
- 替换视频人物时全视频一致性仍不稳(反馈中)
2. 特定风格提示词示意 / 3. 撰写提示词的最佳方式
⚠️ 官方文档这两节正文未渲染完整(文档持续更新中)
第05章四、开源用户参考(官方提供)
- 视频提示词写作指南:https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md
- 全参考模式输出指南:https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md
- 中文版:《MiniMax H3 - 视频扩写 Prompt 写作全能指南》
第06章五、案例速查表(官方 goodcase)
| # | 案例 | 场景 |
|---|---|---|
| 1 | 望远镜窥视 MINIMAX 装置 | 品牌大片/多图关键帧 |
| 2 | 太空歌剧院线预告 | 电影预告/标题包装 |
| 3 | THE STARS WERE LISTENING | 科幻悬疑/Audio标注 |
| 4 | 时尚品牌 campaign(荒漠公路) | 商业广告/资产参考 |
| 5 | 傍晚小厨房手绘发光动画 | 视觉创意/实拍混合 |
| 6 | 深夜洗衣店手绘动画 | 视觉创意/手持纪实 |
| 7 | dark-pop MV(90s zine 美学) | MV/拼贴风格 |
| 8 | 绿幕→童话背景 | 动态图形/背景替换 |
| 9 | TouchDesigner 追踪图形 | MG动画/规则遵循 |
| 10 | 古装武侠悬疑短剧 | AI 剧情/电影质感 |
| 11 | 家庭争吵竖屏短剧 | AI 剧情/短剧表演 |
| 12 | 吸血鬼爱情短剧(ReelShort) | AI 剧情/出海 |
| 13 | 赛博朋克游戏 UI 演示 | 数字体验/UI动效 |
| 14 | 产品官网落地页 | 网页UI/滚动动效 |
| 15 | 汽车网站 UI | 网页UI |
| 16 | 机器臂抓方块 | 硬件/具身智能 |
| 17 | 工位替换 | 场景替换 |
| 18 | 黏土狐狸飞跃峡谷 | 风格化动画 |
| 19 | 国风仙侠 3D PV | 角色PV/分镜 |
| 20 | 乙游男主 PV | 二次元/角色锁定 |
| 21 | 参考剪辑(图×6+视频) | 多素材联合 |
| 22 | Minecraft 化城市 | 多素材联合/风格迁移 |
| 23 | 西装男→水豚(动作模仿) | 动作参考 |
| 24 | 街舞角色替换+动作参考 | 角色编辑 |
| 25 | 增加同制服人物 | 物体编辑 |
| 26 | 小孩→金毛狗+换外套 | 精准局部编辑 |
| 27 | 轻吻猫角色替换 | 角色编辑 |
| 28 | 台词替换(分手→挽留) | 声音编辑 |
| 29 | 音色克隆(Follow the wind) | 音色参考 |
| 30 | 数字人唱歌(neo soul) | 官方评论区测试提示词 |
