MiniMax H3 開源影音一體生成模型,一次同時生2K影片與立體聲配音
MiniMax 發布這套全方位多模態生成模型 MiniMax H3 ,能解決過往AI影音創作人最常遇到的瓶頸,處理「影像與音訊需要分開生成」問題,通常先畫出畫面,再去處理配音或音效,最後在剪輯軟體中對齊畫面嘴型與音效,剛跨入AI創作的人,或許可先服用 MiniMax H3 能在一次同步生成高畫質影像與原生立體聲對白音訊…

MiniMax H3 技術重點拆解
MiniMax H3 是的原生多模態生成模型,具備全方位的文本、圖像、影音與音訊理解。
影音同步原生生成: 不同於「先生影片再合成配音」的方法,MiniMax H3 可一次性在模型推理中同步輸出畫面與聲軌,包含背景音效、環境音以及聲軌對白。
高畫質與長度規格: 支援最長 15 秒、最高 2K 畫質的影片輸出,畫面流暢度與細節呈現算是目前開源模型的高水準,要在本地端生出生最佳品質影品還是取決於手上的硬體規格。
32kHz 立體聲: 內建 32kHz 雙聲道立體聲 輸出,並支援高達 11 種語言,包含中文、英文、日文、韓文等的對白生成。
全方位多模態輸入與視覺比例: 支援文字(Text-to-Video)、單圖/首尾幀(Image-to-Video)以及多重參考(Reference-to-Video,最多支援 9 張圖像、3 段影片及 3 段音訊),畫面比例涵蓋 21:9、16:9、4:3、1:1、9:16 主流格式。
老黑應用場景分析
自媒體與短影音創作者: 原本繁瑣的配音與音效對位,直接輸入劇本與角色設定圖,一次生成帶有語音對白與環境音的 15 秒短影音素材,能縮短剪輯製作時間。
廣告腳本與概念分鏡預覽: 企劃階段可先快速生成具備聲音氛圍的動態概念影片,方便直接向客戶展示提案。
角色IP與動畫創作: 利用多圖片與參考音訊檔,精準維持角色外觀一致性與配音音色,非常適合用於故事繪本動態化或微動畫製作。
這裡取得工具
MiniMax H3 模型(Hugging Face): https://huggingface.co/MiniMaxAI/MiniMax-H3
ComfyUI 整合包與工作流: https://huggingface.co/Comfy-Org/MiniMax-H3
