中國人工智慧新創 MiniMax 近日推出了 MiniMax H3,這是一款可同時理解文字、圖片、影片及音訊的多模態影片生成模型。除了常見的文字生成影片及圖片生成影片,還能加入參考影片、人物圖片及音訊,透過文字說明不同素材的用途,再透過模型組合成新的有聲影片。
H3最高可生成15秒、2K解析度的影片,並同步產生立體聲音訊。MiniMax 也已釋出模型權重,讓開發者自行部署及調整模型。相較於目前多數只能透過網站、應用程式或API使用的先進影片模型,H3試圖將開放權重模式延伸至影音共同生成領域。
單一模型整合多模態架構
過去的影片生成工具常會將不同工作拆成個別模型,例如文字生成影片、圖片生成影片、首尾畫面控制、人物參考、動作轉移及影片編輯等功能,都要分別由不同模型或處理流程才能完成,MiniMax H3 則將這些功能整合至同一套模型架構,使用者不需要先選擇特定任務,只要提供素材並以文字說明需求,模型便會自行分析不同素材與生成結果之間的關係。
例如使用者可以提供一段參考影片,要求沿用其中的攝影機運動,再上傳一張人物圖片,指定由該人物演出,最後加入一段音訊,讓人物依照聲音內容演唱,這代表 H3 需要同時理解影片中的運鏡、圖片中的人物外觀,以及音訊與人物嘴型之間的關係,而不只是單獨讀取每一份素材,生成範例可參考 MiniMax H3官方介紹連結。
最高容納12個參考檔案
MiniMax H3目前提供兩種主要生成方式。第一種為首尾畫面模式。使用者可以只輸入文字,也可以提供一張圖片作為影片的開頭或結尾,或同時提供兩張圖片控制影片開始及結束時的畫面。第二種為多模態參考模式,可混合輸入圖片、影片及音訊。官方模型說明顯示,單次最多可加入9張圖片、3段影片及3段音訊,所有素材合計不得超過12個檔案。每段參考影片及音訊長度須介於2秒至15秒,影片與音訊的總長度也各自不得超過15秒。音訊不能單獨作為唯一輸入,必須搭配圖片或參考影片使用。
這種輸入方式非常適合需要維持人物外觀、產品造型、拍攝方式或動作設計的內容。創作者不必只靠文字描述複雜鏡頭,也能直接提供實際素材作為參考。
同步處理影音與對話生成
MiniMax H3 可以生成4秒至15秒的影片,支援21比9、16比9、4比3、1比1、3比4及9比16等常見畫面比例,輸出影格率為每秒24格。音訊採用32 kHz立體聲,可同步產生人物對話、音效、環境聲及音樂。官方表示目前對中文、英文、日文、韓文、法文、德文、義大利文、西班牙文、葡萄牙文、俄文及阿拉伯文等11種語言提供較穩定的對話支援。
影片與音訊共同生成,這點有別於過去先產生無聲影片再交由另一套語音模型配音的方式,也因為H3的影片及聲音會在同一個生成流程中處理,這樣有助於配合人物嘴型、動作節奏及場景變化。
重新生成提升2K畫面細節
H3 的基礎模型 H3-Base 會先產生短邊 768 像素的影片。官方服務中的 2K 影片,則會透過 H3-Regenerate-2K 重新生成,這並不是是使用一般影像放大工具提高解析度,而是將768p影片、原始提示及參考素材再次送入模型,讓模型重新分析人物、文字及細節,產生解析度更高的版本。MiniMax 認為這種重新生成方式比傳統升頻更有機會恢復包裝文字、小型物件及畫面細節,因為模型仍能參考使用者最初提供的素材,而不是只根據低解析度影片自行推測缺少的內容。
但是 H3-Regenerate-2K 目前尚未開放權重,若想重現官方的完整2K生成流程,仍須使用MiniMax提供的API。
部分權重開放需注意授權規範
MiniMax已釋出的 H3-Base 以 330 億參數的 H3-Omni-Transformer 作為核心生成網路,可共同預測影片及音訊,系統另外還包含H3-Encoder、Visual VAE及Audio VAE等元件,開發者可透過 Diffusers、SGLang、vLLM 及 ComfyUI 等工具自行部署。
完整的 H3 系統由三個部分組成。 H3-Context-IR 負責理解文字、圖片、影片及音訊之間的關係。 H3-Base負責生成768p影片及立體聲音訊。 H3-Regenerate-2K 負責將結果重新生成為 2K 影片。目前真正釋出模型權重的主要是H3-Base。負責解析複雜多模態指令的H3-Context-IR 以及負責 2K 重新生成的 H3-Regenerate-2K 都尚未完整開放,只能透過官方API使用。因此自行部署可以生成768p有聲影片,但不一定能完整重現 MiniMax 官方平台的多模態理解及2K輸出效果。
此外 H3 採用 MiniMax H3 Community License Agreement,而不是 MIT 或 Apache 2. 0等常見開放原始碼授權。所以如果是打算將H3模型用於商用,務必先確認授權條款及適用地區,不能只因為模型權重可以下載就認為沒有使用限制。
強化動作轉移與品牌視覺
除了從零生成影片,H3 的素材編輯及動作轉移能力也頗受矚目。使用者可以提供一段真人表演、舞蹈或運鏡影片,再指定另一個人物、角色或畫面風格,讓模型參考原始影片中的動作及攝影方式來生成新影片。這項能力可被應用於虛擬角色、遊戲人物、品牌廣告及動畫製作,有了這項功能,創作者就不必只以文字來描述複雜肢體動作,而是能使用實際影片向模型示範。
MiniMax 也特別強調文字及品牌內容的呈現能力,包括產品名稱、包裝、網站介面、動畫海報及片頭標題,這對廣告及電子商務內容相當重要,因為商業影片不只要求畫面好看,也需要產品外觀、文字及品牌元素在不同鏡頭中保持一致。
各大熱門影片模型差異
目前與MiniMax H3功能定位較接近的模型,包括 Google Veo 3.1、ByteDance Seedance 2.5及Kling VIDEO 3.0 Omni。這些模型均已支援有聲影片生成,但在影片長度、參考素材、部署方式及主要用途上仍有明顯差異。
| 模型 | 開發企業 | 最長單次影片 | 支援素材與數量 | 模型權重 | 主要特色與編輯功能 | 適合對象 |
|---|---|---|---|---|---|---|
| MiniMax H3 | MiniMax | 15 秒 | 可混合輸入文字、圖片、影片及音訊,最多支援 9 張圖片、3 段影片及 3 段音訊,合計不得超過12個檔案 | 部分開放,已釋出 H3-Base 權重 | 支援動作轉移、品牌視覺呈現,以及影片、音訊與人物對話的同步生成 | 具備 GPU 與開發能力,並希望自行部署影片生成服務的團隊 |
| Google Veo 3.1 | Google DeepMind | 最長8秒,單次可選4秒、6秒或8秒;另外支援影片延伸 | 文字、首幀或首尾畫面、最多3張參考圖片,可延伸先前由Veo生成的影片 | 未開放 | 強調寫實畫質、物理效果及影音同步,並整合至 Gemini 與 Flow | 希望直接使用成熟雲端影片生成工具的使用者 |
| Seedance 2.5 | ByteDance | 30 秒,可多次延伸 | 支援影音共同生成,最多可加入 30 張圖片、10 段影片及 10 段音訊 | 未開放 | 支援依時間點修改、綠幕處理、攝影機角度控制及多鏡頭敘事 | 需要製作較長影片及進行複雜後續編輯的創作者 |
| Kling VIDEO 3.0 Omni | 快手 | 15 秒 | 可混合輸入文字、圖片、影片及人物元素 | 未開放 | 支援人物一致性控制、多鏡頭分鏡、人物建立及聲音設定 | 偏好透過完整線上介面直接製作影片的一般創作者 |
主打低廉生成成本仍待驗證
MiniMax官方表示,H3 在 2K 解析度下的每秒生成價格低於主流模型的三分之一,768p 價格則低於主流模型 720p 價格的一半。
但是 MiniMax 並未在官方介紹中列出所比較的模型名稱、採用的價格基準及計算方式。雖然目前官方已公布 H3 的 API 價格,但實際上各模型支援的影片長度、解析度、音訊及參考素材功能不盡相同,因此尚不能據此認定 H3 是市場上生成成本最低的影片模型。
開創開放權重新格局
MiniMax H3 推出才沒幾天,目前可看到的案例主要都來自官方展示,尚缺乏大量獨立測試。人物一致性、複雜肢體動作、文字呈現及不同語言對話的穩定程度,仍須觀察更多實際使用結果,況且 H3 目前也不是一套完全開放且一般個人電腦即可輕鬆執行的影片模型,CyberQ 實測採用 Comfyui 0.3.0 搭配 ComfyUI 量化版過的 MiniMax H3 模型,在具備 16GB VRAM 的 NVDIA RTX 5060 Ti 是可以跑,但有給電腦處理器進行記憶體 offload ,要有比較好的體驗至少要具備 NVIDIA DGX Spark 以上的機器,以及企業等級 NVIDIA 顯示卡和伺服器會更強大來用運用這些工具。完整 2K 流程仍依賴官方API,授權也附帶特定使用條件。
H3 令大家關注的是,已經有夠強的先進影片生成模型採用較完整的開放權重形式,過去開放權重主要集中於大型語言模型及圖片生成,影片模型因為規模、推論成本及技術複雜度較高,大多都是由業者透過封閉平台提供。在 MiniMax 釋出 H3-Base 後,具備運算設備及開發能力的企業,就可以進一步建立內部影片生成、產品展示、虛擬角色或品牌內容製作系統,不必將所有素材及生成流程完全交給外部平台。
H3 目前最大的優點,並不一定是畫質全面領先 Veo、Seedance 或可靈 Kling,而是在保留雲端服務的同時,讓開發者多了一款可自行部署及調整的高階影音共同生成模型。至於它能否在實際品質、成本及部署效率上形成優勢,仍待更多三方實際測試驗證,但隨著社群熱烈使用,這個生態系是有可能形成的,值得留意與觀察。
首圖由 Nano Banana AI 生成







