CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
聯繫我們
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • 熱門
  • AI 人工智慧
  • 資安
  • Docker
  • 進階應用
  • 網通
  • NAS
  • 開箱測試
  • 教學
  • 展覽直擊
首頁 新聞 AI 人工智慧

MiniMax H3開放權重影片模型登場 支援多模態素材與原生立體聲

Ashley Hsieh by Ashley Hsieh
2026 年 08 月 04 日 23:50
in AI 人工智慧, 新聞
閱讀時間: 3 分鐘
A A
MiniMax H3開放權重影片模型登場 支援多模態素材與原生立體聲
144
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

中國人工智慧新創 MiniMax 近日推出了 MiniMax H3,這是一款可同時理解文字、圖片、影片及音訊的多模態影片生成模型。除了常見的文字生成影片及圖片生成影片,還能加入參考影片、人物圖片及音訊,透過文字說明不同素材的用途,再透過模型組合成新的有聲影片。

RELATED POSTS

DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出

AI 浪潮襲來,企業能記取歷史教訓,成功重塑勞工技能嗎?

Qwen3.8-Max 宣稱代理式電腦使用超越 GPT-5.6 與 Fable 5|Palantir 稱先進 AI 實驗室不可信|產業精選 08.04

H3最高可生成15秒、2K解析度的影片,並同步產生立體聲音訊。MiniMax 也已釋出模型權重,讓開發者自行部署及調整模型。相較於目前多數只能透過網站、應用程式或API使用的先進影片模型,H3試圖將開放權重模式延伸至影音共同生成領域。

單一模型整合多模態架構

過去的影片生成工具常會將不同工作拆成個別模型,例如文字生成影片、圖片生成影片、首尾畫面控制、人物參考、動作轉移及影片編輯等功能,都要分別由不同模型或處理流程才能完成,MiniMax H3 則將這些功能整合至同一套模型架構,使用者不需要先選擇特定任務,只要提供素材並以文字說明需求,模型便會自行分析不同素材與生成結果之間的關係。

例如使用者可以提供一段參考影片,要求沿用其中的攝影機運動,再上傳一張人物圖片,指定由該人物演出,最後加入一段音訊,讓人物依照聲音內容演唱,這代表 H3 需要同時理解影片中的運鏡、圖片中的人物外觀,以及音訊與人物嘴型之間的關係,而不只是單獨讀取每一份素材,生成範例可參考 MiniMax H3官方介紹連結。

最高容納12個參考檔案

MiniMax H3目前提供兩種主要生成方式。第一種為首尾畫面模式。使用者可以只輸入文字,也可以提供一張圖片作為影片的開頭或結尾,或同時提供兩張圖片控制影片開始及結束時的畫面。第二種為多模態參考模式,可混合輸入圖片、影片及音訊。官方模型說明顯示,單次最多可加入9張圖片、3段影片及3段音訊,所有素材合計不得超過12個檔案。每段參考影片及音訊長度須介於2秒至15秒,影片與音訊的總長度也各自不得超過15秒。音訊不能單獨作為唯一輸入,必須搭配圖片或參考影片使用。

這種輸入方式非常適合需要維持人物外觀、產品造型、拍攝方式或動作設計的內容。創作者不必只靠文字描述複雜鏡頭,也能直接提供實際素材作為參考。

同步處理影音與對話生成

MiniMax H3 可以生成4秒至15秒的影片,支援21比9、16比9、4比3、1比1、3比4及9比16等常見畫面比例,輸出影格率為每秒24格。音訊採用32 kHz立體聲,可同步產生人物對話、音效、環境聲及音樂。官方表示目前對中文、英文、日文、韓文、法文、德文、義大利文、西班牙文、葡萄牙文、俄文及阿拉伯文等11種語言提供較穩定的對話支援。

影片與音訊共同生成,這點有別於過去先產生無聲影片再交由另一套語音模型配音的方式,也因為H3的影片及聲音會在同一個生成流程中處理,這樣有助於配合人物嘴型、動作節奏及場景變化。

重新生成提升2K畫面細節

H3 的基礎模型 H3-Base 會先產生短邊 768 像素的影片。官方服務中的 2K 影片,則會透過 H3-Regenerate-2K 重新生成,這並不是是使用一般影像放大工具提高解析度,而是將768p影片、原始提示及參考素材再次送入模型,讓模型重新分析人物、文字及細節,產生解析度更高的版本。MiniMax 認為這種重新生成方式比傳統升頻更有機會恢復包裝文字、小型物件及畫面細節,因為模型仍能參考使用者最初提供的素材,而不是只根據低解析度影片自行推測缺少的內容。

但是 H3-Regenerate-2K 目前尚未開放權重,若想重現官方的完整2K生成流程,仍須使用MiniMax提供的API。

部分權重開放需注意授權規範

MiniMax已釋出的 H3-Base 以 330 億參數的 H3-Omni-Transformer 作為核心生成網路,可共同預測影片及音訊,系統另外還包含H3-Encoder、Visual VAE及Audio VAE等元件,開發者可透過 Diffusers、SGLang、vLLM 及 ComfyUI 等工具自行部署。

完整的 H3 系統由三個部分組成。 H3-Context-IR 負責理解文字、圖片、影片及音訊之間的關係。 H3-Base負責生成768p影片及立體聲音訊。 H3-Regenerate-2K 負責將結果重新生成為 2K 影片。目前真正釋出模型權重的主要是H3-Base。負責解析複雜多模態指令的H3-Context-IR 以及負責 2K 重新生成的 H3-Regenerate-2K 都尚未完整開放,只能透過官方API使用。因此自行部署可以生成768p有聲影片,但不一定能完整重現 MiniMax 官方平台的多模態理解及2K輸出效果。

此外 H3 採用 MiniMax H3 Community License Agreement,而不是 MIT 或 Apache 2. 0等常見開放原始碼授權。所以如果是打算將H3模型用於商用,務必先確認授權條款及適用地區,不能只因為模型權重可以下載就認為沒有使用限制。

強化動作轉移與品牌視覺

除了從零生成影片,H3 的素材編輯及動作轉移能力也頗受矚目。使用者可以提供一段真人表演、舞蹈或運鏡影片,再指定另一個人物、角色或畫面風格,讓模型參考原始影片中的動作及攝影方式來生成新影片。這項能力可被應用於虛擬角色、遊戲人物、品牌廣告及動畫製作,有了這項功能,創作者就不必只以文字來描述複雜肢體動作,而是能使用實際影片向模型示範。

MiniMax 也特別強調文字及品牌內容的呈現能力,包括產品名稱、包裝、網站介面、動畫海報及片頭標題,這對廣告及電子商務內容相當重要,因為商業影片不只要求畫面好看,也需要產品外觀、文字及品牌元素在不同鏡頭中保持一致。

各大熱門影片模型差異

目前與MiniMax H3功能定位較接近的模型,包括 Google Veo 3.1、ByteDance Seedance 2.5及Kling VIDEO 3.0 Omni。這些模型均已支援有聲影片生成,但在影片長度、參考素材、部署方式及主要用途上仍有明顯差異。

模型開發企業最長單次影片支援素材與數量模型權重主要特色與編輯功能適合對象
MiniMax H3MiniMax15 秒可混合輸入文字、圖片、影片及音訊,最多支援 9 張圖片、3 段影片及 3 段音訊,合計不得超過12個檔案部分開放,已釋出 H3-Base 權重支援動作轉移、品牌視覺呈現,以及影片、音訊與人物對話的同步生成具備 GPU 與開發能力,並希望自行部署影片生成服務的團隊
Google Veo 3.1Google DeepMind最長8秒,單次可選4秒、6秒或8秒;另外支援影片延伸文字、首幀或首尾畫面、最多3張參考圖片,可延伸先前由Veo生成的影片未開放強調寫實畫質、物理效果及影音同步,並整合至 Gemini 與 Flow希望直接使用成熟雲端影片生成工具的使用者
Seedance 2.5ByteDance30 秒,可多次延伸支援影音共同生成,最多可加入 30 張圖片、10 段影片及 10 段音訊未開放支援依時間點修改、綠幕處理、攝影機角度控制及多鏡頭敘事需要製作較長影片及進行複雜後續編輯的創作者
Kling VIDEO 3.0 Omni快手15 秒可混合輸入文字、圖片、影片及人物元素未開放支援人物一致性控制、多鏡頭分鏡、人物建立及聲音設定偏好透過完整線上介面直接製作影片的一般創作者

主打低廉生成成本仍待驗證

MiniMax官方表示,H3 在 2K 解析度下的每秒生成價格低於主流模型的三分之一,768p 價格則低於主流模型 720p 價格的一半。

但是 MiniMax 並未在官方介紹中列出所比較的模型名稱、採用的價格基準及計算方式。雖然目前官方已公布 H3 的 API 價格,但實際上各模型支援的影片長度、解析度、音訊及參考素材功能不盡相同,因此尚不能據此認定 H3 是市場上生成成本最低的影片模型。

開創開放權重新格局

MiniMax H3 推出才沒幾天,目前可看到的案例主要都來自官方展示,尚缺乏大量獨立測試。人物一致性、複雜肢體動作、文字呈現及不同語言對話的穩定程度,仍須觀察更多實際使用結果,況且 H3 目前也不是一套完全開放且一般個人電腦即可輕鬆執行的影片模型,CyberQ 實測採用 Comfyui 0.3.0 搭配 ComfyUI 量化版過的 MiniMax H3 模型,在具備 16GB VRAM 的 NVDIA RTX 5060 Ti 是可以跑,但有給電腦處理器進行記憶體 offload ,要有比較好的體驗至少要具備 NVIDIA DGX Spark 以上的機器,以及企業等級 NVIDIA 顯示卡和伺服器會更強大來用運用這些工具。完整 2K 流程仍依賴官方API,授權也附帶特定使用條件。

H3 令大家關注的是,已經有夠強的先進影片生成模型採用較完整的開放權重形式,過去開放權重主要集中於大型語言模型及圖片生成,影片模型因為規模、推論成本及技術複雜度較高,大多都是由業者透過封閉平台提供。在 MiniMax 釋出 H3-Base 後,具備運算設備及開發能力的企業,就可以進一步建立內部影片生成、產品展示、虛擬角色或品牌內容製作系統,不必將所有素材及生成流程完全交給外部平台。

H3 目前最大的優點,並不一定是畫質全面領先 Veo、Seedance 或可靈 Kling,而是在保留雲端服務的同時,讓開發者多了一款可自行部署及調整的高階影音共同生成模型。至於它能否在實際品質、成本及部署效率上形成優勢,仍待更多三方實際測試驗證,但隨著社群熱烈使用,這個生態系是有可能形成的,值得留意與觀察。

首圖由 Nano Banana AI 生成

DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出
FLUX 3開放搶先體驗 可同時生成影像影片與聲音
ComfyUI 0.16 新版預設啟用動態 VRAM,導入更多新世代影像與影片生成模型
標籤: AI影音生成MiniMax H3多模態AI影片生成模型開放權重
Share2Tweet1ShareShareShare
上一篇

AI 浪潮襲來,企業能記取歷史教訓,成功重塑勞工技能嗎?

下一篇

DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出

Ashley Hsieh

Ashley Hsieh

專案管理者與 UI/UX 設計、AI美術設計認證、淨零碳規劃管理師,在上市歐洲外商、生醫、金融、科技產業中淬煉,曾參與過多個跨平台專案,從需求分析、設計、使用者測試到專案交付流程都樂在其中。 私底下,我是一位「喜歡買東西但錢包容易抗議」的人,對科技、設計與藝術有熱情,正在努力平衡質感生活,學習和錢包一起成長的日常小練習者。

相關文章

DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出
AI 人工智慧

DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出

2026 年 8 月 5 日
AI 浪潮襲來,企業能記取歷史教訓,成功重塑勞工技能嗎?
AI 人工智慧

AI 浪潮襲來,企業能記取歷史教訓,成功重塑勞工技能嗎?

2026 年 8 月 4 日
新聞

Qwen3.8-Max 宣稱代理式電腦使用超越 GPT-5.6 與 Fable 5|Palantir 稱先進 AI 實驗室不可信|產業精選 08.04

2026 年 8 月 4 日
新聞

全球記憶體短缺衝擊 MacBook Air|GraphRAG與向量RAG的適用情境比較|產業精選 08.03

2026 年 8 月 3 日
新聞

Apple Upgrade 計畫改寫持有模式 | 知名 YouTuber 坦言 AI 讓人出現多巴胺依賴

2026 年 8 月 2 日
DeepSeek V4 Flash 正式版成績不俗且成本僅 Gemini 的 1/19,開放權重挑戰閉源 AI
AI 人工智慧

DeepSeek V4 Flash 正式版成績不俗且成本僅 Gemini 的 1/19,開放權重挑戰閉源 AI

2026 年 8 月 1 日
下一篇
DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出

DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出

推薦閱讀

DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出

DGX Spark 跑通 MiniMax-H3 官方全權重實測,搭配 QNAP NAS 載入與輸出

2026 年 8 月 5 日
MiniMax H3開放權重影片模型登場 支援多模態素材與原生立體聲

MiniMax H3開放權重影片模型登場 支援多模態素材與原生立體聲

2026 年 8 月 4 日
AI 浪潮襲來,企業能記取歷史教訓,成功重塑勞工技能嗎?

AI 浪潮襲來,企業能記取歷史教訓,成功重塑勞工技能嗎?

2026 年 8 月 4 日

Qwen3.8-Max 宣稱代理式電腦使用超越 GPT-5.6 與 Fable 5|Palantir 稱先進 AI 實驗室不可信|產業精選 08.04

2026 年 8 月 4 日
GitHub 趨勢周報 Vol.26:AI 教育普及與開源工具創新的雙重浪潮

GitHub 趨勢周報 Vol.26:AI 教育普及與開源工具創新的雙重浪潮

2026 年 8 月 3 日

近期熱門

  • DeepSeek V4 Flash 正式版成績不俗且成本僅 Gemini 的 1/19,開放權重挑戰閉源 AI

    DeepSeek V4 Flash 正式版成績不俗且成本僅 Gemini 的 1/19,開放權重挑戰閉源 AI

    268 shares
    Share 107 Tweet 67
  • 微軟發布 Windows 11 KB5101684 選擇性更新:檔案總管與搜尋速度提升,容量與穩定度全面解析

    183 shares
    Share 73 Tweet 46
  • QNAP AI NAS Edge AI 方案與自建 DGX Spark 地端 LLM 架構比較

    132 shares
    Share 53 Tweet 33
  • 全球記憶體短缺衝擊 MacBook Air|GraphRAG與向量RAG的適用情境比較|產業精選 08.03

    119 shares
    Share 48 Tweet 30
  • Apple Upgrade 計畫改寫持有模式 | 知名 YouTuber 坦言 AI 讓人出現多巴胺依賴

    107 shares
    Share 43 Tweet 27
  • GitHub 趨勢周報 Vol.26:AI 教育普及與開源工具創新的雙重浪潮

    93 shares
    Share 37 Tweet 23
  • AI 浪潮襲來,企業能記取歷史教訓,成功重塑勞工技能嗎?

    92 shares
    Share 37 Tweet 23
  • FCC 擴大設備禁令海外先進機器人與電源逆變器入列

    90 shares
    Share 36 Tweet 23
  • Zuckerberg 預測個人 AI 代理五年內普及|微軟 AI 投資兩樣情|產業精選 07.30

    89 shares
    Share 36 Tweet 22
  • Qwen3.8-Max 宣稱代理式電腦使用超越 GPT-5.6 與 Fable 5|Palantir 稱先進 AI 實驗室不可信|產業精選 08.04

    87 shares
    Share 35 Tweet 22

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。