![]()
智東西
作者 楊京麗
編輯 李水青
智東西8月3日報道,今日,MiniMax正式開源新一代通用視頻模型MiniMax H3。
MiniMax H3是一個通用型全模態生成系統,可統一理解文本、圖像、視頻和音頻組成的多模態上下文,生成最長15秒、最高2K分辨率并帶有原生立體聲音頻的視頻。
此前7月31日,MiniMax H3發布。目前,在Artificial Analysis有聲視頻編輯榜單中,MiniMax H3以1130分的Elo成績位列第一,領先Gemini Omni Flash、HappyHorse-1.0、Wan 2.7等國內外視頻模型。
![]()
▲MiniMax H3位列有聲視頻編輯榜單榜首
H3系統由H3-Context-IR、H3-Base、H3-Regenerate-2K三個模塊組成。開發者可以直接從Hugging Face下載MiniMax H3模型,H3-Base目前支持通過SGLang、vLLM、diffusers和ComfyUI等推理框架和工作流進行部署。
與模型開源同步,華為昇騰、摩爾線程、沐曦、海光信息、昆侖芯、天數智芯、壁仞科技、AMD、Intel等國內外芯片廠商,以及Hugging Face、魔搭ModelScope、ComfyUI、RunningHub、fal等開發社區和云推理平臺,另有vLLM-Omni、SGLang等推理框架,共16家生態伙伴均完成了相關適配支持。
![]()
開源地址:
huggingface.co/MiniMaxAI/MiniMax-H3
模型體驗地址:
H3-2K直出:
platform.minimaxi.com/docs/api-reference/video-generation-v2-create
H3-Context-IR:
platform.minimaxi.com/docs/api-reference/video-generation-v2-h3-context-ir
H3-Regenerate-2K:
platform.minimaxi.com/docs/api-reference/video-generation-v2-regeneration
MiniMax Hub: hub.minimaxi.com
海螺AI:hailuoai.com
今天,智東西對MiniMax H3進行了實測。MiniMax H3已經能夠完成不同類型的視頻生成任務,在畫面自然度、鏡頭組織和整體風格一致性方面表現較好。模型在畫面真實感、鏡頭編排等方面有一定的提升空間。
比如,我們讓模型生成了一段15秒的風光攝影航拍視頻,成片中的雪山、草地等自然景觀較為真實,色彩、光影和航拍鏡頭運動也比較自然,長鏡頭整體保持了較好的視覺連貫性。不過,畫面中的寺廟建筑仍有較明顯的AI生成感。
隨后,我們又讓MiniMax H3生成了一段奶茶和游戲IP聯動的廣告宣傳視頻。MiniMax生成的視頻包含6個分鏡頭,整體敘事順序較為清楚,畫面風格和廣告氛圍也基本統一。不過,在多鏡頭編排方面,模型出現了一處較明顯的重復:店員向顧客遞出奶茶的動作被連續呈現了兩次。
一、最長生成15秒2K視頻,畫面與立體聲同步輸出
MiniMax H3 是一個通用型全模態生成系統。在輸出規格方面,H3可生成4秒至15秒的視頻,支持21:9、16:9、4:3、1:1、3:4、9:16等多種畫面比例,輸出幀率為24FPS,并可同步生成32kHz立體聲音頻。
模型默認生成短邊為768像素的視頻,通過H3-Regenerate-2K可進一步生成2K版本。H3穩定支持中文、英語、日語、韓語、法語、德語等11種語言,對其他語言也提供不同程度的支持。
H3包含FL2VA和Ref2VA兩個版本,分別面向首尾幀生成與全模態參考生成。
H3-Base-FL2VA為首尾幀模式,最多可輸入兩張圖像。不輸入圖像時,模型執行文生視頻任務;輸入一張首幀或尾幀圖像時,可生成對應的首幀生視頻或尾幀生視頻;同時輸入兩張圖像時,則可根據指定的首尾畫面生成中間的視頻內容。
H3-Base-Ref2VA支持全模態參考模式,最多可輸入9張圖像;視頻最多可輸入3段,每段時長為2秒至15秒,總時長不超過15秒;音頻最多可輸入3段,每段時長為2秒至15秒,總時長不超過15秒,且必須與圖像或視頻一同輸入,不能作為唯一輸入。圖像、視頻和音頻文件合計最多可輸入12個。
二、三大模塊協同生成音視頻,2K畫面采用上下文再生成
H3系統由負責理解和整理多模態指令的H3-Context-IR、負責生成音視頻的H3-Base,以及負責生成2K畫面的H3-Regenerate-2K三個模塊組成。
![]()
▲MiniMax H3系統概覽(圖源:MiniMax)
H3-Context-IR是一套托管式預處理與編排系統,能夠理解文本、圖像、音頻和參考視頻之間的關系,以及這些素材與預期生成結果之間的關系。其內部工作流包括指令解析、跨模態關聯、時序理解和復雜邏輯推理。
H3-Context-IR依賴多階段工作流,以及多個托管模型與服務,該模塊暫未開源。MiniMax目前提供了相應API和提示詞指南,開發者可以據此搭建自己的多模態預處理系統。
視頻提示詞寫作指南:
huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md
全參考模式輸出指南:
huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md
H3-Base負責實際的音視頻生成。文本由H3-Encoder編碼,視覺素材同時經過H3-Encoder和H3-VisualVAE處理,音頻則由H3-AudioVAE編碼。不同模態的信息隨后被組織成統一序列,輸入H3-Omni-Transformer。
![]()
▲MiniMax H3-Base架構概覽(圖源:MiniMax)
對于H3的2K分辨率輸出,H3沒有采用傳統的專用超分辨率模塊,而是通過H3-Regenerate-2K,讓基礎模型結合原始文本及多模態參考素材,對已經生成的768p視頻重新生成。這種方式可以再次利用原始上下文,有助于還原小文字和精細紋理等僅憑低分辨率畫面難以補全的信息。該模塊目前同樣尚未開源,開發者可通過官方API復現完整的2K生成流程。
三、本地部署可生成768p音視頻,完整2K工作流需調用API
MiniMax為開發者提供了H3-Base本地部署和完整2K工作流兩種驗證方式。H3-Base以FL2VA和Ref2VA兩個獨立模型倉庫發布,均包含處理器、分詞器、文本編碼器、Omni Transformer、Visual VAE和Audio VAE等推理組件,可通過SGLang、vLLM、diffusers和ComfyUI等框架或工作流部署,并支持多GPU并行推理。
僅在本地部署H3-Base時,開發者可以生成短邊為768像素的音視頻。其中,FL2VA版本支持文生音視頻及首尾幀生成,Ref2VA版本支持聯合參考圖像、視頻和音頻,完成角色與場景保留、動作和嘴型編輯、音色參考等任務。
完整2K工作流則需要結合本地模型與官方API:首先由H3-Context-IR理解并擴展用戶輸入,隨后由本地部署的H3-Base生成768p音視頻,最后通過H3-Regenerate-2K結合原始上下文重新生成2K視頻。MiniMax還提供了文生音視頻、首幀生音視頻和全模態參考生成等可復現案例,相關請求參數、示例代碼和參考結果均可在Hugging Face模型頁面查看。
結語:全模態視頻生成加速走向開放生態
從實際效果來看,MiniMax H3已經能夠處理自然風光、商業廣告等不同類型的生成任務,在畫面自然度、鏡頭組織和風格一致性方面展現出較高的完成度。
隨著多家芯片廠商、開發社區、云推理平臺和推理框架同步完成適配,MiniMax H3此次開源不僅開放了模型能力,也初步打通了從模型下載、本地部署到應用開發的生態鏈路。全模態視頻模型之間的競爭,正從單一畫面效果進一步延伸至聲音生成、復雜指令理解和產業生態建設。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.