IT之家 7 月 31 日消息,稀宇科技今天宣布推出 MiniMax H3 全模態生成模型,支持對文本、圖像、視頻、聲音組成的多模態上下文的統一理解能力、能夠輸出具備原生雙聲道的音視頻,最高可支持 15s 2K 分辨率。
![]()
據前期邀測反饋,MiniMax H3 具備商用級多場景內容生成能力,在指令遵循、文字與品牌信息呈現、V2V Motion Transfer(視頻到視頻動作遷移)等方面表現出色,號稱可精準、可控實現多模態內容編輯與生成,適用于廣告、電商、品牌、產品設計、UI / UX 和游戲等場景。
核心技術方面,MiniMax H3 增加了 Caption 能力,定制了專屬模型和全模態理解管線,大部分素材需要消耗 100K Token 的推理,最終得到平均約 4K 的 Token。
同時,MiniMax H3 的 2K 視頻輸出能力并沒有使用常規超分模塊,而是使用 H3 基礎模型對自己的低分辨率結果進行 in-context 的重新生成,可最大程度地復用 H3 基模已經具備的生成能力,還擁有傳統超分方案無法靠“猜”還原的信息。
此外,MiniMax H3 將在未來幾天內開放模型權重。IT之家將持續關注,第一時間帶來最新消息。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.