![]()
![]()
AI音樂開始進入“審美競爭”階段。
作者|周悅
編輯|栗子
7月19日,昆侖萬維在2026世界人工智能大會(WAIC 2026)上舉辦了“世界模型與多模態(tài)范式躍遷”論壇。
這場論壇的嘉賓橫跨學術(shù)、產(chǎn)業(yè)和文娛領(lǐng)域。從中國科學院院士周志華、Reactor AI CEO Alberto Taiuti,到清華大學交叉信息研究院助理教授、破殼機器人創(chuàng)始人許華哲、黎曼機器人創(chuàng)始人劉揚,再到黃曉明、王珞丹、《消失的她》導演崔睿、愛奇藝高級副總裁楊海濤和甲子光年創(chuàng)始人兼CEO張一甲,不同背景的嘉賓圍繞技術(shù)突破、內(nèi)容生產(chǎn)和產(chǎn)業(yè)落地展開討論。
當天,昆侖萬維發(fā)布和升級了三款模型:可交互世界模型Matrix-3.5、AI音樂大模型Mureka V9.5,以及具身智能機器人模型Riemann-1.0,分別覆蓋可交互世界、音樂生成和具身智能。
其中,Mureka V9.5的升級最容易被現(xiàn)場觀眾感知。現(xiàn)場展示的Funk音樂一響,臺下觀眾整齊抬起頭。十幾部手機很快舉了起來,前排還有觀眾跟著節(jié)奏用腳打拍子。
Mureka V9.5配樂MV,視頻來源:昆侖萬維
圓桌上,黃曉明談起一次錄歌經(jīng)歷,AI演唱的Demo“太完美了”,沒有換氣,也沒有呼吸感,聽起來反而“沒有人味”。他提到,真人不必再和AI比誰更完美,獨特的個性和表達才更重要。
![]()
國家一級演員、中國電影家協(xié)會副主席黃曉明,圖片來源:昆侖萬維
黃曉明還分享了今早使用Mureka的經(jīng)歷。他讓模型生成了兩首歌,一首參考楊宗緯《空白格》的抒情氣質(zhì),另一首則借鑒他最近喜歡的顏人中,主題是“中年危機”。“還不錯,詞還挺觸動人心的。”他說。
王珞丹則認為,AI可以給自己的想法“增加很多翅膀”,但“決定往哪飛的權(quán)利要在我手里”。
![]()
“世界模型與多模態(tài)范式躍遷”論壇圓桌討論,圖片來源:昆侖萬維(從左至右分別為:甲子光年創(chuàng)始人張一甲,昆侖萬維董事長兼CEO方漢,中國電影家協(xié)會副主席黃曉明,演員王珞丹,愛奇藝高級副總裁楊海濤,青年導演崔睿)
在隨后接受「甲子光年」在內(nèi)媒體采訪時,昆侖萬維董事長兼CEO方漢反復強調(diào)的關(guān)鍵詞是“克制”。
這也是Mureka V9.5此次升級的重點。過去,一些AI音樂模型習慣通過增加聲部、加厚音色和持續(xù)推高情緒來制造完成感,容易出現(xiàn)人聲被伴奏遮蓋、編曲擁擠、歌曲缺少起伏等問題。
Mureka V9.5沒有繼續(xù)增加音樂的復雜度,而是改善人聲、編配和曲風控制,讓生成結(jié)果更自然,也更貼合用戶的創(chuàng)作意圖。方漢將這一方向概括為“克制、真實、貼合創(chuàng)作意圖”。
與V9.5同時亮相的,還有基于這一底座的O3音樂推理擴展方案。前者提高生成質(zhì)量和穩(wěn)定性,后者通過推理時選優(yōu),讓更多作品接近模型的能力上限。
「甲子光年」認為,AI音樂已經(jīng)跨過“能不能寫歌”的第一道門檻。下一階段的競爭,是模型能否作出更好的音樂選擇。
1.Mureka V9.5,讓AI音樂少一點“AI味”
一些AI音樂模型擅長通過密集聲部和厚重音色制造完成感,容易出現(xiàn)人聲被遮蓋、編曲擁擠和情緒缺少起伏等問題。
Mureka V9.5沒有繼續(xù)追求“更滿”,而是把重點放在人聲、編配和情緒之間的關(guān)系上。
中文流行歌曲《夜色緩緩》是其中一例。
它的提示詞包括柔和鋼琴、氛圍合成器、漸進式弦樂和貼近演唱的男聲,想要呈現(xiàn)的是“雨夜里未說出口的告別”,憂傷但溫柔,情緒從低聲訴說逐漸走向釋放,又不能顯得過分煽情。
這類歌曲考驗的是模型對分寸的控制。伴奏太重,人聲會被壓住;情緒推進太快,后半段便失去變化;弦樂進入得過早,也容易讓整首歌顯得用力過猛。
從這首Demo呈現(xiàn)的效果看,V9.5試圖讓伴奏、人聲和情緒層次保持更自然的關(guān)系。編配既要托住人聲,也要為人聲留出空間。
另一首《Melted Chrome》,重點變成了模型對復雜曲風的理解和還原。
提示詞要求的是迷幻的西海岸G-Funk街頭說唱,并進一步限定了滑動合成器低音、Moog哨音、Talkbox、Rhodes電鋼琴、哇音吉他和復古磁帶質(zhì)感。鼓點要略微落后于節(jié)拍,人聲則要保持沙啞、松弛的質(zhì)感。
提示詞還明確排除了Trap踩镲、Drill節(jié)奏和EDM式落點。模型不僅要識別G-Funk的核心元素,還要理解這些元素如何組合,才能形成低底盤夜間巡游般的迷幻氛圍。
對AI音樂來說,理解“不要什么”,有時和理解“要什么”同樣重要。識別一個曲風標簽并不困難,難的是讓音色、節(jié)奏、人聲和整體氛圍始終指向同一種表達。
前兩首作品主要展示V9.5對人聲、編配和曲風的控制,與之同時亮相的O3,則把重點放在全曲結(jié)構(gòu)和情緒推進上。
《誤差》是一首極簡電子與Cosmic Pop風格的無人聲作品。提示詞以晶瑩的合成器脈沖、低頻氛圍和空間混響,描繪一座漂浮在軌道上的空間站,要求整首歌保持冰冷、空曠和緩慢的基調(diào)。
《Still in the Room》則轉(zhuǎn)向Dream Pop。混響吉他、漂浮感男聲、柔和的氛圍合成器,加上溫暖貝斯和松弛鼓組,構(gòu)成一個獨處于房間中的夜晚。提示詞同時要求作品保留親密感和距離感,讓情緒緩慢展開。
這兩首作品都不依賴密集編配或明顯的副歌爆發(fā),更看重氛圍能否貫穿全曲,以及局部變化是否破壞整體表達。O3所做的,是在V9.5提供的音樂基礎(chǔ)上,進一步檢查和調(diào)整這些選擇。
從中文流行到G-Funk,再到極簡電子和Dream Pop,四首Demo分別對應(yīng)人聲與情緒、曲風控制和全曲一致性。Mureka V9.5展示的變化,不是加入更多聲音,而是讓每一種聲音更好地服務(wù)整體表達。
2.V9.5打底,O3提高優(yōu)質(zhì)結(jié)果的穩(wěn)定性
Mureka此次升級包含兩個層次。
Mureka V9.5是音樂生成的底座模型,決定人聲、編配、曲風和情緒表達的基礎(chǔ)質(zhì)量;O3建立在V9.5之上,通過推理階段的持續(xù)比較和選優(yōu),提高單次生成接近模型能力上限的概率。
簡單來說,V9.5負責抬高模型的基礎(chǔ)水平,O3則盡量減少優(yōu)質(zhì)結(jié)果對單次采樣運氣的依賴。兩者共同指向一個問題:如何降低AI音樂生成的隨機性。
這也是Mureka V9.5和O3此次最重要的亮點。它想做的不是偶爾生成一首好歌,而是把“好聽”拆解為可評測、可訓練、可部署,并能在推理階段繼續(xù)優(yōu)化的系統(tǒng)能力。
在訓練階段,V9.5通過強化學習,同時改善整體聽感、創(chuàng)作控制和生成穩(wěn)定性。在MusiCoT音樂思維鏈的基礎(chǔ)上,模型會先確定全曲的結(jié)構(gòu)、曲風和情緒方向,再安排段落推進、樂器進出和強弱變化。
![]()
Mureka V9.5/O3發(fā)布,圖片來源:昆侖萬維
這種變化首先體現(xiàn)在結(jié)構(gòu)與編配上。
主旋律需要突出時,其他聲部會相應(yīng)退后;情緒尚未發(fā)展到高潮時,編配也不會提前加碼。所有音樂元素不再各自追求存在感,而是共同服務(wù)整首歌的表達。
第二項能力,是對復雜創(chuàng)作意圖的控制。一首歌的主歌、副歌和橋段承擔著不同作用。主歌通常負責敘事,副歌集中釋放情緒,橋段則完成轉(zhuǎn)折。模型如果只理解單句歌詞,便容易出現(xiàn)歌詞內(nèi)容與音樂推進脫節(jié)。
V9.5需要判斷每段歌詞在全曲中的位置,再安排旋律、節(jié)奏和編配的變化。它不僅要把歌詞唱出來,還要讓音樂結(jié)構(gòu)跟隨語義自然推進。
第三項能力,是人聲表達與情緒的匹配。AI人聲是否可信,并不只取決于音準和音質(zhì)。同一句歌詞,在低聲講述和情緒釋放時,需要采用不同的唱腔和力度;伴奏也要隨之變化,不能始終保持相同的密度。
模型不僅要保證音準和音質(zhì),還要處理唱腔、情緒與伴奏之間的關(guān)系。例如,演唱方式是否符合歌曲氛圍,伴奏是否給人聲留下足夠空間,人聲的力度能否隨著段落自然變化。
第四項能力,是對復雜創(chuàng)作意圖的控制。用戶輸入的Prompt通常不只包含曲風和樂器,還可能同時涉及演唱方式、情緒變化、段落結(jié)構(gòu),甚至明確要求避開某些節(jié)奏和音色。模型需要判斷這些條件之間的主次,再把它們落實到旋律、節(jié)奏、人聲和編配中。
這是V9.5區(qū)別于關(guān)鍵詞拼接式生成的地方。識別出“G-Funk”“Dream Pop”或“中文流行”等標簽只是第一步,模型還要讓整首歌在音色、節(jié)奏、唱腔和整體氛圍上保持一致。
根據(jù)昆侖萬維的數(shù)據(jù),在歌曲的主觀評分中,V9.5的指令精準度從6.92提高至7.62,旋律、人聲、音質(zhì)和編曲等維度也有所改善。這說明模型不僅需要生成一首結(jié)構(gòu)完整的歌,還要更準確地理解用戶究竟想創(chuàng)作什么。
![]()
Mureka V9.5等模型生成歌曲的主觀評分,圖片來源:昆侖萬維
底座模型的能力提高后,O3進一步處理生成過程中的偏差。
O3通過test-time scaling擴展MusiCoT的推理過程。模型不會按照最初的選擇一路生成到底,而是在生成過程中比較候選方案,并檢查局部旋律是否仍然服務(wù)全曲、編配是否遮蓋人聲、情緒是否提前釋放,以及段落結(jié)構(gòu)是否偏離最初的提示詞。
發(fā)現(xiàn)偏差后,模型可以調(diào)整后續(xù)決策,讓旋律發(fā)展、編曲結(jié)構(gòu)和情緒推進逐步回到全曲目標上。
由此,V9.5和O3形成了一條相互銜接的技術(shù)路徑:V9.5通過訓練提高底座質(zhì)量與穩(wěn)定性,O3再通過推理時優(yōu)化,提高優(yōu)質(zhì)結(jié)果出現(xiàn)的概率。
Mureka形成了一條可以隨版本持續(xù)迭代的技術(shù)路徑,而不是依賴少數(shù)Demo或某一次采樣的運氣。
從這個意義上看,Mureka在模型層面的差異,不只是“能不能生成音樂”,而是能否把“好聽”從偶然結(jié)果,轉(zhuǎn)化為可評測、可訓練、可復現(xiàn),并能在推理階段繼續(xù)優(yōu)化的系統(tǒng)能力。
穩(wěn)定生成更好的音樂只是第一步。Mureka的完整差異還包括版本化創(chuàng)作工具和平臺分發(fā)能力。模型負責提高作品質(zhì)量,工具承接比較與修改,平臺則連接創(chuàng)作、發(fā)布和消費。
3.AI音樂開始進入“審美競爭”階段
過去,AI音樂最先吸引人的,是速度——幾十秒生成一首完整歌曲。但當“會寫歌”逐漸成為基礎(chǔ)能力,行業(yè)競爭也開始轉(zhuǎn)向更難的問題:模型能否理解取舍。
旋律什么時候推進,什么時候留白;什么元素應(yīng)該保留,什么需要刪掉;同一個創(chuàng)意,能否沿著不同方向繼續(xù)發(fā)展。下一階段的差距,不只在生成速度,也在音樂判斷和創(chuàng)作控制。
「甲子光年」認為,AI音樂的“審美競爭”,并不是讓模型替用戶決定什么是好音樂,而是讓用戶的取舍和判斷更持續(xù)地作用于作品。
多數(shù)AI音樂工具仍以“一次生成”為基本單位。結(jié)果不滿意,用戶往往只能重新生成,此前滿意的旋律、人聲或段落也可能被全部改寫。
方漢強調(diào),作為模型廠商,他們希望“讓提示詞寫得不好的人,也能做出更好的作品”,把模型的遵從性和易用性繼續(xù)往前推,降低普通人的創(chuàng)作門檻。
Mureka希望把創(chuàng)作從一次性生成,轉(zhuǎn)向版本化工作流。圍繞同一個創(chuàng)意,用戶可以快速生成不同版本,比較旋律、唱腔、編配和結(jié)構(gòu);滿意的部分可以保留,不合適的部分則可以單獨替換。
在產(chǎn)品層面,Mureka Studio承接了這套工作流。傳統(tǒng)數(shù)字音頻工作站需要創(chuàng)作者熟悉軌道、插件、混音和大量參數(shù)。Studio試圖把部分操作轉(zhuǎn)化為更直接的創(chuàng)作指令。
它改變的不只是操作方式,也是人與工具之間的分工。創(chuàng)作者的重心,也由執(zhí)行具體操作轉(zhuǎn)向比較方案和作出審美判斷,也就是從“操作DAW”走向“指揮創(chuàng)作”。
對專業(yè)音樂人來說,V9.5生成的旋律、編曲和人聲可以成為繼續(xù)發(fā)展的素材;對普通用戶來說,不熟悉編曲和混音,也可以圍繞一個想法逐步完成作品。音樂由此不再只是供人收聽的內(nèi)容,也可以用來記錄一段關(guān)系、一種情緒或一段記憶。
在產(chǎn)業(yè)端,游戲、短劇、影視和有聲內(nèi)容需要大量穩(wěn)定、可控的音樂素材。昆侖萬維也將游戲工業(yè)化、短劇量產(chǎn)、音樂創(chuàng)作平民化和影視降本增效列為重點落地場景。
Mureka此前已經(jīng)開放API,服務(wù)于短視頻、游戲、播客和影視配樂等場景。 V9.5和O3進一步提高作品質(zhì)量與生成穩(wěn)定性后,模型能力也更容易通過Studio和API進入真實的內(nèi)容生產(chǎn)流程。
Mureka的差異因此不只來自某一次生成效果,而來自模型訓練、推理時選優(yōu)、版本化創(chuàng)作工具和平臺分發(fā)能力的組合。
當“會寫歌”不再稀奇,誰能讓用戶持續(xù)比較、修改和使用作品,才可能建立下一階段的優(yōu)勢。
Mureka V9.5只是昆侖萬維此次WAIC發(fā)布中的一個模型,卻提供了一個更容易被感知的觀察窗口。
從Matrix-3.5到Mureka V9.5,再到Riemann-1.0,昆侖萬維試圖連接可交互世界、內(nèi)容生成和現(xiàn)實行動。對Mureka而言,下一步也不只是生成更多歌曲,而是讓模型、工具與分發(fā)共同進入真實的創(chuàng)作流程。
(封面圖及文中視頻、音頻、配圖素材均來自昆侖萬維)
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.