![]()
智東西
作者 茄子
編輯 程茜
智東西7月20日消息,今日,字節跳動發布音頻創作模型Seed Audio 1.0。據官方介紹,該模型通過一段提示詞即可生成包含對白、音效和環境聲的完整聲音場景,支持多音頻要素協同生成、音色風格控制和多語種自然表達,并能夠保持長音頻中的角色一致性。
智東西對Seed Audio 1.0進行了實際體驗。在測試中發現,該模型能夠根據提示詞生成包含角色對白、環境音和音效的完整場景,并在角色音色保持、聲音模仿、多語言表達等方面展現出較強能力。不過,在部分場景下,該模型生成的音頻仍存在一定AI感,情緒細節和真實度仍有提升空間。
比如,在這段辦公室場景對話中,Seed Audio 1.0生成的對話創作了辦公室日常遇到困難時的討論場景。其中,該模型對角色落寞的語氣、翻頁時的停頓和領導走過來時的高跟鞋音效都有較好地還原。
//oss.zhidx.com/uploads/2026/07/6a5def2408391_6a5def2404310_6a5def24042d6_智東西-場景對話.wav
▲Seed Audio 1.0生成辦公室對話音頻
官方評測顯示,Seed Audio 1.0在音色生成、復雜場景創作和多語種表達等方面具備較強能力。在盲測主觀偏好CMOS打分中,該模型相較頭部商用音頻服務最高提升0.79,用戶更偏好其生成音頻;在電影、短劇、播客、動畫等十余類場景測試下,該模型生成的整體音頻可用率達91%;在多語種能力測試方面,該模型支持20余種語言生成,絕大多數語種人聲自然度MOS平均分超4分(≥4分為優質標準)。
![]()
▲Seed Audio 1.0各項測試得分
體驗平臺:火山方舟體驗中心
https://seed.bytedance.com/seedaudio1_0
一、憑環境描寫,Seed Audio 1.0能直出環境音+人物對話音頻
Seed Audio 1.0發布后,智東西體驗了該模型在音頻創作和聲音模仿上的能力。
智東西首先輸入了一段不包含語氣和對白信息的提示詞,測試Seed Audio 1.0是否能夠僅根據場景描述生成符合人物設定的角色對話。
提示詞:熒光燈持續嗡鳴、冰柜壓縮機低響、高速貨車不時駛過,低沉懸疑弦樂鋪墊,兩名中年男人分開站在窗口兩側,一人局促不安反復望向加油站入口,另一人單手插兜、神色冷淡散漫,兩人刻意保持距離互不靠近。
//oss.zhidx.com/uploads/2026/07/6a5dd5100267c_6a5dd50fed330_6a5dd50fed2ee_一句提示詞生成一段對話.wav
▲Seed Audio 1.0一句話創作音頻
該模型生成了一段兩名男子在高速加油站等待同伙接頭的懸疑場景,并通過環境音和角色語氣營造出緊張氛圍。此外,兩人的語氣和對話也較好地對應了提示詞中的一人緊張、一人散漫。
第二,智東西給出了一段古風武俠對話,驗證Seed Audio 1.0生成的音頻在角色聲音輸出上是否能保持一致性,以及能否生成包含對白、音效和環境聲在內的完整聲音場景。
提示詞:
1[古風武俠電影氛圍,深秋密林濃霧籠罩,林間寒風穿林呼嘯,遠處山間隱約傳來狼嚎,肅殺緊張]
2[枯枝踩踏碎裂聲響,林間冷風持續沙沙作響,樹葉被氣流卷動四處飛舞]
3蘇晚(女子,二十余歲,溫潤古風聲線,緊繃急促,壓低聲音)快步穿梭樹叢,低聲急呼:“追兵已經追上山了,快走,往懸崖密道去!”
4[身后樹干被箭矢穿透悶響,樹枝斷裂轟然落地]
5沈硯(男子,三十歲上下,聲線慌亂急促,踉蹌摔倒在枯葉堆)喘息慌亂開口:“密道入口被巨石封死,我們走投無路了!”
6蘇晚(語氣堅定凌厲,拔劍出鞘輕鳴)沉聲決斷:“我來劈開封堵巖石,你緊隨我身后,切莫亂跑!”
7[片刻安靜,風聲減弱,只剩二人急促喘氣與遠處漸近的馬蹄聲]
8[長劍全力劈砸巨石轟然爆響,碎石滾落山崖,低沉古風弦樂驟然響起,隨后徹底靜默]
//oss.zhidx.com/uploads/2026/07/6a5dd65119855_6a5dd6510e14b_6a5dd6510e115_古風武俠.wav
▲Seed Audio 1.0創作古風武俠場景音頻
從生成效果來看,Seed Audio 1.0不僅能夠理解提示詞中的場景設定,還能將環境音、人物對白和劇情事件進行組合生成。在這段音頻中,該模型還原了密林環境中的風聲、狼嚎、箭矢穿透、巨石碎裂等聲音元素,并根據人物設定生成了不同角色的聲音表現。其中,蘇晚和沈硯的音色、語氣與提示詞中的角色狀態保持一致,前者表現出緊張中的堅定,后者呈現出慌亂急促的情緒,并且,蘇晚的2段臺詞也沒有出現明顯的角色漂移。
第三,智東西體驗了該模型對聲音的模仿能力。我們給出了一段新聞聯播女聲和一段《甄嬛傳》中甄嬛的臺詞,并要求該模型用新聞聯播女聲輸出這段臺詞音頻。
//oss.zhidx.com/uploads/2026/07/6a5dd74abde60_6a5dd74ab80dc_6a5dd74ab809c_新聞聯播女聲_愛給網_aigei_com_cut_21sec.mp3
▲新聞聯播女聲
從生成音頻來看,該模型的聲音模仿能力較突出,無需額外訓練,就可以根據參考音頻生成新聞聯播女聲風格的《甄嬛傳》臺詞。在音色方面,生成結果能夠較好還原參考聲音的特點,聲音辨識度較高。
//oss.zhidx.com/uploads/2026/07/6a5dd76faa341_6a5dd76fa4277_6a5dd76fa4248_Result-1.wav
▲Seed Audio 1.0用新聞聯播女聲生成《甄嬛傳》臺詞
第四,智東西還體驗了Seed Audio 1.0的多語言能力。我們給出了一段文字,并要求該模型用粵語生成音頻。
提示詞:【底層音效:茶餐廳瓷碗碰撞、抽油煙機低頻嗡鳴、鄰桌客人細碎交談、風扇轉動聲】中年阿姨拉開膠凳坐下,拿起茶單小聲自語,語氣放松家常:“落咗成日落雨,收工即刻過嚟嘆茶,整份蝦餃燒賣同凍檸茶先,凍檸茶要少冰多檸。”手指輕敲塑料茶單發出沙沙聲。服務員端著托盤快步走近,瓷杯磕碰作響,揚聲搭話:“阿姐,今日鳳爪炆得夠曬火候,好多熟客特登過嚟點,要唔要加一碟?” 阿姨擺手輕笑,翻了兩頁餐單,隨口閑聊:“唔使啦,今日仲要趕返屋企煮飯畀孫仔,聽日再嚟試。對咗,隔籬街市今日水果平唔平?尋日我買嘅荔枝好甜。”遠處收銀臺掃碼機滴滴響,服務員轉身回話,腳步聲走遠:“今日芒果特價,十蚊三斤,晚黑收攤仲會再平啲,行過可以睇下。”
//oss.zhidx.com/uploads/2026/07/6a5ddb3e66b24_6a5ddb3e5491a_6a5ddb3e548cf_粵語對話.wav
▲Seed Audio 1.0輸出粵語音頻
Seed Audio 1.0生成的對話完整地還原了茶餐廳的背景音效,并且生成的音頻在語氣、節奏上也有較好地把握。但是在音色上還存在一定的AI感,尤其在剛進入對話的時候,難以讓人代入,后面的對話較前面更自然一點。
二、多要素協同與精準控制,Seed Audio 1.0創作完整音頻
據官方介紹,Seed Audio 1.0具備復雜聲音場景編排能力。它不需要拼接就能自然地組織角色語氣、背景氛圍和聲音節奏,輸出的音頻更接近一段完整作品。
比如,官方展示的這段救災音頻,既包含新聞記者的沉穩女聲,也包括前線救災員略帶東北口音的普通話,還有渲染緊張氛圍的背景音。
//oss.zhidx.com/uploads/2026/07/6a5ddc0926289_6a5ddc0922b83_6a5ddc0922b45_救援.m4a
▲Seed Audio 1.0生成復雜聲音場景
其次,Seed Audio 1.0還具備時間線控制能力。據官方介紹,Seed Audio 1.0能理解創作意圖,將角色、臺詞、情緒和音效按照時間線進行編排,控制不同聲音的進入時機與銜接方式,支持100ms級時間精度,讓生成音頻更符合影視、廣告等內容創作需求。
官方展示了一段Seed Audio 1.0對一段視頻的翻配,該模型在角色進場和說話時間上都能較好卡點。
//oss.zhidx.com/uploads/2026/07/6a5ddc5f4ad00_6a5ddc5f4795c_6a5ddc5f47931_時間卡點.m4a
▲Seed Audio 1.0對視頻的翻配卡點
此外,Seed Audio 1.0還支持零樣本音頻生成。創作者既可以直接用文字描述目標聲音,也可以結合參考音頻進一步控制生成結果,就不需要為每一種聲音單獨訓練模型。
官方展示了2段音頻,一段是Seed Audio 1.0根據英文文本創作的音頻,還有一段是Seed Audio 1.0對一段播客中2名外國青年男子聲音的模仿。
//oss.zhidx.com/uploads/2026/07/6a5ddcd72a705_6a5ddcd72456f_6a5ddcd724540_文本一鍵生成音頻.m4a
▲Seed Audio 1.0根據英文文本創作音頻
//oss.zhidx.com/uploads/2026/07/6a5ddce48a9b2_6a5ddce480a1a_6a5ddce4809f0_模仿音頻.m4a
▲Seed Audio 1.0參考英文播客輸出模仿音色音頻
并且,該模型還能在同一音色的基礎上生成不同風格的音頻。比如,在官方案例中,同一音色在不同場景下能夠呈現不同表達方式:足球解說中的高亢激昂、有聲書中的平穩敘述,以及直播帶貨中的快速強調。
官方介紹,該模型還具有多語種創作的能力。在多語種生成案例中,Seed Audio 1.0能夠根據不同語言調整發音節奏、重音和情緒表達。
結語:AI音頻從“會說”走向“會創作”
從語音合成到音頻創作,AI音頻模型正在突破單一聲音生成的邊界。Seed Audio 1.0嘗試將對白、音效、環境聲和情緒表達統一到同一生成框架中,讓AI能夠理解完整聲音場景,而不只是輸出一段語音。
隨著模型對聲音結構、角色一致性和時間控制能力不斷增強,AI音頻正在從輔助工具逐漸走向內容生產環節。未來,如何讓生成聲音進一步接近真人表達,并滿足更復雜的創作需求,將成為音頻大模型持續探索的方向。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.