![]()
認知神經科學前沿文獻分享
基本信息
Title:Dynamic acoustic-to-categorical representations of phonemes and prosody along ventral and dorsal speech streams
發表時間:2026-07-10
發表期刊:Nature Communications
影響因子:18.1
獲取原文:
1. 添加小助手:PSY-Brain-Frontier即可獲取PDF版本
![]()
研究背景
當我們聆聽他人講話時,聽到的并不是連續漸變的物理聲波,而是能瞬間將其切分成離散的輔音或元音(音素),并聽出對方是陳述還是疑問的語氣(韻律)。這種將連續變化的聲學線索映射為離散類別的能力,被稱為范疇化感知(categorical perception),它是人類理解語音意義的基石。
然而,大腦究竟在何時、何地完成了這種“從聲學到類別”的轉換?經典的語音加工雙流模型(dual-stream model)通常假設這是一條嚴格的串行流水線:語音首先在早期的初級聽覺皮層進行聲學特征分析,隨后才在更高階的顳葉或額葉區域被轉化為抽象的語言類別。此外,以往研究大多聚焦于音素,而對于依賴音高輪廓、持續時間更長的韻律信息,大腦是否采用了相同的計算機制仍是未解之謎。
為了回答這些問題,近期發表于 Nature Communications 的一項研究借助腦磁圖(MEG)和心理物理學行為實驗,結合時間分辨的表征相似性分析(RSA)與多變量轉移熵(mTE)技術,以前所未有的時空分辨率追蹤了音素與韻律在大腦腹側和背側通路中的動態表征過程。這項工作不僅證實了韻律同樣具有范疇化感知的心理現實性,更對傳統的串行加工模型提出了實質性挑戰。
研究核心總結
研究者通過對真實德語單詞“Bar”和“Paar”進行聲學漸變處理,構建了發聲起始時間(VOT,代表音素變化)和音高輪廓(代表陳述/疑問韻律變化)的正交刺激連續體。通過精細的神經表征追蹤,研究揭示了以下三個核心發現。
一、聲學與類別表征在時空上是并行的,而非嚴格串行
經典模型預測,大腦會先處理聲學細節,再將其丟棄并形成抽象類別。但本研究的 RSA 變異配分結果表明,音素和韻律的聲學表征與類別表征在時間上高度重疊,且在空間上共同分布于雙側顳葉區域。
更令人意外的是,抽象的類別表征在極早期的聽覺皮層(AC)就已經出現。這意味著早期感覺皮層不僅僅是簡單的“特征檢測器”,它已經參與到了聽覺客體的范疇化構建中。大腦并沒有在形成類別后就抹除聲學細節,而是將兩者并行維持,這可能為在嘈雜環境中進行穩健的語音識別提供了重分析的冗余信息。
![]()
Fig 1. 行為學結果證實,無論是基于發聲起始時間(VOT)的音素,還是基于音高輪廓的韻律,人類都能對其進行清晰的范疇化感知。
![]()
Fig 2. 研究采用時間分辨的表征相似性分析(RSA),將大腦活動的神經表征與聲學特征、類別特征的模型進行比對。二、韻律的類別表征比音素更廣泛,且獨特地調用了背側通路
盡管音素和韻律都經歷了并行的聲學-類別轉換,但它們調用的神經網絡存在顯著差異。音素的類別表征相對局限,主要集中在雙側聽覺皮層和左側后顳上溝(pSTS),信息流向符合腹側通路典型的“由后向前”傳遞特征。
相比之下,韻律的類別表征在空間上更為廣泛。在腹側通路中,它進一步向前延伸至前顳上溝(aSTS);更關鍵的是,它還跨越到了背側通路,顯著激活了雙側運動前區(PMC)和右側下額回(IFG)。信息流分析顯示,aSTS 和 PMC 成為了韻律信息跨網絡交互的核心樞紐。研究者推測,這可能是因為韻律在更長的時間尺度上展開,這種時間特性恰好落入了聽覺-運動整合系統的最佳處理窗口,從而需要背側通路的額外參與。
![]()
Fig 3. 音素的表征集中在雙側腹側通路,而韻律的表征在刺激偏離后不僅出現在腹側,還延伸至背側通路的運動前區(PMC)和下額回(IFG)。
![]()
Fig 4. 多變量轉移熵分析揭示了信息流向:音素主要在腹側通路內由后向前傳遞,而韻律信息則在腹側與背側通路之間存在廣泛的跨網絡交互。
![]()
Fig 5. 變異配分結果表明,聲學表征與類別表征在雙側顳葉區域存在顯著的時空重疊,打破了傳統的嚴格串行加工假設。三、任務目標自上而下特異性增強左側 pSTS 的音素類別表征
大腦對語音的處理并非完全被動。當被試在實驗中被要求專門關注并識別音素(而非韻律)時,其左側 pSTS 對音素的類別表征(而非聲學表征)得到了顯著的自上而下增強。這一效應在右側 pSTS 中并未出現。
這一結果不僅印證了左側 pSTS 在音素范疇化和口語詞匯識別中的特殊核心地位,也表明大腦能夠根據當前的語言任務需求,靈活、動態地調整特定皮層區域對特定抽象層級信息的處理權重。
![]()
Fig 6. 任務調節效應顯示,當被試專注于音素識別任務時,左側后顳上溝(pSTS)對音素的類別表征得到了特異性的自上而下增強。
研究意義
這項研究在理論層面上對經典的語音感知層次模型進行了重要修正。它證明了大腦在處理基本語音構建塊時,采用的是一種“聲學與類別并行處理”的共享計算原則,而非簡單的串行接力。這種并行機制解釋了人類為何能在復雜多變的自然對話中保持極高的語音解碼準確率。
在機制層面上,該工作清晰地展示了大腦如何根據不同語言元素的物理特性(如時間尺度的長短)和語言功能,靈活分配計算資源。短暫的音素依賴腹側通路的局部網絡,而持續的韻律則需要腹側與背側通路的廣泛協同。
當然,這項研究目前僅考察了 VOT 和音高輪廓這兩種特定的聲學線索,且使用了孤立的單音節詞。未來研究仍需進一步探索在連續、自然的真實語流中,大腦是如何將這些分布在不同網絡中的音素與韻律信息重新綁定,最終構建出統一的語義與語用理解的。
分享人:飯鴿兒
審核:PsyBrain 腦心前沿編輯部
你好,這里是「PsyBrain 腦心前沿」
專注追蹤全球認知神經科學的最尖端突破
視野直擊 Nature, Science, Cell 正刊 及核心子刊與頂級大刊
每日速遞「深度解讀」與「前沿快訊」
科研是一場探索未知的長跑,但你無需獨行。歡迎加入PsyBrain 學術社群,和一群懂你的同行,共同丈量腦與心智的無垠前沿。
點擊卡片進群,歡迎你的到來
一鍵關注,點亮星標 ? 前沿不走丟!
![]()
一鍵分享,讓更多人了解前沿
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.