快科技7月21日消息,英特爾工程師近日向Linux內核提交了冷重置恢復補丁,專門針對Xe顯卡驅動的硬件錯誤處理,該補丁已歷經近十二個版本迭代。
此前遇到電源管理單元(PUNIT)錯誤時,顯卡在熱重置或驅動重新加載后仍無法恢復,用戶只能重啟整臺電腦。
補丁在DRM核心代碼中引入了一種新的恢復方法:DRM_WEDGE_RECOVERY_COLD_RESET。當顯卡因不可恢復錯誤被標記為失效時,驅動將請求冷重置而非系統重啟。
這意味著顯卡可以從硬件層面徹底斷電再通電,無需牽連整臺電腦。
DRM核心會通過uevent向用戶空間發出冷重置通知。隨后,udev等系統服務可根據配置自動執行相應操作。整個過程無需用戶手動干預,系統在顯卡發生嚴重錯誤時能完成自我修復,大大降低了運維復雜度。
該功能對數據中心和服務器場景意義重大。在大規模部署英特爾Xe顯卡的AI推理和云游戲環境中,GPU錯誤導致的整機重啟會嚴重影響服務可用性。冷重置恢復機制可將停機時間從分鐘級縮短至秒級。
目前補丁已發布在dri-devel郵件列表上供社區審查。未來英特爾GPU在Linux上遇到特定PUNIT硬件錯誤時,系統可自動執行設備級冷重置,無需重啟整機。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.