近日,百度正式發布并開源端到端OCR模型Unlimited OCR。模型發布后迅速獲得全球開發者關注,發布次日即登頂 GitHub Daily Trending 榜、Python榜。隨后熱度持續攀升,GitHub Star僅 5天就突破1萬,躋身 GitHub 現象級爆款項目行列,在HuggingFace全球模型總趨勢榜和多模態模型趨勢榜也均排名第一,實現GitHub、HuggingFace四榜第一。
與此同時,百度AI在資本市場也迎來積極信號。6月29日,百度集團-SW
![]()
![]()
![]()
![]()
股價漲超 8%,據The Information 最新報道,百度旗下昆侖芯正計劃赴港上市,目標估值約 500 億美元。
GitHub Star 突破 1 萬,一直被視為全球開源項目影響力的重要分水嶺,而能夠在極短時間內達到這一規模的,通常都是具有現象級關注度的開源項目。Unlimited OCR 僅用 5 天便邁過這一里程碑,展現出強勁的技術實力與全球開發者影響力。
Unlimited OCR 面向長文檔解析場景打造,總參數規模 3B、推理時激活參數僅約 570M。公開評測結果顯示,Unlimited OCR 在 OmniDocBench v1.6 基準測試中取得 93.92% 綜合成績,刷新端到端 OCR 最新紀錄;在保持高精度解析能力的同時,真實文檔場景推理速度較 DeepSeek OCR 提升約 12.7%,輸出長度達 6000 tokens 時速度優勢擴大至 35%。
Unlimited OCR 更重要的意義在于推動了長文檔解析技術向前邁出關鍵一步。過去,OCR 模型面對書籍、論文、報告等長文檔時,通常需要采用“逐頁解析+結果拼接”的工程方案,隨著輸出內容不斷增長,解碼階段的 KV Cache 持續膨脹,推理速度和顯存成本也隨之增加。
針對這一行業痛點,百度提出Reference Sliding Window Attention(R-SWA)機制,為長程解析提供了新的解決思路。該機制借鑒人類閱讀和抄錄長文檔時的工作方式:始終保持對原始文檔內容的關注,同時僅保留最近一段生成內容作為“工作記憶”,而不是無限累積全部歷史信息。基于這一設計,模型能夠在一次前向推理中連續完成數十頁文檔解析,實現從第一頁到最后一頁的連貫輸出,同時將解碼階段的 KV Cache 控制在恒定規模,使計算成本和顯存占用不隨輸出長度持續增長。
![]()
這一突破不僅提升了 OCR 在長文檔場景下的可用性,也為大模型長期記憶管理提供了新的技術思路。近年來,行業普遍通過擴展上下文窗口來增強長程能力,而 Unlimited OCR 則探索了另一條路徑——通過更高效的注意力機制和記憶管理策略,讓模型“學會保留關鍵上下文、適度遺忘歷史信息”,以更穩定、更經濟的方式完成超長任務。
Unlimited OCR 展現的不僅是一項 OCR 能力升級,更是百度在多模態基礎模型和長程推理方向上的一次重要探索,為行業提供了處理超長上下文的新思路。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.