![]()
英偉達(dá)正式推出NVIDIA Nemotron 3 Embed系列開源嵌入模型,旨在提升檢索增強(qiáng)生成(RAG)、智能體檢索及代碼檢索的質(zhì)量與效率。該系列包含三款模型,在精度與效率平衡上達(dá)到行業(yè)先進(jìn)水平,其中8B參數(shù)模型在RTEB排行榜中位列第一。
模型矩陣:兼顧精度與生產(chǎn)級部署
Nemotron 3 Embed系列針對不同應(yīng)用場景提供了三種變體:
- Nemotron-3-Embed-8B-BF16:旗艦級模型,RTEB榜單排名第一,適用于對精度要求極高的高風(fēng)險企業(yè)級RAG應(yīng)用。
- Nemotron-3-Embed-1B-BF16:高效標(biāo)準(zhǔn)版,專為對成本和延遲敏感的生產(chǎn)環(huán)境打造,兼顧性能與資源占用。
- Nemotron-3-Embed-1B-NVFP4:針對NVIDIA Blackwell架構(gòu)優(yōu)化的硬件加速變體,以極低內(nèi)存占用實(shí)現(xiàn)高吞吐量,適用于超大規(guī)模基礎(chǔ)設(shè)施。
核心特性與技術(shù)優(yōu)勢
除卓越的基準(zhǔn)測試表現(xiàn)外,該系列還具備以下企業(yè)級特性:
- 開放生態(tài):提供開放權(quán)重、數(shù)據(jù)集及訓(xùn)練配方,支持企業(yè)在自有基礎(chǔ)設(shè)施上進(jìn)行微調(diào)與部署。
- 長上下文支持:擁有32k上下文窗口,有效處理長文檔、大型代碼庫及多輪智能體歷史記錄,減少信息截斷。
- 多語言與代碼檢索:支持全球企業(yè)數(shù)據(jù)、技術(shù)文檔及多文件代碼倉庫的跨語言檢索。
- NVFP4高效能:針對Blackwell優(yōu)化的4位量化路徑,在保持小內(nèi)存占用的同時實(shí)現(xiàn)高吞吐量。
- 無縫集成:已在Hugging Face上線,支持NVIDIA NIM微服務(wù)部署及vLLM,并通過主流AI云平臺提供訪問。
基準(zhǔn)評估:檢索質(zhì)量與智能體效率雙升
在RTEB基準(zhǔn)測試中,Nemotron-3-Embed-8B-BF16以78.5%的得分率位居榜首,在MMTEB Retrieval上得分率為75.5%。1B BF16變體則在縮小規(guī)模的同時保留了大部分檢索質(zhì)量,RTEB得分為72.4%,相比前代1B模型錯誤率降低27%。
在智能體工作流評估中,更優(yōu)質(zhì)的檢索能力顯著降低了下游Token成本。使用Nemotron 3 Ultra驅(qū)動的搜索智能體測試顯示,Nemotron 3 Embed模型能更早返回相關(guān)證據(jù),減少重復(fù)搜索與推理輪次。在ViDoRe V3、BRIGHT和BrowseComp-Plus基準(zhǔn)測試中,8B模型實(shí)現(xiàn)了最高的平均檢索準(zhǔn)確率與最低的估計下游Token成本。
針對高吞吐量場景,1B NVFP4變體在Blackwell架構(gòu)上的吞吐量比BF16高出多達(dá)2倍,同時保持了BF16版本99%以上的檢索準(zhǔn)確率。
架構(gòu)演進(jìn):從8B教師模型到1B高效變體
Nemotron-3-Embed-8B-BF16基于Ministral-3-8B-Instruct骨干網(wǎng)絡(luò),通過轉(zhuǎn)換為雙向編碼器并經(jīng)過多領(lǐng)域多語言數(shù)據(jù)微調(diào)而成。1B變體并非從零訓(xùn)練,而是通過結(jié)構(gòu)化剪枝與蒸餾技術(shù)壓縮而來:
- 利用NVIDIA ModelOpt將3B基礎(chǔ)模型壓縮至2B中間規(guī)模。
- 通過量化感知蒸餾(QAD)從8B教師模型恢復(fù)排序準(zhǔn)確率。
- 再次執(zhí)行剪枝與蒸餾,將2B模型壓縮至最終的1.14B嵌入模型,并通過兩階段上下文擴(kuò)展調(diào)度,使其在長輸入中保持判別性召回能力。
產(chǎn)業(yè)界評估與合作
包括Automation Anywhere、Boomi、IBM、Mem0、Palantir、ServiceNow、turbopuffer、You.com、Zep和Zoom在內(nèi)的多家企業(yè)正在評估或集成Nemotron 3 Embed。早期反饋顯示,該模型在提升智能體準(zhǔn)確性、降低延遲及優(yōu)化存儲成本方面表現(xiàn)優(yōu)異。例如,Zep的內(nèi)部基準(zhǔn)測試表明,Nemotron 3 Embed 1B在所有記憶檢索任務(wù)中排名第一;You.com指出替換為該模型后,重排序堆棧性能顯著飛躍。
開發(fā)者入門
開發(fā)者可通過Hugging Face獲取模型權(quán)重與示例代碼,或通過build.nvidia.com訪問優(yōu)化的NIM微服務(wù)。此外,英偉達(dá)開源了NVIDIA NeMo AutoModel訓(xùn)練配方,支持領(lǐng)域適配微調(diào)與模型蒸餾。實(shí)測數(shù)據(jù)顯示,在NV Docs評估中,微調(diào)后的Nemotron-3-Embed-1B-BF16將NDCG@10提升了11.6%。
【星途科訊 圖文丨Patrick 首發(fā)于ZAKER科技,轉(zhuǎn)載請注明出處】
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.