一、當AI開始為物理世界的信任定價
WAIC 2026 在傳遞出一個信號:scaling law 正在被改寫。
圖靈獎得主、強化學習之父 Richard Sutton 在 WAIC 2026 主論壇中指出:人類數據已經達到極限——已經很難再靠簡單增加預訓練數據量來提升模型能力。
與此同時,WAIC 一場多位院士同臺的語料生態論壇形成共識:AI 競爭正在從「誰算得多」轉向「誰懂得深」——高質量垂類數據正成為每一個應用場景的決勝點。
這些觀點都指向同一個結論:通用數據即將見頂,誰擁有更深、更高知識密度的行業數據,誰才能擁有通用大模型之外的差異化能力。
商品交易恰好是一個通用的競技場——精準地判斷一件商品的真假、成色和估價,不是互聯網上能搜到的信息,而是面向交付的生產過程中形成的專家數據。
這個場景里生長出了一家提供垂直模型、數據和服務的公司——圖靈深視。這家由清華大學孵化的公司,想實現一個簡單的愿景:用 AI 守護商品交易信任。
他們的發展路徑并不典型:與大多數 AI 應用公司直接調用通用模型能力,再自上而下積累底層應用數據的路徑不同,圖靈深視選擇先通過人機協同的「臟活累活」模式深耕商品鑒定質檢場景,交付 100%「鑒錯包賠付」的服務,積累高精度、高知識密度數據,再自下而上構建垂直大模型——基于此,還牽頭制定并發布了全國首個《AI 鑒定》團體標準。今天,他們發布了新一代商品評估大模型「圖靈鑒 X」。
圖靈鑒 X 的創始人唐平中是清華大學教授,他的學術背景聚焦于博弈論、機制設計與平臺算法。博弈論里有一個經典結論:一個能真實反映商品信息的平臺,比一個放任虛假信息的平臺,能促成更多交易——這也是諾貝爾經濟學獎得主 Roger Myerson 的核心洞見(revelation principle)。唐平中堅信,用技術手段讓商品交易信息回歸真實,是利國、利業、利民的正確路徑。
但要讓 AI 真正「在物理世界干活」,遠比想象中難。從「看懂圖片」到「看懂商品」——品牌、款式、真偽、成色、瑕疵、價格——這不再是計算機視覺問題,而是基于海量高質量圖文對構建、訓練和推理的多模態大模型問題。
圖靈鑒 X 的核心架構是 LLM-EDC(LLM-Enhanced Discriminative Core,大模型增強的判別內核)。
通用多模態大模型擅長理解意圖、解析問題和組織語言,卻不擅長判斷「壓印邊緣是否平滑」這類細粒度差異;專業判別模型判斷更精準,卻缺乏任務規劃和解釋能力。LLM-EDC 將兩者解耦協作:大模型理解圖片與鑒定問題,確定需要關注的部位和特征,再通過 MoE 路由,將任務動態分發給相應的專家判別模型。兩者各司其職,最后聚合結果并生成鑒定說明。
但鑒定不僅要準確,更要「判斷有據」。傳統模型學習的是「圖片→標簽」,只對結論負責;圖靈鑒 X 不同,它學的是「圖像—結論—依據」三元組。行業專家在標注真偽的同時,還會與 AI 討論關鍵部位、異常特征及判斷理由,并將這些專業依據用于再次訓練。模型學習的是「證據定位—特征判斷—結論生成」的完整鏈路,輸出不再只是「真/假」,而是可核驗、可追溯的推理鏈,例如:
皮標壓印邊緣存在毛刺,與正品工藝特征不符,因此判定為假。
在此基礎上,圖靈鑒 X 引入了 RLVR(可驗證獎勵強化學習),讓獎勵不僅取決于結論是否正確,也取決于模型是否關注了正確區域、識別出關鍵異常,以及證據能否支撐結論。模型優化的目標由「猜中標簽」升級為「基于正確證據得出正確結論」。
隨著鑒定師持續新增判斷依據,數據會回流訓練,推動專家模型、路由策略和證據生成能力不斷迭代,形成隨造假手法持續進化的數據飛輪。EDC 構建的,不只是一個分類模型,而是一套以專業證據為核心,可驗證、可追溯、可持續進化的智能評估內核。
![]()
唐平中在發布視頻中定義了圖靈鑒 X 的能力版圖:
「商品評估包括識款式、鑒真假、評成色、識瑕疵、估價格。每個功能都支持多輪次多模態交互。圖靈鑒 X 是全行業首個多輪次多模態交互的商品評估產品。」
![]()
發布視頻中具體展示了運用圖靈自研的軟硬件產品評估、鑒定不同的品類——不是功能清單巡展,而是每個品類的評估能力都已經能適應有挑戰性的實戰場景:比如高仿包袋,大多數鑒定機構已經放棄接單;做舊瓷器,肉眼看不出問題;美妝護膚品,盒子真、瓶子和質地假;高仿潮鞋,資深鑒定師連連「翻車」……每個場景都在回答同一件事:難在哪里,圖靈鑒 X 怎么解決。
二、品類能力——不同場景中的技術縱深
包袋:可解釋的證據鏈與可量化的價值評估
視頻中,首席奢侈品包袋鑒定師 Blue 演示了一款高仿 Coach 包:拍一張外觀圖,系統從多個維度持續輸出結論。結果:非正品,高精仿。推理依據逐點展示——白標油墨字間距及字形存在差異、油邊厚重。每個判斷都伴有可解釋依據,而不是甩出一個「假」的結論。
![]()
這背后是 X-VLM 可解釋多模態判別技術:通過跨模態注意力與證據定位,將結論錨定到具體的視覺區域和文本依據,形成可追溯、可核驗的證據鏈,把「黑盒決策」轉化為「可解釋的特征判斷」。
在此基礎上,圖靈鑒 X 采用基于可驗證獎勵的強化學習(RLVR)框架,以過程獎勵(Process Reward)的方式,將鑒定師的專業經驗拆解為證據定位、異常識別、推理一致性等多個可驗證環節,并納入模型優化目標。模型優化的不只是最終結論是否正確,更包括整條推理鏈路是否建立在有效證據之上、是否符合專業鑒定邏輯。
隨后,Blue 演示了一款 LV 中古包的大模型評估,依次拍攝五金磨損、底角磨損、肩帶褶皺,系統評估為 88 新,再基于款式和成色給出估價區間:998~2100 元。唐平中強調:對于二手商品,價格是款式和成色的函數。同樣一款 LV,99 新和 90 新的價格差別很大——必須先量化評估成色,再給出價格。
錢幣:專家經驗的數字化與鑒定邏輯的函數化
古錢幣鑒定有獨特挑戰——每一枚錢幣經過長時間流通,包漿、品相獨一無二,模型沒法靠「背標準答案」進行學習和輸出。視頻中演示了一枚崇寧重寶:拍攝正反兩面,系統馬上給出鑒定報告——真品,綠銹自然分布,呈現「入骨銹」特征,市場估值 500~700 元。
![]()
![]()
針對同一圖片,多位專家分別給出人類反饋,系統對標簽一致性和理由一致性進行綜合計算,并將其轉化為獎勵信號——把人的經驗直接翻譯成模型能理解的數學語言,確保輸出的準確性。
瓷器:在推理中適應,在動態中穩定
瓷器通過高拍儀演示,這也是在 WAIC·央視 AI 盛典上,唐國強用來「AI 鑒寶」的儀器。把瓷器放在高拍儀攝像頭下,系統自動識別并截取關鍵鑒定點——整體器型和底部。視頻中的高仿瓷器被 AI 判別為假——底部存在人工做舊,獅子和花卉線條不符合清早期特征。
「這個看起來也沒有賊光啊。」誠如唐平中所言——肉眼看不出的油潤感問題,系統精準判別為假。
![]()
為應對瓷器在不同光照環境下——如拍賣行強光、倉庫暗光、手機閃光燈——產生的釉色反光干擾,以及高仿瓷器隨時間推移不斷升級所帶來的「仿古偽作分布漂移」,系統引入了 TTA(測試時自適應)。在不觸動核心模型權重的前提下,僅在推理時動態調整批歸一化參數,不僅可以讓模型「即時適應」新環境,還能確保線上推理具有極高的魯棒性。
服裝:OCR + 瑕疵——從鑒定到質檢的延伸
視頻中的服飾品類由潮品算法負責人 Leo 演示,展示了圖靈鑒 X 在瑕疵檢測、OCR 兩個核心維度的質檢能力。
瑕疵檢測:使用圖靈鑒 X 拍照,AI 識別并框選瑕疵點位——結果顯示,系統框出了衣服上的 4 處主要瑕疵,均標注為臟污類型,并標明每處瑕疵的具體位置。這里有一個細節值得一提:瑕疵樣本在真實場景中畢竟是少數,圖靈深視使用人類反饋強化學習進行數據生成,補充訓練數據。技術層面采用 CLLAD(對比學習驅動長尾判別)和 DAMN(域對齊多尺度注意力)——后者自適應對齊不同物理形態下的印刷與織線特征,消除柔軟織物褶皺形變帶來的干擾。
![]()
OCR:使用圖靈鑒 X 小程序拍攝吊牌照片,幾秒內即可完成文字識別和結構化輸出——品牌、產地、材質自動提取,AI 提取結果與吊牌實際文字完全一致。
![]()
圖靈深視的 AI 質檢系統已將這些視覺評估能力落地于倉儲物流環節,為品牌方和電商平臺提供供應鏈端的品控支持。據公開信息,公司目前已與多家國際物流企業和頭部跨境電商企業建立合作關系。
從 AI 鑒定到 AI 質檢,這套歷經多年迭代的視覺技術,正在不同業務場景中展現出可遷移的通用性,覆蓋更多物理世界的商品流通節點。
潮鞋:AR 鑒定眼鏡與對抗性持續學習
潮鞋品類通過 AR 鑒定眼鏡演示——解放雙手,眼鏡內實時提示鑒定點位,把鑒定點放到視線內,1 秒鐘拍攝一個。這是目前市面上唯一面向鑒定場景的 AR 眼鏡產品。
視頻中,Leo 戴上眼鏡拍攝鞋內、鞋外和鞋盒,結果顯示:不符合正品工藝,高仿。Leo 補充道:很多身經百戰的鑒定師都在這個批次上「翻車」。
![]()
為了攻克潮鞋鑒定中的技術難點,圖靈自研并落地了兩項重要技術:
DiffuLT:按鑒定師指定的缺陷類型,定向合成稀缺假貨訓練樣本。真實世界里,某類新出現的造假手法樣本往往很少,不足以支撐訓練。系統會按鑒定師指定的缺陷類型,比如某處車線、某種壓膠,定向合成對應的仿冒樣本,把「該學卻見得少」的情況補齊。
模型融合:每出現一類新造假,單獨微調出一個「任務向量」,再以權重融合的方式并入主模型。舊款式的能力保存在原有權重里,結構上不被覆蓋;新手法以增量方式疊加,無需重訓整模,也能快速迭代。
美妝:從包裝盒到內容物鑒定
視頻中,美妝品類通過高拍儀演示。美妝鑒定負責人 Emma 把一瓶海藍之謎精粹水放到高拍儀下,按提示翻轉產品,AI 自動截幀并提取鑒定點,幾秒內完成全部評估:符合正品工藝,批號無誤。唐平中追問:包裝盒真、瓶子假怎么辦?Emma 演示了拆盒檢測——分別拍攝瓶身各部位進行檢測。
![]()
![]()
美妝鑒偽的難點,是判斷包裝盒和瓶身的文字是否由正確的字模、制版和印刷工藝產生。其鑒定技術核心可以拆分為三層:
字體取證:系統以高分辨率視覺 Transformer 將文字切分為字符級、筆畫級視覺 token,在識別品名和批號的同時,比對筆畫骨架、字腔比例、字距、基線、油墨擴散和燙印邊緣。傳統 OCR 追求「字體變化后仍能認出同一個字」,字體鑒偽則反過來:文字內容越相同,模型越要捕捉細微的字形和工藝差異,將其編碼為可檢索的「生產指紋」。
多幀融合與 MIL:高拍儀在產品翻轉過程中采集連續畫面,模型通過幀間配準,融合不同角度的反光、壓印和紋理信息。隨后,MIL(多實例學習)將盒體、瓶身、標簽、批號繼續拆分為字符與筆畫實例,并以 Top-K 異常聚合實現鑒定師的核心規則——任一關鍵部件異常,都會提升整件商品的風險,而不會被其他正常區域平均掉。
開放集檢測與 UDA:假貨樣式無法窮舉,模型因此不只學習「見過的假貨」,而是為不同品牌、SKU 和批次建立正品原型空間,檢測偏離正品分布的未知異常。面對換版、換批次和拍攝環境變化,UDA(無監督域適應)再通過自監督表征與原型對齊,將舊品規知識遷移至新品規,在減少重新標注成本的同時,區分正常迭代與偽造工藝。
最終,系統輸出的不只是「真或假」,而是一條可解釋的證據鏈:批號規則是否成立、字模是否匹配、排版是否偏移,以及異常究竟來自盒體、瓶身還是印刷工藝。AI 讀取的是文字,鑒定的則是文字背后的生產系統。
線下實物鑒定:AI + 儀器 + 專家,錯一賠貨值
圖靈鑒 X 在線上提供云鑒定服務「圖靈專鑒」,線下在全國設有十余家實物鑒定中心。線上線下的底層邏輯是一樣的——人機系統:AI 置信度較高的訂單直接輸出結果,置信度較低的訂單交由人工復核,爭議案例則由資深專家與 AI 協作,作出最終裁決。線下再加入儀器檢測,形成 AI、儀器、專家三重驗證。
不同品類的鑒定結果出具方式不同:鞋、包、服、妝出具鑒定報告,并掛簽或貼簽;珠寶、玉石、貴金屬出具 CMA 證書;錢幣、卡牌進行評級封裝。線下鑒定準確率為 99.999%。
線下圖靈評鑒提供「錯一賠貨值」保障。敢賠錢,是因為高精度的 AI 直接輸出,以及精度更高的人機系統協同交付。據了解,圖靈內部將假陽率——即把假的判成真的比例——作為核心管控指標,在高價值品類上,假陽率趨近于零。
![]()
餐品:檢索權威數據再計算
視頻最后還有一個彩蛋——算法科學家 Ron 和唐平中邊吃外賣邊「鑒餐」。拍一張外賣照片,系統給出碳水化合物、蛋白質、脂肪含量,以及安全和營養等評分。
有一個細節:系統顯示總能量為 1480 大卡,人均值為 740 大卡——它自動識別出這頓飯是兩個人吃的。圖靈鑒 X 還具備茶葉、大閘蟹等食品的鑒定能力——以龍井茶為例,可以判斷產區、品種,甚至新舊程度。
![]()
![]()
鑒餐的技術底座可以概括為一句話:不讓大模型直接猜數字,而是識別食物→通過 RAG 檢索權威營養數據庫→經過結構化推理后進行估算。其技術基于多篇前沿論文的方法組合——不是靠參數量硬猜,而是檢索權威數據源后再計算。
三、隨機抽樣評測:通用大模型、人工圖片鑒定平臺
與其他垂直領域測評不同,鑒定模型的能力評估,不能在公開或不均衡的數據集上驗證。例如,在一批公開的或 100% 為正品的數據上,專家或模型均能輕松達到 100% 的準確率。
機器之心從多家實物鑒定中心近 48 小時的鑒定樣本中,隨機抽取了 100 套樣本,按 1∶1 配置真假樣本,制作了一個實時的小型 benchmark。每個樣本都經過實驗室方法進行實物鑒定,確保測試標簽的準確性。
為保證測評有效性,本次抽樣重點滿足兩個條件:一是時效性,樣本來自近期真實訂單,避免模型更新后將其納入訓練集;二是對抗性,盡可能覆蓋足以迷惑普通消費者,甚至通用模型的高仿產品。
在統一圖片、輸入信息和計時口徑的前提下,對不同參評對象進行測試,并控制樣本難度、信息量等變量。
本次測評定義了三個核心指標:
? 鑒定準確率:能否正確判斷商品真偽。無法鑒定、需要補圖等未給出明確真假結論的情形,均計為錯誤。
? 鑒定時效性:從上傳鑒定圖片到輸出完整結果所需的時間。
? 理由合理性:模型給出的證據是否具體、可信,并能夠支撐最終結論。
其中,圖靈鑒 X 將與各品類頭部專業鑒定平臺比較準確率與鑒定時效,同時與頭部多模態大模型比較鑒定理由的合理性。換言之,這場測評不僅考察「判得對不對、快不快」,也考察「為什么這樣判」。
人工圖片鑒定平臺選擇:
? 平臺 D:行業知名圖片鑒定平臺,聚焦潮品鑒定和交易。
? 平臺 W:行業知名圖片鑒定平臺,聚焦美妝鑒定。
? 平臺 Y:行業知名圖片鑒定平臺,聚焦古玩文玩鑒定。
鑒定理由打分:
由三方資深鑒定師團隊采用匿名方式進行評審。所有輸出均隱去模型來源并隨機打亂,鑒定師依據證據定位、特征描述和推理一致性進行獨立評分,最終取平均分。
評分采用 0、1、3、5 分四級量表:
? 5 分|結果正確并解釋精準:準確定位關鍵鑒定部位,明確描述紋理、刻印、Logo 等特征,且證據與正品工藝標準及最終結論高度一致。
? 3 分|結果正確并解釋模糊:結論正確,但理由較為空泛,例如僅稱「整體質感不符」,沒有命中決定真偽的核心特征。
? 1 分|結果正確并存在幻覺型解釋:理由存在常識性錯誤、邏輯矛盾或憑空捏造。即使碰巧得到正確結論,也無法形成可信的證據支撐。
? 0 分|結果錯誤。
評測結果:
(1)準確率對比
![]()
注:人工圖片鑒定平臺 D 在包袋品類中出現 1 次無法判斷、7 次要求補圖;潮服品類中有 1 次因圖片質量問題未給出結論。人工圖片鑒定平臺 W 在美妝品類中出現 2 次無法判斷、6 次要求補圖。人工圖片鑒定平臺 Y 在錢幣品類中出現 2 次無法判斷。按統一規則,上述情況均記為未命中。在上述測試中,均選取了人工平臺覆蓋且擅長的品類進行測試。
在這組近期真實訂單樣本中,圖靈鑒 X 在包袋、潮鞋、潮服和美妝四個品類中均取得 100% 的準確率,在錢幣品類中達到 95.5%。
人工圖片鑒定平臺 D 在潮鞋和潮服等品類中表現出較高水準,其中潮鞋準確率同樣達到 100%;但在包袋品類中,其準確率僅為 63.6%,跨品類表現存在明顯波動。相比之下,圖靈鑒 X 的優勢并非集中在某一個品類,體現了更穩定的多品類泛化能力。
在本次評測所覆蓋的近期高仿樣本及統一輸入條件下,圖靈鑒 X 展現出了更為突出的跨品類泛化能力與性能穩定性。這一結果也在一定程度上印證了 LLM-EDC 架構的設計思路:由大模型承擔任務理解、流程規劃與專家模型調度,再由細粒度判別模型針對 Logo 刻印、印刷工藝、材質紋理等專業鑒定特征進行深度分析。
通過將通用模型的認知與推理能力同垂直領域模型的精細辨識能力結合,系統得以在不同品類之間維持相對一致的鑒定表現。
(2)時效性對比
![]()
本輪評測中,圖靈鑒 X 在五個品類上的鑒定用時,均顯著低于速度最快的人工圖片鑒定平臺,顯示出了 AI 的實時性和普惠性。
(3)鑒定理由評測
![]()
注:「未提供」表示該平臺不輸出鑒定理由,不按 0 分處理。
相比只輸出真偽結論,鑒定理由更能檢驗模型是否真正識別了關鍵特征。評測結果顯示,圖靈鑒 X 在包袋、潮鞋、潮服、美妝和錢幣五個品類中均取得最高分,單項得分為 3.07~4.00 分,五品類等權平均達到 3.48 分。表現最好的通用多模態大模型平均得分約為 2.00 分,圖靈鑒 X 領先 1.48 分。
更值得關注的是,這種優勢并未集中在單一品類。無論是依賴刻印工藝、Logo 刻字和材質判斷的包袋、潮鞋,還是專業知識門檻更高的錢幣與美妝,圖靈鑒 X 都保持了相對穩定的證據輸出能力。
這說明它給出的理由并非套用「質感不符」「做工粗糙」等通用描述,而是更傾向于定位具體部位、識別異常特征,并建立證據與結論之間的對應關系。
綜合結論
綜合準確率、鑒定時效性和理由合理性,圖靈鑒 X 在近期真實訂單的高仿樣本中體現出「判斷準確、響應高效、證據可核驗」的系統性優勢。
這與 LLM-EDC 的架構分工相吻合:大模型負責理解任務、規劃關鍵區域并組織表達,MoE 路由動態調度細粒度專家模型,證據監督則約束結論建立在具體特征之上。
四、商品交易信任的基礎設施
商品評估大模型時代的開啟,改變的不只是效率——更是信任結構和話語權。
一件商品值多少錢,過去賣家說了算;真假怎么判,所謂專家說了算;出了問題誰來兜底,沒人來擔責。圖靈鑒 X,是把「說了算」從個人經驗變成第三方獨立、人人可驗證的普惠能力——每一步都透明、可驗證,每一次出錯都有賠付兜底。
據了解,圖靈鑒 X 小程序版、網頁版均已上線,并向所有用戶開放免費體驗——這既是建立賣家信任的基座,也是重塑買家信任的入口。
- 網頁版:https://x.tulegit.com
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.