RCP-nDCG@10:更全面衡量檢索相關性的方法
RCP-nDCG@10: A more complete way to measure retrieval relevance
Cohere提出 RCP-nDCG@10,試圖補上傳統 nDCG 依賴既有相關性標籤、可能漏掉新系統找出的有用文件這個缺口。Cohere的盲評研究中,兩種指標選出不同勝方時,評審有70%站在 RCP-nDCG 一方;不過整體勝方命中率是在刻意增加指標意見不一致案例的樣本中計算,不能直接視為一般情況下的勝率。
傳統檢索指標各有側重,nDCG的弱點在於標籤
Recall@10、MRR及 nDCG@k 衡量檢索品質的不同面向。nDCG同時考慮相關程度和排名位置,但它本身不判斷文件是否相關,而是依據既有的人工作答判斷集(qrels)評分。由於全面評估大量查詢與文件組合成本高,qrels通常只涵蓋一部分文件;因此,新系統找到但未曾標註的相關文件,傳統 nDCG 可能不會給分。
- ViDoRe v3 的一個查詢中,答案集只評定兩份文件,其中一份出現在系統前五名;排名第三的文件雖直接引述答案,卻因從未被標註而不算相關。該例的 nDCG@5 為 0.760,只反映五項結果中的一項。
- Cohere指出,系統愈能探索舊系統未曾找到的語料部分,舊有判斷集的涵蓋不足就愈可能影響基準評分。
| 指標 | 衡量重點 |
|---|---|
| Recall@10 | 前十項結果包含多少相關資料;不看結果排序。 |
| MRR | 第一項相關結果排得多前;不考慮其後的結果。 |
| nDCG@k | 兼顧相關程度與排序位置,排名較前的有用結果權重較高;依賴既有相關性判斷。 |
Cohere的標註研究顯示判斷集與人工評估有落差
Cohere稱,其46人人工標註研究中,qrels對盲評人工相關性判斷的預測能力有限:作為預測人工評分的指標,AUC為0.65;以校準後的LLM相關性分數計算,AUC為0.91。這些是該公司研究中的結果,並不表示人工判斷本身毫無歧義。
- 基準把29%的文件標為相關,人工評審則認為60%有用;基準標為不相關的文件中,28%被人評為有用。反過來,基準標為相關的文件中,15%連基本的主題相關性都未達到。
- 兩位評審獨立以0至4分評同一文件時,完全一致的比例為42%;原文另提及一項重新標註標準基準的研究,評審一致度曾低至17%。
RCP-nDCG@10如何評分
RCP-nDCG@10保留 nDCG 按排序給分的目標,但不只依靠原有答案集:校準後的AI評審會按同一套相關性準則評估每份檢索文件,讓未列入舊判斷集的文件也有機會獲得分數。
- AI評審會對每份文件回答五項是非題,題目難度不一,但每個查詢都使用相同問題。
- 評審亦會把文件分組互相比較,估計各文件勝過其他文件的可能性;校準時由文件比較決定排序,相關性準則則把排序放到跨查詢共用的分數尺度上。
- Cohere表示,這套設計要讓不同查詢的分數具有相同含義;它比單純讓LLM為每份文件給一個分數多了比較與校準步驟。
盲評支持新指標,但結果須連同樣本設計理解
Cohere在 NanoBEIR、BRIGHT及 ViDoRe v3 的查詢上進行盲評:46名受聘評註者均至少持有相關領域的學士學位,評審系統的前五項結果時看不到系統名稱、排名或答案集。每場系統對決由三名評註者審閲,以多數票決定勝方;273個查詢中的289場對決得出判決。
- 在 RCP-nDCG 與傳統 nDCG 選出不同勝方的對決中,評審有70%支持 RCP-nDCG。RCP-nDCG差距大約高於0.02時,評審同意率為82%;差距低於該水平時,同意率不比擲硬幣好。差距最大時同意率達97%;傳統 nDCG 即使在差距最大的情況,同意率也只有53%。
- 所有對決合計,RCP-nDCG選中評審偏好系統的比例為77%,傳統 nDCG 為52%。但樣本刻意多收兩種指標意見不一致的對決;在指標一致的案例中,兩者都與評審結果相符,比例為87%。
- 當兩種指標意見不一時,不同答案集涵蓋程度下,評審支持 RCP-nDCG 的比例介乎64%至78%。Cohere把其優勢主要歸因於替答案集漏掉的相關文件計分,帶來19個百分點;評定文件相關程度再增加6個百分點。單獨加入相關程度評分只增加3.3個百分點,因為它只能重新衡量答案集已有的文件。
對模型開發的影響與適用界線
Cohere表示,在開發即將推出的第五代 Embed 與 Rerank 時,選擇以 RCP-nDCG@10 而非傳統 nDCG 作為優化目標;因此新模型未必會在舊版 nDCG 評分中顯得最強。該公司的目標是讓模型更貼近使用者實際找到相關資訊的體驗,而非單為某項指標優化。
- 本文的驗證比較的是多個基準資料集上、盲評者對前五項結果的偏好。它支持 RCP-nDCG 在這種評估設計下較能反映人工判斷,但不能單憑這些結果證明實際部署成效,也不等同證明AI評審就是客觀的相關性真值。
- 原文沒有提供第五代模型的具體檢索成績;所述的是 Cohere 選用的開發指標及其理由。
來源:Cohere 產品與研究博客 · cohere.com