Cohere Labs:官方研究博客·· 4 天前AI 評分44
大型語言模型在 RAG 中的檢索穩健性評估
Evaluating the Retrieval Robustness of Large Language Models
AI 導讀
研究以涵蓋五個資料集、三類任務的 1,891 個樣本,評估 11 個 LLM 在實際 RAG 設定中的檢索穩健性;整體穩健性普遍偏高,但因任務而異。停用推理時,Qwen 和 GPT 模型的穩健性明顯下降,即使在單跳 QA 任務上亦然;把檢索文件作為工具回覆提供,則提升 Claude 模型表現、損害 Qwen 和 GPT 模型表現。研究指出,是否採用 RAG 仍須按個案判斷。
來源:Cohere Labs:官方研究博客 · cohere.com