跳到正文
原文
英國 AI Security Institute:Blog·· 3 小時前AI 評分38

LLM 評審受檢驗:評估自動評分器的新統計框架

LLM judges on trial: A new statistical framework to assess autograders

AI 導讀

研究人員提出以貝葉斯廣義線性模型(GLM)評估 AI 模型,並同步衡量自動評分器可靠性的框架。框架可按評分資料屬於二元、序數或計數類型,選用相應機率分佈及連結函數,並以後驗分佈表達不確定性。論文中的統計模型以開源套件形式在 GitHub 提供,另有各範例的可重現 notebooks。

來源:英國 AI Security Institute:Blog · aisi.gov.uk