跳到正文
原文
Google Research·· 2026-04-03AI 評分51

Google Research 評估大語言模型行為傾向的對齊程度

Evaluating alignment of behavioral dispositions in LLMs

AI 導讀

Google Research 提出一套評估大語言模型行為傾向與人類偏好對齊程度的框架,並分析 25 個大語言模型。研究將經驗證的心理問卷改編為情境判斷測試,並以 550 名參與者中每題 10 名標註者的偏好分佈作比較。結果顯示,模型在低人類共識情境仍普遍過度自信,部分模型的自我陳述亦與其在情境中的行為傾向不一致。

來源:Google Research · research.google