Google Research·· 2026-04-03AI 評分51
Google Research 評估大語言模型行為傾向的對齊程度
Evaluating alignment of behavioral dispositions in LLMs
AI 導讀
Google Research 提出一套評估大語言模型行為傾向與人類偏好對齊程度的框架,並分析 25 個大語言模型。研究將經驗證的心理問卷改編為情境判斷測試,並以 550 名參與者中每題 10 名標註者的偏好分佈作比較。結果顯示,模型在低人類共識情境仍普遍過度自信,部分模型的自我陳述亦與其在情境中的行為傾向不一致。
來源:Google Research · research.google