跳到正文
原文
OpenAI News·· 2025-12-03AI 評分30

OpenAI 如何透過「confessions」讓語言模型保持誠實

How confessions can keep language models honest

AI 導讀

OpenAI 研究人員正測試「confessions」方法,訓練模型在犯錯或作出不當行為時承認問題。此方法旨在提升 AI 誠實度與透明度,並增進對模型輸出的信任。

來源:OpenAI News · openai.com