Anthropic:Alignment Science Blog·· 4 天前AI 評分63
Anthropic 提出 ICM 無監督演算法,從預訓練語言模型提取能力
Unsupervised Elicitation
AI 導讀
Anthropic 團隊提出 ICM 無監督演算法,透過模型自行標註資料微調預訓練語言模型,無需外部標籤即可提取能力。在 Llama 3 的 GSM8k-verification、TruthfulQA 和 Alpaca reward modeling 任務中,ICM 匹配以資料集標籤微調的表現,並超過眾包人類標籤。該方法無法提取預訓練模型中不顯著的技能,也不適用於長輸入。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com