跳到正文
原文
Hacker News:AI 熱帖·· 4 天前AI 評分27

Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器

Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers

AI 導讀

Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。

來源:Hacker News:AI 熱帖 · news.ycombinator.com