AI as Normal Technology· Sayash Kapoor·· 2026-02-24AI 評分64
新論文《Towards a Science of AI Agent Reliability》分析 AI 智能體可靠性
New Paper: Towards a science of AI agent reliability
AI 導讀
新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。
來源:AI as Normal Technology · normaltech.ai