熱點事件持續更新
Harvey 更新法律智能體評測基準
1 篇報道1 個報道來源2 小時前更新
先了解這件事
AI 綜述
2026年10月9日,Artificial Analysis 發表文章,介紹 Harvey 的 LAB-AA v1.1 更新。新版本在評測法律工作智能體任務時,新增按任務來源文件核查模型是否出現幻覺的檢查。報道指出,若模型在任務中出現重大幻覺,該任務在 Hallucination-Gated All-Pass Rate 指標中會得零分。這項更新將來源文件核查納入評測,並以重大幻覺作為該指標的零分判定條件;報道未交代其他功能或測試結果。
AI 根據報道生成 · 2 小時前更新
最新進展10月9日 03:23
Harvey 的 LAB-AA v1.1 新增按任務來源文件核查幻覺,重大幻覺會令該任務在指定指標中得零分。報道時間線
沿着報道,瞭解事件的不同側面。
10月9日
- Artificial Analysis 完整文章Harvey LAB-AA v1.1 加入模型幻覺檢查,提升智能體法律工作的評測標準
Harvey 的 LAB-AA v1.1 新增按任務來源文件核查模型幻覺,重大幻覺會令任務在 Hallucination-Gated All-Pass Rate 中得零分。
本事件熱度走勢
還沒有足夠的連續觀測數據,暫不繪製趨勢。