Hacker News:AI 熱帖·· 4 天前AI 評分18
評測智能體在雜亂真實公司知識中的檢索能力
Benchmarking retrieval for agents on messy real-world company knowledge
AI 導讀
這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。
來源:Hacker News:AI 熱帖 · news.ycombinator.com