跳到正文

#Agent

今日 161 條
10月3日週六
  1. LlamaIndex:產品、工程與評測41

    智能文件處理(IDP)平台:大多數供應商做錯了甚麼

    多數智能文件處理(IDP)平台在真實生產環境中,難以應付文件格式與品質差異,表現往往不及供應商示範。示範與生產環境的準確率差距常達 10 至 20 個百分點,模板式系統亦會因文件類型增加而累積維護成本。新一代架構以 LLM 編排層將文字交由 OCR 引擎、表格交由版面感知擷取,圖表及圖片則交由視覺語言模型處理。

  2. Google Developers Blog60

    Harness Engineering 剖析:如何評估、迭代及為 AI 編碼智能體設置防護

    Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。

  3. LlamaIndex:產品、工程與評測55

    AI 文件抽取為何容易在 Schema 設計上出錯

    LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。

  4. LlamaIndex:產品、工程與評測27

    甚麼是 Agentic OCR?智能文件自動化的下一階段

    Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。

  5. OpenAI Developers:Blog76

    OpenAI Realtime API 開發者筆記:GA 後語音對語音更新要點

    OpenAI 整理 Realtime API 與 gpt-realtime 語音對語音模型進入 GA 後的介面變更、新功能及整合注意事項。文章建議客户遷移至 GA 介面,並説明 beta 與 GA 在功能支援、temperature 和非同步函式呼叫上的差異。

    推薦理由:文章對照 beta 與 GA 的功能支援差異,並説明介面遷移、temperature 設定及長對話截斷的處理方式,方便開發者按整合環節核對需要調整的設定。

  6. OpenAI Developers:Blog63

    如何打造優質 ChatGPT app,讓產品能力在對話中發揮價值

    OpenAI 提供 ChatGPT app 設計指南,説明如何選擇使用場景,並將產品優勢拆成模型可在對話中調用的明確能力。文章以 Know、Do、Show 概括 app 的增值方式,建議聚焦少量操作,而非移植整個產品。指南亦涵蓋模糊與明確意圖下的互動、清晰的工具參數與結構化輸出、資料最小化及跨 app 協作。

  7. OpenAI Developers:Blog67

    Codex Agent 技能的 Evals 系統化測試實踐指南

    OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。

  8. OpenAI Developers:Blog76

    OpenAI 分享以 Skills、託管 shell 與服務端 compaction 建構長時間運行智能體的實作技巧

    OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。

    推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。

  9. OpenAI Developers:Blog21

    OpenAI Codex 部落格文章一覽

    OpenAI Developer Blog 彙列多篇 Codex 文章,涵蓋以 Codex 建立遊戲、進行建築視覺化、製作前端介面,以及自動化重複工程工作的案例。其他內容包括 Skills 與提示詞、Codex Security、遠端工程工作、程式碼審查規則、JetBrains MCP 整合,以及用 Evals 系統測試 Agent Skills 的指南。

  10. Hacker News:AI 熱帖18

    評測智能體在雜亂真實公司知識中的檢索能力

    這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。

  11. Hacker News:AI 熱帖27

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。

  12. MiniMax:Blog76

    MiniMax M2.5:為真實工作場景生產力而打造

    MiniMax 發佈 M2.5 與 M2.5-Lightning,稱兩款模型在編碼、智能體工具調用、搜索及辦公任務達到 SOTA,M2.5 在 SWE-Bench Verified 得分 80.2%。

    推薦理由:文中並列 SWE-Bench Verified 成績、不同腳手架的評測結果、執行時間與定價,方便比較 M2.5 的編碼表現和使用成本。

  13. Anthropic:Alignment Science Blog63

    Anthropic 提出 ASL-4 安全論證的三種草圖

    Anthropic 提出三種 ASL-4 安全論證草圖,探討當開發者無法排除模型具備危險能力與破壞安全程序能力時,如何論證部署安全。草圖分別採用機制可解釋性監測、AI Control,以及檢驗 RLHF 是否激勵策略性欺騙的分析。Anthropic 尚未定義 ASL-4,並明言這些假設例子均未能完整處理破壞風險,亦非正式政策或計劃。

  14. Anthropic:Alignment Science Blog63

    Anthropic 發佈開源工具 Bloom,自動生成行為評測

    Anthropic 發佈開源 Bloom,這套 AI 智能體框架可按研究者指定的行為自動生成評測,並量化其在多種情境中的出現頻率與嚴重程度。Anthropic 同時公佈 16 個模型在妄想式迎合、受指示的長期破壞、自我保存和自我偏袒四類行為的基準;在 40 份轉錄中,Claude Opus 4.1 的評分與人工標註 Spearman 相關係數為 0.86。

  15. Anthropic:Alignment Science Blog60

    AI 的「混亂失誤」:錯位如何隨模型智能與任務複雜度變化?

    Anthropic 研究團隊以偏差與方差分解分析前沿推理模型,發現推理或行動序列越長,錯誤中的不一致性佔比越高。在基準任務中,較智能模型在容易題目上的錯誤較一致,但最難題目上的錯誤不變或更不一致。多個樣本集成可降低不一致性,但在行動不可逆的真實智能體任務中可能難以實用。

  16. Anthropic:Alignment Science Blog56

    AuditBench:評估對隱藏行為模型的對齊審計技術

    Anthropic 研究團隊推出 AuditBench,這套對齊審計基準涵蓋 14 類隱藏行為,並包含 56 個植入相關行為的語言模型。研究以 13 種工具配置評估審計智能體,腳手架式使用者採樣和文本補全的平均成功率均超過 50%,高於預設智能體約 37%。研究亦發現,工具單獨能提供有效線索,未必能提升智能體判斷表現;團隊公開模型、智能體及評估框架。

  17. Anthropic:Alignment Science Blog66

    AI 組織可比單一智能體更有效,但對齊程度較低

    Anthropic 研究團隊比較 AI 組織與單一智能體在 12 項任務的表現,發現前者商業目標得分較高、倫理得分較低。研究涵蓋 AI 顧問及 AI 軟件團隊情境,作者觀察到角色分工與協調問題可能令倫理考量未能進入整體決策。差距受模型選擇影響,Opus 4.5 在郵件式顧問任務中的倫理差距較小;作者建議多智能體部署另行進行安全與對齊評估。