LlamaIndex 推出 Turbo Beta 文件抽取層,面向低延遲即時工作流
LlamaIndex 在 LlamaParse Platform 推出 Turbo Beta 文件抽取層,面向低延遲的即時工作流。在 ExtractBench 上,Turbo 比 Cost Effective 快約 4 倍,單頁中位處理時間為 3.7 秒,F1 為 0.84;它直接從文件頁面抽取內容並行處理,中、長文件約為每頁 0.5 秒。
LlamaIndex 在 LlamaParse Platform 推出 Turbo Beta 文件抽取層,面向低延遲的即時工作流。在 ExtractBench 上,Turbo 比 Cost Effective 快約 4 倍,單頁中位處理時間為 3.7 秒,F1 為 0.84;它直接從文件頁面抽取內容並行處理,中、長文件約為每頁 0.5 秒。
Google for Startups AI Agents Challenge 各賽道的高排名參賽方案呈現四種工程模式,包括雙向 MCP、事件驅動並行、模型回退後共用驗證,以及昂貴模型調用前的分層路由。
LlamaIndex 將先低成本解析並檢索、再對相關頁面執行 VLM-OCR 的流程稱為 Just-in-Time Agentic OCR,適用於約 10–100 份文件的臨時資料室。
多數智能文件處理(IDP)平台在真實生產環境中,難以應付文件格式與品質差異,表現往往不及供應商示範。示範與生產環境的準確率差距常達 10 至 20 個百分點,模板式系統亦會因文件類型增加而累積維護成本。新一代架構以 LLM 編排層將文字交由 OCR 引擎、表格交由版面感知擷取,圖表及圖片則交由視覺語言模型處理。
Google 宣佈 ADK for Kotlin 1.0 正式推出,為 Kotlin、Android 及伺服器端開發提供 AI 智能體工具包。版本功能與 ADK 1.0 Core 完整對齊,涵蓋多智能體協調、上下文壓縮、多輪對話、人工確認和工作階段恢復。
Google Developers Blog 提出評估 AI 編碼智能體的方法,主張以行為評測補足端到端基準,觀察可驗證的中間操作而非只看最終結果。文章建議先針對單一失誤設定目標,按任務複雜度選擇嚴格或彈性的斷言,再以批次評測追蹤整體通過率。行為評測與大型端到端評測互補,可用來檢查提示詞、工具 schema 或模型更新是否造成回歸。
LlamaIndex 指出,AI 文件抽取在生產環境失準,往往源於 Schema 未界定欄位語義、可空性或重複資料結構,而不只是模型讀取錯誤。其 ExtractBench 涵蓋 4,869 頁、370 份文件、8 個業務領域及 67 種文件類型,分開衡量值 F1、記錄完整度與詞級及頁級 grounding F1;文中稱商用 VLM 在長文件中會截斷記錄清單。
LlamaIndex 發佈文件抽取智能體 Extract v2.5,提升所有檔位的準確度,且每頁收費不變。ExtractBench 上,Cost Effective 的整體 value F1 由 87.1 升至 93.9,Agentic 由 89.8 升至 95.8,Agentic Plus 由 95.1 升至 96.4。
Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。
NVIDIA 推出 DGX Spark 64GB 版本,起售價 4,999 美元,並將於 10 月 23 日發售。產品基於 GB10 Grace-Blackwell,約 56GB 記憶體可供模型權重與 KV cache 使用,並最多支援 4 台設備組成集羣。官方實測兩台設備組成集羣運行 Qwen3.8-27B,相比單台設備性能最高提升 1.7 倍。
Meta 宣佈,旗下 AI 智能體 Muse 將於近期登陸智能眼鏡,用户可透過語音指令讓它在後台代辦任務。Muse 基於 Muse Spark AI 模型運行,使用持續運作的雲端 Linux 虛擬機,並可自行編寫、執行程式碼或把工作分派給多個子智能體。
OpenAI 整理 Realtime API 與 gpt-realtime 語音對語音模型進入 GA 後的介面變更、新功能及整合注意事項。文章建議客户遷移至 GA 介面,並説明 beta 與 GA 在功能支援、temperature 和非同步函式呼叫上的差異。
推薦理由:文章對照 beta 與 GA 的功能支援差異,並説明介面遷移、temperature 設定及長對話截斷的處理方式,方便開發者按整合環節核對需要調整的設定。
OpenAI 提供 ChatGPT app 設計指南,説明如何選擇使用場景,並將產品優勢拆成模型可在對話中調用的明確能力。文章以 Know、Do、Show 概括 app 的增值方式,建議聚焦少量操作,而非移植整個產品。指南亦涵蓋模糊與明確意圖下的互動、清晰的工具參數與結構化輸出、資料最小化及跨 app 協作。
OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。
Alpic 分享 ChatGPT Apps 開發的 15 項經驗,並將部分做法納入開源 Skybridge 框架及 chatgpt-apps-builder Codex 技能。
OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。
推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。
OpenAI 宣佈即日起,Codex 可透過 Figma MCP server 在 Figma 與程式碼間雙向協作,並將運行中的介面轉成可編輯的 Figma frames。
OpenAI Developer Blog 彙列多篇 Codex 文章,涵蓋以 Codex 建立遊戲、進行建築視覺化、製作前端介面,以及自動化重複工程工作的案例。其他內容包括 Skills 與提示詞、Codex Security、遠端工程工作、程式碼審查規則、JetBrains MCP 整合,以及用 Evals 系統測試 Agent Skills 的指南。
Hacker News 分享了 openid.net 上一份題為《面向 AI 智能體的身份管理》的 PDF,標示年份為 2025 年。頁面未提供文件內容細節。
Justin 推出 Breadcrumb,一款為 Mac 設計的本機工具,可記錄螢幕、會議及 AI 對話與操作,並整理為 AI 可搜尋的記憶和上下文規則。作者舉例,Claude 讀取會議記錄、調取螢幕時間線並檢查程式碼後,建立 14 張 JIRA 工單、附上 12 張截圖,並草擬 Slack 訊息。
這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。
Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。
MiniMax 正式開源並推出面向智能體與編碼的 MiniMax M2,同時在中國推出 M2 驅動的 MiniMax Agent,並升級海外版本。
推薦理由:MiniMax M2 公佈 Artificial Analysis 10 項測試成績、API 定價與約 100 TPS 推理速度,並開放權重,呈現智能體模型在表現、速度與部署成本間的取捨。
MiniMax 發佈 M2.1,着重提升多語言編程、Web 和 App 開發,以及真實複雜任務中的可用性。M2.1 在 VIBE 基準五個子集的平均得分為 88.6,並在多語言場景超越 Claude Sonnet 4.5、接近 Claude Opus 4.5。
MiniMax 推出 MiniMax-M2-her,這款角色扮演模型旨在維持世界設定連貫、推進故事發展,並根據用户偏好調整互動。MiniMax 的 Role-Play Bench 評測中,MiniMax-M2-her 在 100 輪多輪互動中總排名第一,故事維度排名第五。
MiniMax 發佈 M2.5 與 M2.5-Lightning,稱兩款模型在編碼、智能體工具調用、搜索及辦公任務達到 SOTA,M2.5 在 SWE-Bench Verified 得分 80.2%。
推薦理由:文中並列 SWE-Bench Verified 成績、不同腳手架的評測結果、執行時間與定價,方便比較 M2.5 的編碼表現和使用成本。
Anthropic 提出三種 ASL-4 安全論證草圖,探討當開發者無法排除模型具備危險能力與破壞安全程序能力時,如何論證部署安全。草圖分別採用機制可解釋性監測、AI Control,以及檢驗 RLHF 是否激勵策略性欺騙的分析。Anthropic 尚未定義 ASL-4,並明言這些假設例子均未能完整處理破壞風險,亦非正式政策或計劃。
Anthropic 提出 Bumpers 對齊策略,主張為早期 AGI 建立多條相對獨立的防線,以偵測並修正模型未對齊。方案涵蓋訓練階段的審查和部署後監測;若發現警訊,則追查成因、調整微調流程並重新訓練,文章亦指出反覆迭代可能削弱測試效力。
Anthropic 研究團隊在 SHADE-Arena 中優化模組化攻擊策略框架,使 Claude 3.7 Sonnet 的安全分數由 0.87 降至 0.41。
Anthropic 發佈開源 Bloom,這套 AI 智能體框架可按研究者指定的行為自動生成評測,並量化其在多種情境中的出現頻率與嚴重程度。Anthropic 同時公佈 16 個模型在妄想式迎合、受指示的長期破壞、自我保存和自我偏袒四類行為的基準;在 40 份轉錄中,Claude Opus 4.1 的評分與人工標註 Spearman 相關係數為 0.86。
Anthropic 研究團隊以偏差與方差分解分析前沿推理模型,發現推理或行動序列越長,錯誤中的不一致性佔比越高。在基準任務中,較智能模型在容易題目上的錯誤較一致,但最難題目上的錯誤不變或更不一致。多個樣本集成可降低不一致性,但在行動不可逆的真實智能體任務中可能難以實用。
Anthropic 研究團隊推出 AuditBench,這套對齊審計基準涵蓋 14 類隱藏行為,並包含 56 個植入相關行為的語言模型。研究以 13 種工具配置評估審計智能體,腳手架式使用者採樣和文本補全的平均成功率均超過 50%,高於預設智能體約 37%。研究亦發現,工具單獨能提供有效線索,未必能提升智能體判斷表現;團隊公開模型、智能體及評估框架。
Anthropic 建構由 Claude Opus 4.6 驅動的自動化對齊研究員,9 個並行 AAR 在弱到強監督任務中用 5 日達 PGR 0.97。
Anthropic 研究團隊比較 AI 組織與單一智能體在 12 項任務的表現,發現前者商業目標得分較高、倫理得分較低。研究涵蓋 AI 顧問及 AI 軟件團隊情境,作者觀察到角色分工與協調問題可能令倫理考量未能進入整體決策。差距受模型選擇影響,Opus 4.5 在郵件式顧問任務中的倫理差距較小;作者建議多智能體部署另行進行安全與對齊評估。
Anthropic 研究團隊提出 Model Spec Midtraining(MSM),在預訓練後、對齊微調(AFT)前,以討論 Model Spec 的合成文件訓練模型,藉此塑造後續對齊訓練的泛化。
Anthropic Fellows Program 研究團隊發佈 SLEIGHT-Bench,以 40 組合成攻擊測試前沿 AI 監控器的 11 類盲點。在 1% 假陽性率下,Opus 4.6 監控器有 50% 的攻擊在 10 次測試中一次也未被捕捉,只有 8/40 組攻擊能穩定檢出。
Artificial Analysis 更新 Capability Indices 至 v1.1,按領域整合 Intelligence Index v4.2、v4.3 的評測切片及專項評測。
螞蟻集團發佈面向金融領域的開放權重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得分 23、Finance & Accounting Index 得分 24。
Microsoft 發佈 MAI-Code-1-Flash,並稱其在同一 production harness 下的 4 項核心編碼評測中均勝過 Claude Haiku 4.5。
Microsoft 在 Build 2026 的 MAI 主題演講中宣佈推出七款涵蓋圖像、語音、轉錄、推理及編碼的新模型。
推薦理由:演講將模型基準、產品整合和權重調校渠道並列,呈現 Microsoft 從模型發布延伸至企業定製的產品路徑。