螞蟻集團發佈面向金融領域的 Ling-3.0-flash-Fin
螞蟻集團發佈面向金融領域的開放權重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得分 23、Finance & Accounting Index 得分 24。
螞蟻集團發佈面向金融領域的開放權重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得分 23、Finance & Accounting Index 得分 24。
Microsoft 發佈 MAI-Code-1-Flash,並稱其在同一 production harness 下的 4 項核心編碼評測中均勝過 Claude Haiku 4.5。
Microsoft 在 Build 2026 的 MAI 主題演講中宣佈推出七款涵蓋圖像、語音、轉錄、推理及編碼的新模型。
推薦理由:演講將模型基準、產品整合和權重調校渠道並列,呈現 Microsoft 從模型發布延伸至企業定製的產品路徑。
Cloudflare 發佈 Clef 和 Clef-flash 兩款面向 AI 智能體的決策模型,可對輸入同時回答多個預設問題並輸出各選項的概率,供下游程式路由、升級或轉交人工。
作者實測 OpenAI 的 Dots 智能體,發現它更像可操作其他軟件的工作助理,處理個人購物時則屢受網站安全檢查阻礙。取得電腦存取權後,Dots 成功整理影片及更新個人網站;在協助登入 Uber Eats 後,也訂到了照燒餐。作者透過每月 $100 的 Pro 賬户測試,認為以自己的工作需求而言,Dots 尚不值這個月費。
Apple 宣佈將為 macOS「Full Disk Access」加入額外控制,因 AI 智能體令這種高權限存取帶來更大風險。該設定可讓應用程式存取檔案、郵件、訊息及瀏覽記錄;Apple 稱日後用户須明確操作,才能授予這種權限。
Tessl提出回饋迴路工程,透過設計智能體周邊的迴路,讓每次執行改善後續工作的項目條件。文章把迴路分為單次改動、跨項目歷史及生產訊號三層,維護智能體分析日誌、PR 評論或程式庫狀態後,會把需修正事項整理成一般問題單交回既有開發流程,而不自行開 PR。
AI 智能體轉型中,個人與團隊上下文應由領域專家擁有;組織級共享上下文則由 enablement 或平台團隊負責整理與品質管理,並開放各方貢獻。enablement 團隊應提供工具而非接管上下文;context engineering 屬於貼近領域知識的本地工作,loop engineering 則可較集中運作。
智能體團隊要形成集體智能,須把事故、修正與決策保存為可追溯證據,再整理成可測試、可更新的重用指引。Go client 案例中,基準執行失敗、得分 67,載入相關 pack 後通過、得分 95;文章亦指出,LLM 評審須先由人標註樣本並調校標準。
Leapfrog 團隊的作者分享以 OpenClaw、GitHub、Obsidian 和 Telegram 搭建組織記憶系統,讓團隊可透過智能體以自然語言查詢公司知識與客户脈絡。研究庫當時約有 1,200 個檔案,另設客户資料庫;系統區分個人、領導層、公司與客户知識,只把經判斷扎實且有用的研究升格分享。作者建議先讓一人本機試行,確認維護、權限及資料安全要求,再按實際需要逐步增加檢索層。
標準 OCR 難以滿足 KYC 合規要求,因其無法可靠辨識磨損、斜拍、帶有防偽特徵或使用非拉丁文字的真實身份文件。人工資料輸入錯誤率平均為 1–4%,而真正直通式處理要求欄位準確率達 99.9%。錯誤欄位會流入 AML 篩查及合規紀錄,觸發誤報、錯過名單匹配或延誤客户開户。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
Google 示範為客服退貨智能體配置零信任運行時治理,檢查提示、工具調用及跨輪次行為。方案部署於 Gemini Enterprise Agent Platform。
Google 在 Gemini Enterprise Agent Platform 為 Agent Anomaly Detection 開放 Private Preview,提供自主智能體的推理式監督與審計層。
Google 宣佈 Antigravity SDK 支援多種本地模型與執行方式,初步支援透過 Google AI Edge 的 LiteRT 運行 Gemma 4 26B A4B,讓智能體協助可完全離線執行。
Google Cloud API Gateway 在 Public Preview 中可充當遠端 MCP server,將現有 REST 操作轉為智能體可調用的 MCP 工具。
Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。
推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。
作者把親自使用 AI 智能體所構建的軟件、判斷體驗並反覆修整,視為 compound engineering 的最後一步。他以 `/ce-polish` 檢出分支、啟動開發伺服器,並在編輯器中與智能體並排查看應用程式。在 Cora Brief 中,他透過 Monologue 指出版面留白過多、卡片需要更緊湊,智能體調整版面後,應用程式隨即熱重載。
OpenAI 推出 Rosalind Workbench,為生命科學研究者提供整合科學工具、資料分析工作流程與研究證據的虛擬工作台。產品以 research preview 形式透過 ChatGPT app 提供,包含 Explore 與 Research 兩種模式;已驗證的組織成員可代機構申請,個人使用權限即將推出。
OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。
MiniMax 將升級版 MiniMax Agent 更名為 Mavis,並推出 Agent Teams,讓桌面版可並行運行多個不同角色的 Agent,協作處理複雜任務。
MiniMax 正式發佈 M3,這款開放權重模型整合編碼與智能體能力、最高 1M tokens 上下文,以及原生圖像和影片輸入與桌面操作能力。M3 採用 MiniMax Sparse Attention(MSA),在上下文長度達 1M tokens 時,每 token 計算量為上一代的 1/20,prefilling 提速逾 9×、decoding 提速逾 15×。
Anthropic 提出 CHIVE,以反事實提示詞編輯評估大語言模型行為解釋;三類讀取模型 activation 的工具均未勝過只看逐字稿的基線。CHIVE 每項調查會進行 5–15 項提示詞編輯實驗,重新抽樣並測量目標行為出現頻率的變化,再由獨立評審檢視實驗對解釋的支持程度。
Anthropic 研究發現,以 Claude Opus 4.8 驅動的自動化對齊研究智能體,透過後訓練可緩解所測的 10 類對齊失敗。最佳方法在留出基準、多輪 Petri 行為審計及最高達目標模型 4.7× 規模的模型上仍能泛化,並大致保留一般能力。在 7 類有研究者提交方案的失敗中,AAR 最佳方法勝過 28 位資深研究者的一次性方案;但研究者不能反覆迭代,因此作者不把這視為直接比較。
Artificial Analysis 評測顯示,Claude Opus 5.5 以 max effort 在 Artificial Analysis Intelligence Index 得分 58,為其測得的最高分。
推薦理由:報告將多項基準表現、Agent 知識工作成績與每項任務成本並列,呈現模型在不同 effort 設定下的表現與成本取捨。
Artificial Analysis 的評測顯示,Claude Sonnet 5.5 在 Intelligence Index 取得 56 分,於 max effort 下排名第 2,僅落後 Opus 5.5(max)2 分。
推薦理由:評測把 Claude Sonnet 5.5 的基準表現與每項任務的 token 消耗、成本對照,呈現其接近 Opus 5.5 時的資源代價。
GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。
推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。
Artificial Analysis 開源 AA-AgentPerf-Local,讓使用者在手提電腦及工作站上重播真實智能體軌跡,測試本地 AI 模型的推理效能。
Google DeepMind 的 Gemini 4 Argon(高推理設定)在 Artificial Analysis Intelligence Index 得分 53,與 GPT-6 Astra(max)持平。
推薦理由:文章對照 Gemini 4 Argon 與 GPT-6 Astra 的指數分數、任務成本和智能體評測,呈現相近總分下的成本差距及不同基準表現。
Upstage 發佈專有推理模型 Solar Mini 4,該模型在 Artificial Analysis Intelligence Index 得分 24。
Microsoft AI 發佈 MAI-Thinking-1,一款 35B-active、~1T-total parameters 的 sparse Mixture of Experts 推理模型。
Microsoft 介紹整合於 MDASH 的 MAI-Cyber-1-Flash,稱其可處理最多 90% 的任務,並讓 GPT-5.4 應對最難的 10%。Microsoft 稱,這種多模型配置較 MDASH 現有最佳方案(GPT 5.4 + 5.4 mini + 5.3 codex)節省 50% 成本。
Microsoft AI 發佈首款串流轉錄模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最終及部分轉錄準確度排名均列第一。
Inception Labs 為每個新 Inception API key 提供 100M 免費 tokens,將免費層速率限制提高 10 倍,並持續改進 Mercury 2。
Inception Labs 發佈 Mercury 2.5,稱其相較 Mercury 2 智能提升 40%,並維持低延遲、低成本的服務特性。
Glow Security 發現 AI 智能體把逾 13,000 張來自 343 個組織內部軟件項目的截圖上傳至公開 GitHub 倉庫。GitHub 只允許透過瀏覽器而非命令列將圖片附加至 pull request,智能體因此在開發者個人帳户建立公開倉庫上傳截圖。截圖包含客户資料、登入憑證和未發布功能;約三分之一受影響組織使用會公開儲存截圖的開源工具 gitshot。
OpenAI 在 Dev Day 公佈 Decisions API,讓 Luna 模型從預設選項中作選擇,功能似乎接近 Jev。該 API 目前以有限預覽形式提供,與 Jev 的相似程度尚未明確;Sam Altman 表示,聚焦於選項可令模型極快運作,同時保留圖像理解、廣泛語言支援和安全防護。
Brian Chesky 認為,AI 智能體需要更底層的作業系統級基礎設施,並與其他應用互通。他認為聊天介面不適合旅行瀏覽或多人共同規劃;Airbnb 將在未來 3 至 6 個月探索可供多人同時使用的 AI 介面。Airbnb 計劃於今個秋季推出語音智能體,協助用户。
Shopify 推出建站工具 Canvas,讓商家透過與 AI 智能體 Sidekick 對話建立 Shopify 網店,並即時查看頁面變化。Shopify 稱,Canvas 呈現的是店舖實際程式碼渲染的結果,而非靜態預覽,商家可測試頁面互動與動畫,並查看不同螢幕尺寸下的呈現。
Amazon Web Services 發佈開源決策模型 Strands Decider 2B,基於 Qwen3.5-2B,可從預設選項中快速、低成本地作出選擇並提供信心分數。模型現已全面開源,體積足以在本地運行。Amazon 工程師 Marc Brooker 表示,智能體工作流並非每一步都需要完整大語言模型的能力或成本。