LFM2-24B-A2B 在消費級硬件上運行本地工具調用智能體
Liquid AI 以開源桌面智能體 LocalCowork 測試 LFM2-24B-A2B 在筆電本地執行工具調用的表現,模型、工具和資料均留在裝置上。在 Apple M4 Max、36 GB 統一記憶體的筆電上,工具選擇平均耗時約 385 ms、佔用約 14.5 GB 記憶體,單步準確率為 80%。
Liquid AI 以開源桌面智能體 LocalCowork 測試 LFM2-24B-A2B 在筆電本地執行工具調用的表現,模型、工具和資料均留在裝置上。在 Apple M4 Max、36 GB 統一記憶體的筆電上,工具選擇平均耗時約 385 ms、佔用約 14.5 GB 記憶體,單步準確率為 80%。
Liquid AI 發佈端側模型 LFM2.5-8B-A1B,將上下文窗口擴至 128K,並把預訓練規模由 12T 增至 38T tokens。該模型採用推理專用設計,詞表由 65,536 擴至 128,000,AA-Omniscience Index 由 -78.42 升至 -24.70。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
Inception Labs 發佈 Mercury 2.5,稱其相較 Mercury 2 智能提升 40%,並維持低延遲、低成本的服務特性。
H Company 發佈 Holo4 通用電腦操作智能體模型系列,提供 27B dense 與 35B-A3B Mixture of Experts,並推出更新版 Holotron4 Nano。
推薦理由:文章提供 Holo4 在 OSWorld 2.0 的規格分數、Opus 5.5 對照和成本估算口徑,並指出各模型的測試框架與任務子集不盡相同,便於理解比較條件。
Mistral AI 開源 Leanstral,一款為 Lean 4 設計、用於程式碼生成與形式化證明的程式碼智能體,採用 6B active parameters。
OpenAI 發佈更先進的語音對語音模型 gpt-realtime,並為 Realtime API 加入新 API 能力。更新包括 MCP server 支援、圖像輸入及 SIP 電話呼叫支援。
推薦理由:公告同時列出語音對語音模型與 Realtime API 的更新,並點明 MCP server、圖像輸入及 SIP 電話呼叫支援,方便掌握本次功能範圍。
OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款低成本開放權重語言模型,採用 Apache 2.0 授權。它們在推理任務上優於規模相近的開放模型,並具備良好工具使用能力,亦針對消費級硬件高效部署作最佳化。
推薦理由:推理表現、工具使用能力與消費級硬件部署資訊一併呈現,便於從能力和部署兩方面理解兩款開放權重模型的取向。
Mistral AI 發佈 Mistral Large 與 Mistral Small,並透過 Azure 提供 Mistral Large。Mistral Large 支援英語、法語、西班牙語、德語和意大利語,具備 32K tokens 上下文窗口及原生 function calling,並可用於文本理解、轉換和程式碼生成。
推薦理由:這次發佈同時涵蓋旗艦與低延遲型號,並以基準比較和多種接入渠道呈現兩款模型的能力定位及成本、延遲取向。