Fireworks AI:AI 能力前沿不在單一模型,而在路由器
Fireworks AI 以 DeepSWE v1.1 的 113 項工程任務測試模型路由,逐項選出 18 個模型中的最佳者後,oracle 結果達 97.6% 通過率、每項成本 $1.88。
Fireworks AI 以 DeepSWE v1.1 的 113 項工程任務測試模型路由,逐項選出 18 個模型中的最佳者後,oracle 結果達 97.6% 通過率、每項成本 $1.88。
Prime Intellect 推出開源編碼智能體框架 Prime Agent,以 RLM 和 Continual Harness 管理上下文及可更新的 harness 狀態。
Prime Intellect 發佈 Prime Inference,為前沿開源模型提供推理服務,支援無伺服器端點及預留容量,並部署於多個數據中心的 GPU 基礎設施上。
Black Forest Labs 聯合創辦人兼 CEO Robin Rombach 在 G7 呼籲各國政府與業界,將開放且負責任的 AI 開發定為常態。Black Forest Labs 最新開放模型顯示,性深偽及兒童性虐待材料相關漏洞數量,較其他大型科技公司發布的開放模型少逾 10 倍。
Black Forest Labs 發佈開放權重的 7B FLUX 3 Action,這個世界動作模型(WAM)聯合預測影片與機械人動作。
英國 AI Security Institute 開發並開源 Python 套件 optstop,按模型表現估計的精度或穩定程度提前停止評測抽樣。在涵蓋三類評分方式、三種預期模型表現水平,以及 MATH、GPQA Diamond 和 WritingBench 等公開基準的測試中,optstop 節省 57% 至 97% 的預定運行次數,且未影響分數估計。
Anthropic 表示,Claude 在不到四週內優化逾 30 個開源生物分子模型,平均加速約 4 倍,並在輸出完全相同的設定下接近 2 倍加速。低記憶體 Big 模式可在單一 NVIDIA GPU 節點上準確預測超過 10,000 tokens 的生物分子系統。
NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。
Reflection AI 發佈首款開放權重 MoE 模型 Beam,總參數 501B、每 token 啟用 23B 參數,面向編碼、推理及智能體工作負載。
Reflection 的 Beam 是一款 501B 開放權重模型。所提供內容未進一步説明其模型能力或使用方式。
開源命令列工具 RemoveMacAI 可從 macOS 27 移除 Apple Intelligence 功能,也可只移除不想使用的功能並保留其他功能。它透過用戶在「系統設定」批准的設定描述檔和 Apple 自家的資源服務運作,不會直接修改 /System,System Integrity Protection 亦會保持啟用。
開源命令列工具 RemoveMacAI 可在 macOS 關閉 Apple Intelligence 功能、刪除其 AI 模型,並阻止模型再次下載。開發者稱模型約佔 12GB,工具會關閉 Siri、Writing Tools、Genmoji、Image Playground、ChatGPT 擴充功能及各項摘要,並稱 Dictation 仍可使用。
cq 項目旨在為智能體建立可共享、可供審核的知識層,將解決問題所得整理成知識單元,供其他智能體日後檢索。cq 預設使用本地 SQLite 資料庫,知識經審核後可分享至團隊空間或公共知識庫。Joplin MCP 示例中,Claude 在一次配置排錯後提出知識單元,重試時再查詢並採用正確的設定路徑。
Reflection 等多家西方企業據稱本月將推出開放權重 AI 模型,人工智能模型領域的競爭將進一步升級。開放權重模型支援客戶本地部署,對微調及推理數據安全要求嚴格的部分行業具關鍵優勢。Reflection 即將推出的模型預計初期落後於美國競爭對手最先進的閉源模型,但足以與中國同業的頂級開放權重模型競爭。
Meta 開源 Muse Gadgets,並以 Apache 2.0 授權發布 ESP32 韌體和 Linux 設備 SDK,供開發者連接自訂硬件至 Muse。
NASA 與 IBM Research 發佈開源 NASA-IBM Lunar Foundation Model,使用 17 年月球軌道觀測資料支援月球科學的機器學習任務。
System76 更新 COSMIC 項目的 PR 模板,新增強制檢查清單,禁止貢獻者提交 AI 生成的代碼、註解及描述。貢獻者須確認提交內容不含上述 AI 生成內容,cosmic-flatpak 是唯一不受「No LLM contributions」規則限制的代碼庫。
Amazon Strands Agents 團隊推出 Strands Decider 2B 決策模型,並在 GitHub 開源,支援本地 CPU / GPU 執行。
Meta 推出開源專案 Muse Gadgets,讓開發者製作可連接個人 AI 智能體 Muse 的自訂硬件。Meta 提供開源韌體與 Linux SDK,並列出為 Muse 配上彩色電子紙顯示器,或將 Muse 載入可插入電視 HDMI 端口的裝置等構想;開發者可使用 Raspberry Pi 或 ESP32 等設備。
LlamaIndex 發佈 LlamaIndex.TS v0.0.1,這是一個以 TypeScript 為先、協助開發者將私有數據接入大型語言模型的程式庫。它會將文件載入標準化格式並建立索引,再檢索相關資訊供 LLM 生成更有依據的回答。相較 Python 版,LlamaIndex.TS 使用 camel case 函數名、較簡化的提示詞介面及非同步函數,並支援 NodeJS v18 及以上版本。
LlamaIndex 發佈 v0.10.0,將核心功能與整合、模板拆分為獨立套件,並棄用 ServiceContext。新設的 `llama-index-core` 收納核心抽象,數百項整合和模板改為獨立套件,同時保留 `llama_index` 命名空間匯入;使用者可直接傳入參數,或透過全域 `Settings` 設定。
RAGformation 是一款開源 AI 工具,可根據用户的自然語言需求,自動選擇雲端服務、設計架構並估算價格。它運用 RAG 與 Llama Index Workflows 生成架構流程圖,並按需求調整推薦服務和配置。用户確認方案後,工具會生成包含流程圖、定價及所選服務摘要的報告,程式碼可在 GitHub 取得。
LlamaIndex 的 2025-05-06 電子報分享智能體建置、多語言多模態 RAG、文件處理及部署框架的更新。內容包括開源 PapersChat、支援 Solace message broker 的 LlamaDeploy,以及 Ollama 在 LlamaIndex 中支援 Qwen 3。
LlamaIndex 開源 LiteParse,這款 CLI 和 TS 原生程式庫可在本機解析 PDF、Office 文件及圖片,為 AI 智能體抽取保留版面關係的文字,且不依賴 Python。
LlamaIndex 推出 LiteParse v2.1,新增以啟發式規則實現的無模型 PDF 轉 Markdown 管線。文章稱它在 3 項基準中領先同類無模型開源工具;文首列出的分數為 opendataloader-bench 0.875、olmOCR-bench 0.391、ParseBench 0.3279,後文表格則分別列出 0.871、39.2% 和 0.328。
Google 開源 Credentio C++ 庫,用於驗證 C2PA Content Credentials,起步支援規格版本 2.2 和 2.4。其 API 可在開發者應用程式本地執行驗證,媒體檔案毋須傳送至雲端或外部驗證端點;驗證大型檔案時,Credentio 使用的記憶體亦少於其他方案。
LlamaIndex 更新 LiteParse,PDFium 優化令文字抽取耗時減少 20-25%,並改善 Markdown 解析表現,新增視覺定位及 is-complex API。
Anthropic 發佈 Petri 2.0,為自動化行為審計工具新增 70 個 seed 指令、評測意識緩解改進和較新前沿模型的評測結果。真實感分類器與人工修訂 seed 指令合用時,Claude 模型的評測意識中位相對降幅為 47.3%,但部分模型的未提示主動性亦有下降。
Artificial Analysis 開源 AA-AgentPerf-Local,讓使用者在手提電腦及工作站上重播真實智能體軌跡,測試本地 AI 模型的推理效能。
Ai2 開源 AstaBrief 8B,這款模型可把研究問題和檢索到的文獻摘錄生成帶引用報告,並已在 Asta 的 Generate a report 功能中提供 Fast mode。
OpenClaw 將 Tencent 的 AI-Infra-Guard(AIG)整合至 ClawScan,ClawHub 上傳的技能與外掛均納入 AIG 安全審查。
文章示範如何將 Amazon S3 Vectors 設為 NVIDIA NeMo Agent Toolkit(NAT)的持久記憶層,並把智能體工作流部署到 Amazon EKS。
Ai2 發佈 Olmo-core 3,這套開放式 MoE 訓練基礎設施旨在擴展至萬億參數級,同時維持計算效率。一次基準測試將專家池由 8 擴至 128,每個 token 仍選 4 個專家,總參數容量由 4.6B 增至 47B,吞吐量下降少於 5%。
Hugging Face 建立 Open TTS Leaderboard,以客觀指標評估開源、多語言 TTS 模型及聲音複製能力。評估涵蓋 WER/CER、批次推理速度(RTFx)、首段音訊延遲(TTFA)及説話者相似度(SIM),可把單個模型的評估時間由數週縮短至數小時。排行榜不取代人工偏好評選,並設有 Listen 頁籤供用户比較生成音訊及投票;其指標不直接衡量自然度、表現力或聽者偏好。
推薦理由:排行榜以客觀指標並列呈現語音清晰度、説話者相似度與速度表現,並保留聆聽投票,方便比較多語言及聲音複製模型。
NVIDIA TensorRT Model Connect 是一個面向編碼智能體設計、基於 NVIDIA TensorRT 建構的開源 C++ AI 模型參考實作集合。其開發經驗包括並行工作、模型家族隔離、可逆變更,以及 GPU 支援的驗證。
NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。
推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。
GitHub 發佈開發者政策更新,回顧美國 2026 年州議會立法進展,並説明透明度報告變化及後續關注議題。2026 年上半年記錄的政府下架請求為 708 項,高於 2025 全年的 98 項;GitHub 説明增幅主要源於報告範圍及內部追蹤方式調整,並非內容移除同步增加。
OpenClaw 宣佈 OpenClaw Enterprise(OCE),這是一個開源、供應商中立的平台,用於在敏感環境管理持續運行的智能體。平台提供多租戶、硬性安全邊界、全生命週期治理與審計能力,並支援替換 harness、模型和沙箱等核心組件。
小米推出 MiMo-V2.6-Pro,該模型在 Artificial Analysis Intelligence Index 得 46 分,排名開放權重模型首位。
推薦理由:文中並列模型榜單、RL 訓練成本與將開源的環境配方,呈現這次發佈由模型權重延伸至後訓練流程的技術脈絡。
Hugging Face 宣佈,oMLX 創作者兼維護者 Jun Kim 加入團隊,並會繼續領導 oMLX。oMLX 維持 Apache 2.0 授權,項目將轉為獲資助並持續維護;Hugging Face 預期這有助提升穩定性,並希望加快開發。Hugging Face 亦希望以 oMLX 作為新想法的試驗場,並加快將 transformers 模型定義轉成不同引擎可使用的 MLX 參考實作。