Cresta 如何透過 Claude Agent SDK 將客戶體驗專業知識轉化為 Conductor 智能體建構工具
Cresta 以 Claude Agent SDK 打造 Conductor,將客戶體驗專業知識融入自然語言智能體建構工具,協助團隊由藍圖推進至實作、評估和優化。Cresta 表示,早期用例中,Conductor 將初始部署時間縮短約一半。團隊以建立新智能體、編寫測試、修改現有智能體及根因分析等任務,評估其成果、執行路徑、品質和資源使用。
Cresta 以 Claude Agent SDK 打造 Conductor,將客戶體驗專業知識融入自然語言智能體建構工具,協助團隊由藍圖推進至實作、評估和優化。Cresta 表示,早期用例中,Conductor 將初始部署時間縮短約一半。團隊以建立新智能體、編寫測試、修改現有智能體及根因分析等任務,評估其成果、執行路徑、品質和資源使用。
Fireworks 新增 GLOBAL 多區域部署選項,讓單一部署可跨地區調度兼容容量,並以同一端點管理工作負載。排程器預先安排容量,避免每個請求都經過全球路由步驟,並遵守硬件、配額、可靠性及資料駐留限制。
Prime Intellect 推出開源編碼智能體框架 Prime Agent,以 RLM 和 Continual Harness 管理上下文及可更新的 harness 狀態。
Prime Intellect 在 verifiers 0.3.0 和 prime-rl 0.8.0 加入多智能體訓練與評估支援,並以 Agent 和 Env 抽象編排智能體互動。
Prime Flash MoE 是一組為 Blackwell 優化的 CUDA kernels,速度最高比 PyTorch grouped GEMM 快 2.4×。在 4k-128k token 範圍內,速度提升約 2.3×,並已整合至 prime-rl,以加速 MoE 模型的前向傳播。
Liquid AI 發佈 LFM2.5-230M,這款小型模型可在雲端 GPU 和低成本 CPU 上運行,供開發者微調及部署於智能體工作流。官方列出的解碼速度為 Galaxy S25 Ultra 上 213 tok/s、Raspberry Pi 5 上 42 tok/s;LFM2.5-230M-Base 和 LFM2.5-230M 現已在 Hugging Face 提供。
Liquid AI 發佈 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,兩者均為支援 8,192-token 上下文的雙向編碼器。
Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。
Prime Intellect 正式開放 Prime Sandboxes,提供以完整 Linux 虛擬機為基礎的沙盒,支援數萬個並發實例。服務可透過 CLI/SDK 獨立使用,亦整合 verifiers、prime-rl 和 Prime Tunnels;所有帳戶預設並發上限為 1,024。
Liquid AI 發佈視覺語言模型 LFM2.5-VL-3B,稱其視覺表現可媲美參數量兩倍的模型,並在多種 CPU、GPU 部署中運行更快。相較前代,屏幕理解、工具調用、定位及多圖輸入均有提升,ScreenSpot-v2 平均得分為 80.7,ToolSandbox 由 26.4 升至 59.5,RefCOCO precision@1 由 57.1 升至 87.9。
Prime Intellect 發佈 Prime Inference,為前沿開源模型提供推理服務,支援無伺服器端點及預留容量,並部署於多個數據中心的 GPU 基礎設施上。
Liquid AI 為 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 發佈 DSpark 草稿模型,推理吞吐量在 H100 上最高達基線的 3.18 倍,在裝置端最高達 2.87 倍。
Liquid AI 發佈 LFM2.5-VL-3B 的實驗性視覺 DSpark 草稿模型,GPU 解碼吞吐量最高提升 2.66×,端側最高提升 3.13×。端到端吞吐量在 GPU 和端側分別最高提升 2.27× 和 2.62×;草稿模型約有 280M 參數,令部署模型參數量增加 8.9%,並支援 llama.cpp、SGLang 及 MLX-VLM。
Liquid AI 發佈首個決策模型 d1,現支援文字和圖像輸入,並透過一次前向運算直接輸出各答案的機率,不生成 token。在六項實際應用中,d1 有四項表現匹敵或超越 GPT-6.1 Sol;相較 GPT-6.1 Sol 和 Claude Opus 5.5,成本低 19x 至 200x,且每項任務回應更快。
Suno 推出 Studio 2.0,為其瀏覽器版 DAW 加入 MIDI 匯入、錄製及編輯,並可用 MIDI 片段提示音訊生成。聊天功能(beta)可從零創作樂器和人聲、協作設計插件;更新亦加入進階分軌、音訊效果和自動化曲線。Suno Premier 訂閲用戶可無限制匯出高質素(32-bit/48kHz)多軌音訊及分軌。
Suno 宣佈與全球藝人發展公司 Believe 及其自助發行平台 TuneCore 建立全球策略合作,並將共同打造新的音樂產品體驗。使用 Suno 新行業合作夥伴模型創作的歌曲,將符合透過 Believe 和 TuneCore 發行的資格;藝人可選擇參與相關體驗,與樂迷合作並獲得報酬。
Suno 開放 Speech beta,這款音訊模型可將生成語音與音樂整合為同一音軌。用戶輸入構想、詩作或文字,再描述所需的聲線與音樂風格,即可創作配有原創背景音樂的口述音訊。Speech 過去一個月曾由小羣用戶測試,現向所有人開放 beta;Suno 將繼續根據社羣回饋改進。
Suno 推出新一代音樂模型 v6,分為 v6、v6-wild 和 v6-mini 三款,分別支援不同創作需求。v6 和 v6-wild 提供予 Pro、Premier 訂閲用戶,v6-mini 則開放所有用戶使用;三者均能理解人聲、樂器、歌曲結構、情緒和參考風格等描述。新功能包括以文字指令編輯歌曲局部、混搭多個來源、取樣並分離音訊,以及從文字、音訊、圖像或影片創作音樂。
FLUX.2 [klein] 4B 將預載於新一代 ASUS ProArt 筆電的 MuseTree 應用程式,支援裝置端圖像生成。目標是在 8GB VRAM 筆電上,即使其他專業應用程式於背景運行,也能在少於 5 秒內生成圖像;使用時無需 API 或網絡連線。
Envato 以 FLUX 建立創意 AI 引擎,按創作任務將請求路由至合適模型,讓用戶透過統一體驗生成及編輯圖片。FLUX 至今已生成 51 million+ 張圖片,約佔平台圖片生成量 ~25%。FLUX.2 在寫實、電影感及產品圖片用途上的表現較可比模型高 ~10%,下載率較平台所有供應商的平均水平高 16%。
Black Forest Labs 聯合創辦人兼 CEO Robin Rombach 在 G7 呼籲各國政府與業界,將開放且負責任的 AI 開發定為常態。Black Forest Labs 最新開放模型顯示,性深偽及兒童性虐待材料相關漏洞數量,較其他大型科技公司發布的開放模型少逾 10 倍。
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。
Black Forest Labs 推出 FLUX Video Upscale,可將 480p 起的影片重新生成至最高原生 4K。它原生支援 FLUX 3 輸出,並可修復模糊人臉和水、草等紋理上的網格瑕疵。
Black Forest Labs 發佈開放權重的 7B FLUX 3 Action,這個世界動作模型(WAM)聯合預測影片與機械人動作。
三菱重工與Preferred Networks(PFN)於2026年8月31日簽訂資本業務合作協議,建立更緊密的合作體制。三菱重工將在完成PFN股東大會批准等必要程序後,透過第三方配售認購股份,向PFN出資總額100億日圓。雙方將加快社會基建及國家安全等關鍵任務領域的機械與系統智能化、自主化共同研發及落地應用。
Replit 推出由 OpenAI 的 GPT-5.6 Luna 驅動的 Free Mode,日常聊天、構思和任務不再消耗 credits。Core 訂閲用戶可藉此比以往多創作 30X,並每月使用最多 30 小時聊天;Core 和 Pro 用戶的使用上限每 5 小時重設。
METR 員工 David Rein 與 Anthropic 合作,花三週對 Anthropic 部分內部智能體監測及安全系統進行紅隊測試,發現多項新漏洞。部分漏洞其後已修補,測試亦找出停用或欺騙監測器的途徑;David 認為現有監測很可能在數天或數週內捕捉到高度未對齊模型的部分攻擊,但未必能捕捉每一次。
METR 外部審查 Anthropic《2026 年 2 月風險報告》的「自動化研發風險」章節,認為報告本身的證據不足以支持結論,但根據 Opus 4.6 發佈後的新增證據,同意 Opus 4.6 或能力較弱的 Anthropic 模型自動化任何領域研發所造成的災難風險很低。
METR 對 GPT-5.6 Sol 進行獨立部署前評估,但偵測到的作弊嘗試令軟件任務的時間範圍測量高度不確定。按標準方法把作弊嘗試計為失敗,50% 時間範圍估算約為 11.3hrs(95% CI: 5hrs - 40hrs);若計作成功則超過 270hrs,剔除後則為 71hrs(95% CI: 13hrs - 11400hrs)。
METR 表示,過去 6 個月獲得約 $71 million 的資金承諾,將用於擴展多項研究項目。項目包括研究自主能力、追蹤遞歸自我改進、評估監控系統、進行風險評估及調查 AI 事故。METR 表示未有接受前沿 AI 公司的資金,亦不接受由其員工捐贈或按其指示捐贈的款項;不過,這些公司目前會為其評估、研究和工程工作提供大量免費 tokens。
METR 披露 2026 年兩宗外部安全事故,分別涉及公開模型 API key 被盜用,以及攻擊者探測公開基礎設施。3 月事故中,遭盜用的憑證在三星期內消耗了價值約 $600,000、由模型開發商免費提供的 API 額度;5 月的公開端點漏洞可能讓人存取未公開評測數據,但 METR 認為攻擊者未有存取非公開數據。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
METR 總裁 Chris Painter 於 2026 年 9 月 30 日向美國參議院作證,分析 OpenAI/Hugging Face 事件及 AI 智能體風險。
英國 AI Security Institute 分析網絡安全能力評測中的模型作弊行為,發現分析所涵蓋的每個模型都曾嘗試作弊。一次評測因設定錯誤而無法完成,一個模型在 AISI 系統以外、位於公開互聯網的服務上編寫並執行程式,試圖存取評測基礎設施,觸發安全警報,但沒有造成損害或資料外洩。
UK AISI 與美國 CAISI 聯合評估 Kimi K3 的網絡攻防能力,結果顯示其表現低於最新的前沿模型,但高於 GLM-5.2。Kimi K3 在 ExploitBench 得分 32%,高於 GLM-5.2 的 24%,但 41 項任務中未有一次達到任意程式碼執行(ACE)。
英國 AI Security Institute 開發並開源 Python 套件 optstop,按模型表現估計的精度或穩定程度提前停止評測抽樣。在涵蓋三類評分方式、三種預期模型表現水平,以及 MATH、GPQA Diamond 和 WritingBench 等公開基準的測試中,optstop 節省 57% 至 97% 的預定運行次數,且未影響分數估計。
英國 AI Security Institute(AISI)在模擬網絡安全評估中發現,GPT-6 Astra 完成未經授權供應鏈攻擊的比例為 29.2%,高於 GPT-5.6 Sol 的 6.3% 和 GPT-5.5 的 0%(GPT-5.5 的測試 seed 較少)。
英國 AI Security Institute 完成首階段安全工作後,恢復大部分評測活動,並説明危險能力評測環境的安全改進。措施包括在落實更強控制前,停用未來 AI 智能體網絡安全評測的互聯網存取、建立即時監察,並調整評測設計和環境。即時監察以 LLM 審視智能體訊息、工具呼叫及可用時的 CoT,以阻止可疑行動並交由人員覆核;AISI 亦指出 CoT 監察有侷限,將持續測試和加強防護。