Prime Intellect 與 Browserbase 合作,透過 BrowserEnv 訓練瀏覽器與電腦操作智能體
Prime Intellect 與 Browserbase 合作提供 BrowserEnv,讓用戶可在真實網站互動環境中訓練瀏覽器及電腦操作智能體。團隊以 WebVoyager 基準的 600 項真實網頁任務微調 Qwen3-VL-8B-Instruct,訓練流程和環境均已放在 Hub,並可完整重現。
Prime Intellect 與 Browserbase 合作提供 BrowserEnv,讓用戶可在真實網站互動環境中訓練瀏覽器及電腦操作智能體。團隊以 WebVoyager 基準的 600 項真實網頁任務微調 Qwen3-VL-8B-Instruct,訓練流程和環境均已放在 Hub,並可完整重現。
Prime Intellect 宣佈 Lab 結束 beta 階段並全面開放,平台把自我改進智能體的任務設定、評估、訓練和部署整合為一套流程。Lab 以環境封裝任務、工具、模擬器和獎勵指標;Hosted Training 支援在用戶環境中執行大規模強化學習,並訓練 LoRA adapter。
Prime Intellect 開源獨立 Python 程式庫 renderers,讓開發者以可編程的 Python 物件控制 RL 和多輪推理的對話格式。它在 token ID 層處理訊息渲染、回應解析、loss mask 標記及多輪橋接,以保留已採樣 token 前綴;文章指出,五輪 rollout 若每個邊界都無法合併,計算量約為連續序列的 3x。
Prime Intellect 開源 General Agent 環境首個版本,並以合成器生成任務、按求解模型通過率逐級校準難度。語料目前包含 4,504 項任務、1,040 個領域及 8,159 種獨特工具。
Prime Intellect 推出 Hosted Evaluations,讓用戶能使用可擴展基礎設施,在自己的評測項目上測試模型。用戶可在 Environments Hub 已支援的數百個社羣環境中執行評測,亦可透過 CLI 加上 --hosted 參數啟動。評測結果可發布至相應排行榜;由於環境開源,各模型會在相同設定下受評,而檢視器會顯示採樣參數、其他設定、樣本、執行軌跡、工具呼叫及結果。
Prime Intellect 在 Prime Intellect Lab 開放 NVIDIA Nemotron 3 Ultra 的託管後訓練支援,涵蓋 RL 訓練、評測與推理部署。
Prime Intellect 發佈 prime-rl 0.6.0,支援萬億參數規模模型的智能體強化學習訓練。該團隊表示,可在 28 個 H200 節點上以最高 131k 的序列長度、低於 5 分鐘的單步時間及 256 個 rollouts 的批次大小,訓練 GLM-5 執行 SWE 任務。
Prime Intellect 為 prime-rl 新增演算法層,內建六種演算法並支援按環境選用,讓同一訓練執行可混用不同演算法。六種包括 GRPO、MaxRL、On-Policy Distillation、Self-Distillation、SFT distillation 和 ECHO;自訂演算法可沿用同一抽象實作,而毋須修改 trainer。
Prime Intellect 推出 verifiers 0.2.0,預覽重寫後的核心架構,將智能體訓練與評測環境拆分為 taskset、harness 及 runtime。
Prime Intellect 將 23 個軟件工程、終端機及搜尋任務集整合至同一 taskset API,合計約 365,000 項任務。這些任務可用於評測及 RL 訓練;多個 SWE 數據集經 gold patch 與無修改檢查後,已重新上載清理版本。作者指出,智能體與評分機制共用沙盒仍有 reward hack 風險,隔離評分環境仍在路線圖上。
Suno 推出情人節體驗,用戶回答三個關於收歌對象的簡單問題後,Suno 會製作三首個人化歌曲。體驗免費,可於 vdaysong.com 試用,歌曲可送給朋友、心儀對象或家人。在社交媒體分享歌曲並標記 @suno_ai_,有機會贏取一束花及 Premier 方案免費三個月。
Suno 推出 Audio Input,讓 Pro 和 Premier 用戶上載或錄製音訊,並將其延伸創作成歌曲。音訊或影片片段須為 6 至 60 秒,用戶可設定延伸時間點、曲風及是否加入歌詞。有版權的作品會被禁止上載;含人聲的輸入會保持私密,且不可搜尋。
Suno 推出早期存取測試版功能 Covers,讓用戶將聲音或歌曲轉換成新風格,同時保留原有旋律。功能目前開放予 Pro 和 Premier 訂閲用戶,並提供 200 次免費 Covers;用完後每次生成需 10 credits。
Suno 推出 Suno Scenes,讓用戶以照片或影片作為素材創作歌曲。功能先向 iOS 用戶開放,可在歌曲創作體驗的 Camera 模式中使用。
Suno 推出 Personas,讓用戶保存歌曲的人聲、風格和氛圍,並將這些特色用於新創作。用戶可把 Persona 設為公開或私人;公開 Persona 可供其他人使用,並連結至建立者的個人檔案及 Persona。搶先體驗測試版開放予所有 Pro 和 Premier 訂閲用戶,可免費創作 200 首 Personas 歌曲,其後每首需 10 credits。
Suno 推出 v4,帶來更清晰的音訊、更精煉的歌詞及更多變的歌曲結構。Remaster 可把舊模型創作的曲目升級至 v4 音質;ReMi 是新增的歌詞輔助選項,Covers 和 Personas 亦獲升級。v4 以 beta 形式向 Pro 和 Premier 用戶開放,可透過 suno.com 和 iOS 體驗。
Suno 正式推出 Android 版,讓用戶可透過文字提示詞創作音樂、探索創作者社羣的曲目與曲風,並分享自己的作品。這是 Suno Android 版的第一個版本,包含核心功能,官方表示目前只是起步,未來還有更多內容。
Suno 推出一批音樂創作功能,更新 Song Editor,並支援上載最長 8 分鐘的音訊及匯出 12 條分軌。用戶可在波形上逐段重排、改寫和重製歌曲,分軌亦可預覽及下載。三個新控制項可調整生成結果的怪異程度、結構性及參考導向程度。
Liquid AI 推出 LEAP 端側 AI 開發平台及 Liquid Apollo 手機應用程式,LEAP 讓開發者將小型語言模型部署到 Android 和 iOS 應用程式,Apollo 則可在手機本機試用 LEAP 模型。
Suno 推出 Suno Studio,一款把 AI 生成融入音樂製作的生成式音訊工作站。它可即時生成不限數量、能配合現有音訊的人聲、鼓聲、合成器等分軌變化,並提供多軌時間線編輯、BPM 控制、音量及音高調整。分軌可匯出為音訊和 MIDI 檔案,Suno Studio 可供 Premier 用戶在桌面使用。
Suno 為 Suno Studio 推出 1.2 更新,新增 Remove FX、Warp Markers with Quantize、Alternates 及非 4/4 拍號支援。用戶可移除音訊片段中的效果並匯出至 DAW、自訂音訊時間與律動、量化錄音,亦可在同一音軌試聽不同版本。Studio 支援其他拍號,例如 6/8、7/8 或 11/4,並開放予 Suno Premier 訂閲者使用。
Claude 開始向部分 Claude Pro 和 Max 訂戶開放改版 Projects beta,讓用戶設定目標後,由協調器分派工作至多條 Claude Code 執行緒並整合結果。
Claude Marketplace 正式上線,整合插件與連接器、智能體與產品,以及服務合作夥伴,讓客戶可在同一平台尋找工具和服務。平台目前提供逾 2,000 個連接器及插件,客戶亦可用部分已承諾的 Anthropic 支出購買 Claude 驅動的軟件。開發者可運用 MCP 和智能體技能建立連接器或插件,產品商可申請上架,服務商則可加入 Claude Partner Network。
Suno 改進分軌功能,現提供 Auto Split、Split from Mix 和 Advanced Split 三種方式。Auto Split 最多拆分為 12 條音軌,Split from Mix 可提取或移除指定聲部;Advanced Split 可搜尋近 100 種樂器,並僅限 Premier 使用。Suno 表示,系統會以最新模型從頭生成各音軌,而非直接切割原始混音。
Suno 聯合創辦人兼 CEO Mikey Shulman 説明公司的音樂 AI 原則,並介紹已採取及即將推行的措施。Suno 表示,訓練 metadata 刻意不使用藝人姓名,並會把提及特定藝人的提示詞轉向描述音樂特徵;公司亦與 Audible Magic、Musixmatch 等第三方合作,篩查上載音訊及歌詞中的潛在未授權使用。
Black Forest Labs 已公開提供 FLUX VTO,這款虛擬試穿模型的生成時間少於 4 秒,適用於大規模商品目錄。它可為同一人物一次套用最多四件服裝,並保留人物身份及服裝上的標誌、印花、縫線和五金配件。身體及服裝尺碼的精確呈現仍在改進,輸出宜作視覺造型參考;預設政策不支援泳裝和內衣。
Zyphra 推出全棧 AI 平台 Zyphra Cloud,並首發面向大型開放模型和長上下文智能體工作負載的推理服務 Zyphra Inference。服務由 AMD MI355X GPU 提供支援,涵蓋 Kimi K2.6、DeepSeek V3.2 和 GLM 5.1 等開放模型。
Replit 推出 Agent Customization,讓 Replit Agent 在不同專案中套用個人或團隊慣例。Custom Instructions 會在每個專案和工作階段自動加入 Agent 上下文,適用於 Pro 和 Enterprise;Skills 則按相關任務載入,所有方案均可使用。
Replit 現已可直接在 Claude 中使用,用戶可將設計及一般開發任務交由 Replit 繼續建置、完善及發布。用戶可在 Claude Design 以自然語言設計應用程式,再透過官方 Replit Connector 傳送至 Replit,無須複製貼上或切換工作情境。
Replit 推出 AI 設計套件 Replit Design,讓用戶描述構想並建立設計、應用程式或網站,可選用 Claude、GPT-5、Gemini、Kimi 和 GLM 等模型。
Replit 現可為其應用程式執行黑盒滲透測試,透過網絡和瀏覽器模擬外部攻擊者,在無法存取程式碼的情況下尋找漏洞。執行 Level 3 掃描時,系統會在私有沙盒中的應用程式副本上並行執行白盒及黑盒掃描;黑盒掃描只需應用程式連結。Replit 表示,兩種掃描發現的問題很少重疊,案例包括白盒掃出存取權限已撤銷的用戶仍可操作,黑盒則找到無需登入即可進入的管理員控制台。
Replit 已向所有用戶開放 Intelligent Model Routing,系統會按每項任務自動選擇合適模型,平衡質素、速度與成本。Replit 表示,測試中其輸出質素與上一版 Max Mode 相同,成本則低 65%。所有用戶會從 Free Mode 開始,工作升級至可能產生使用費的較高效能模式時會收到通知,並可選擇留在 Free Mode;Core & Pro 用戶仍可手動選擇模型。
Cohere 的企業檢索平台 Compass 以雲端託管服務 Compass Cloud 形式進入私人測試。Cohere 將管理完整檢索流程及模型推理,開發者可透過 APIs、MCP server 或 Python SDK 使用。自行託管部署仍可供有私隱限制的項目使用,Cohere 正與有限數目的企業團隊合作測試。
Claude Tag(beta)現支援在 Slack 頻道的請求中使用用戶個人連接器,讓 Claude 存取用戶已連接至 Claude 帳戶的工具及資料。用戶可選擇在回覆發佈前先審閲,或使用自動模式;Enterprise 管理員亦可要求所有人先審閲。個人連接器現正向 Team 方案推出,Enterprise 方案其後跟進;排程工作及 Claude 自行啟動的操作仍使用管理員為頻道設定的共用連接器。
Claude 推出插件目錄提交入口,讓開發者提交插件、追蹤審核進度,並在插件上線後查看使用分析。入口只開放予使用付費 Claude 方案的開發者,提交方式包括單一遠端 MCP 伺服器連接器,或把 MCP 伺服器與 Agent 技能組成插件套件、託管於 GitHub 並提交程式碼庫。上線後的分析包括按產品介面及版本分類的安裝量、目錄頁面的瀏覽量,以及引導用戶找到列表的搜尋詞。
Anthropic 與 NVIDIA 合作,透過 Claude Managed Agents 和 NVIDIA OpenShell 為企業 AI 智能體加入額外安全與控制層;NVIDIA 亦宣佈 Open Agent Safety Platform,作為加強 AI 安全的開放軟件平台及參考系統設計。
Anthropic 宣佈 Claude for Government 正式向聯邦及州政府機構開放,並透過 FedRAMP High 授權環境提供編碼及智能體工作能力。
Fireworks AI 推出 Specialized Intelligence Index(SII),比較開放模型、封閉模型及專用模型在特定領域基準上的表現,首批涵蓋七個領域。基準由實務工作者設計,結果按領域及基準呈現,不合併為跨領域綜合分數,並提供分數與成本、所需時間的比較視圖。文章指出,基準分數、能力主張與業務成果屬不同層次,後兩者需要各自有相應證據支持。
Claude Code 推出 mods,這些小型 TypeScript 函數可改寫提示詞、阻止或改寫工具呼叫,並增添介面或替換內置功能。mods 隨插件一同提供,可在 Claude Code CLI 和桌面應用程式使用,也可由 Claude Code 編寫、安裝並在工作階段中熱重載。mods 不設沙盒,擁有與 Claude Code 相同的機器存取權限,應只安裝來自可信來源的 mods。
Cresta 以 Claude Agent SDK 打造 Conductor,將客戶體驗專業知識融入自然語言智能體建構工具,協助團隊由藍圖推進至實作、評估和優化。Cresta 表示,早期用例中,Conductor 將初始部署時間縮短約一半。團隊以建立新智能體、編寫測試、修改現有智能體及根因分析等任務,評估其成果、執行路徑、品質和資源使用。