FLUX 3 與 mimic 合作打造新一代影片動作模型 FLUX-mimic
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 發佈開放權重的 7B FLUX 3 Action,這個世界動作模型(WAM)聯合預測影片與機械人動作。
Reka AI 發佈 Rho-1 研究預覽,這個 19-billion-parameter 全模態模型在單一神經網絡中處理及生成文字、圖像、影片和機械人控制動作。
AGIBOT 發佈 GE-Act 2.0 原生世界-動作模型,並以零樣本測試報告訓練數據擴大時既有技能表現提升、新能力逐步出現。
Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。
推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。
NVIDIA 發佈 Cosmos-H-Dreams,一款根據機械人動作即時生成手術場景影片的模擬器。它將 Cosmos-H-Surgical-Simulator 蒸餾為因果學生模型,並透過 FlashDreams 在單張 NVIDIA RTX PRO 6000 上達到約 160 fps。
Google DeepMind 發佈 Gemini Robotics-ER 1.6,提升機械人的空間與多視角推理能力,並新增儀表讀數能力。模型在指點、計數、任務成功檢測等方面較 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有所提升,並透過 Gemini API 和 Google AI Studio 向開發者提供。
NVIDIA 發佈 Cosmos Reason 2,稱其在 Physical AI Bench 和 Physical Reasoning 榜單位列視覺理解開放模型第一。
Hugging Face 發佈 SmolVLA,一款 450M 開源 Vision-Language-Action(VLA)機械人模型,以 LeRobot 社羣數據預訓練,可在消費級硬件上運行。
推薦理由:文中比較社羣數據預訓練前後的成功率,以及同步與非同步推理的完成時間和吞吐量,呈現數據與推理架構各自帶來的變化。
NVIDIA 在 GTC 2025 發佈 Cosmos Transfer、Physical AI Dataset 和 NVIDIA Isaac GR00T N1 三項 Physical AI 開源資源。
推薦理由:三項資源分別涵蓋可控合成場景、機械人訓練數據與人形機械人推理及技能,呈現 Physical AI 開發中生成、訓練和執行能力的不同分工。