RealtimeWAM:一步式非同步世界動作模型
RealtimeWAM 透過一步動作生成與非同步推理,提升世界動作模型(WAM)的推理效率。其提出 Teacher-Anchored Consistency Distillation(TACD)及 Cross-Expert Wavefront Pipelining(CEWP),分別減少動作生成的多步迭代與影片、動作專家之間的等待。
RealtimeWAM 透過一步動作生成與非同步推理,提升世界動作模型(WAM)的推理效率。其提出 Teacher-Anchored Consistency Distillation(TACD)及 Cross-Expert Wavefront Pipelining(CEWP),分別減少動作生成的多步迭代與影片、動作專家之間的等待。
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 發佈開放權重的 7B FLUX 3 Action,這個世界動作模型(WAM)聯合預測影片與機械人動作。
Anthropic 的研究估算,現有機械人可在某些環境下執行美國 74% 的體力工作任務,佔總工作時間 34%。但機械人目前只有 0.3% 的工作任務具成本競爭力;若價格維持過往每年約 3% 的跌幅,比例升至 10% 約需 40 年。
Reka AI 發佈 Rho-1 研究預覽,這個 19-billion-parameter 全模態模型在單一神經網絡中處理及生成文字、圖像、影片和機械人控制動作。
Safeworld 結束隱身模式,獲得超過 $12 million 種子輪融資,並開發機械人安全評估平台。這輪融資由 Shine Capital 和 a16z Speedrun 領投。平台會在模擬環境中以機械人的實際軟件運行數以千計的人類行為情境,測試其控制系統的應對方式。
德國媒體 Donaukurier 報道,Wayve 將與大眾汽車集團旗下軟件公司 CARIAD 合作,為大眾供應自動駕駛方案。Wayve 將開發自動駕駛 AI 軟件;CARIAD 負責軟件,以及大眾與博世共同開發硬件的系統整合工作。報道又稱,十多家技術供應商曾參與大眾在德國南部一座主要城市舉行的方案演示,Wayve 憑技術及財務表現令大眾留下深刻印象。
FieldAI 正尋求融資 7 億美元,投後估值達 100 億美元,短短一年多升至上一輪估值的五倍。公司已簽署本輪投資條款清單,但領投機構未明,交易可能尚未完成交割。知情人士稱,自 6 月以來,FieldAI 新增至少 3,500 萬美元的營收及客戶訂單,訂單與營收總額突破 1.35 億美元。
現代汽車集團計劃未來幾年在全球旗下工廠部署 2.5 萬台波士頓動力 Atlas,並在美國興建年產能 3 萬台機械人的生產設施。Atlas 已在佐治亞州 Metaplant 園區的 RMAC 展開訓練,由訓練員遙距控制;部署計劃於 2028 年從零部件排序開始,目標在 2030 年擴展至零部件裝配。
IDC數據顯示,AGIBOT於2026年上半年出貨逾8,600台人形機械人,全球排名第一,約佔全球出貨量35%。同期全球出貨量接近25,000台,按年增長432.1%;IDC預計全球人形機械人出貨量到2030年將超過750,000台。
JEPA-TTT 透過在測試期間持續自我監督更新預訓練世界模型的潛在動力學預測器,適應測試時與訓練時不同的環境動力學。在 4 個連續控制環境的 8 種動力學轉變中,JEPA-TTT 均改善規劃表現;經 500 個測試回合後,潛在自回歸預測誤差平均降低 83%,規劃表現較凍結的 JEPA 世界模型提升 153%。
AGIBOT與ASD在中國100間零售店部署100台AGIBOT X2人形機械人,擔任店內銷售助理並與店員協作。雙方於9月28日至30日安排為期三天的門店直播,每場連續10小時,展示機械人在日常營業中的運作。AGIBOT X2負責迎賓、瞭解顧客需求、介紹及推薦廚具;涉及促銷、庫存和交易時,則轉交店員處理。
Import AI 第 474 期聚焦柏拉圖式心智假説、Google 籌備將 TPU 送入太空及智譜以 GLM-5.3 加速自身推理基建。機械人研究者指出,領域仍欠缺可擴展的通用後訓練配方;他們介紹的 EXPO(-FT) 仍在早期發展,未廣泛使用。
AGIBOT 與長隆啟動具身 AI 園區部署,逾 300 台機械人進駐娛樂、教育、訪客服務及酒店營運場景。首階段位於 Chimelong Spaceship Park;AGIBOT、長隆與 China Mobile 建立專用 5G-A 網絡,配合多機協調及安全措施。合作並向長隆交付 AGIBOT 生產線下線的第 20,000 台機械人,另宣佈成立聚焦文旅具身 AI 的聯合研究院。
YC 2026 夏季批次的 236 家公司中,91% 與 AI 相關,創業方向由應用層轉向模型以下的基礎設施及實體世界。與春季批次相比,模型以下公司佔比由 8% 升至 20%,應用層由 55% 降至 39%;推出自主 Agent 的公司比例由 45% 降至 33%。夏季批次有 45 家公司交付實體硬件,為春季批次的兩倍;另有 21 家公司投入算力建設。
MIT 研究人員開發 HardFlow,讓生成式 AI 在安全關鍵任務中滿足硬性約束,並找到較現有方法更優質的解決方案。它只在最終輸出施加約束,可於部署時套用至預訓練生成模型,無需重新訓練。在機械人操作、迷宮導航及文字指引圖像編輯測試中,HardFlow 完全滿足約束,運算時間與多數競爭方法相若或更低。
蘇度、螞蟻靈波、自變量與破殼的四位代表,在「2026 Inclusion 外灘大會」圓桌上討論具身智能的路線分歧與商業化。討論聚焦仿真與真機數據、GPT-6 Astra 對具身行業的衝擊,以及高成功率、泛化性和客户持續付費等商業化指標。
AGIBOT 發佈 GE-Act 2.0 原生世界-動作模型,並以零樣本測試報告訓練數據擴大時既有技能表現提升、新能力逐步出現。
ChinaTalk 刊出《財經》特稿的節譯,報道宇樹科技 CEO 王興興的管理方式、成本控制,以及宇樹 IPO 前後的員工處境。文章引述員工、供應商及投資者,描述王興興深度介入產品細節和營運決策,並記錄員工所述的高工作壓力與有限福利。宇樹於 2026 年 8 月 19 日在上海證券交易所科創板上市;171 名高管及核心員工參與戰略配售,合共認購約 272 million yuan。
OpenMOSS/Awesome-WAM 資源庫配合 World Action Models(WAM)綜述,分類整理相關論文、訓練數據及評估資源。綜述涵蓋 Cascaded 與 Joint WAM 架構、訓練數據、評估流程,以及用於 VLA 學習的世界模型。資源庫亦收錄論文摘要博客、基準排行榜與表現趨勢圖,並開源生成摘要所用的 Paper2Blog 技能。
多家機械人初創公司正嘗試透過記錄人類動作、聘人操作機械人等方式,增加機械人訓練數據。目前最大型的公開機械人任務數據集 ABC-130K 只有 3,500 小時示範;模擬訓練有助步行等任務,但複雜操作受到模擬與現實差距限制。另有公司讓人類佩戴手套或外骨骼完成日常工作,以收集更豐富的動作數據。
文章將具身智能機械人訓練數據分為人類數據與機械人數據,前者包括網絡及第一身視角影片、UMI 和動作捕捉,後者包括遙操作及模擬生成數據。YouTube 每日上載逾 720,000 小時影片,Open X-Embodiment Dataset 則有 1,150 至 2,000 小時實際機械人操作數據;但網絡影片欠缺力、扭矩等物理訊號,也面對人與機械人身體形態不同造成的轉移障礙。
Google 在 2023 年宣佈 RT-2,將多模態大語言模型訓練成可直接生成機械人動作的 VLA 模型,帶動以此架構為基礎的機械人研究熱潮。文章梳理 Physical Intelligence 等團隊以動作分段、強化學習、記憶和視覺推理改善機械人操作與複雜任務能力,並探討 VLA 與世界模型的關係。
人形機械人雖在舞蹈和跑步等示範中取得進展,但物件操作、任務泛化、長時間工作及安全部署仍有多重障礙,短期內難以追上人類工作者。Physical Intelligence 示範完成 15 項操作挑戰中的 10 項,但機械人完成大部分任務所需時間是人類的 4 至 10 倍,成功率為 52%。
Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。
推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。
NVIDIA 發佈 Cosmos-H-Dreams,一款根據機械人動作即時生成手術場景影片的模擬器。它將 Cosmos-H-Surgical-Simulator 蒸餾為因果學生模型,並透過 FlashDreams 在單張 NVIDIA RTX PRO 6000 上達到約 160 fps。
Pollen Robotics 發佈開源、低成本的 Grabette 手持式系統,可記錄人工操作示範並轉成機械人訓練數據集。裝置配備兩部攝影機,瀏覽器處理流程透過 RTAB-MAP 執行 SLAM,並輸出 LeRobot 格式數據;Grabette 的物料清單成本約 490€。
推薦理由:Grabette 把手持式示範、SLAM 軌跡處理與 LeRobot 數據集串成採集流程,並以 200 段示範呈現訓練及機械臂評估的端到端用法。
LeRobot v0.6.0 新增世界模型策略、統一六項模擬基準的 lerobot-eval,以及用於部署和收集人工修正資料的 lerobot-rollout CLI。
推薦理由:版本把策略部署、人工接管修正與資料回訓串成可重複流程,並以統一 CLI 整合六項模擬基準,呈現機械人學習由實作到評估的工作流。
Google DeepMind 推出 Google DeepMind Accelerator: Robotics,選出 15 家歐洲機械人初創參加為期 3 個月的計劃。入選團隊可接觸 Google 的 AI stack 及 Gemini robotics models,並獲 Google DeepMind 與 Google 團隊提供技術指導和產品指引。
Google DeepMind 發佈 Gemini Robotics-ER 1.6,提升機械人的空間與多視角推理能力,並新增儀表讀數能力。模型在指點、計數、任務成功檢測等方面較 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有所提升,並透過 Gemini API 和 Google AI Studio 向開發者提供。
LeRobot 團隊發佈 v0.5.0,擴展機械人硬件、策略模型、資料集處理及模擬環境支援。版本加入 Unitree G1 人形機械人完整支援(包括全身控制)、Pi0-FAST 自回歸 VLA 及 Real-Time Chunking,並新增 EnvHub 以從 Hugging Face Hub 載入模擬環境,亦整合 NVIDIA IsaacLab-Arena。
推薦理由:版本把人形機械人控制、即時推理、模擬環境和資料提速納入同次更新,呈現 LeRobot 從硬件接入至訓練工具鏈的擴展範圍。
NVIDIA 發佈 Cosmos Reason 2,稱其在 Physical AI Bench 和 Physical Reasoning 榜單位列視覺理解開放模型第一。
FlagOpen 推出 CoRobot 1.0,這是一套面向多機械人具身數據的開放框架,涵蓋數據採集、轉換、處理、檢索、預覽、下載及訓練。
LeRobot 發佈 v0.4.0,加入 Datasets v3.0、VLA 模型 PI0 和 PI0.5、GR00T N1.5,以及硬件插件系統。Datasets v3.0 採用分塊 episode 格式並支援串流,可處理 OXE 級(> 400GB)資料集。
推薦理由:資料集規模化、模擬評測、多 GPU 訓練和硬件插件同時更新,勾勒出 LeRobot 從資料處理到機械人控制的工具鏈演進。
Hugging Face 發佈 LeRobotDataset v3.0,將多個 episode 合併存入單一檔案,並可串流處理大型機械人資料集。v2 每個 episode 各存一個檔案,資料集擴展至數百萬個 episode 時會遇到檔案系統限制;v3 以關聯式 metadata 取得各 episode 資訊。
Pollen Robotics 與 Hugging Face 推出 Reachy Mini,一款面向人機互動、創意編程與 AI 實驗的開源桌面機械人,售價由 $399 起。
推薦理由:Reachy Mini Lite 與 Compute 版分別售 $399 和 $499,連線及供電配置不同,規格表可供對照入門成本與功能取捨。
FlagOpen/RoboSkill 以 MCP 規範統一廠商整合規格,建立具身機械人的通用技能商店,讓機械人技能可一鍵整合至機械人框架。技能按廠商名稱及機械人型號分層註冊,建議配合 FlagOpen/RoboOS 廠商適配流程使用;開發者可依 MCP 規範編寫技能函數,並以 `mcp dev skill.py` 本地測試。
Hugging Face 發佈 SmolVLA,一款 450M 開源 Vision-Language-Action(VLA)機械人模型,以 LeRobot 社羣數據預訓練,可在消費級硬件上運行。
推薦理由:文中比較社羣數據預訓練前後的成功率,以及同步與非同步推理的完成時間和吞吐量,呈現數據與推理架構各自帶來的變化。
Hugging Face 收購 Pollen Robotics,並開始銷售其開源人形機械人 Reachy 2。Reachy 2 可透過 sales@pollen-robotics.com 電郵訂購,價格為 $70,000,適用於研究、教育和具身 AI 實驗,並兼容 VR。
推薦理由:這宗收購把 Hugging Face 的 LeRobot 開源機械人項目與 Pollen Robotics 的硬件團隊納入同一組織,呈現其軟硬件佈局。
NVIDIA 在 GTC 2025 發佈 Cosmos Transfer、Physical AI Dataset 和 NVIDIA Isaac GR00T N1 三項 Physical AI 開源資源。
推薦理由:三項資源分別涵蓋可控合成場景、機械人訓練數據與人形機械人推理及技能,呈現 Physical AI 開發中生成、訓練和執行能力的不同分工。