跳到正文

#具身智能

今日 5 條
今天10月6日週二
  1. HuggingFace Daily Papers(社區熱門論文)48

    RealtimeWAM:一步式非同步世界動作模型

    RealtimeWAM 透過一步動作生成與非同步推理,提升世界動作模型(WAM)的推理效率。其提出 Teacher-Anchored Consistency Distillation(TACD)及 Cross-Expert Wavefront Pipelining(CEWP),分別減少動作生成的多步迭代與影片、動作專家之間的等待。

10月5日週一
  1. IT之家58

    消息指 Wayve 將為大眾汽車集團供應自動駕駛方案

    德國媒體 Donaukurier 報道,Wayve 將與大眾汽車集團旗下軟件公司 CARIAD 合作,為大眾供應自動駕駛方案。Wayve 將開發自動駕駛 AI 軟件;CARIAD 負責軟件,以及大眾與博世共同開發硬件的系統整合工作。報道又稱,十多家技術供應商曾參與大眾在德國南部一座主要城市舉行的方案演示,Wayve 憑技術及財務表現令大眾留下深刻印象。

  2. IT之家64

    FieldAI 擬融資 7 億美元,投後估值達 100 億美元

    FieldAI 正尋求融資 7 億美元,投後估值達 100 億美元,短短一年多升至上一輪估值的五倍。公司已簽署本輪投資條款清單,但領投機構未明,交易可能尚未完成交割。知情人士稱,自 6 月以來,FieldAI 新增至少 3,500 萬美元的營收及客戶訂單,訂單與營收總額突破 1.35 億美元。

10月4日週日
  1. IT之家74

    現代汽車集團計劃部署 2.5 萬台波士頓動力 Atlas,並建設年產能 3 萬台的美國工廠

    現代汽車集團計劃未來幾年在全球旗下工廠部署 2.5 萬台波士頓動力 Atlas,並在美國興建年產能 3 萬台機械人的生產設施。Atlas 已在佐治亞州 Metaplant 園區的 RMAC 展開訓練,由訓練員遙距控制;部署計劃於 2028 年從零部件排序開始,目標在 2030 年擴展至零部件裝配。

9月30日週三
  1. HuggingFace Daily Papers(社區熱門論文)44

    JEPA-TTT:動力學轉變下用於規劃的潛在世界模型持續測試時訓練

    JEPA-TTT 透過在測試期間持續自我監督更新預訓練世界模型的潛在動力學預測器,適應測試時與訓練時不同的環境動力學。在 4 個連續控制環境的 8 種動力學轉變中,JEPA-TTT 均改善規劃表現;經 500 個測試回合後,潛在自回歸預測誤差平均降低 83%,規劃表現較凍結的 JEPA 世界模型提升 153%。

9月29日週二
  1. AGIBOT 智元62

    AGIBOT與ASD在中國100間零售店部署100台AGIBOT X2人形機械人

    AGIBOT與ASD在中國100間零售店部署100台AGIBOT X2人形機械人,擔任店內銷售助理並與店員協作。雙方於9月28日至30日安排為期三天的門店直播,每場連續10小時,展示機械人在日常營業中的運作。AGIBOT X2負責迎賓、瞭解顧客需求、介紹及推薦廚具;涉及促銷、庫存和交易時,則轉交店員處理。

9月28日週一
9月23日週三
  1. AGIBOT 智元59

    AGIBOT 與長隆在 Chimelong Spaceship Park 啟動逾 300 台機械人的具身 AI 部署

    AGIBOT 與長隆啟動具身 AI 園區部署,逾 300 台機械人進駐娛樂、教育、訪客服務及酒店營運場景。首階段位於 Chimelong Spaceship Park;AGIBOT、長隆與 China Mobile 建立專用 5G-A 網絡,配合多機協調及安全措施。合作並向長隆交付 AGIBOT 生產線下線的第 20,000 台機械人,另宣佈成立聚焦文旅具身 AI 的聯合研究院。

9月19日週六
  1. elsewhere:文章66

    YC 最新投資的 236 家公司:「幾乎所有事情都不一樣了」

    YC 2026 夏季批次的 236 家公司中,91% 與 AI 相關,創業方向由應用層轉向模型以下的基礎設施及實體世界。與春季批次相比,模型以下公司佔比由 8% 升至 20%,應用層由 55% 降至 39%;推出自主 Agent 的公司比例由 45% 降至 33%。夏季批次有 45 家公司交付實體硬件,為春季批次的兩倍;另有 21 家公司投入算力建設。

9月14日週一
  1. MIT News49

    HardFlow:讓生成式 AI 適用於安全關鍵場景的新方法

    MIT 研究人員開發 HardFlow,讓生成式 AI 在安全關鍵任務中滿足硬性約束,並找到較現有方法更優質的解決方案。它只在最終輸出施加約束,可於部署時套用至預訓練生成模型,無需重新訓練。在機械人操作、迷宮導航及文字指引圖像編輯測試中,HardFlow 完全滿足約束,運算時間與多數競爭方法相若或更低。

9月11日週五
9月10日週四
  1. ChinaTalk65

    ChinaTalk 節譯《財經》特稿,剖析宇樹科技 CEO 王興興的管理風格與 IPO 後員工處境

    ChinaTalk 刊出《財經》特稿的節譯,報道宇樹科技 CEO 王興興的管理方式、成本控制,以及宇樹 IPO 前後的員工處境。文章引述員工、供應商及投資者,描述王興興深度介入產品細節和營運決策,並記錄員工所述的高工作壓力與有限福利。宇樹於 2026 年 8 月 19 日在上海證券交易所科創板上市;171 名高管及核心員工參與戰略配售,合共認購約 272 million yuan。

9月7日週一
  1. OpenMOSS / 復旦NLP / 上海創智 / MOSI51

    OpenMOSS/Awesome-WAM 彙整 World Action Models 綜述與研究資源

    OpenMOSS/Awesome-WAM 資源庫配合 World Action Models(WAM)綜述,分類整理相關論文、訓練數據及評估資源。綜述涵蓋 Cascaded 與 Joint WAM 架構、訓練數據、評估流程,以及用於 VLA 學習的世界模型。資源庫亦收錄論文摘要博客、基準排行榜與表現趨勢圖,並開源生成摘要所用的 Paper2Blog 技能。

9月4日週五
  1. Timothy B. Lee:Understanding AI57

    機械人初創公司正嘗試各種方法取得更多訓練數據

    多家機械人初創公司正嘗試透過記錄人類動作、聘人操作機械人等方式,增加機械人訓練數據。目前最大型的公開機械人任務數據集 ABC-130K 只有 3,500 小時示範;模擬訓練有助步行等任務,但複雜操作受到模擬與現實差距限制。另有公司讓人類佩戴手套或外骨骼完成日常工作,以收集更豐富的動作數據。

9月3日週四
  1. Recode China AI54

    打造智能機械人需要大量數據,數據從何而來?

    文章將具身智能機械人訓練數據分為人類數據與機械人數據,前者包括網絡及第一身視角影片、UMI 和動作捕捉,後者包括遙操作及模擬生成數據。YouTube 每日上載逾 720,000 小時影片,Open X-Embodiment Dataset 則有 1,150 至 2,000 小時實際機械人操作數據;但網絡影片欠缺力、扭矩等物理訊號,也面對人與機械人身體形態不同造成的轉移障礙。

  2. Timothy B. Lee:Understanding AI52

    Google 如何教大語言模型控制機械人,並帶動機械人熱潮

    Google 在 2023 年宣佈 RT-2,將多模態大語言模型訓練成可直接生成機械人動作的 VLA 模型,帶動以此架構為基礎的機械人研究熱潮。文章梳理 Physical Intelligence 等團隊以動作分段、強化學習、記憶和視覺推理改善機械人操作與複雜任務能力,並探討 VLA 與世界模型的關係。

9月1日週二
  1. Timothy B. Lee:Understanding AI61

    人形機械人為何短期內仍難追上人類工作者

    人形機械人雖在舞蹈和跑步等示範中取得進展,但物件操作、任務泛化、長時間工作及安全部署仍有多重障礙,短期內難以追上人類工作者。Physical Intelligence 示範完成 15 項操作挑戰中的 10 項,但機械人完成大部分任務所需時間是人類的 4 至 10 倍,成功率為 52%。

7月28日週二
  1. Google DeepMind69

    Gemini Robotics 2 為機械人帶來全身智能控制

    Google DeepMind 發佈 Gemini Robotics 2 系列模型,為機械人帶來全身控制、靈巧操作及多機協作能力。系列包括將視覺與語言輸入轉為動作控制的 Gemini Robotics 2、用於具身推理與多步任務規劃的 Gemini Robotics ER 2,以及可在機械人裝置本地運行的 Gemini Robotics On-Device 2。

    推薦理由:全身控制、靈巧操作、多機協作與本地適配均有具體案例,呈現 Gemini Robotics 2 系列面向機械人任務的能力佈局。

7月27日週一
7月21日週二
  1. Hugging Face Blog62

    Pollen Robotics 發佈開源機械人操作數據採集系統 Grabette

    Pollen Robotics 發佈開源、低成本的 Grabette 手持式系統,可記錄人工操作示範並轉成機械人訓練數據集。裝置配備兩部攝影機,瀏覽器處理流程透過 RTAB-MAP 執行 SLAM,並輸出 LeRobot 格式數據;Grabette 的物料清單成本約 490€。

    推薦理由:Grabette 把手持式示範、SLAM 軌跡處理與 LeRobot 數據集串成採集流程,並以 200 段示範呈現訓練及機械臂評估的端到端用法。

7月7日週二
  1. Hugging Face Blog75

    LeRobot v0.6.0 發佈,新增世界模型策略、六項模擬基準及部署 CLI

    LeRobot v0.6.0 新增世界模型策略、統一六項模擬基準的 lerobot-eval,以及用於部署和收集人工修正資料的 lerobot-rollout CLI。

    推薦理由:版本把策略部署、人工接管修正與資料回訓串成可重複流程,並以統一 CLI 整合六項模擬基準,呈現機械人學習由實作到評估的工作流。

6月9日週二
4月13日週一
3月9日週一
  1. Hugging Face Blog68

    LeRobot 發佈 v0.5.0,擴展機械人硬件、策略模型及資料與模擬功能

    LeRobot 團隊發佈 v0.5.0,擴展機械人硬件、策略模型、資料集處理及模擬環境支援。版本加入 Unitree G1 人形機械人完整支援(包括全身控制)、Pi0-FAST 自回歸 VLA 及 Real-Time Chunking,並新增 EnvHub 以從 Hugging Face Hub 載入模擬環境,亦整合 NVIDIA IsaacLab-Arena。

    推薦理由:版本把人形機械人控制、即時推理、模擬環境和資料提速納入同次更新,呈現 LeRobot 從硬件接入至訓練工具鏈的擴展範圍。

1月6日週二
11月18日週二
10月24日週五
  1. Hugging Face Blog75

    LeRobot v0.4.0 升級開源機械人學習工具鏈

    LeRobot 發佈 v0.4.0,加入 Datasets v3.0、VLA 模型 PI0 和 PI0.5、GR00T N1.5,以及硬件插件系統。Datasets v3.0 採用分塊 episode 格式並支援串流,可處理 OXE 級(> 400GB)資料集。

    推薦理由:資料集規模化、模擬評測、多 GPU 訓練和硬件插件同時更新,勾勒出 LeRobot 從資料處理到機械人控制的工具鏈演進。

9月16日週二
7月9日週三
7月2日週三
  1. 智源 FlagOpen:原創開源項目36

    FlagOpen/RoboSkill:以 MCP 規範建立具身機械人通用技能商店

    FlagOpen/RoboSkill 以 MCP 規範統一廠商整合規格,建立具身機械人的通用技能商店,讓機械人技能可一鍵整合至機械人框架。技能按廠商名稱及機械人型號分層註冊,建議配合 FlagOpen/RoboOS 廠商適配流程使用;開發者可依 MCP 規範編寫技能函數,並以 `mcp dev skill.py` 本地測試。

6月3日週二
  1. Hugging Face Blog62

    Hugging Face 發佈 SmolVLA:基於 LeRobot 社羣數據訓練的 450M 開源 VLA 模型

    Hugging Face 發佈 SmolVLA,一款 450M 開源 Vision-Language-Action(VLA)機械人模型,以 LeRobot 社羣數據預訓練,可在消費級硬件上運行。

    推薦理由:文中比較社羣數據預訓練前後的成功率,以及同步與非同步推理的完成時間和吞吐量,呈現數據與推理架構各自帶來的變化。

4月14日週一
  1. Hugging Face Blog68

    Hugging Face 收購 Pollen Robotics,開始銷售 Reachy 2 開源人形機械人

    Hugging Face 收購 Pollen Robotics,並開始銷售其開源人形機械人 Reachy 2。Reachy 2 可透過 sales@pollen-robotics.com 電郵訂購,價格為 $70,000,適用於研究、教育和具身 AI 實驗,並兼容 VR。

    推薦理由:這宗收購把 Hugging Face 的 LeRobot 開源機械人項目與 Pollen Robotics 的硬件團隊納入同一組織,呈現其軟硬件佈局。

3月18日週二