跳到正文

全部動態

今日 8 條
2月3日週二
2月2日週一
2月1日週日
1月30日週五
  1. Google DeepMind68

    Project Genie:用實驗原型探索無限互動世界

    Google DeepMind 開始向美國年滿 18 歲的 Google AI Ultra 訂户逐步開放 Project Genie;這款由 Genie 3、Nano Banana Pro 和 Gemini 驅動的實驗研究原型,可建立、探索及改編互動世界。

    推薦理由:原型把世界草圖、即時探索與改編放進同一體驗,並交代生成時長、物理表現和角色操控限制,可看出目前互動世界模型的使用方式與邊界。

1月29日週四
  1. Hugging Face Blog58

    Gradio 團隊推出 Daggr,讓 AI 工作流程可程式化串接並視覺化檢查

    Gradio 團隊推出開源 Python 函式庫 Daggr,可用程式串接 Gradio 應用、ML 模型及自訂函數,建立 AI 工作流程。Daggr 會自動生成視覺畫布,供使用者檢視中間輸出、修改輸入並單獨重跑步驟,同時保存工作流程狀態。該工具目前處於 beta,更新期間仍可能發生本機保存資料遺失。

1月28日週三
  1. Google Research58

    Google Research 探討智能體系統的規模化原理及有效條件

    Google Research 團隊對 180 種智能體配置進行受控評估,提出智能體系統的量化規模化原則。在可並行的金融推理任務中,集中式協作較單智能體提升 80.9%;在 PlanCraft 的序列規劃任務中,多智能體方案則令表現下降 39–70%。研究的預測模型根據工具數量及任務可拆解程度,對 87% 未見任務配置正確識別最佳協作策略。

1月27日週二
1月26日週一
1月24日週六
1月23日週五
  1. Google Research44

    小模型,大成果:Google Research 以分解方法提升意圖提取效果

    Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。

1月22日週四
  1. Mistral AI60

    Mistral AI 分享 vLLM 記憶體洩漏的排查與修復過程

    Mistral AI 團隊追查 vLLM 分離式服務的記憶體洩漏,定位到 UCX 的 mmap hook 與延後清理的記憶體池。問題只在使用 NIXL 的 Prefill/Decode 分離式設定中重現;設置 UCX_MEM_MMAP_HOOK_MODE=none 可解決洩漏,且在此 vLLM 用例中不影響效能。

    推薦理由:這篇排查記錄示範如何從 RSS 與匿名映射的異常增長開始,逐步利用 BPFtrace 和 GDB 定位 UCX mmap hook,並整理 vLLM 分離式服務可用的修復設定。

1月21日週三
  1. Hugging Face Blog51

    AssetOpsBench 彌合 AI 智能體基準與工業實務的落差

    AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。

1月20日週二
  1. Hugging Face Blog67

    Overworld 推出 Waypoint-1 即時互動影片擴散模型

    Overworld 發佈 Waypoint-1,這款即時互動影片擴散模型可透過文字、滑鼠和鍵盤控制,並按控制輸入逐影格生成。模型以 10,000 小時配有控制輸入及文字描述的多樣化遊戲影片訓練,並以 self-forcing 後訓練,令訓練更貼近逐影格推理。

    推薦理由:Waypoint-1 從訓練之初便以互動體驗為目標,與常見的先用預訓練影片模型、再微調簡化控制輸入的做法形成對照。