FLUX 3 與 mimic 合作打造新一代影片動作模型 FLUX-mimic
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。
字節 Seed 正式發布新一代影片創作模型 Seedance 2.5,單次最長可生成 30 秒影片,並支援多輪延長、多模態參考及時間戳精準編輯。用戶單次最多可輸入 30 張圖片、10 段影片和 10 段音訊作參考,模型亦提升長影片連貫性及綠幕、視角和運鏡編輯能力。Seedance 2.5 正陸續於即夢 AI、豆包專業版上線,API 服務近期亦將上線火山方舟。
推薦理由:Seedance 2.5 將單次影片生成時長提升至 30 秒,並支援多輪延長、多模態參考及時間戳編輯,呈現影片創作由片段輸出走向完整流程的能力變化。
OpenMOSS 發佈開源影片與同步音訊生成模型 MOVA,模型可在單次推理中生成影片及同步音訊。程式庫提供模型權重、推理、訓練、LoRA 微調及評測流程,並列出不同推理及訓練設定的硬件資源與耗時數據。
Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。
推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。
MiniMax 發佈 H3 通用多模態生成模型,可理解文字、圖像、影片與音訊的統一上下文,並生成最長 15 秒、2K 解析度的原生立體聲影片。H3 預設提供 2K 輸出,官方表示其 2K 每秒價格低於主流模型的三分之一,並計劃在未來幾天內於適用法律法規範圍內開放模型權重。模型面向廣告、品牌、電商等創作場景,MiniMax 表示完整技術報告將於稍後分享。
Tavus 發佈 Griffin,稱其為首個「Human Interaction Model」(HIM);其研究中,48% 參與者在一分鐘視像通話後認為 Griffin 是真人。
OpenMOSS 發佈 MOSS-VL 開放權重影片理解模型系列,涵蓋連續影片即時互動、離線理解及後續訓練三類用途。系列包括 MOSS-VL-Realtime、MOSS-VL-Instruct-0708 和 MOSS-VL-Base-0708,分別面向即時互動、離線任務,以及持續預訓練和微調。三款模型均為 11B 參數,支援 256K 上下文窗口;倉庫亦提供即時與離線推理、部署和微調資源。
inclusionAI 發佈 Realtime-Venus 全雙工互動系統,提供視聽版 Realtime-Venus-Omni 與音訊版 Realtime-Venus-Audio,兩者均為 9B。
NVIDIA 發佈 Cosmos-H-Dreams,一款根據機械人動作即時生成手術場景影片的模擬器。它將 Cosmos-H-Surgical-Simulator 蒸餾為因果學生模型,並透過 FlashDreams 在單張 NVIDIA RTX PRO 6000 上達到約 160 fps。
Google DeepMind 推出 Nano Banana 2 Lite,並首次向開發者開放 Gemini Omni Flash。
推薦理由:兩款模型分別面向高速批量圖像生成與影片生成、對話式編輯,文中列出成本、延遲及 API 限制,可供評估多媒體工作流的取捨。
Google DeepMind 推出 Gemini Omni 系列首個模型 Gemini Omni Flash,可結合圖像、影片、文字及語音參考生成影片,並支援透過對話編輯。
推薦理由:材料把 Gemini Omni Flash 的多模態輸入、對話式影片編輯和分階段上線平台放在一起,便於理解新模型如何連接生成能力與實際使用入口。
Overworld 推出 Waypoint-1.5 即時影片世界模型,提升視覺保真度並擴大可本地運行的硬件範圍。桌面硬件 RTX 3090 至 5090 可生成最高 720p、60 FPS 的即時環境;另有面向更廣泛消費級硬件(包括遊戲筆電)的 360p 版本,Apple Silicon Mac 支援即將推出。
推薦理由:Waypoint-1.5 分設 720p 與 360p 檔位,並列明 RTX 3090 至 5090 可達最高 720p、60 FPS,呈現其畫質與本地硬件覆蓋方案。
Overworld 發佈 Waypoint-1,這款即時互動影片擴散模型可透過文字、滑鼠和鍵盤控制,並按控制輸入逐影格生成。模型以 10,000 小時配有控制輸入及文字描述的多樣化遊戲影片訓練,並以 self-forcing 後訓練,令訓練更貼近逐影格推理。
推薦理由:Waypoint-1 從訓練之初便以互動體驗為目標,與常見的先用預訓練影片模型、再微調簡化控制輸入的做法形成對照。
Google DeepMind 推出 D4RT,這是一個統一的 AI 模型,可重建並追蹤跨越空間與時間的 4D 場景。測試中,D4RT 比此前方法快 18x 至 300x;在單顆 TPU 上,約 5 秒即可處理 1 分鐘影片,而舊方法最多需 10 分鐘。其查詢式 Transformer 架構支援點追蹤、點雲重建及相機姿態估計,應用方向包括機械人、擴增實境與世界模型。
NVIDIA 發佈 Cosmos Reason 2,稱其在 Physical AI Bench 和 Physical Reasoning 榜單位列視覺理解開放模型第一。
OpenAI 推出 Sora 2,這是一款可生成同步對白與音效的影片生成模型。材料並指出,Sora 產品已不再提供。
推薦理由:這則材料同時交代 Sora 2 的同步對白與音效生成能力,以及 Sora 產品已不再提供的狀態,讓讀者掌握模型能力介紹與產品供應情況。
OpenAI 發佈 Sora 2 系統卡,介紹這款基於 Sora 的影片與音訊生成模型。Sora 2 加入過往影片模型較難實現的能力,包括更準確的物理表現、更清晰的寫實效果、同步音訊、更強的可控性及更廣的風格範圍。
推薦理由:Sora 2 系統卡將其能力置於既有影片模型的比較脈絡中,並列出物理表現、同步音訊與風格範圍等變化。
Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。
推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。