跳到正文

AI 影片

AI 影片生成與理解:文生影片模型、影片編輯工具與影視創作變革的追蹤。

最新精選

第 1–18 條 · 共 18 條
今天10月6日週二
  1. 字節 Seed:Research Feed78

    Seedance 2.5 正式發布,單次最長可生成 30 秒影片並支援多模態參考

    字節 Seed 正式發布新一代影片創作模型 Seedance 2.5,單次最長可生成 30 秒影片,並支援多輪延長、多模態參考及時間戳精準編輯。用戶單次最多可輸入 30 張圖片、10 段影片和 10 段音訊作參考,模型亦提升長影片連貫性及綠幕、視角和運鏡編輯能力。Seedance 2.5 正陸續於即夢 AI、豆包專業版上線,API 服務近期亦將上線火山方舟。

    推薦理由:Seedance 2.5 將單次影片生成時長提升至 30 秒,並支援多輪延長、多模態參考及時間戳編輯,呈現影片創作由片段輸出走向完整流程的能力變化。

10月3日週六
  1. Meta AI:Research Blog76

    Meta 發佈 Muse Image 並預覽 Muse Video

    Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。

    推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。

9月2日週三
8月28日週五
7月1日週三
5月18日週一
4月9日週四
  1. Hugging Face Blog61

    Waypoint-1.5 提升互動世界保真度並擴展本地硬件支援

    Overworld 推出 Waypoint-1.5 即時影片世界模型,提升視覺保真度並擴大可本地運行的硬件範圍。桌面硬件 RTX 3090 至 5090 可生成最高 720p、60 FPS 的即時環境;另有面向更廣泛消費級硬件(包括遊戲筆電)的 360p 版本,Apple Silicon Mac 支援即將推出。

    推薦理由:Waypoint-1.5 分設 720p 與 360p 檔位,並列明 RTX 3090 至 5090 可達最高 720p、60 FPS,呈現其畫質與本地硬件覆蓋方案。

1月20日週二
  1. Hugging Face Blog67

    Overworld 推出 Waypoint-1 即時互動影片擴散模型

    Overworld 發佈 Waypoint-1,這款即時互動影片擴散模型可透過文字、滑鼠和鍵盤控制,並按控制輸入逐影格生成。模型以 10,000 小時配有控制輸入及文字描述的多樣化遊戲影片訓練,並以 self-forcing 後訓練,令訓練更貼近逐影格推理。

    推薦理由:Waypoint-1 從訓練之初便以互動體驗為目標,與常見的先用預訓練影片模型、再微調簡化控制輸入的做法形成對照。

1月14日週三
  1. Google DeepMind72

    Veo 3.1 Ingredients to Video 更新,提升影片一致性與創意並加入原生直向及 1080p、4K 輸出

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,提升參考圖像生成影片的一致性與表現,並加入原生 9:16 直向輸出及 1080p、4K 升頻。

    推薦理由:更新同時處理參考圖像影片中的角色、背景與物件一致性,並加入原生直向及高解像度輸出,可看出 Veo 3.1 如何覆蓋短片創作與專業製作需求。

12月11日週四
  1. OpenAI News80

    The Walt Disney Company 與 OpenAI 達成協議,將逾 200 個角色引入 Sora

    The Walt Disney Company 與 OpenAI 達成協議,將逾 200 個 Disney、Marvel、Pixar 及 Star Wars 角色帶到 Sora,用於製作以粉絲創意為靈感的短片。協議強調在娛樂領域負責任地使用 AI,並包括 Disney 全公司使用 ChatGPT Enterprise 和 OpenAI API。

    推薦理由:這項協議同時涵蓋粉絲創作短片中的角色使用,以及 Disney 全公司使用 ChatGPT Enterprise 和 OpenAI API,呈現合作涉及娛樂內容與企業工具兩方面。

10月1日週三
  1. Sam Altman:Blog84

    Sora App 推出,結合新模型 Sora 2,支援創作、分享和觀看影片

    Sam Altman 宣佈推出 Sora App,結合新模型 Sora 2,並提供影片創作、分享和觀看功能。Cameo 功能可讓用户把自己和朋友加入影片,團隊為角色一致性投入大量工作。產品設有防止深偽肖像濫用、處理令人不安或違法內容的措施,並會定期檢視 Sora 對用户情緒和身心狀況的影響;作者亦提出長期用户滿意度、用户控制動態及優先創作等原則。

    推薦理由:文章列出 Sora 在用户滿意度、動態控制和創作方面的原則,並交代深偽肖像濫用防護及定期檢視用户身心狀況的安排。

9月30日週二
  1. OpenAI News67

    OpenAI 發佈 Sora 2 影片生成模型

    OpenAI 推出 Sora 2,這是一款可生成同步對白與音效的影片生成模型。材料並指出,Sora 產品已不再提供。

    推薦理由:這則材料同時交代 Sora 2 的同步對白與音效生成能力,以及 Sora 產品已不再提供的狀態,讓讀者掌握模型能力介紹與產品供應情況。

  2. OpenAI News66

    OpenAI 發佈 Sora 2 系統卡,介紹影片及音訊生成模型

    OpenAI 發佈 Sora 2 系統卡,介紹這款基於 Sora 的影片與音訊生成模型。Sora 2 加入過往影片模型較難實現的能力,包括更準確的物理表現、更清晰的寫實效果、同步音訊、更強的可控性及更廣的風格範圍。

    推薦理由:Sora 2 系統卡將其能力置於既有影片模型的比較脈絡中,並列出物理表現、同步音訊與風格範圍等變化。

9月2日週二
2月20日週四
  1. Hugging Face Blog68

    SmolVLM2 將影片理解帶到各類裝置

    Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。

    推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。

1月27日週一
  1. Hugging Face Blog69

    Diffusers 中開源影片生成模型的現況

    Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。

    推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。

12月9日週一
  1. OpenAI News88

    OpenAI 影片生成模型 Sora 現已可在 sora.com 使用

    OpenAI 的影片生成模型 Sora 現已可在 sora.com 使用,支援生成最高 1080p、最長 20 秒的影片。影片可採寬屏、直向或正方形畫幅;用户可用自備素材延展、改編或混合影片,也可單憑文字生成全新內容。

    推薦理由:Sora 的可用入口及生成規格清晰列出,涵蓋影片時長、解像度、畫幅選擇,以及文字生成和自備素材改編等方式。

5月8日週一
  1. Hugging Face Blog68

    文字生成影片模型深入解析:技術演進、主要挑戰與 Hugging Face 工具

    Hugging Face Blog 梳理文字生成影片模型的發展,對比 GAN、Transformer 與擴散模型路線,並概述生成能力限制。空間與時間一致性、配對資料稀缺及影片描述困難,令模型訓練成本高,長影片生成亦受上下文限制。Hugging Face Diffusers 可下載、執行及微調 Text2Video-Zero 和 ModelScope,Hub 亦提供多個示範及本地運行指引。

    推薦理由:文章梳理文字生成影片模型從 GAN、Transformer 到擴散模型的演進,並交代資料與長影片生成的核心限制。