跳到正文

#影片

今日 12 條
1月14日週三
1月6日週二
12月11日週四
  1. OpenAI News80

    The Walt Disney Company 與 OpenAI 達成協議,將逾 200 個角色引入 Sora

    The Walt Disney Company 與 OpenAI 達成協議,將逾 200 個 Disney、Marvel、Pixar 及 Star Wars 角色帶到 Sora,用於製作以粉絲創意為靈感的短片。協議強調在娛樂領域負責任地使用 AI,並包括 Disney 全公司使用 ChatGPT Enterprise 和 OpenAI API。

    推薦理由:這項協議同時涵蓋粉絲創作短片中的角色使用,以及 Disney 全公司使用 ChatGPT Enterprise 和 OpenAI API,呈現合作涉及娛樂內容與企業工具兩方面。

10月15日週三
10月1日週三
  1. Sam Altman:Blog84

    Sora App 推出,結合新模型 Sora 2,支援創作、分享和觀看影片

    Sam Altman 宣佈推出 Sora App,結合新模型 Sora 2,並提供影片創作、分享和觀看功能。Cameo 功能可讓用户把自己和朋友加入影片,團隊為角色一致性投入大量工作。產品設有防止深偽肖像濫用、處理令人不安或違法內容的措施,並會定期檢視 Sora 對用户情緒和身心狀況的影響;作者亦提出長期用户滿意度、用户控制動態及優先創作等原則。

    推薦理由:文章列出 Sora 在用户滿意度、動態控制和創作方面的原則,並交代深偽肖像濫用防護及定期檢視用户身心狀況的安排。

9月30日週二
  1. OpenAI News67

    OpenAI 發佈 Sora 2 影片生成模型

    OpenAI 推出 Sora 2,這是一款可生成同步對白與音效的影片生成模型。材料並指出,Sora 產品已不再提供。

    推薦理由:這則材料同時交代 Sora 2 的同步對白與音效生成能力,以及 Sora 產品已不再提供的狀態,讓讀者掌握模型能力介紹與產品供應情況。

  2. OpenAI News66

    OpenAI 發佈 Sora 2 系統卡,介紹影片及音訊生成模型

    OpenAI 發佈 Sora 2 系統卡,介紹這款基於 Sora 的影片與音訊生成模型。Sora 2 加入過往影片模型較難實現的能力,包括更準確的物理表現、更清晰的寫實效果、同步音訊、更強的可控性及更廣的風格範圍。

    推薦理由:Sora 2 系統卡將其能力置於既有影片模型的比較脈絡中,並列出物理表現、同步音訊與風格範圍等變化。

9月2日週二
7月23日週三
  1. Hugging Face Blog50

    TimeScope:大型多模態模型能理解多長的影片?

    Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。

7月17日週四
2月20日週四
  1. Hugging Face Blog68

    SmolVLM2 將影片理解帶到各類裝置

    Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。

    推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。

2月12日週三
  1. Hugging Face Blog58

    如何為影片生成建立優質資料集

    Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。

1月27日週一
  1. Hugging Face Blog69

    Diffusers 中開源影片生成模型的現況

    Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。

    推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。

12月9日週一
  1. OpenAI News88

    OpenAI 影片生成模型 Sora 現已可在 sora.com 使用

    OpenAI 的影片生成模型 Sora 現已可在 sora.com 使用,支援生成最高 1080p、最長 20 秒的影片。影片可採寬屏、直向或正方形畫幅;用户可用自備素材延展、改編或混合影片,也可單憑文字生成全新內容。

    推薦理由:Sora 的可用入口及生成規格清晰列出,涵蓋影片時長、解像度、畫幅選擇,以及文字生成和自備素材改編等方式。

3月25日週一
5月8日週一
  1. Hugging Face Blog68

    文字生成影片模型深入解析:技術演進、主要挑戰與 Hugging Face 工具

    Hugging Face Blog 梳理文字生成影片模型的發展,對比 GAN、Transformer 與擴散模型路線,並概述生成能力限制。空間與時間一致性、配對資料稀缺及影片描述困難,令模型訓練成本高,長影片生成亦受上下文限制。Hugging Face Diffusers 可下載、執行及微調 Text2Video-Zero 和 ModelScope,Hub 亦提供多個示範及本地運行指引。

    推薦理由:文章梳理文字生成影片模型從 GAN、Transformer 到擴散模型的演進,並交代資料與長影片生成的核心限制。