Prism:用於原生 2K 聯合影片音訊生成模型訓練的動態稀疏注意力
Prism 提出動態稀疏注意力框架,用於原生以 2K 訓練聯合影片音訊生成模型。框架按時空區域的視覺變化及音訊對影片的影響,動態調整區塊形狀和每個查詢的稀疏度。實驗顯示,相比全注意力,Prism 的訓練速度提升 2.5 倍,生成質素亦更高。
Prism 提出動態稀疏注意力框架,用於原生以 2K 訓練聯合影片音訊生成模型。框架按時空區域的視覺變化及音訊對影片的影響,動態調整區塊形狀和每個查詢的稀疏度。實驗顯示,相比全注意力,Prism 的訓練速度提升 2.5 倍,生成質素亦更高。
Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。
Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。