跳到正文
原文
HuggingFace Daily Papers(社區熱門論文)·· 3 天前AI 評分37

Prism:用於原生 2K 聯合影片音訊生成模型訓練的動態稀疏注意力

Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

AI 導讀

Prism 提出動態稀疏注意力框架,用於原生以 2K 訓練聯合影片音訊生成模型。框架按時空區域的視覺變化及音訊對影片的影響,動態調整區塊形狀和每個查詢的稀疏度。實驗顯示,相比全注意力,Prism 的訓練速度提升 2.5 倍,生成質素亦更高。

來源:HuggingFace Daily Papers(社區熱門論文) · huggingface.co