HuggingFace Daily Papers(社區熱門論文)·· 3 天前AI 評分37
Prism:用於原生 2K 聯合影片音訊生成模型訓練的動態稀疏注意力
Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training
AI 導讀
Prism 提出動態稀疏注意力框架,用於原生以 2K 訓練聯合影片音訊生成模型。框架按時空區域的視覺變化及音訊對影片的影響,動態調整區塊形狀和每個查詢的稀疏度。實驗顯示,相比全注意力,Prism 的訓練速度提升 2.5 倍,生成質素亦更高。
來源:HuggingFace Daily Papers(社區熱門論文) · huggingface.co