跳到正文
字節 Seed:Research Feed·· 2 小時前精選AI 評分77

Seedance 2.5 正式發布,單次可生成 30 秒影片並支援多輪延長

一镜成片,随心参考:Seedance 2.5 正式发布

AI 導讀

Seedance 2.5 正式發布,單次影片生成時長提升至 30 秒,並支援多輪延長。模型單次最多可參考 30 張圖片、10 段影片及 10 段音訊,並支援時間戳精準編輯。模型正陸續上線即夢 AI、豆包專業版,API 服務將於近期上線火山方舟;項目主頁:https://seed.bytedance.com/seedance2_5。

推薦理由

Seedance 2.5 將單次生成時長提升至 30 秒,並支援多素材參考及時間戳編輯,呈現影片生成由片段輸出走向長敍事與精細控制的能力變化。

正文 · 繁體中文

今天,我們正式發佈新一代視頻創作模型 Seedance 2.5。Seedance 2.0 發佈後,我們觀察到,用戶對視頻創作模型的期待正在從“生成一個片段”走向“完成一段創作”。Seedance 2.5 延續了 Seedance 2.0 統一的多模態音視頻聯合生成架構,重點突破長敍事能力、多模態參考能力和編輯能力。圍繞真實的產業場景,讓創作擁有更大的想像空間,並進一步釋放生產力。

其核心亮點如下:

單次生成時長達 30 秒,支持多輪延長:Seedance 2.5 可單次生成 30 秒高質量視頻片段,並支持多輪延長。同時,模型優化了鏡頭銜接和場景過渡,讓長視頻保持更好的連貫性。模型還大幅優化了畫質、音質以及運動質量,並有效弱化了視頻生成中常見的“油膩感”。用戶可以生產數分鐘具有統一視聽語言、高質量的連貫內容,精彩故事一次呈現。

多模態參考能力全面升級:Seedance 2.5 支持用戶單次輸入最多 30 張圖片、10 段視頻、10 段音頻作為參考素材。模型還提升了白模參考、運動參考、創意參考等各類參考能力,使模型能更好地理解創作意圖,實現多主體、多場景、多鏡頭變化的複雜創意。

更精準、穩定的編輯能力:Seedance 2.5 支持精準的時間戳控制,可定向編輯視頻內容,提升創作的效率和可控性。同時,模型強化了綠幕編輯、視角編輯、參考編輯等多種編輯能力,滿足影視、廣告等更多專業、複雜場景的創作需求。

憑藉長敍事、多模態參考、編輯能力的提升,模型不只能單次生成更長的視頻,也能更好地理解創作意圖、更可控地完成從想法到視頻落地的全過程。接下來,我們想邀請你一起觀看一段創意短片,全片由 Seedance 2.5 獨立生成。

今天,Seedance 2.5 正在陸續上線即夢 AI、豆包專業版等平台,API 服務也將在近期上線火山方舟,歡迎體驗和反饋。

項目主頁:

https://seed.bytedance.com/seedance2_5

體驗入口:

1)即夢網頁端-視頻生成-選擇 Seedance 2.5

2)豆包專業版-視頻生成-選擇 Seedance 2.5

30 秒長敍事、支持多輪延長,精彩故事一次呈現

Seedance 2.5 將單次視頻生成時長從 15 秒提升至 30 秒,同時進一步提升長視頻中的敍事能力。模型可以在 30 秒內組織多個有邏輯關聯的鏡頭,讓故事從鋪墊、推進、轉折到收尾逐步展開,而不是簡單延續一個畫面。比如創作一段歌手一鏡到底上台演出的片段,模型演繹了歌手在化妝間與工作人員互動後,穿過後台走廊與伴舞相遇並一起登台演出的完整故事,而非僅歌手上台的畫面。

T2V prompt:一鏡到底手持穩定器跟拍,鏡頭從紅色厚重幕布縫隙緩緩推進,進入暖色後台化妝間。年輕女歌手背對鏡頭整理耳機,工作人員提醒她準備登台。她回頭看向鏡頭,開始唱起 City Pop。鏡頭後退跟拍,歌手穿過幕布進後台通道,與舞伴自然互動,一位工作人員把麥克風遞給她。隨後歌手與舞伴登上舞台,鏡頭繞至背面,紅黑舞美、LED 屏、追光、煙霧與反光地板逐漸展開。鏡頭最終拉遠至體育館全景,呈現滿場觀眾、燈牌、熒光棒與歡呼聲,營造年輕自由的演唱會高潮氛圍。

憑藉模型的多輪延長能力, 用戶能在已有的視頻結果上自然銜接後續鏡頭,並在延長過程中保持主體特徵、場景環境和敍事節奏的連貫,最終生成數分鐘具有統一視聽語言的連貫內容,減少拆分鏡頭、反覆拼接和處理銜接的成本。

R2V prompt:延長視頻,銜接 @視頻 1 畫面內容和主體繼續生成一個 30 秒的視頻,保持人物主體、場景、畫面風格、聲音音效一致。小男孩抱着足球沿車廂跑,地鐵停穩後側邊門打開,他立刻衝出,男主緊追。兩人一路穿過站台跑到街上,驚動街邊路人,男主最終追上並抓住他,小男孩委屈抬頭,男主慢慢消氣,摸摸他的頭,露出無奈笑容。

在畫面呈現上,模型能更好地做到自然的運鏡銜接,主體在多次切鏡中仍保持穩定,音畫始終對齊,使長視頻生成結果更連貫。比如在一段京劇表演中,鏡頭伴隨主角旋轉水袖甩動完成一次優雅的環繞運鏡,主體和背景的呈現始終保持一致。水袖在空中的擺動形成自然的弧線,更遵循物理規律。

R2V prompt:16:9 寬幅電影級質感,一鏡到底,絲滑運鏡,無剪輯。場景參考 @圖片 4。 0-5 秒:@圖片 2 霸王近景開場,鏡頭緩慢環繞上半身並過渡至中景;霸王旋身翻轉,隨後身體與靠旗從鏡頭前快速掠過,形成自然遮擋,鏡頭順勢繞至 @圖片 1 虞姬身側。6-10 秒:鏡頭穩定環繞 @圖片 1 虞姬中景,跟隨水袖動作完成環繞運鏡虞姬抬臂、挑腕、展袖、半轉身。最後收袖定格,側身看向霸王。11-20 秒:@圖片 3 武生出場完成後空翻騰動作,隨後霸王居中,武生在對側進退攻防。虞姬位於霸王側後方以水袖配合,形成剛柔對比。鏡頭從武生中近景緩慢後拉至舞台大景,結尾三人面向觀眾同步京劇落幕亮相。

此外,針對視頻生成中常見的“油膩感”問題,Seedance 2.5 對物體材質、人物膚質與眼神、光影、畫面飽和度等細節進行系統優化。模型還減少了字幕與背景音樂不受控的情況,使成片更接近實拍的影視質感。

多模態參考能力全面升級,複雜創作任務更可控

Seedance 2.5 進一步強化多模態參考能力,支持用戶單次輸入最多 30 張圖片、10 段視頻和 10 段音頻作為參考素材。更多數量、不同類型的參考素材,能更好的還原用戶腦海中的創意,生成主體更多、場景更豐富、鏡頭變化更靈活的複雜視頻內容。

模型能綜合理解不同素材中的畫面構圖、場景、風格、人物、道具等元素,並按指令將這些參考素材用於視頻生成。在多人同框、羣像敍事等複雜場景中,也能同時還原多個人物的形象與聲音,保持各主體特徵穩定。

R2V prompt:30 秒音樂會片段,16:9 橫屏,電影感寫實,真實音樂廳光影,暖金色舞台燈,正式古典音樂會氛圍。場景@圖一,鋼琴家參考@圖二,大提琴參考@圖三,小提琴參考@圖四,主唱參考@圖五,管絃等其他樂隊參考@圖六到圖十,合唱團參考圖十一到圖十四,觀眾席參考@圖十五到圖十八。主唱舞台中央走向前沿,鋼琴家在鋼琴旁,樂隊分佈兩側與後方,合唱團在舞台後方。開場高位俯拍音樂廳全景,鋼琴家落鍵,主唱進入追光演唱,鏡頭自然帶過小提琴、大提琴與管絃樂隊,小提琴明亮,大提琴温暖。後段合唱團加入,主唱與第一排觀眾短暫眼神交流,觀眾微笑點頭。結尾鏡頭後移,演唱結束,觀眾跟隨鼓掌。

此外,模型還提升了白模參考、運動參考、創意參考等各類參考能力,讓畫面中的主體、動作、運鏡更可控。比如,在白模參考中,用戶可以用無紋理 3D 模型搭出畫面的空間結構、主體姿態、運動軌跡和鏡頭機位,再讓模型參考這套結構生成視頻,使複雜鏡頭的構圖和調度更接近預期。同時,模型還增強了光照控制能力,通過白模的空間信息,生成符合真實物理規律的光照效果,包括光源方向、色温、強度、陰影投射等,讓最終生成的畫面光影更自然。

R2V prompt:參考 @白模 1 的運鏡、鏡頭節奏、景別變化、主體軌跡和鏡頭調度。參考 @圖片 2 的角色外形、場景、材質、光照、色彩和童話氛圍,將白模渲染為夢幻温暖、兒童幻想感、3D 動畫短片。劇情依次為:幻想天空飛行→雲海神獸伴飛→俯衝入海→鰩魚海底穿梭→鏡面時空裂縫→宇宙摘星→幻化回房間→爸爸蓋被→合上繪本定格。

更精準、穩定的編輯能力,有效提升創作效率

在視頻生成創作中,用戶通常需要控制生成時的節奏,並在生成後持續打磨細節。某個動作在第幾秒出現、鏡頭在什麼時間切換,或某片段裏的角色、動作是否需要調整,都關係到最終成片的效果。更精準、穩定的編輯能力,可以讓用戶準確還原創意,提高創作效率,減少反覆生成的成本。

Seedance 2.5 支持通過時間戳精準編輯音視頻內容,在生成時,用戶通過 prompt 控制某個時間段發生的故事、畫面視角、運鏡和整體節奏,使其更貼近創作意圖。在生成後,用戶還能針對指定片段裏的角色、動作、聲音或劇情進行定向修改,同時保持修改前後的連貫性和真實感。

模型還進一步提升了綠幕編輯、視角與運鏡編輯、參考編輯等多種編輯能力,以滿足影視、廣告等更多專業、複雜的創作場景。比如,在綠幕編輯方面,模型不僅能在保持主體不變的情況下,替換不同場景、講述不同故事,還能更好地基於不同場景的物理規則渲染人物身上的物理效果,包括衣服飄動方向、頭髮狀態、步態節奏、光影等,使主體和場景更加和諧。

R2V prompt:把 @視頻 1 綠幕背景渲染場景、障礙、服裝和配角:0-4 秒:戶外訓練,障礙換石頭、磚塊、輪胎、木箱;4-10 秒:休息室,朋友鼓勵;10-15 秒:國際賽場,訓練杆換原創防守球員和門將,主角進球。整體寫實電影級。

R2V prompt:編輯 @視頻 1,保持人物、動作及畫風不變,僅調整運鏡。15 秒分段運鏡設計:0–4 秒,微型 FPV 貼鍋穿行,跟隨彈起的吐司後橫甩至咖啡;4–7 秒,推近並沿鍋邊橫移,跟隨煎蛋翻起落回;7–11 秒,急速升至頂視角,勻速下壓掃過餐盤和鑰匙;11–15 秒,手持近鏡跟隨雙手快速橫甩,最後推近早餐,再拉回雙人中景。全程連貫穩定。

深入更廣泛的產業場景,持續探索應用價值

隨着模型能力的提升,Seedance 2.5 也在深入教育、工業等更廣泛的產業場景。在教育領域,模型已開始進入真實學習場景。比如,Seedance 2.5 可以將課文背後的歷史背景、人物和情節轉化為視頻內容,把學習內容從靜態講解轉化成更生動、更沉浸感的畫面。同時,模型可以幫助老師更高效地製作教學視頻,將科學原理、歷史事件、實驗過程等抽象內容轉化為動態演示,不僅降低教學物料的製作門檻,還支持靈活的內容定製。

豆包愛學 App「豆包課堂」場景示例

R2V prompt:東方寫意風格。 南宋臨安街景,熱鬧的街上幾個孩子邊跑邊鬧,孩子們嘴裏張嘴念着“驀然回首,那人卻在,燈火闌珊處”。鏡頭始終跟隨孩子們奔跑,帶過熱鬧的街景。鏡頭上搖,此人正是 @圖片 1 辛棄疾。辛棄疾回頭,遠處是在燈火闌珊中的男子,鏡頭連貫。

在工業製造、具身智能和自動駕駛等產業中,Seedance 2.5 也開始進入更具體的生產環節。模型可以生成高質量合成視頻數據,幫助訓練機器人的感知和操作能力;也可以用於工業仿真、流程培訓和設備演示。在自動駕駛場景中,模型還可以模擬極端天氣、複雜路況等低頻場景,為系統測試和訓練提供更多樣本。

R2V prompt:參考 @白模 1 的運鏡、構圖、景別、空間關係、零件位置、模型結構、裝配順序和運動軌跡。參考 @圖片 1 的材質、光照、色彩、反射和氛圍,將白模渲染為高端真實汽車拼裝片段。

總結與展望

Seedance 2.5 進一步增強了對真實世界的理解和呈現能力,讓視頻生成從片段級輸出,走向更完整的創作流程。我們也看到,在複雜運動的物理合理性、極多主體交互場景的穩定性上,模型仍有提升空間。

未來,Seedance 團隊將繼續探索更長的連貫敍事、更懂用戶的生成與編輯體驗,並進一步增強模型對物理世界規律的理解。我們希望 Seedance 系列模型能更生動、更可控、更懂創作者,幫助更多用戶表達創意的同時,持續探索並服務更廣泛的產業需求。

來源:字節 Seed:Research Feed · seed.bytedance.com