ElevenLabs 推出 Image & Video (Beta),整合圖像與影片創作流程
ElevenLabs 推出 Image & Video (Beta),在同一平台整合圖像、影片生成及音訊後製流程。用戶可透過 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成圖像,並以 Veo、Sora、Kling、Wan 和 Seedance 生成影片,再匯出至 Studio 加入語音、背景音樂及音效。
ElevenLabs 推出 Image & Video (Beta),在同一平台整合圖像、影片生成及音訊後製流程。用戶可透過 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成圖像,並以 Veo、Sora、Kling、Wan 和 Seedance 生成影片,再匯出至 Studio 加入語音、背景音樂及音效。
ElevenLabs 推出 Dubbing v2,直接以原始表演作為條件,將説話者的語調、語氣、節奏和情感意圖延續至 90+ 種語言。其同步感知翻譯系統會自動對齊內容的起始、結束位置和節奏,減少手動調整。
ElevenLabs 在 ElevenCreative 推出 Flows Agent,讓用戶以對話描述創作需求,由智能體建立、連接並執行工作流程。它會選擇合適模型、建立及連接節點,並在生成前確認影片長度、語氣和結構;啟用 Assist mode 後,高成本生成須經用戶確認。
ElevenLabs 在 ElevenCreative 推出 Ads Engine,首項功能可把廣告素材本地化並推回 Google、Meta 和 LinkedIn。
Suno 推出 Suno Scenes,讓用戶以照片或影片作為素材創作歌曲。功能先向 iOS 用戶開放,可在歌曲創作體驗的 Camera 模式中使用。
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。
Black Forest Labs 推出 FLUX Video Upscale,可將 480p 起的影片重新生成至最高原生 4K。它原生支援 FLUX 3 輸出,並可修復模糊人臉和水、草等紋理上的網格瑕疵。
字節 Seed 正式發布新一代影片創作模型 Seedance 2.5,單次最長可生成 30 秒影片,並支援多輪延長、多模態參考及時間戳精準編輯。用戶單次最多可輸入 30 張圖片、10 段影片和 10 段音訊作參考,模型亦提升長影片連貫性及綠幕、視角和運鏡編輯能力。Seedance 2.5 正陸續於即夢 AI、豆包專業版上線,API 服務近期亦將上線火山方舟。
推薦理由:Seedance 2.5 將單次影片生成時長提升至 30 秒,並支援多輪延長、多模態參考及時間戳編輯,呈現影片創作由片段輸出走向完整流程的能力變化。
據彭博社報道,快手旗下可靈 AI 已選定承銷銀行,正籌備赴港 IPO,擬募資至少 10 億美元。可靈 AI 正與中金公司、高盛集團及瑞銀集團推進潛在股票發行,目標最早於明年完成上市;融資規模和上市時間仍可能變動。
PyTorch 在過去兩年整合媒體處理架構,由 TorchCodec 集中負責圖像、影片和音訊的解碼與編碼,TorchVision 和 TorchAudio 則專注處理媒體轉換。
OpenMOSS 發佈開源影片與同步音訊生成模型 MOVA,模型可在單次推理中生成影片及同步音訊。程式庫提供模型權重、推理、訓練、LoRA 微調及評測流程,並列出不同推理及訓練設定的硬件資源與耗時數據。
瑞典滾珠軸承製造商 SKF 使用 AI 生成已故女星葛麗泰·嘉寶的虛擬形象拍攝廣告,呼應她曾參與推介瑞典產業的短片。
Prism 提出動態稀疏注意力框架,用於原生以 2K 訓練聯合影片音訊生成模型。框架按時空區域的視覺變化及音訊對影片的影響,動態調整區塊形狀和每個查詢的稀疏度。實驗顯示,相比全注意力,Prism 的訓練速度提升 2.5 倍,生成質素亦更高。
明基(BenQ)推出面向室內高爾夫的 AK900ST、AK800ST 投影機,支援 4K UHD,亮度最高可達 6000 ANSI 流明,色域覆蓋 97% Rec.709。兩款機型支援高爾夫模式 2.0,並採用基於影格的 AI 影片處理技術,針對高爾夫優化色彩、對比度和細節。
LlamaIndex 結合 OpenAI GPT4V 與 LanceDB,示範以多模態 RAG 處理影片,檢索影像及音訊轉寫內容。流程每 5 秒擷取 1 個影格(約 160 個),將音訊轉成文字,再用 OpenAI CLIP 為文字和影像生成嵌入向量,存入 LanceDB VectorStore。
Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。
推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。
Google 團隊在 TPU v6e 上優化 SVG 稀疏注意力的執行流程,令 720p、81 幀影片的端到端去噪提速 1.28×。去噪時間由 153.50 s 降至 119.86 s;在 1440p(302K tokens)下則由 2,471 s 降至 1,461 s,提速 1.69×,PSNR 為 24.05 dB。
MiniMax 發佈 H3 通用多模態生成模型,可理解文字、圖像、影片與音訊的統一上下文,並生成最長 15 秒、2K 解析度的原生立體聲影片。H3 預設提供 2K 輸出,官方表示其 2K 每秒價格低於主流模型的三分之一,並計劃在未來幾天內於適用法律法規範圍內開放模型權重。模型面向廣告、品牌、電商等創作場景,MiniMax 表示完整技術報告將於稍後分享。
Tavus 發佈 Griffin,稱其為首個「Human Interaction Model」(HIM);其研究中,48% 參與者在一分鐘視像通話後認為 Griffin 是真人。
OpenMOSS 發佈 MOSS-VL 開放權重影片理解模型系列,涵蓋連續影片即時互動、離線理解及後續訓練三類用途。系列包括 MOSS-VL-Realtime、MOSS-VL-Instruct-0708 和 MOSS-VL-Base-0708,分別面向即時互動、離線任務,以及持續預訓練和微調。三款模型均為 11B 參數,支援 256K 上下文窗口;倉庫亦提供即時與離線推理、部署和微調資源。
Manus 推出 Manus 2.0,帶來 Cascade 最新迭代、Cloud Computer 和 Automations,並將桌面應用升級為 Manus Studio、推出 Cue 獨立應用。
Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。
Higgsfield AI 藉助 GPT-6 Astra 在一天內推出新影片功能,讓小型企業更容易製作影片廣告。這亦令 Higgsfield AI 能更快將新創作工具推向市場。
vLLM 整合 PyNvVideoCodec,支援使用 NVIDIA GPU 解碼影片,將影片解碼工作從 CPU 移走,以擴展多 GPU 影片字幕生成吞吐量。在 8 張 H100 的測試中,GPU 解碼吞吐量比 CPU 解碼高逾一倍,且大型負載的 CPU 瓶頸消除。PyNvVideoCodec 已包含於標準 CUDA 版 vLLM;自訂安裝需加入 PyNvVideoCodec==2.0.4。
inclusionAI 發佈 Realtime-Venus 全雙工互動系統,提供視聽版 Realtime-Venus-Omni 與音訊版 Realtime-Venus-Audio,兩者均為 9B。
Google DeepMind 推出 Gemini 智能體影片理解功能,影片分析成本最多降低 66%、token 用量最多降低 88%,準確度最多提升 7%。
推薦理由:相較固定 FPS 靜態處理,Gemini 會動態檢視畫面、音訊與字幕,影片分析的 token 用量最多減少 88%、成本最多減少 66%。
Google DeepMind 推出 Gemini Omni 1.1 Flash,為影片生成加入場景延伸、首尾幀控制、影片參考輸入及 1080p 或 4K 輸出。
推薦理由:場景延伸可分析最多10秒的既有影片,並以10秒增量延長至累計40秒;配合首尾幀指定,呈現更長影片創作中的控制方式。
FireRedTeam 開源 FireRed-OpenStoryline,這是一款透過自然語言對話製作和編輯影片的工具。它可搜尋並下載符合要求的圖片和影片片段、生成故事線和旁白,並按提示詞調整剪輯及畫面細節。
NVIDIA 發佈 Cosmos-H-Dreams,一款根據機械人動作即時生成手術場景影片的模擬器。它將 Cosmos-H-Surgical-Simulator 蒸餾為因果學生模型,並透過 FlashDreams 在單張 NVIDIA RTX PRO 6000 上達到約 160 fps。
Google DeepMind 推出 Nano Banana 2 Lite,並首次向開發者開放 Gemini Omni Flash。
推薦理由:兩款模型分別面向高速批量圖像生成與影片生成、對話式編輯,文中列出成本、延遲及 API 限制,可供評估多媒體工作流的取捨。
Google DeepMind 推出 Gemini Omni 系列首個模型 Gemini Omni Flash,可結合圖像、影片、文字及語音參考生成影片,並支援透過對話編輯。
推薦理由:材料把 Gemini Omni Flash 的多模態輸入、對話式影片編輯和分階段上線平台放在一起,便於理解新模型如何連接生成能力與實際使用入口。
Overworld 推出 Waypoint-1.5 即時影片世界模型,提升視覺保真度並擴大可本地運行的硬件範圍。桌面硬件 RTX 3090 至 5090 可生成最高 720p、60 FPS 的即時環境;另有面向更廣泛消費級硬件(包括遊戲筆電)的 360p 版本,Apple Silicon Mac 支援即將推出。
推薦理由:Waypoint-1.5 分設 720p 與 360p 檔位,並列明 RTX 3090 至 5090 可達最高 720p、60 FPS,呈現其畫質與本地硬件覆蓋方案。
OpenAI 開發 Sora 2 和 Sora app 時,以安全為根基,應對最先進影片模型及全新社交創作平台帶來的新安全挑戰。其安全方案以具體防護措施為核心。
Manus 在 2026 年以同一段 8 分鐘素材測試 10 款 AI 影片剪輯平台,比較它們減少剪輯時間、保留創作控制權及將長片改編為短片的表現。評測涵蓋 Manus、Adobe Premiere、Veed.io、Wisecut、DaVinci Resolve、Descript、CapCut、Runway、OpusClip 和 Filmora。
Sora 動態消息以激發創意、促進連結及保障使用體驗安全為設計理念。相關設計包括個人化推薦、家長控制及強力防護措施。
Overworld 發佈 Waypoint-1,這款即時互動影片擴散模型可透過文字、滑鼠和鍵盤控制,並按控制輸入逐影格生成。模型以 10,000 小時配有控制輸入及文字描述的多樣化遊戲影片訓練,並以 self-forcing 後訓練,令訓練更貼近逐影格推理。
推薦理由:Waypoint-1 從訓練之初便以互動體驗為目標,與常見的先用預訓練影片模型、再微調簡化控制輸入的做法形成對照。
Google DeepMind 推出 D4RT,這是一個統一的 AI 模型,可重建並追蹤跨越空間與時間的 4D 場景。測試中,D4RT 比此前方法快 18x 至 300x;在單顆 TPU 上,約 5 秒即可處理 1 分鐘影片,而舊方法最多需 10 分鐘。其查詢式 Transformer 架構支援點追蹤、點雲重建及相機姿態估計,應用方向包括機械人、擴增實境與世界模型。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,提升參考圖像生成影片的一致性與表現,並加入原生 9:16 直向輸出及 1080p、4K 升頻。
推薦理由:更新同時處理參考圖像影片中的角色、背景與物件一致性,並加入原生直向及高解像度輸出,可看出 Veo 3.1 如何覆蓋短片創作與專業製作需求。