跳到正文

#多模態

今日 34 條
今天10月6日週二
  1. ElevenLabs:Blog65

    ElevenLabs 在 ElevenCreative 推出 Flows Agent

    ElevenLabs 在 ElevenCreative 推出 Flows Agent,讓用戶以對話描述創作需求,由智能體建立、連接並執行工作流程。它會選擇合適模型、建立及連接節點,並在生成前確認影片長度、語氣和結構;啟用 Assist mode 後,高成本生成須經用戶確認。

  2. Suno:Blog46

    Suno Audio Input:用任何聲音創作歌曲

    Suno 推出 Audio Input,讓 Pro 和 Premier 用戶上載或錄製音訊,並將其延伸創作成歌曲。音訊或影片片段須為 6 至 60 秒,用戶可設定延伸時間點、曲風及是否加入歌詞。有版權的作品會被禁止上載;含人聲的輸入會保持私密,且不可搜尋。

  3. Liquid AI 模型與工程博客45

    LFM2-VL:高效視覺語言模型

    LFM2-VL 推出 LFM2-VL-450M 和 LFM2-VL-1.6B 兩款開放權重視覺語言模型,支援文字及可變解像度圖像輸入。在 GPU 上的推理速度最高達現有 VLM 的 2 倍,並原生處理最高 512×512 解像度的圖像;更大的圖像會切分為 512×512 區塊。兩款模型現已於 Hugging Face 提供,採用基於 Apache 2.0 的開放授權。

  4. Liquid AI 模型與工程博客63

    Liquid AI 發佈 LFM2.5-VL-3B 端側視覺語言模型

    Liquid AI 發佈視覺語言模型 LFM2.5-VL-3B,稱其視覺表現可媲美參數量兩倍的模型,並在多種 CPU、GPU 部署中運行更快。相較前代,屏幕理解、工具調用、定位及多圖輸入均有提升,ScreenSpot-v2 平均得分為 80.7,ToolSandbox 由 26.4 升至 59.5,RefCOCO precision@1 由 57.1 升至 87.9。

  5. Suno:Blog74

    Suno 推出新一代音樂模型 v6,提供三款模型並擴展創作功能

    Suno 推出新一代音樂模型 v6,分為 v6、v6-wild 和 v6-mini 三款,分別支援不同創作需求。v6 和 v6-wild 提供予 Pro、Premier 訂閲用戶,v6-mini 則開放所有用戶使用;三者均能理解人聲、樂器、歌曲結構、情緒和參考風格等描述。新功能包括以文字指令編輯歌曲局部、混搭多個來源、取樣並分離音訊,以及從文字、音訊、圖像或影片創作音樂。

  6. Black Forest Labs:Blog69

    FLUX 3 Video 第一部分:影片生成初始版本開放使用

    Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。

  7. 小米 MiMo:官網發佈與博客54

    MiMo-V2.5 系列全流程推理優化實踐

    小米 MiMo 團隊介紹 MiMo-V2.5 系列的全流程推理工程優化,涵蓋 KVCache 管理、排程、Prefill/Decode 執行流程及多模態推理。多模態 Encoder 的 QPS 由 15 增至 30,平均延遲由 78.39 ms 變為 80.28 ms;1 小時影片的 Encoder 端到端延遲由 156 s 降至 23 s。

  8. NAVER / CLOVA 研究35

    聖地亞哥 NeurIPS 2025:NAVER 的 AI 現況與未來

    NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。

  9. 字節 Seed:Research Feed66

    Seedream 5.0 Pro 發佈,支援資訊圖生成與交互式精準編輯

    Seedream 5.0 Pro 正式發布,作為多模態圖像創作模型,提升圖文匹配、結構合理性、文字渲染及畫面美感。其四項核心能力包括高密度資訊圖生成、交互式精準編輯、影像與人像質感提升,以及十餘種常用語言的原生輸入與生成。目前模型已在火山方舟體驗中心上線,並將陸續在豆包、即夢上線;項目主頁:https://seed.bytedance.com/seedream5_0_pro

  10. 字節 Seed:Research Feed78

    Seedance 2.5 正式發布,單次最長可生成 30 秒影片並支援多模態參考

    字節 Seed 正式發布新一代影片創作模型 Seedance 2.5,單次最長可生成 30 秒影片,並支援多輪延長、多模態參考及時間戳精準編輯。用戶單次最多可輸入 30 張圖片、10 段影片和 10 段音訊作參考,模型亦提升長影片連貫性及綠幕、視角和運鏡編輯能力。Seedance 2.5 正陸續於即夢 AI、豆包專業版上線,API 服務近期亦將上線火山方舟。

    推薦理由:Seedance 2.5 將單次影片生成時長提升至 30 秒,並支援多輪延長、多模態參考及時間戳編輯,呈現影片創作由片段輸出走向完整流程的能力變化。

  11. 字節 Seed:Research Feed75

    字節 Seed 發佈 SeedRealtime 原生音訊及影片全雙工大模型,邁向全模態自然互動

    字節 Seed 正式推出原生音訊及影片全雙工大模型 SeedRealtime,透過統一架構在連續多模態資訊流中即時互動。SeedRealtime 已在豆包 App 全量上線;端到端人工評測顯示,與級聯模型相比,其音訊及影片對話節奏問題減少一半,單次對話順暢、完整交流的機率亦有明顯提升。項目主頁:https://seed.bytedance.com/seedrealtime

  12. Thinking Machines Lab:News44

    Thinking Machines Lab 宣佈提供互動性研究資助

    Thinking Machines Lab 宣佈提供多項互動性研究資助,每項金額為 $100,000,另附 $25,000 Tinker credits。研究方向包括即時多模態互動評測與安全、以生成式 UI 解釋複雜資訊,以及在長期任務中即時瞭解智能體的執行情況並加以引導;亦歡迎其他相關提案。申請截止日期為 June 19, 2026。

10月5日週一
10月4日週日
10月3日週六