跳到正文

#模型發佈

今日 20 條
10月6日週二
  1. Suno:Blog77

    Suno 發佈 v3,可在數秒內生成完整兩分鐘歌曲

    Suno 發佈首個可製作電台級音樂的模型 v3,用戶可在數秒內生成完整兩分鐘歌曲。v3 現已向所有用戶開放,網址為 https://app.suno.ai。v3 亦改善音質、增加風格與曲風選擇,並提升提示詞遵循度、減少模型幻覺,令歌曲結尾更自然。

    推薦理由:v3 可在數秒內生成完整兩分鐘歌曲,並改善音質、風格選擇及提示詞遵循,呈現這次更新在生成速度與創作控制上的具體變化。

  2. Liquid AI 模型與工程博客45

    LFM2-VL:高效視覺語言模型

    LFM2-VL 推出 LFM2-VL-450M 和 LFM2-VL-1.6B 兩款開放權重視覺語言模型,支援文字及可變解像度圖像輸入。在 GPU 上的推理速度最高達現有 VLM 的 2 倍,並原生處理最高 512×512 解像度的圖像;更大的圖像會切分為 512×512 區塊。兩款模型現已於 Hugging Face 提供,採用基於 Apache 2.0 的開放授權。

  3. Liquid AI 模型與工程博客65

    Liquid AI 發佈 Liquid Nanos,主打在日常裝置上提供前沿級表現

    Liquid AI 發佈 Liquid Nanos,一系列 350M–2.6B 參數的基礎模型,可在手機、手提電腦及嵌入式裝置上本機運行。首批實驗性模型涵蓋資料抽取、英日雙向翻譯、RAG、工具調用及數學推理,另包括社羣製作的法語微調模型。模型現已在 Liquid Edge AI 平台(LEAP)及 Hugging Face 提供,並以開放授權向學術界、開發者及小型企業開放。

  4. Liquid AI 模型與工程博客60

    Liquid AI 發佈 LFM2-8B-A1B 端側 MoE 模型(已由 LFM2.5-8B-A1B 取代)

    Liquid AI 發佈 LFM2-8B-A1B 早期檢查點,這款端側 MoE 模型共有 8.3B 參數,每個 token 啟用 1.5B 參數。官方公佈 16 項基準測試結果,其中 MMLU-Pro 得分為 37.42,較 LFM2-2.6B 高 11.46 分;模型面向手機、平板及手提電腦的本地推理。頁首註明,該模型已棄用,並由 LFM2.5-8B-A1B 取代。

  5. Claude:Blog74

    編碼工作階段更長、使用更多上下文,Claude Opus 5.5 為此而設

    Claude Opus 5.5 針對更長、上下文用量更高的編碼工作階段設計,按 token 計費的典型工作負載估計比 Opus 5 便宜約 40%。輸入及輸出 token 價格下調 20%,讀取快取 token 的價格下調 60%;Claude Code 的快取未命中輸入亦減少逾 50%。文中指出,長而開放的任務較有機會透過減少錯誤方向上的回合降低成本,而簡單、短小的機械式任務所需回合數大致相同。

  6. Black Forest Labs:Blog54

    FLUX VTO 開放使用,支援大規模虛擬試穿

    Black Forest Labs 已公開提供 FLUX VTO,這款虛擬試穿模型的生成時間少於 4 秒,適用於大規模商品目錄。它可為同一人物一次套用最多四件服裝,並保留人物身份及服裝上的標誌、印花、縫線和五金配件。身體及服裝尺碼的精確呈現仍在改進,輸出宜作視覺造型參考;預設政策不支援泳裝和內衣。

  7. ElevenLabs:Blog70

    ElevenLabs 發佈 Eleven v4 與 Eleven v4 Turbo 文字轉語音模型

    ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。

  8. Liquid AI 模型與工程博客69

    Liquid AI 發佈可在裝置端運行的 LFM2.5-2.6B 模型

    Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。

  9. Liquid AI 模型與工程博客63

    Liquid AI 發佈 LFM2.5-VL-3B 端側視覺語言模型

    Liquid AI 發佈視覺語言模型 LFM2.5-VL-3B,稱其視覺表現可媲美參數量兩倍的模型,並在多種 CPU、GPU 部署中運行更快。相較前代,屏幕理解、工具調用、定位及多圖輸入均有提升,ScreenSpot-v2 平均得分為 80.7,ToolSandbox 由 26.4 升至 59.5,RefCOCO precision@1 由 57.1 升至 87.9。

  10. Suno:Blog74

    Suno 推出新一代音樂模型 v6,提供三款模型並擴展創作功能

    Suno 推出新一代音樂模型 v6,分為 v6、v6-wild 和 v6-mini 三款,分別支援不同創作需求。v6 和 v6-wild 提供予 Pro、Premier 訂閲用戶,v6-mini 則開放所有用戶使用;三者均能理解人聲、樂器、歌曲結構、情緒和參考風格等描述。新功能包括以文字指令編輯歌曲局部、混搭多個來源、取樣並分離音訊,以及從文字、音訊、圖像或影片創作音樂。

  11. Black Forest Labs:Blog69

    FLUX 3 Video 第一部分:影片生成初始版本開放使用

    Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。

  12. 小米 MiMo:官網發佈與博客58

    小米發佈 MiMo-V2.5-TTS 語音合成模型系列

    小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。