跳到正文

#圖像生成

今日 2 條
今天10月7日週三
10月6日週二
  1. HuggingFace Daily Papers(社區熱門論文)62

    研究提出以校準式內容認證判斷影像真實性可否被合理否認

    研究提出並評估一種以生成器忠實重建能力校準的內容認證方法,用來判斷影像真實性是否可被合理否認。研究測試 20 款深偽檢測器對 10 個近四年推出的生成器,準確率由接近完美的 99.5% 降至 76%;對抗性擾動則令所有基線檢測器的準確率跌至 2% 以下。新方法可校準至生成內容遭錯誤認證的比例不超過 1%,並在所評估的有界擾動攻擊下維持此上限,但不涵蓋任意對抗性轉換。

  2. ElevenLabs:Blog65

    ElevenLabs 在 ElevenCreative 推出 Flows Agent

    ElevenLabs 在 ElevenCreative 推出 Flows Agent,讓用戶以對話描述創作需求,由智能體建立、連接並執行工作流程。它會選擇合適模型、建立及連接節點,並在生成前確認影片長度、語氣和結構;啟用 Assist mode 後,高成本生成須經用戶確認。

  3. Goodfire Research74

    Goodfire Research 展示 Paint With Ember 以擴散模型潛在表徵進行概念繪圖

    Goodfire Research 展示 Paint With Ember,讓用戶透過畫布操控 SDXL-Turbo 的內部表徵,以概念方式生成和編輯圖像。工具使用 BatchTopK SAE 拆解圖像潛在表示,再以 NMF 將相關特徵聚合為概念,支援繪製、拖曳和調整概念。Goodfire Research 提供應用程式公開版本及開源 SAE 解讀器模型。

  4. Black Forest Labs:Blog54

    FLUX VTO 開放使用,支援大規模虛擬試穿

    Black Forest Labs 已公開提供 FLUX VTO,這款虛擬試穿模型的生成時間少於 4 秒,適用於大規模商品目錄。它可為同一人物一次套用最多四件服裝,並保留人物身份及服裝上的標誌、印花、縫線和五金配件。身體及服裝尺碼的精確呈現仍在改進,輸出宜作視覺造型參考;預設政策不支援泳裝和內衣。

  5. Black Forest Labs:Blog45

    Envato 如何以 FLUX 打造創意 AI 引擎

    Envato 以 FLUX 建立創意 AI 引擎,按創作任務將請求路由至合適模型,讓用戶透過統一體驗生成及編輯圖片。FLUX 至今已生成 51 million+ 張圖片,約佔平台圖片生成量 ~25%。FLUX.2 在寫實、電影感及產品圖片用途上的表現較可比模型高 ~10%,下載率較平台所有供應商的平均水平高 16%。

  6. 字節 Seed:Research Feed66

    Seedream 5.0 Pro 發佈,支援資訊圖生成與交互式精準編輯

    Seedream 5.0 Pro 正式發布,作為多模態圖像創作模型,提升圖文匹配、結構合理性、文字渲染及畫面美感。其四項核心能力包括高密度資訊圖生成、交互式精準編輯、影像與人像質感提升,以及十餘種常用語言的原生輸入與生成。目前模型已在火山方舟體驗中心上線,並將陸續在豆包、即夢上線;項目主頁:https://seed.bytedance.com/seedream5_0_pro

10月5日週一
  1. Hacker News:AI 熱帖61

    Jagex 重申不以生成式 AI 製作 RuneScape 遊戲、美術及創意素材,並撤下 Dragon Slayer II 預告片

    Jagex 因 Dragon Slayer II 預告片引發生成式 AI 疑慮而將影片下架調查,並重申不以生成式 AI 製作遊戲、美術或創意素材。外部合作方曾明確承諾不使用 GenAI,但預告片出現六指畫面;Jagex 稱會在 RuneFest 後立即改革審核流程,並與社羣創作者合作呈現 Dragon Slayer II 的故事。

10月3日週六
  1. IT之家64

    Black Forest Labs 發佈 FLUX 3 Image,支援最高 4K 生成及精確排布畫面元素

    Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。

  2. Hacker News:AI 熱帖30

    消費者對 AI 的疲勞感令人難以招架,本地商户應重新考慮使用 AI

    消費者對 AI 內容的疲勞感已令人難以招架,討論主張本地商户重新考慮使用 AI。支持者認為,專業運用 AI 可製作媲美甚至勝過人工作品的內容,速度更快、成本更低。批評者稱,AI 產出有 99% 一眼可見地粗劣;他們所見的做法是未用過 AI 的人只輸入「a poster」,便採用首個結果。

  3. Meta AI:Research Blog76

    Meta 發佈 Muse Image 並預覽 Muse Video

    Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。

    推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。

  4. Microsoft AI:官方博客67

    Microsoft 發佈 MAI-Image-2.6,登上 Arena 文字生成圖像排行榜第二位並領先 Google、Meta 和 xAI

    Microsoft 宣佈 MAI-Image-2.6 在 Arena 文字生成圖像排行榜排名第二,較 MAI-Image-2.5 整體提升 79 Elo。其文字渲染提升 91 Elo,並在 Arena 每個測量類別均較 2.5 有改善。MAI-Image-2.6 現可在 Arena 試用,本週稍後將登上 MAI Playground,並即將推送至 Microsoft Foundry 等產品。

10月2日週五
  1. TechCrunch · AI54

    教宗良十四世呼籲保護人類藝術,稱 AI 生成作品與人類藝術存在本體差異

    教宗良十四世在 X 發文,呼籲在 AI 時代保護人類藝術,並稱人類創作與機器生成作品在本體上存在差異。他認為機器根據數百萬張他人創作的圖像進行統計計算,算法缺乏人性的火花。他 5 月的通諭強調自動化日益普及時維護人類尊嚴的重要性;TechCrunch 援引《紐約時報》近期報道稱,Anthropic 曾遊説梵蒂岡重新考慮非人類意識立場,但似乎成效有限。

  2. TechCrunch · AI65

    ChatGPT 新增衣物與配飾虛擬試穿功能

    OpenAI 全球推出 ChatGPT 虛擬試穿及商品收藏兩項購物功能,用户可上傳自拍、全身照或商品圖片,預覽衣物與配飾穿上身的效果。虛擬試穿入口會出現在購物結果中的 Try On 按鈕;Favorites 可把商品保存至應用程式 Library 以便稍後查看。OpenAI 表示,這些功能使用新推出的 ChatGPT Images 2.5。

9月28日週一
  1. HuggingFace Daily Papers(社區熱門論文)37

    AFP-GIC:可控生成式圖像壓縮的自適應融合先驗遷移

    AFP-GIC 提出按圖像內容引導編碼與重建的自適應融合先驗遷移流程,用於可控生成式圖像壓縮,無須傳送先驗本身。單一可部署的預訓練模型支援五個碼率操作點。在 NVIDIA RTX 4090 上以 256×256 圖像區塊測試,解碼延遲較 DC-VIC 低 18.1%(80.47 ms 對 98.27 ms),推理參數少 20.5%。

9月25日週五
9月24日週四
  1. Midjourney:Updates52

    Midjourney Alpha 更新多項功能,韓文版向所有用戶開放

    Midjourney 為 alpha.midjourney.com 推出多項功能更新,並在 midjourney.com 向所有用戶開放韓文版。更新包括樣式側欄即時預覽提示詞套用不同樣式的效果、將提示列設定存為預設值,以及把創作動態牆改為全闊瀑布流,提示詞和按鈕則改在滑鼠懸停時顯示;搜尋封存及專案管理亦有調整。編輯器新增對 v8.1 和 v8.2 編輯類型的支援,編輯畫布亦可使用 HD。

9月17日週四
  1. 螞蟻 inclusionAI:HuggingFace 新模型52

    inclusionAI 發佈 Ming-Image-0.1-Design 6B 文生圖模型

    inclusionAI 發佈 Ming-Image-0.1-Design,這款 6B 文生圖模型面向 UI、資訊圖表、海報等文字密集的視覺設計。模型可生成完整視覺構圖並支援透明背景 RGBA 輸出,建議解像度為 2048 x 2048,或採用 1024 x 1024 加快生成。建議採樣步數為 12,驗證配置為一張配備 80 GiB VRAM 的 CUDA GPU,授權為 MIT License。

  2. Midjourney:Updates39

    Midjourney Alpha 更新日誌:9/16/26

    Midjourney 更新 Alpha 網站,改善 v8.2 編輯器、手機和平板版面、提示詞欄及圖片整理功能。v8.2 編輯器在附加圖片時會詢問用戶想修改甚麼,草稿批次可在網格中預覽來源圖片並使用 Enhance;手機和平板版亦改善版面及上載刪除操作。團隊下一步計劃設定預設參數、以提示詞預覽 sref,並在用戶開啟圖片再返回時保留搜尋內容。

9月8日週二
9月4日週五
9月1日週二
8月28日週五