Google 發佈 Nano Banana 2.1,提升視覺設計、遮罩編輯與主體一致性
Google 發佈圖像生成與編輯模型 Nano Banana 2.1,重點提升視覺設計、遮罩編輯及主體一致性。Nano Banana 2.1 正逐步部署至 Gemini 應用、Google 搜尋 AI 模式、Google AI Studio、Google Flow、Stitch、Google 廣告及 Gemini 企業平台。
Google 發佈圖像生成與編輯模型 Nano Banana 2.1,重點提升視覺設計、遮罩編輯及主體一致性。Nano Banana 2.1 正逐步部署至 Gemini 應用、Google 搜尋 AI 模式、Google AI Studio、Google Flow、Stitch、Google 廣告及 Gemini 企業平台。
Google 發佈圖像生成與編輯模型 Nano Banana 2.1,取代 2026 年 2 月推出的 Nano Banana 2,並稱新版本在多方面均有改進。
推薦理由:文章並列 Nano Banana 2.1 的定價、基準測試與實際生成圖片比較,呈現其成本變化及相對 Nano Banana Pro 的畫質差異。
研究提出並評估一種以生成器忠實重建能力校準的內容認證方法,用來判斷影像真實性是否可被合理否認。研究測試 20 款深偽檢測器對 10 個近四年推出的生成器,準確率由接近完美的 99.5% 降至 76%;對抗性擾動則令所有基線檢測器的準確率跌至 2% 以下。新方法可校準至生成內容遭錯誤認證的比例不超過 1%,並在所評估的有界擾動攻擊下維持此上限,但不涵蓋任意對抗性轉換。
ElevenLabs 推出 Image & Video (Beta),在同一平台整合圖像、影片生成及音訊後製流程。用戶可透過 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成圖像,並以 Veo、Sora、Kling、Wan 和 Seedance 生成影片,再匯出至 Studio 加入語音、背景音樂及音效。
ElevenLabs 在 ElevenCreative 推出 Flows Agent,讓用戶以對話描述創作需求,由智能體建立、連接並執行工作流程。它會選擇合適模型、建立及連接節點,並在生成前確認影片長度、語氣和結構;啟用 Assist mode 後,高成本生成須經用戶確認。
Goodfire Research 展示 Paint With Ember,讓用戶透過畫布操控 SDXL-Turbo 的內部表徵,以概念方式生成和編輯圖像。工具使用 BatchTopK SAE 拆解圖像潛在表示,再以 NMF 將相關特徵聚合為概念,支援繪製、拖曳和調整概念。Goodfire Research 提供應用程式公開版本及開源 SAE 解讀器模型。
Black Forest Labs 已公開提供 FLUX VTO,這款虛擬試穿模型的生成時間少於 4 秒,適用於大規模商品目錄。它可為同一人物一次套用最多四件服裝,並保留人物身份及服裝上的標誌、印花、縫線和五金配件。身體及服裝尺碼的精確呈現仍在改進,輸出宜作視覺造型參考;預設政策不支援泳裝和內衣。
Goodfire Research 介紹其新論文提出的區塊稀疏特徵器(Block-Sparse Featurizers,BSF),以多維子空間刻畫視覺模型中的概念結構。
FLUX.2 [klein] 4B 將預載於新一代 ASUS ProArt 筆電的 MuseTree 應用程式,支援裝置端圖像生成。目標是在 8GB VRAM 筆電上,即使其他專業應用程式於背景運行,也能在少於 5 秒內生成圖像;使用時無需 API 或網絡連線。
Envato 以 FLUX 建立創意 AI 引擎,按創作任務將請求路由至合適模型,讓用戶透過統一體驗生成及編輯圖片。FLUX 至今已生成 51 million+ 張圖片,約佔平台圖片生成量 ~25%。FLUX.2 在寫實、電影感及產品圖片用途上的表現較可比模型高 ~10%,下載率較平台所有供應商的平均水平高 16%。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Seedream 5.0 Pro 正式發布,作為多模態圖像創作模型,提升圖文匹配、結構合理性、文字渲染及畫面美感。其四項核心能力包括高密度資訊圖生成、交互式精準編輯、影像與人像質感提升,以及十餘種常用語言的原生輸入與生成。目前模型已在火山方舟體驗中心上線,並將陸續在豆包、即夢上線;項目主頁:https://seed.bytedance.com/seedream5_0_pro
ChatGPT 正在把真實漫畫家的簽名加到偽造的《紐約客》漫畫中。
瑞典滾珠軸承製造商 SKF 使用 AI 生成已故女星葛麗泰·嘉寶的虛擬形象拍攝廣告,呼應她曾參與推介瑞典產業的短片。
Jagex 因 Dragon Slayer II 預告片引發生成式 AI 疑慮而將影片下架調查,並重申不以生成式 AI 製作遊戲、美術或創意素材。外部合作方曾明確承諾不使用 GenAI,但預告片出現六指畫面;Jagex 稱會在 RuneFest 後立即改革審核流程,並與社羣創作者合作呈現 Dragon Slayer II 的故事。
Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。
消費者對 AI 內容的疲勞感已令人難以招架,討論主張本地商户重新考慮使用 AI。支持者認為,專業運用 AI 可製作媲美甚至勝過人工作品的內容,速度更快、成本更低。批評者稱,AI 產出有 99% 一眼可見地粗劣;他們所見的做法是未用過 AI 的人只輸入「a poster」,便採用首個結果。
Microsoft 宣佈推出自家研發的圖像生成模型 MAI-Image-1,該模型登上 LMArena 文生圖模型前十。
Microsoft AI 宣佈推出圖像生成模型 MAI-Image-2,並稱 MAI 模型系列在 Arena.ai 排行榜排名第 3。模型主打寫實圖像、圖中文字生成,以及豐富細節場景創作。
Microsoft AI 發佈 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2,三款模型現已可在 Microsoft Foundry 和 MAI Playground 使用。
Microsoft 發佈圖像生成模型 MAI-Image-2-Efficient,主打旗艦級品質及成本降低 41%,現已在 Microsoft Foundry 和 MAI Playground 3 提供。
Microsoft 發佈圖像模型 MAI-Image-2.5 和 MAI-Image-2.5-Flash;MAI-Image-2.5 在 Arena 圖像編輯排行榜排名第 2、文字轉圖像排名第 3,Arena 評分超過 GPT-Image-1.5 和 Nano Banana Pro 2K。
Microsoft AI 將 MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash 開放公開預覽,分別面向高保真圖像生成與高速、大規模語音場景。
Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。
推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。
Microsoft 宣佈 MAI-Image-2.6 在 Arena 文字生成圖像排行榜排名第二,較 MAI-Image-2.5 整體提升 79 Elo。其文字渲染提升 91 Elo,並在 Arena 每個測量類別均較 2.5 有改善。MAI-Image-2.6 現可在 Arena 試用,本週稍後將登上 MAI Playground,並即將推送至 Microsoft Foundry 等產品。
Microsoft 將 MAI-Image-2.6 帶入 Microsoft Foundry,並擴展系列推出 MAI-Image-2.6-Flash。兩款模型均支援多圖參考編輯、web grounding 和動態長寬比;MAI-Image-2.6-Flash 相較 GPT-Image-2-Medium 生成圖像快 2.8x、效率高 72%。
教宗良十四世在 X 發文,呼籲在 AI 時代保護人類藝術,並稱人類創作與機器生成作品在本體上存在差異。他認為機器根據數百萬張他人創作的圖像進行統計計算,算法缺乏人性的火花。他 5 月的通諭強調自動化日益普及時維護人類尊嚴的重要性;TechCrunch 援引《紐約時報》近期報道稱,Anthropic 曾遊説梵蒂岡重新考慮非人類意識立場,但似乎成效有限。
Black Forest Labs 發佈 Flux 3 Image,作為 Flux 3 模型家族的圖像版本,並稱其多步編輯不會改動圖像其他部分。模型支援文字生成圖像、圖生圖、文字渲染和寫實圖像生成,亦可用邊界框組合場景、加入最多 10 張參考圖,並輸出最高 4K 圖像。
OpenAI 全球推出 ChatGPT 虛擬試穿及商品收藏兩項購物功能,用户可上傳自拍、全身照或商品圖片,預覽衣物與配飾穿上身的效果。虛擬試穿入口會出現在購物結果中的 Try On 按鈕;Favorites 可把商品保存至應用程式 Library 以便稍後查看。OpenAI 表示,這些功能使用新推出的 ChatGPT Images 2.5。
Ideogram 現已推出 Ideogram 4.5 圖像模型,並稱模型只會編輯用户指定的圖像區域,保留其餘畫面不變。GPT-Image 2.5 和 Nano Banana 雖已改善局部編輯,但多次編輯時仍可能產生瑕疵。
AFP-GIC 提出按圖像內容引導編碼與重建的自適應融合先驗遷移流程,用於可控生成式圖像壓縮,無須傳送先驗本身。單一可部署的預訓練模型支援五個碼率操作點。在 NVIDIA RTX 4090 上以 256×256 圖像區塊測試,解碼延遲較 DC-VIC 低 18.1%(80.47 ms 對 98.27 ms),推理參數少 20.5%。
Midjourney 在 alpha.midjourney.com 的介面中測試快速模型,並更新風格預覽、edit model 編輯及 V8.1/8.2 的 `--tile` 效果。
Midjourney 為 alpha.midjourney.com 推出多項功能更新,並在 midjourney.com 向所有用戶開放韓文版。更新包括樣式側欄即時預覽提示詞套用不同樣式的效果、將提示列設定存為預設值,以及把創作動態牆改為全闊瀑布流,提示詞和按鈕則改在滑鼠懸停時顯示;搜尋封存及專案管理亦有調整。編輯器新增對 v8.1 和 v8.2 編輯類型的支援,編輯畫布亦可使用 HD。
inclusionAI 發佈 Ming-Image-0.1-Design,這款 6B 文生圖模型面向 UI、資訊圖表、海報等文字密集的視覺設計。模型可生成完整視覺構圖並支援透明背景 RGBA 輸出,建議解像度為 2048 x 2048,或採用 1024 x 1024 加快生成。建議採樣步數為 12,驗證配置為一張配備 80 GiB VRAM 的 CUDA GPU,授權為 MIT License。
Midjourney 更新 Alpha 網站,改善 v8.2 編輯器、手機和平板版面、提示詞欄及圖片整理功能。v8.2 編輯器在附加圖片時會詢問用戶想修改甚麼,草稿批次可在網格中預覽來源圖片並使用 Enhance;手機和平板版亦改善版面及上載刪除操作。團隊下一步計劃設定預設參數、以提示詞預覽 sref,並在用戶開啟圖片再返回時保留搜尋內容。
OpenAI 推出 ChatGPT Images 2.5,可把使用者的想法、草圖和參考相片轉化為更個人化、精緻,且更能反映其構想的圖像。
Midjourney 正徵集意見和建議,以瞭解接下來應優先處理及推進哪些工作。平台表示,將於未來一至兩週舉行正式投票。
Midjourney Alpha 加入 v8.2 編輯模型,並在 lightbox 內置新編輯器。用戶可在 lightbox 開啟圖片,以文字指令編輯、附加最多 4 張參考圖片,並集中查看同一工作階段的所有編輯。更新亦修正多項錯誤,並開始測試 lightbox 的 Change Style 功能。
Intern Lumina U2 推理代碼已公開,Ascend 訓練權重已上架 Hugging Face;NVIDIA 權重、訓練代碼與技術報告將後續推出。模型為 16B-A1B MoE,採用基於 AToken 的 8-codebook 視覺表示,支援文字問答、文生圖、圖像編輯及圖像、影片和 3D 理解。
Midjourney 開放所有用戶測試首個 V8.2 圖像編輯模型,支援按指令編輯圖片,以及最多同時使用 4 張參考圖生成圖片。模型亦可修改圖片指定區域、擴展畫布,並支援 personalization、moodboards 和 srefs。