Google 發佈 Nano Banana 2.1,提升視覺設計、遮罩編輯與主體一致性
Google 發佈圖像生成與編輯模型 Nano Banana 2.1,重點提升視覺設計、遮罩編輯及主體一致性。Nano Banana 2.1 正逐步部署至 Gemini 應用、Google 搜尋 AI 模式、Google AI Studio、Google Flow、Stitch、Google 廣告及 Gemini 企業平台。
Google 發佈圖像生成與編輯模型 Nano Banana 2.1,重點提升視覺設計、遮罩編輯及主體一致性。Nano Banana 2.1 正逐步部署至 Gemini 應用、Google 搜尋 AI 模式、Google AI Studio、Google Flow、Stitch、Google 廣告及 Gemini 企業平台。
Google 發佈圖像生成與編輯模型 Nano Banana 2.1,取代 2026 年 2 月推出的 Nano Banana 2,並稱新版本在多方面均有改進。
推薦理由:文章並列 Nano Banana 2.1 的定價、基準測試與實際生成圖片比較,呈現其成本變化及相對 Nano Banana Pro 的畫質差異。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Seedream 5.0 Pro 正式發布,作為多模態圖像創作模型,提升圖文匹配、結構合理性、文字渲染及畫面美感。其四項核心能力包括高密度資訊圖生成、交互式精準編輯、影像與人像質感提升,以及十餘種常用語言的原生輸入與生成。目前模型已在火山方舟體驗中心上線,並將陸續在豆包、即夢上線;項目主頁:https://seed.bytedance.com/seedream5_0_pro
Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。
Microsoft 宣佈推出自家研發的圖像生成模型 MAI-Image-1,該模型登上 LMArena 文生圖模型前十。
Microsoft AI 宣佈推出圖像生成模型 MAI-Image-2,並稱 MAI 模型系列在 Arena.ai 排行榜排名第 3。模型主打寫實圖像、圖中文字生成,以及豐富細節場景創作。
Microsoft AI 發佈 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2,三款模型現已可在 Microsoft Foundry 和 MAI Playground 使用。
Microsoft 發佈圖像生成模型 MAI-Image-2-Efficient,主打旗艦級品質及成本降低 41%,現已在 Microsoft Foundry 和 MAI Playground 3 提供。
Microsoft 發佈圖像模型 MAI-Image-2.5 和 MAI-Image-2.5-Flash;MAI-Image-2.5 在 Arena 圖像編輯排行榜排名第 2、文字轉圖像排名第 3,Arena 評分超過 GPT-Image-1.5 和 Nano Banana Pro 2K。
Microsoft AI 將 MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash 開放公開預覽,分別面向高保真圖像生成與高速、大規模語音場景。
Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。
推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。
Microsoft 宣佈 MAI-Image-2.6 在 Arena 文字生成圖像排行榜排名第二,較 MAI-Image-2.5 整體提升 79 Elo。其文字渲染提升 91 Elo,並在 Arena 每個測量類別均較 2.5 有改善。MAI-Image-2.6 現可在 Arena 試用,本週稍後將登上 MAI Playground,並即將推送至 Microsoft Foundry 等產品。
Microsoft 將 MAI-Image-2.6 帶入 Microsoft Foundry,並擴展系列推出 MAI-Image-2.6-Flash。兩款模型均支援多圖參考編輯、web grounding 和動態長寬比;MAI-Image-2.6-Flash 相較 GPT-Image-2-Medium 生成圖像快 2.8x、效率高 72%。
Black Forest Labs 發佈 Flux 3 Image,作為 Flux 3 模型家族的圖像版本,並稱其多步編輯不會改動圖像其他部分。模型支援文字生成圖像、圖生圖、文字渲染和寫實圖像生成,亦可用邊界框組合場景、加入最多 10 張參考圖,並輸出最高 4K 圖像。
Ideogram 現已推出 Ideogram 4.5 圖像模型,並稱模型只會編輯用户指定的圖像區域,保留其餘畫面不變。GPT-Image 2.5 和 Nano Banana 雖已改善局部編輯,但多次編輯時仍可能產生瑕疵。
inclusionAI 發佈 Ming-Image-0.1-Design,這款 6B 文生圖模型面向 UI、資訊圖表、海報等文字密集的視覺設計。模型可生成完整視覺構圖並支援透明背景 RGBA 輸出,建議解像度為 2048 x 2048,或採用 1024 x 1024 加快生成。建議採樣步數為 12,驗證配置為一張配備 80 GiB VRAM 的 CUDA GPU,授權為 MIT License。
Intern Lumina U2 推理代碼已公開,Ascend 訓練權重已上架 Hugging Face;NVIDIA 權重、訓練代碼與技術報告將後續推出。模型為 16B-A1B MoE,採用基於 AToken 的 8-codebook 視覺表示,支援文字問答、文生圖、圖像編輯及圖像、影片和 3D 理解。
Midjourney 開放所有用戶測試首個 V8.2 圖像編輯模型,支援按指令編輯圖片,以及最多同時使用 4 張參考圖生成圖片。模型亦可修改圖片指定區域、擴展畫布,並支援 personalization、moodboards 和 srefs。
Google DeepMind 推出 Nano Banana 2 Lite,並首次向開發者開放 Gemini Omni Flash。
推薦理由:兩款模型分別面向高速批量圖像生成與影片生成、對話式編輯,文中列出成本、延遲及 API 限制,可供評估多媒體工作流的取捨。
FireRedTeam 發佈 FireRed-Image-Edit-1.1,基於 FireRed-Image-Edit-1.0,優化人像一致性、多元素融合、風格化文字參照及人像妝效。內置 Agent 可自動處理超過 3 張輸入圖片的區域偵測、裁切拼接及提示詞改寫。項目提供的加速推理配置標示使用 30GB VRAM,生成約 4.5s/sample。
Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。
推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。
推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),一款基於 Gemini 3 Pro 的圖像生成與編輯模型。
推薦理由:相較原版 Nano Banana 主打快速、有趣的編輯,Pro 面向複雜構圖,並提供多語圖中文字、最多 5 人形象一致性和 2K、4K 輸出,呈現兩者的能力定位差異。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
Segmind 開源 SD-Small 與 SD-Tiny 的知識蒸餾程式碼及預訓練權重;兩款模型參數量分別較基礎模型少 35% 和 55%,圖像保真度相若。兩者推理速度最高較基礎模型快 100%,預訓練檢查點可於 Hugging Face 取得。模型仍處早期階段,輸出未必達生產級,且在組合性與多概念生成方面表現有限。
rinna Co., Ltd. 發佈 Japanese Stable Diffusion,這款文本生成圖像模型以日語標註圖片微調 Stable Diffusion,支援日語提示詞並生成反映日語文化圈的圖像。
推薦理由:文章拆解 Japanese Stable Diffusion 的兩階段微調流程,説明專用日語文本編碼器與聯合調整潛在擴散模型的作用,訓練數據約為 Stable Diffusion 訓練集的 1/20。
OpenAI 訓練了名為 DALL·E 的神經網絡,可根據文字描述生成圖像,涵蓋自然語言能表達的多種概念。
推薦理由:材料指出 DALL·E 可按文字描述生成涵蓋多種自然語言概念的圖像,清楚交代了其輸入形式與生成範圍。