Midjourney 開放 V8.2 圖像編輯模型供用戶測試
Midjourney 開放所有用戶測試首個 V8.2 圖像編輯模型,支援按指令編輯圖片,以及最多同時使用 4 張參考圖生成圖片。模型亦可修改圖片指定區域、擴展畫布,並支援 personalization、moodboards 和 srefs。
Midjourney 開放所有用戶測試首個 V8.2 圖像編輯模型,支援按指令編輯圖片,以及最多同時使用 4 張參考圖生成圖片。模型亦可修改圖片指定區域、擴展畫布,並支援 personalization、moodboards 和 srefs。
MIT CSAIL 團隊在 Nature Communications 發表研究,提出 attribution decay(歸因衰減),指出訓練數據愈多,單一訓練樣本對生成圖像的影響愈小。
Diffusers 現已原生支援 Nunchaku Lite 的 4-bit 擴散模型推理,預量化檢查點可用 `from_pretrained()` 載入,無須獨立推理引擎或本機編譯 CUDA。
推薦理由:文章説明 Nunchaku Lite 在 Diffusers 的原生載入方式,並以 RTX PRO 6000 基準量化呈現延遲與顯存變化。
Google DeepMind 推出 Nano Banana 2 Lite,並首次向開發者開放 Gemini Omni Flash。
推薦理由:兩款模型分別面向高速批量圖像生成與影片生成、對話式編輯,文中列出成本、延遲及 API 限制,可供評估多媒體工作流的取捨。
Manus 在 Manus Slides 上線 GPT Image 2,將 OpenAI 的圖像生成模型接入演示文稿工作流程。Manus 稱模型可提供 4K 照片級真實感解像度、近乎完美的文字渲染及進階空間推理,並支援局部編輯幻燈片文字和視覺元素。該功能向所有用户開放,可在生成設定中選擇 GPT Image 2。
Google Photos 的 Auto frame 現已提供照片視角重構功能,會自動調整相機視點並補全原照片未拍到的畫面區域。方法先估算 3D 點圖與相機參數,再以生成式潛在擴散模型補全重新渲染後的空缺。這項功能會處理符合條件且包含人物的照片,重構版本列為 Auto frame 候選中的第二個版本。
推薦理由:文章説明它如何把照片視為 3D 場景,重設相機位置並補出鏡頭外內容,呈現傳統裁切和縮放無法做到的視角修正。
OpenAI 於 2026 年推出 ChatGPT Images 2.0,改進文字渲染,並提供多語言支援與視覺推理。頁面另提示讀者查看 Images 2.5 的新內容。
推薦理由:更新聚焦文字渲染、多語言支援和視覺推理,從三個具體面向呈現 ChatGPT Images 2.0 的更新重點。
ChatGPT 可讓使用者透過清晰提示詞創作及完善圖像,並在數分鐘內生成高質素視覺作品。使用者亦可反覆調整設計,逐步優化圖像。
Manus 的指南提出品牌攝影 AI 圖像提示詞的四層結構,依次描述主體與服裝、場景、相機與膠片類型,以及光線。指南提供廣角、三分之四、側面輪廓、特寫、背面角度和雙人鏡頭的可複製範例,示範中多次使用 Kodak Portra 400。它建議在各提示詞中固定模特描述、相機、膠片和光線設定,以維持系列圖片的一致性。
FireRedTeam 發佈 FireRed-Image-Edit-1.1,基於 FireRed-Image-Edit-1.0,優化人像一致性、多元素融合、風格化文字參照及人像妝效。內置 Agent 可自動處理超過 3 張輸入圖片的區域偵測、裁切拼接及提示詞改寫。項目提供的加速推理配置標示使用 30GB VRAM,生成約 4.5s/sample。
Hugging Face 推出 Modular Diffusers,讓使用者以可重用區塊組合擴散模型流程,作為現有 DiffusionPipeline 的更靈活、可組合替代方案。
推薦理由:文章以現成流程、自訂區塊及 Hub 分享示例,展示如何把擴散工作流拆成可檢視、替換並重新組合的元件。
Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。
推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。
作者以四組相同提示詞測試 ChatGPT(GPT-4o)、Midjourney、Nano Banana Pro、Adobe Firefly 和 Manus,比較五款 AI 圖像生成器的表現。
Manus 推出 Design View,這項 Manus Agent 擴展功能把視覺資產的生成、局部修改及文字編輯整合到同一設計工作流程。用户可在手機應用程式中按住圖像選取區域,以語音或文字輸入修改指令,亦可一次提交多個區域的編輯。Manus 表示,Design View 即日起向所有用户開放,設計模式由 Google 的 Nano Banana Pro 提供支援。
Manus 現已向所有用户開放編輯以 Nano Banana Pro 建立的幻燈片,無須重新生成整張幻燈片即可作定向修改。用户可編輯文字、點選視覺元素作局部更改,亦可選取多個區域批量編輯;文字渲染會配合原有設計。
OpenAI 推出更快的 ChatGPT Images 體驗,並在 API 中提供 GPT-Image-1.5。材料亦提及 ChatGPT Images 2.5,但未提供更多細節。
推薦理由:更新同時涵蓋 ChatGPT Images 體驗提速與 GPT-Image-1.5 在 API 提供,呈現這次發佈涉及的兩部分變化。
OpenAI Developers 的 gpt-image-1.5 提示詞指南介紹圖像生成與編輯工作流,並提供涵蓋多種任務的實例。指南建議按場景、主體、細節和限制組織提示詞,明確標示要修改及保留的內容,再以小幅迭代降低畫面偏移。
Manus 推出 Manus 1.6,帶來旗艦 Agent Manus 1.6 Max、移動應用程式開發,以及用於圖像創建和編輯的 Design View。官方稱 Max 在雙盲測試中的用户滿意度提高 19.2% 以上,並提升複雜多步驟任務的成功率;廣泛研究的所有子 Agent 現在均基於 Max 架構運行。
Manus 將 Google 的 Nano Banana Pro 整合至 Manus Slides,讓用户可用提示詞生成完整簡報。每張幻燈片以獨立高解析度圖像生成,並可渲染清晰易讀的文字;此功能向所有 Manus 用户開放。內容以圖像形式嵌入,需要完全可編輯的文字簡報時,Manus 建議使用標準 HTML 幻燈片工具。
OpenAI 與 NORAD 合作,為「NORAD Tracks Santa」帶來三款 ChatGPT 節日工具,讓家庭創作節日精靈、玩具填色頁及自訂聖誕故事。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。
推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),一款基於 Gemini 3 Pro 的圖像生成與編輯模型。
推薦理由:相較原版 Nano Banana 主打快速、有趣的編輯,Pro 面向複雜構圖,並提供多語圖中文字、最多 5 人形象一致性和 2K、4K 輸出,呈現兩者的能力定位差異。
Hugging Face 介紹如何在 ZeroGPU Spaces 使用 PyTorch AoT 編譯,將模型預先編譯後在不同程序中載入,以減少即時編譯造成的冷啟動開銷。
推薦理由:文章拆解 ZeroGPU Spaces 的 PyTorch AoT 編譯流程,並展示量化、動態形狀與區域編譯等可遷移的優化做法。
OpenAI Developers 示範如何使用 4o 模型生成圖像。
OpenAI 示範如何在 Image API 和 Responses 圖像生成工具中設定 input_fidelity="high",以保留輸入圖片的關鍵細節。指南提供人像、標誌、局部物件編輯及多圖合成示例,並説明多圖輸入時首張圖片可保留更豐富的紋理細節。該設定會比預設值消耗更多 image input tokens。
Hugging Face Diffusers 文章比較五種量化後端在 FLUX.1-dev 上的記憶體佔用與推理時間。BF16 載入後約佔 31.447 GB,bitsandbytes 4-bit 為 12.584 GB、推理需 12 秒;torchao int4_weight_only 為 10.635 GB,但推理需 109 秒。
OpenAI 宣佈其最新圖像生成模型 gpt-image-1 現已可透過 API 使用。開發者與企業可將可自訂的專業級視覺內容直接整合至自有工具與平台。
推薦理由:材料交代 gpt-image-1 已可透過 API 使用,並指出開發者與企業可將可自訂的專業級視覺內容直接整合到自有工具與平台。
OpenAI 在 GPT‑4o 中推出原生圖像生成,並提升文字渲染與指令遵循能力。原文亦提及 ChatGPT Images 2.5。
推薦理由:原生圖像生成之外,文字渲染與指令遵循是明確列出的改進點,讀者可據此掌握 GPT‑4o 圖像功能此次更新的着力處。
OpenAI 簡化、穩定並擴展連續時間一致性模型,令其樣本品質可媲美領先擴散模型。採樣僅需兩個步驟。
Stable Diffusion 3.5 Large(8B)及其 timestep 蒸餾版(8B)已在 Hugging Face Hub 提供,並可透過 Diffusers 進行推理與訓練。
推薦理由:文章把 Diffusers 中的量化推理與 LoRA 微調落到具體步驟,並提供在 24GB VRAM 消費級 GPU 上微調 SD3.5 Large 的參考路徑。
Hugging Face 示範如何在 Diffusers 中使用 Quanto 量化 Transformer-based diffusion pipeline,以降低推理時的 GPU 記憶體佔用。
推薦理由:文章提供在 Diffusers 中以 Quanto 量化擴散 Transformer 與文字編碼器的操作步驟,並用記憶體和延遲數據呈現精度設定的取捨。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
Artificial Analysis 推出文生圖模型排行榜與 Image Arena,以超過 45,000 次人類圖像偏好計算模型 ELO 排名。排行榜收錄 Midjourney、DALL·E、Stable Diffusion、Playground 等開源及專有模型,評測為每個模型生成超過 700 張圖像。用户可在 Image Arena 投票,投滿 30 票後查看個人化模型排名。
推薦理由:排行榜以超過 45,000 次人類圖像偏好計算 ELO,並涵蓋開源與專有模型,為比較不同文生圖模型提供同一參照。
Hugging Face 在 🤗 Diffusers 中測試多種 SDXL 推理優化方法,並於 A100 GPU(40 GB)比較其記憶體佔用和推理延遲。未優化管線為 28.09GB、72,200.5ms;fp16 + SDPA 降至 21.72GB、11,413.0ms,加入 torch.compile 後延遲為 10,296.7ms。
推薦理由:文章以 A100 測試數據對照 SDXL 加速與省記憶體方案的取捨,並説明 Tiny Autoencoder 可能省略部分圖像細節,提供按硬件限制與生成用途選擇配置的參考。
Segmind 開源 SD-Small 與 SD-Tiny 的知識蒸餾程式碼及預訓練權重;兩款模型參數量分別較基礎模型少 35% 和 55%,圖像保真度相若。兩者推理速度最高較基礎模型快 100%,預訓練檢查點可於 Hugging Face 取得。模型仍處早期階段,輸出未必達生產級,且在組合性與多概念生成方面表現有限。
Hugging Face Blog 示範使用 diffusers 為 Stable Diffusion 訓練 ControlNet,並以 FaceSynthetics 的 100K 張合成臉製作人臉姿勢條件資料。
推薦理由:文章以 FaceSynthetics 示範從人臉關鍵點製作 ControlNet 條件圖、整理訓練資料到配置低顯存參數的流程,可供類似訓練任務參照。
Hugging Face 的 Diffusers for Mac 1.1 已在 Mac App Store 提供,更新效能與介面,並會按電腦自動選擇加速器。文中稱,視乎電腦配置,文字生成圖像速度最高可達原來的兩倍;測試列出 GPU 與 ANE 在不同 Mac 上的表現。
推薦理由:文章按多款 Mac 和 Stable Diffusion 型號列出 GPU、ANE 的生成基準,並指出 M1 Max 上 GPU 較快、標準 M1 上 ANE 較快,呈現加速器選擇受硬件配置影響。
這篇教程示範如何把 Stable Diffusion 的 Image2Image 納入 2D 遊戲素材製作流程,從手繪草圖迭代生成素材。作者以玉米圖示説明先用 denoising strength 0.8 生成,再手動修改並以 0.6 重新生成,不到 10 分鐘便完成可直接用於遊戲的圖示。
Hugging Face Blog 的系列教程示範以 AI 工具在 5 天內製作完整農場遊戲,第一部分用 Stable Diffusion 1.5 設定美術風格,並以 Unity 搭建場景。
Hugging Face Blog 介紹如何在 Apple Silicon 上透過 Core ML 運行 Stable Diffusion,並提供自行轉換後上載至 Hugging Face Hub 的模型權重。
推薦理由:文章交代 Python 與 Swift 所需的模型封裝、attention 變體及運算單元差異,能幫助開發者按硬件和使用方式選擇 Core ML 推理配置。