OpenAI 推出 ChatGPT Images 2.5
OpenAI 推出 ChatGPT Images 2.5,可把使用者的想法、草圖和參考相片轉化為更個人化、精緻,且更能反映其構想的圖像。
OpenAI 推出 ChatGPT Images 2.5,可把使用者的想法、草圖和參考相片轉化為更個人化、精緻,且更能反映其構想的圖像。
Diffusers 現已原生支援 Nunchaku Lite 的 4-bit 擴散模型推理,預量化檢查點可用 `from_pretrained()` 載入,無須獨立推理引擎或本機編譯 CUDA。
推薦理由:文章説明 Nunchaku Lite 在 Diffusers 的原生載入方式,並以 RTX PRO 6000 基準量化呈現延遲與顯存變化。
Google DeepMind 推出 Nano Banana 2 Lite,並首次向開發者開放 Gemini Omni Flash。
推薦理由:兩款模型分別面向高速批量圖像生成與影片生成、對話式編輯,文中列出成本、延遲及 API 限制,可供評估多媒體工作流的取捨。
Google Photos 的 Auto frame 現已提供照片視角重構功能,會自動調整相機視點並補全原照片未拍到的畫面區域。方法先估算 3D 點圖與相機參數,再以生成式潛在擴散模型補全重新渲染後的空缺。這項功能會處理符合條件且包含人物的照片,重構版本列為 Auto frame 候選中的第二個版本。
推薦理由:文章説明它如何把照片視為 3D 場景,重設相機位置並補出鏡頭外內容,呈現傳統裁切和縮放無法做到的視角修正。
OpenAI 於 2026 年推出 ChatGPT Images 2.0,改進文字渲染,並提供多語言支援與視覺推理。頁面另提示讀者查看 Images 2.5 的新內容。
推薦理由:更新聚焦文字渲染、多語言支援和視覺推理,從三個具體面向呈現 ChatGPT Images 2.0 的更新重點。
ChatGPT 可讓使用者透過清晰提示詞創作及完善圖像,並在數分鐘內生成高質素視覺作品。使用者亦可反覆調整設計,逐步優化圖像。
Hugging Face 推出 Modular Diffusers,讓使用者以可重用區塊組合擴散模型流程,作為現有 DiffusionPipeline 的更靈活、可組合替代方案。
推薦理由:文章以現成流程、自訂區塊及 Hub 分享示例,展示如何把擴散工作流拆成可檢視、替換並重新組合的元件。
Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。
推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。
OpenAI 推出更快的 ChatGPT Images 體驗,並在 API 中提供 GPT-Image-1.5。材料亦提及 ChatGPT Images 2.5,但未提供更多細節。
推薦理由:更新同時涵蓋 ChatGPT Images 體驗提速與 GPT-Image-1.5 在 API 提供,呈現這次發佈涉及的兩部分變化。
OpenAI 與 NORAD 合作,為「NORAD Tracks Santa」帶來三款 ChatGPT 節日工具,讓家庭創作節日精靈、玩具填色頁及自訂聖誕故事。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。
推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。
Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),一款基於 Gemini 3 Pro 的圖像生成與編輯模型。
推薦理由:相較原版 Nano Banana 主打快速、有趣的編輯,Pro 面向複雜構圖,並提供多語圖中文字、最多 5 人形象一致性和 2K、4K 輸出,呈現兩者的能力定位差異。
Hugging Face 介紹如何在 ZeroGPU Spaces 使用 PyTorch AoT 編譯,將模型預先編譯後在不同程序中載入,以減少即時編譯造成的冷啟動開銷。
推薦理由:文章拆解 ZeroGPU Spaces 的 PyTorch AoT 編譯流程,並展示量化、動態形狀與區域編譯等可遷移的優化做法。
Hugging Face Diffusers 文章比較五種量化後端在 FLUX.1-dev 上的記憶體佔用與推理時間。BF16 載入後約佔 31.447 GB,bitsandbytes 4-bit 為 12.584 GB、推理需 12 秒;torchao int4_weight_only 為 10.635 GB,但推理需 109 秒。
OpenAI 宣佈其最新圖像生成模型 gpt-image-1 現已可透過 API 使用。開發者與企業可將可自訂的專業級視覺內容直接整合至自有工具與平台。
推薦理由:材料交代 gpt-image-1 已可透過 API 使用,並指出開發者與企業可將可自訂的專業級視覺內容直接整合到自有工具與平台。
OpenAI 在 GPT‑4o 中推出原生圖像生成,並提升文字渲染與指令遵循能力。原文亦提及 ChatGPT Images 2.5。
推薦理由:原生圖像生成之外,文字渲染與指令遵循是明確列出的改進點,讀者可據此掌握 GPT‑4o 圖像功能此次更新的着力處。
OpenAI 簡化、穩定並擴展連續時間一致性模型,令其樣本品質可媲美領先擴散模型。採樣僅需兩個步驟。
Stable Diffusion 3.5 Large(8B)及其 timestep 蒸餾版(8B)已在 Hugging Face Hub 提供,並可透過 Diffusers 進行推理與訓練。
推薦理由:文章把 Diffusers 中的量化推理與 LoRA 微調落到具體步驟,並提供在 24GB VRAM 消費級 GPU 上微調 SD3.5 Large 的參考路徑。
Hugging Face 示範如何在 Diffusers 中使用 Quanto 量化 Transformer-based diffusion pipeline,以降低推理時的 GPU 記憶體佔用。
推薦理由:文章提供在 Diffusers 中以 Quanto 量化擴散 Transformer 與文字編碼器的操作步驟,並用記憶體和延遲數據呈現精度設定的取捨。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
Artificial Analysis 推出文生圖模型排行榜與 Image Arena,以超過 45,000 次人類圖像偏好計算模型 ELO 排名。排行榜收錄 Midjourney、DALL·E、Stable Diffusion、Playground 等開源及專有模型,評測為每個模型生成超過 700 張圖像。用户可在 Image Arena 投票,投滿 30 票後查看個人化模型排名。
推薦理由:排行榜以超過 45,000 次人類圖像偏好計算 ELO,並涵蓋開源與專有模型,為比較不同文生圖模型提供同一參照。
Hugging Face 在 🤗 Diffusers 中測試多種 SDXL 推理優化方法,並於 A100 GPU(40 GB)比較其記憶體佔用和推理延遲。未優化管線為 28.09GB、72,200.5ms;fp16 + SDPA 降至 21.72GB、11,413.0ms,加入 torch.compile 後延遲為 10,296.7ms。
推薦理由:文章以 A100 測試數據對照 SDXL 加速與省記憶體方案的取捨,並説明 Tiny Autoencoder 可能省略部分圖像細節,提供按硬件限制與生成用途選擇配置的參考。
Segmind 開源 SD-Small 與 SD-Tiny 的知識蒸餾程式碼及預訓練權重;兩款模型參數量分別較基礎模型少 35% 和 55%,圖像保真度相若。兩者推理速度最高較基礎模型快 100%,預訓練檢查點可於 Hugging Face 取得。模型仍處早期階段,輸出未必達生產級,且在組合性與多概念生成方面表現有限。
Hugging Face Blog 示範使用 diffusers 為 Stable Diffusion 訓練 ControlNet,並以 FaceSynthetics 的 100K 張合成臉製作人臉姿勢條件資料。
推薦理由:文章以 FaceSynthetics 示範從人臉關鍵點製作 ControlNet 條件圖、整理訓練資料到配置低顯存參數的流程,可供類似訓練任務參照。
Hugging Face 的 Diffusers for Mac 1.1 已在 Mac App Store 提供,更新效能與介面,並會按電腦自動選擇加速器。文中稱,視乎電腦配置,文字生成圖像速度最高可達原來的兩倍;測試列出 GPU 與 ANE 在不同 Mac 上的表現。
推薦理由:文章按多款 Mac 和 Stable Diffusion 型號列出 GPU、ANE 的生成基準,並指出 M1 Max 上 GPU 較快、標準 M1 上 ANE 較快,呈現加速器選擇受硬件配置影響。
這篇教程示範如何把 Stable Diffusion 的 Image2Image 納入 2D 遊戲素材製作流程,從手繪草圖迭代生成素材。作者以玉米圖示説明先用 denoising strength 0.8 生成,再手動修改並以 0.6 重新生成,不到 10 分鐘便完成可直接用於遊戲的圖示。
Hugging Face Blog 的系列教程示範以 AI 工具在 5 天內製作完整農場遊戲,第一部分用 Stable Diffusion 1.5 設定美術風格,並以 Unity 搭建場景。
Hugging Face Blog 介紹如何在 Apple Silicon 上透過 Core ML 運行 Stable Diffusion,並提供自行轉換後上載至 Hugging Face Hub 的模型權重。
推薦理由:文章交代 Python 與 Swift 所需的模型封裝、attention 變體及運算單元差異,能幫助開發者按硬件和使用方式選擇 Core ML 推理配置。
Hugging Face 將於 11 月 30 日舉辦擴散模型社羣活動,並於 11 月 28 日推出與 Jonathan Whitaker 合作的免費 Diffusion Models Class。課程涵蓋擴散模型理論與應用;活動講者包括 Stable Diffusion 創作者、Stability AI 與 Meta 研究人員等,分享擴散模型及其應用工具。
Hugging Face 團隊以 Diffusers 的 `train_dreambooth.py` 對 Stable Diffusion 進行 Dreambooth 微調實驗,整理降低過擬合及改善生成品質的設定建議。
推薦理由:文中以不同主體的對照實驗梳理學習率、訓練步數與 prior preservation 對過擬合的影響,為 Dreambooth 微調提供具體設定參照。
OpenAI 宣佈 DALL·E API 開放公測,開發者可開始用它構建應用。
推薦理由:公告交代 DALL·E API 已開放公測及開發者可開始構建應用,呈現了這次開放對應的對象與實際用途。
rinna Co., Ltd. 發佈 Japanese Stable Diffusion,這款文本生成圖像模型以日語標註圖片微調 Stable Diffusion,支援日語提示詞並生成反映日語文化圈的圖像。
推薦理由:文章拆解 Japanese Stable Diffusion 的兩階段微調流程,説明專用日語文本編碼器與聯合調整潛在擴散模型的作用,訓練數據約為 Stable Diffusion 訓練集的 1/20。
OpenAI 宣佈 DALL·E 不再設候補名單,新用户可立即開始創作。OpenAI 表示,部署過程累積的經驗及安全系統改進,讓服務得以擴大開放。
推薦理由:DALL·E 取消候補名單後,新用户可立即開始創作;OpenAI 同時交代擴大開放所依據的部署經驗與安全系統改進。
Hugging Face 團隊介紹 Diffusers 0.3 的功能更新,涵蓋圖生圖、Textual Inversion、實驗性修補管線及推理優化。Textual Inversion 可用 3-5 張樣本個人化 Stable Diffusion;啟用優化後,Stable Diffusion 僅需 3.2GB VRAM,生成結果相同但速度降低 10%。
推薦理由:Diffusers 0.3 把圖生圖、模型個人化等功能更新,連同小顯存、Mac 與 ONNX 的操作示例一併呈現,便於對照 Stable Diffusion 在不同環境的操作與部署方式。
DALL·E 推出 outpainting 功能,讓圖像可延展至任意尺寸,以擴展創作並講述更大的故事。
Hugging Face 文章示範如何用 Diffusers 的 StableDiffusionPipeline 執行 Stable Diffusion 文生圖,並介紹模型原理及自訂推理流程。
推薦理由:文章從 Stable Diffusion 的基礎生成示例延伸至參數設定與自訂推理流程,並解釋 VAE、U-Net 和文字編碼器在潛在空間生成中的分工,提供拆解 Diffusers pipeline 的實用脈絡。
OpenAI 宣佈 DALL·E 開放 Beta,並將在未來數週邀請候補名單中的 1 million 人使用。用户可使用每月補充的免費點數創作,也可按每 115 次生成 $15 的價格購買額外點數。
推薦理由:材料同時列出候補邀請規模、免費點數補充頻率及額外點數價格,能讓讀者瞭解 Beta 開放初期的使用方式與成本。
OpenAI 正在為 DALL·E 推行一項新技術,令其生成的人物圖像更準確反映世界人口多樣性。這項措施旨在減少 DALL·E 2 的偏見並改善安全性。
OpenAI 將開始每週從候補名單增添最多 1,000 名 DALL·E 2 研究預覽用户。早期用户至今已創作超過 3 million 張圖像,並協助 OpenAI 改進安全流程。
OpenAI 訓練了名為 DALL·E 的神經網絡,可根據文字描述生成圖像,涵蓋自然語言能表達的多種概念。
推薦理由:材料指出 DALL·E 可按文字描述生成涵蓋多種自然語言概念的圖像,清楚交代了其輸入形式與生成範圍。