跳到正文

#圖像生成

今日 2 條
8月28日週五
8月19日週三
7月23日週四
7月1日週三
4月29日週三
  1. Manus:Blog58

    Manus Slides 上線 GPT Image 2 圖像生成模型

    Manus 在 Manus Slides 上線 GPT Image 2,將 OpenAI 的圖像生成模型接入演示文稿工作流程。Manus 稱模型可提供 4K 照片級真實感解像度、近乎完美的文字渲染及進階空間推理,並支援局部編輯幻燈片文字和視覺元素。該功能向所有用户開放,可在生成設定中選擇 GPT Image 2。

4月23日週四
  1. Google Research73

    Google Photos 在 Auto frame 中推出照片視角重構功能

    Google Photos 的 Auto frame 現已提供照片視角重構功能,會自動調整相機視點並補全原照片未拍到的畫面區域。方法先估算 3D 點圖與相機參數,再以生成式潛在擴散模型補全重新渲染後的空缺。這項功能會處理符合條件且包含人物的照片,重構版本列為 Auto frame 候選中的第二個版本。

    推薦理由:文章説明它如何把照片視為 3D 場景,重設相機位置並補出鏡頭外內容,呈現傳統裁切和縮放無法做到的視角修正。

4月21日週二
4月10日週五
4月9日週四
  1. Manus:Blog51

    如何為品牌攝影編寫 AI 圖像提示詞

    Manus 的指南提出品牌攝影 AI 圖像提示詞的四層結構,依次描述主體與服裝、場景、相機與膠片類型,以及光線。指南提供廣角、三分之四、側面輪廓、特寫、背面角度和雙人鏡頭的可複製範例,示範中多次使用 Kodak Portra 400。它建議在各提示詞中固定模特描述、相機、膠片和光線設定,以維持系列圖片的一致性。

4月4日週六
  1. FireRedTeam:原創語音與多模態項目59

    FireRedTeam 發佈 FireRed-Image-Edit-1.1,優化人像一致性等編輯能力

    FireRedTeam 發佈 FireRed-Image-Edit-1.1,基於 FireRed-Image-Edit-1.0,優化人像一致性、多元素融合、風格化文字參照及人像妝效。內置 Agent 可自動處理超過 3 張輸入圖片的區域偵測、裁切拼接及提示詞改寫。項目提供的加速推理配置標示使用 30GB VRAM,生成約 4.5s/sample。

3月5日週四
2月27日週五
  1. Google DeepMind76

    Google DeepMind 發佈 Nano Banana 2(Gemini 3.1 Flash Image),融合 Pro 能力與 Flash 速度

    Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。

    推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。

2月2日週一
12月22日週一
  1. Manus:Blog60

    Manus 推出 Design View,支援視覺資產生成與編輯

    Manus 推出 Design View,這項 Manus Agent 擴展功能把視覺資產的生成、局部修改及文字編輯整合到同一設計工作流程。用户可在手機應用程式中按住圖像選取區域,以語音或文字輸入修改指令,亦可一次提交多個區域的編輯。Manus 表示,Design View 即日起向所有用户開放,設計模式由 Google 的 Nano Banana Pro 提供支援。

12月18日週四
12月16日週二
12月15日週一
12月5日週五
12月1日週一
11月20日週四
  1. Google DeepMind75

    使用 Nano Banana Pro(Gemini 3 Pro Image)構建圖像應用

    Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。

    推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。

9月2日週二
7月18日週五
7月17日週四
5月21日週三
4月23日週三
  1. OpenAI News70

    OpenAI 將 gpt-image-1 圖像生成模型接入 API

    OpenAI 宣佈其最新圖像生成模型 gpt-image-1 現已可透過 API 使用。開發者與企業可將可自訂的專業級視覺內容直接整合至自有工具與平台。

    推薦理由:材料交代 gpt-image-1 已可透過 API 使用,並指出開發者與企業可將可自訂的專業級視覺內容直接整合到自有工具與平台。

3月25日週二
10月23日週三
10月22日週二
7月30日週二
6月12日週三
  1. Hugging Face Blog79

    Diffusers 支持 Stable Diffusion 3 Medium

    Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。

    推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。

6月6日週四
  1. Hugging Face Blog64

    Artificial Analysis 推出文生圖模型排行榜與 Image Arena

    Artificial Analysis 推出文生圖模型排行榜與 Image Arena,以超過 45,000 次人類圖像偏好計算模型 ELO 排名。排行榜收錄 Midjourney、DALL·E、Stable Diffusion、Playground 等開源及專有模型,評測為每個模型生成超過 700 張圖像。用户可在 Image Arena 投票,投滿 30 票後查看個人化模型排名。

    推薦理由:排行榜以超過 45,000 次人類圖像偏好計算 ELO,並涵蓋開源與專有模型,為比較不同文生圖模型提供同一參照。

10月24日週二
  1. Hugging Face Blog70

    探索 SDXL 推理速度與記憶體的簡單優化方法

    Hugging Face 在 🤗 Diffusers 中測試多種 SDXL 推理優化方法,並於 A100 GPU(40 GB)比較其記憶體佔用和推理延遲。未優化管線為 28.09GB、72,200.5ms;fp16 + SDPA 降至 21.72GB、11,413.0ms,加入 torch.compile 後延遲為 10,296.7ms。

    推薦理由:文章以 A100 測試數據對照 SDXL 加速與省記憶體方案的取捨,並説明 Tiny Autoencoder 可能省略部分圖像細節,提供按硬件限制與生成用途選擇配置的參考。

8月1日週二
  1. Hugging Face Blog48

    Segmind 開源 SD-Small 與 SD-Tiny 的知識蒸餾程式碼及權重

    Segmind 開源 SD-Small 與 SD-Tiny 的知識蒸餾程式碼及預訓練權重;兩款模型參數量分別較基礎模型少 35% 和 55%,圖像保真度相若。兩者推理速度最高較基礎模型快 100%,預訓練檢查點可於 Hugging Face 取得。模型仍處早期階段,輸出未必達生產級,且在組合性與多概念生成方面表現有限。

3月24日週五
  1. Hugging Face Blog70

    如何使用 diffusers 訓練 ControlNet

    Hugging Face Blog 示範使用 diffusers 為 Stable Diffusion 訓練 ControlNet,並以 FaceSynthetics 的 100K 張合成臉製作人臉姿勢條件資料。

    推薦理由:文章以 FaceSynthetics 示範從人臉關鍵點製作 ControlNet 條件圖、整理訓練資料到配置低顯存參數的流程,可供類似訓練任務參照。

2月24日週五
  1. Hugging Face Blog61

    Diffusers for Mac 1.1 提升 Stable Diffusion 圖像生成速度

    Hugging Face 的 Diffusers for Mac 1.1 已在 Mac App Store 提供,更新效能與介面,並會按電腦自動選擇加速器。文中稱,視乎電腦配置,文字生成圖像速度最高可達原來的兩倍;測試列出 GPU 與 ANE 在不同 Mac 上的表現。

    推薦理由:文章按多款 Mac 和 Stable Diffusion 型號列出 GPU、ANE 的生成基準,並指出 M1 Max 上 GPU 較快、標準 M1 上 ANE 較快,呈現加速器選擇受硬件配置影響。

1月26日週四
  1. Hugging Face Blog58

    AI 遊戲開發 #4:2D 素材生成

    這篇教程示範如何把 Stable Diffusion 的 Image2Image 納入 2D 遊戲素材製作流程,從手繪草圖迭代生成素材。作者以玉米圖示説明先用 denoising strength 0.8 生成,再手動修改並以 0.6 重新生成,不到 10 分鐘便完成可直接用於遊戲的圖示。

1月2日週一
12月1日週四