跳到正文
Hugging Face Blog·· 1 天前精選AI 評分81

用 ML-intern 打造原本不存在的模型

The model that didn't exist, so you made it yourself

AI 導讀

作者以 ML-intern 建立六個原本沒有的模型,並完成訓練、評估及公開發布到 Hugging Face Hub。文章分享提示詞如何列明數據集與基礎模型,要求先測基準、執行小規模 smoke test 並設定支出上限;六個項目的運算費用合計約 USD 103。

推薦理由

文章把 ML-intern 的提示詞設計拆成可操作環節,從先測基準、設定小規模 smoke test 到限制預算,並以六個模型專案展示這套流程。

正文 · 繁體中文

上星期,我想要一個小型版本的 提示詞改寫器,也就是 Qwen-Image 2.1 隨附的那個。官方版本是一個 9B 模型,需要約 20 GB 記憶體,而且要推理數千個 token 才寫出一段文字。我在 Hub 上只找到同一個 9B 模型的壓縮版本。於是我向 ML Intern 説明想要甚麼,翌日便得到一個可在 CPU 上執行的 0.8B 版本。它有 99.7% 的機會輸出有效結果,使用的 token 約為教師模型的四分之一。整個項目的運算成本共 USD 16,包括讓 9B 模型為 8,797 個示例請求加上標籤。

接下來幾天,我用同樣的方法再製作了五個模型。每個項目都始於 HuggingChat 上一則啟用了 ML-intern 的訊息,最後都成為 Hub 上的公開模型,並在模型卡中列出評估結果。ML-intern 會規劃工作,在花費任何費用前先向我詢問預算,正式開始前先進行小規模測試,然後在 Hugging Face 硬件上訓練、評估並發布模型。

我如何為 ML Intern 撰寫提示詞

我會把心力放在第一則訊息上。我為下文分享的 citrus 模型撰寫的第一個提示詞約有 450 個字。到第 6 個項目時,提示詞已接近 2,000 個字,因為每個項目都讓我學到一些想用在下一個項目的東西。七個提示詞都放在 GitHub 的 yvrjsharma/ml-intern-prompts,內容完全照我撰寫時的樣子。

提示詞開首先用一句話交代構想,以及我想做它的原因。然後列出具體項目:數據集、基礎模型和訓練腳本。我已經查證的資料會放在一個標題明確寫着「已核實的事實,請勿重新推導」的部分,讓 Agent 把預算用於實際工作,而不是重新查證我已知的事情。以相機角度 LoRA 為例,該部分列明哪個訓練器剛加入透明圖片支援,以及哪些尚未解決的 GitHub issue 令備用訓練器存在風險。

提示詞中有兩行至關重要。第一行要求在訓練前先測量基準表現。例如,citrus 提示詞寫道:「另外,請先報告基礎模型在相同評分指標上的零樣本分數,以便我們瞭解提升幅度。」沒有這項要求,你只會得到一個訓練好的模型,卻不知道它是否比原來的模型好。第二行要求進行附有檢查項目的冒煙測試。我要求圖像 LoRA 先訓練 50 步,然後檢查已儲存的權重是否確實有所改變,之後才支付完整訓練的費用。

在提示詞末尾,我會列出預期交付項目並設下成本上限。我會説明模型卡需要包含甚麼,並加入這樣的指示:「總支出上限為 USD 12,超出前請先詢問我。」由於 ML-intern 每項任務開始時的預算都是零美元,而且執行付費工作前必須獲得許可,因此會嚴格遵守這項支出上限。如果你沒有列明預算,Agent 會按項目規模提出兩個方案,並詢問你偏好哪一個。

首次嘗試時未必需要做到以上所有事情。例如,我在 citrus 的項目説明中沒有加入已核實事實部分,ML Intern 仍然製作出一個模型,其準確度比 Qwen3.5-2B 模型提升至三倍以上。讓我帶你看看短短幾天內,我用 Ml-Intern 製作的 6 個項目。

1. 一個熟悉你所在領域的模型

通用視覺模型可以描述一片變黃的柑橘葉。不過,要判斷問題是蟎蟲侵害還是缺乏鎂,以及用哪些生物性和非生物性方法處理植物,就困難得多。我使用 Claude,從 Hub 上 Project-AgML 組織託管的三個來源合併整理出一個訓練數據集。所得的 citrus-disease-vlm-instruct 是一個數據集,包含 3,017 張已標註圖片,涵蓋 21 種不同的害蟲、病害、營養缺乏問題及處理方法。ML-intern 使用這些範例微調 Qwen3.5-2B,並確保事先對基礎模型進行基準測試。

在 335 張測試照片中,基礎模型只有 14.9% 的情況能正確指出問題。在一張 A10G 上訓練兩個 epoch 後,微調模型的正確率達到 52.8%。計算成本約 USD 1.90。

看看:模型 · 數據集 · Citrus Doctor App

2. 一個能繪畫你角色的模型

圖像模型掌握不少角色的形象,但 Huggy 並不在其中。Huggy 以 Hugging Face 品牌素材的扁平風格繪製。我請 ML-Intern 為 FLUX.2 klein base 4B 訓練 LoRA,使用 Chunte/huggy_for_training 數據集中的 84 幅附有説明文字的繪圖。

Agent 每隔 100 步儲存一個檢查點,並用每個檢查點繪製同一組提示詞,令選擇變得容易。到第 200 步,Huggy 首次完全符合模型風格。從第 500 步起,Huggy 的風格開始滲入與 Huggy 毫無關係的提示詞!訓練好的 LoRA 亦可在蒸餾版 klein 模型上以 4 步運行。計算成本約 USD 7.60。

看看:模型 · 數據集 · Huggy Generator App

3. 一個能學會新技巧的模型

  1. 相機角度 LoRA 是較早期 Qwen-Image 模型中最受社羣歡迎的附加項目之一。你可以給模型一張物件圖片,要求它以從左方 45 度的角度呈現物件。我在 Qwen-Image 2.1 模型發布幾天後查看,發現還沒有人製作這類 LoRA,於是交由 ML-intern 建立。

Qwen camera angle LoRA

ML-intern 在一項成本僅幾美仙的 CPU 工作中,將 Google Scanned Objects 的 1,030 件掃描家居物件各從 24 個角度渲染,產生 24,722 張透明背景圖片。之後,它選定 461 件物件作訓練,另保留 40 件作測試,並製作 1,844 組前後對照訓練配對,均勻分佈於 23 條相機指令。

訓練在一張 A100 上執行 2,000 步,耗時約 90 分鐘(約 USD 3.75)。整個項目耗時約半天,共執行 48 項工作,包括因缺少套件或路徑錯誤而失敗、需要由 ML-Intern 重新提交的工作。總計算成本約 USD 16。

看看:模型 · 數據集 · Viewpoint Orbit App

  1. Doodle-in LoRA 是另一個有趣的構思。上載一張畫有洋紅色塗鴉的照片,再加入一段簡短提示詞,指出物件名稱。LoRA 會以該物件取代塗鴉,同時保持原有光線和構圖一致。

沒有現成的數據集,因此我的提示詞説明瞭如何建立一個。從 Open Images 的真實照片開始,使用 LaMa 修補模型移除一件物件,再在該物件原本所在的位置畫上塗鴉線條。未經修改的照片就是目標圖像。ML-intern 在 CPU 沙盒中編寫並測試建立配對的腳本,然後在 GPU 任務中執行,同時記錄每張來源照片的作者及授權條款。它建立了 6,042 組訓練配對和一個包含 160 組配對的測試集,其中 40 組測試配對來自 23 個完全未納入訓練的物件類別。

訓練前,它先測試基礎模型本身,以及搭配 Viggle turbo LoRA 時的表現,並確認批次執行編輯能產生相同的圖像,令評估成本降低。訓練在一張 A100 上執行 2,000 步,耗時 1 小時 38 分鐘(約 USD 4);接着比較在 48 組測試配對上儲存的檢查點,選出第 500 步的檢查點。

搭配 Viggle turbo LoRA 並以 6 步執行時,LoRA 表現出色。有 67.5% 的物件在塗畫位置被偵測到,每次編輯需時 4.7 秒。來自 23 個未見類別的物件,成功率與其餘物件相若(65.0% 對 64.2%)。整個項目耗時略多於一天,共執行 59 項任務。計算成本合共約 USD 24。

查看:模型 · 數據集 · Doodle-in App

4. 適合你裝置的模型

  1. 這篇文章開首提到的 Pocket Rewriter 是第一個例子。ML-intern 首先透過 Inference Providers 使用一個小型指令模型,生成 8,797 個簡短的圖像要求。內容組合依照我的提示詞設定,涵蓋照片、海報、標誌、資訊圖表等;其中約三分之一要求準確呈現引號內的文字,不少要求更以英語以外的語言撰寫。接着,9B 教師模型在一張 A100 上花 2 小時 37 分鐘(約 USD 6.50)改寫所有要求。篩選質素後,選出 1,840 個例子納入訓練數據集。

Qwen Image 2.1 Pocket Studio

訓練 0.8B 和 2B 學生模型分別在 A10G 上花了 12 和 18 分鐘(兩者合共 USD 0.75)。0.8B 版本亦提供 812 MB 的 GGUF 檔案,可在 CPU 上執行。整個項目耗時約 11 小時,共執行 24 項任務。計算成本合共約 USD 16。

查看:Pocket rewriter 0.8B Student · 2B Student · 數據集 · Pocket Studio App · 在 Rewriter Arena 比較教師模型與學生模型

  1. 第二個例子是 Agate-Preview-002-4step。Logolabs 的 Agate Preview 002 是一個有 260M 個參數的文生圖模型,小巧得足以在瀏覽器中運行,但需要在引導下執行 50 步,即每張圖像要進行 100 次網絡前向傳播。我請 ML-intern 把它蒸餾至只需 4 次前向傳播!

這項工作分兩次執行。第一次將 155,000 張訓練圖像快取為潛在表示,將引導整合至模型,再分階段把步數由 16 減至 8,再減至 4,全程使用 A100。以相同步數執行時,4 步學生模型在 GenEval 和 FID 評測中的表現勝過教師模型。之後,ML-intern 將模型匯出為 ONNX,供瀏覽器使用。這次執行耗時約 13 小時,花費 USD 22。

我要求 ML-Intern 再進行第二次訓練,進一步改善 4 步學生模型。它隨後使用教師模型以 16 步生成另外 24,000 組圖像配對,再用這些配對微調 4 步學生模型,耗時約一小時。GenEval 分數由 0.509 升至 0.536;教師模型以 50 步執行時的分數則為 0.563,而學生模型只需 4 步,計算量只有四分之一。ML-intern 重新匯出了瀏覽器版本。第二次執行耗時約 8 小時。兩次執行的計算成本合共約 USD 37。

查看:Agate 4-step model · 數據集 · 在瀏覽器中執行 Agate · Agate 4-step LIVE

費用

模型 基礎模型 運算費用
Citrus Doctor Qwen3.5-2B USD 1.90
Huggy LoRA FLUX.2 klein base 4B USD 7.60
Pocket rewriter (0.8B and 2B) Qwen3.5-0.8B and 2B USD 16.05
Viewpoint Orbit LoRA Qwen-Image 2.1 USD 16
Doodle-in LoRA Qwen-Image 2.1 USD 24.30
Agate 4-step(兩次執行) Agate Preview 002 USD 37
總計 約 USD 103

這些是各工作階段所列出的 GPU 和 CPU 工作費用。

建立自己的模型

ML-intern 已在 HuggingChat 提供。開啟 ML-intern 模式,然後貼上提示詞。如果你想找個起點,可以免費複製我的提示詞範例。從一個你希望存在的模型,以及你已有或能夠描述的數據集開始。為它設定小額預算,要求它提供基準模型和冒煙測試,並在提高上限前先閲讀返回的內容。

如果你用它製作了作品,請在 X 分享並標註 @Gradio 和 @HuggingFace。我們很想看看你製作的模型——那些其他人不會想到要為你打造的模型。

來源:Hugging Face Blog · huggingface.co