在 24GB 消費級 GPU 上使用 RLHF 微調 20B 大語言模型
Hugging Face 發佈 trl 與 peft 整合,介紹以 RLHF 在 24GB 消費級 GPU 上微調 20B 大語言模型的方法。示例以 gpt-neox-20b 為基礎,結合 8-bit 載入與 PEFT 低秩適配器,並透過停用適配器讓同一模型提供參考與當前 logits。
推薦理由:文章拆解 8-bit 載入、PEFT 低秩適配器與共用參考模型的組合,呈現降低 RLHF 微調大型模型顯存需求的實作思路。
AI 產品與應用的功能上新、改版與商業化動態——誰家的產品變強了、變貴了、能用了。
Hugging Face 發佈 trl 與 peft 整合,介紹以 RLHF 在 24GB 消費級 GPU 上微調 20B 大語言模型的方法。示例以 gpt-neox-20b 為基礎,結合 8-bit 載入與 PEFT 低秩適配器,並透過停用適配器讓同一模型提供參考與當前 logits。
推薦理由:文章拆解 8-bit 載入、PEFT 低秩適配器與共用參考模型的組合,呈現降低 RLHF 微調大型模型顯存需求的實作思路。
Hugging Face 的 Diffusers for Mac 1.1 已在 Mac App Store 提供,更新效能與介面,並會按電腦自動選擇加速器。文中稱,視乎電腦配置,文字生成圖像速度最高可達原來的兩倍;測試列出 GPU 與 ANE 在不同 Mac 上的表現。
推薦理由:文章按多款 Mac 和 Stable Diffusion 型號列出 GPU、ANE 的生成基準,並指出 M1 Max 上 GPU 較快、標準 M1 上 ANE 較快,呈現加速器選擇受硬件配置影響。
Hugging Face 推出 🤗 PEFT 函式庫,整合 🤗 Transformers 與 🤗 Accelerate,支援以參數高效微調大型語言模型。該方法凍結預訓練模型的大部分參數,只訓練少量參數並保存增量權重,以降低計算和儲存成本,同時達到與完整微調相若的效能。文中 LoRA 範例為 bigscience/T0_3B 保存的 adapter_model.bin 僅 19MB。
推薦理由:文章以 LoRA 範例展示 🤗 PEFT 如何接入 🤗 Transformers 的微調流程,並説明只保存增量權重可減少儲存負擔,另交代訓練參數設定與權重載入方式。
OpenAI 推出 ChatGPT 的試行訂閲計劃 ChatGPT Plus。ChatGPT 是一款對話式 AI,可與用户交談、回答後續問題,並質疑錯誤假設。
OpenAI 宣佈 DALL·E API 開放公測,開發者可開始用它構建應用。
推薦理由:公告交代 DALL·E API 已開放公測及開發者可開始構建應用,呈現了這次開放對應的對象與實際用途。
Hugging Face 推出 Inference Endpoints,讓用户可從 Hugging Face Hub 將機器學習模型部署至所選雲端的受管基礎設施。
推薦理由:文章逐步展示從 Hugging Face Hub 將模型部署至 AWS,並比較 Protected 與 Private 端點的存取範圍和 VPC 設定。
Hugging Face 的 Evaluation on the Hub 現已支援免寫程式對 Hub 上的因果語言模型進行零樣本分類評估,最高支援 66 billion parameters。
推薦理由:文章説明如何用 Evaluation on the Hub 比較不同規模模型,並以 WinoBias 案例展示零樣本評估如何檢視職業性別偏見。
OpenAI 宣佈 DALL·E 不再設候補名單,新用户可立即開始創作。OpenAI 表示,部署過程累積的經驗及安全系統改進,讓服務得以擴大開放。
推薦理由:DALL·E 取消候補名單後,新用户可立即開始創作;OpenAI 同時交代擴大開放所依據的部署經驗與安全系統改進。
Hugging Face 與 Intel Labs、UKP Lab 共同介紹 SetFit,這是一套無需提示詞、以少量標註資料微調 Sentence Transformers 的少樣本學習框架。
推薦理由:文章比較 SetFit 與其他少樣本方法在 RAFT 等基準的表現,並列出訓練時間與成本,提供分類效能和訓練效率的直接參照。
Hugging Face 團隊介紹 Diffusers 0.3 的功能更新,涵蓋圖生圖、Textual Inversion、實驗性修補管線及推理優化。Textual Inversion 可用 3-5 張樣本個人化 Stable Diffusion;啟用優化後,Stable Diffusion 僅需 3.2GB VRAM,生成結果相同但速度降低 10%。
推薦理由:Diffusers 0.3 把圖生圖、模型個人化等功能更新,連同小顯存、Mac 與 ONNX 的操作示例一併呈現,便於對照 Stable Diffusion 在不同環境的操作與部署方式。
DALL·E 推出 outpainting 功能,讓圖像可延展至任意尺寸,以擴展創作並講述更大的故事。
OpenAI 宣佈 DALL·E 開放 Beta,並將在未來數週邀請候補名單中的 1 million 人使用。用户可使用每月補充的免費點數創作,也可按每 115 次生成 $15 的價格購買額外點數。
推薦理由:材料同時列出候補邀請規模、免費點數補充頻率及額外點數價格,能讓讀者瞭解 Beta 開放初期的使用方式與成本。
Hugging Face 推出由 AutoTrain 驅動的 Evaluation on the Hub,讓使用者無需編寫程式,即可用任意資料集與指標評估 Hub 上的模型。評估結果會提交至模型卡的 Hub pull request,平台亦提供排行榜,方便比較模型在不同資料集切分與指標上的表現。
推薦理由:它讓使用者可在 Hub 選擇模型、資料集和指標,免寫程式完成評估;結果回寫模型卡,排行榜便於比較表現及重用評估設定。
Hugging Face Hub 推出 Pull Request 和 Discussions 協作功能,現已向所有模型、資料集及 Spaces 倉庫開放。社羣成員可在 Community 分頁提問、分享建議,並透過網站開啟、評論、合併或關閉 Pull Request。Pull Request 使用直接儲存在來源倉庫的自訂 refs,無需為模型或資料集的每個新版本建立 fork。
推薦理由:Hugging Face Hub 以來源倉庫內的 refs 處理 Pull Request,免去為模型或資料集每個新版本建立 fork,呈現其針對 ML 倉庫簡化協作流程的做法。
Gradio 3.0 正式推出,全面重設前端,並加入可在 Python 中構建自訂 Web app 的低階 Gradio Blocks API。前端採用 Svelte 等技術,文章稱載荷更小、頁面載入更快;Dataframe 經改良,並新增 Gallery 和 TabbedInterface。
推薦理由:Gradio Blocks 的 Python 範例展示如何組合元件、事件與版面,構建多步驟互動介面,提供可借鑑的實作思路。
OpenAI 在 API 新增嵌入向量端點,支援自然語言與程式碼任務。端點可用於語義搜尋、聚類、主題建模和分類。
推薦理由:新端點涵蓋語義搜尋、聚類、主題建模與分類,呈現嵌入向量在自然語言及程式碼任務中的應用範圍。
OpenAI 宣佈其 API 現已不設候補名單,服務可用範圍進一步擴大。公告指出,擴大開放是安全方面進展促成的。
推薦理由:OpenAI API 免候補即可使用的變化,連結到安全方面的進展,提供了理解其擴大開放背景的線索。
OpenAI 發佈 Triton 1.0,這是一種用於神經網絡 GPU 程式設計的類 Python 開源語言。它讓沒有 CUDA 經驗的研究人員也能編寫高效 GPU 程式碼;OpenAI 稱,多數情況下這些程式碼可媲美專家所能產出。
推薦理由:Triton 1.0 以類 Python 語言降低神經網絡 GPU 程式設計門檻,讓沒有 CUDA 經驗的研究人員也能編寫高效程式碼,OpenAI 稱多數情況下可媲美專家產出。
Hugging Face Hub 接入 spaCy,讓使用者可分享 spaCy pipelines,並在瀏覽器試用或透過 Inference API 調用模型。
推薦理由:這次整合把 spaCy pipeline 上傳、瀏覽器試用、NER 推理和安裝入口放在 Hub,呈現模型分享後如何被測試與接入應用。
Hugging Face 推出適用於 Amazon SageMaker 的 Inference DLC 和 Inference Toolkit,支援部署已訓練模型及 Model Hub 上 10,000+ 個公開模型。
推薦理由:文章分別示範訓練完成後、從 Amazon S3 檢查點及從 Model Hub 部署模型,並附上建立 SageMaker 推理端點的程式範例。