跳到正文

全部動態

今日 11 條
6月13日週四
6月12日週三
  1. Hugging Face Blog79

    Diffusers 支持 Stable Diffusion 3 Medium

    Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。

    推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。

  2. Hugging Face Blog63

    Hugging Face 在 TRL 推出 RLOO Trainer,作為 PPO 的線上 RLHF 替代方案

    Hugging Face 在 TRL 引入 RLOO Trainer,這是一種較 PPO 更易實作、較省 GPU 記憶體的線上 RLHF 訓練方法。測試顯示,RLOO 約比 PPO 少用 50–70% vRAM,1B 模型快 2 倍、6.9B 模型最高快 3 倍;6.9B checkpoint 的 GPT4 評審偏好率為 78.7%(k=2)。

    推薦理由:文章對照 RLOO 與 PPO 的 GPU 記憶體用量、訓練速度及回答勝率,並披露 bf16 下 RLOO 有較多批次資料的梯度被清零。

6月10日週一
6月8日週六
6月7日週五
  1. Hugging Face Blog40

    Hugging Face 計劃重設 Transformers 文件,改採以開發者為先的架構

    Hugging Face 計劃重新設計 Transformers 文件,令內容更貼合開發者需要,並改善導覽與內容整合。文件原為機器學習工程師與研究人員而寫,後隨文本、LLM及優化等階段逐步擴充,造成內容分散、結構僵化和導覽困難。重設方向是以程式碼示例和解決方案為先,結合初階機器學習概念,並採用可自然擴展的靈活架構。

6月6日週四
  1. Hugging Face Blog64

    Artificial Analysis 推出文生圖模型排行榜與 Image Arena

    Artificial Analysis 推出文生圖模型排行榜與 Image Arena,以超過 45,000 次人類圖像偏好計算模型 ELO 排名。排行榜收錄 Midjourney、DALL·E、Stable Diffusion、Playground 等開源及專有模型,評測為每個模型生成超過 700 張圖像。用户可在 Image Arena 投票,投滿 30 票後查看個人化模型排名。

    推薦理由:排行榜以超過 45,000 次人類圖像偏好計算 ELO,並涵蓋開源與專有模型,為比較不同文生圖模型提供同一參照。

6月5日週三
  1. Mistral AI67

    Mistral AI 推出模型客製化方案,提供三種微調入口

    Mistral AI 在 la Plateforme 推出模型客製化方案,提供自有基礎設施微調 SDK、無伺服器微調服務和客製訓練三種入口。開源工具 mistral-finetune 採用 LoRA 訓練範式;平台微調服務目前支援 Mistral 7B 和 Mistral Small,並使用 LoRA adapters,以保留基礎模型知識及提升服務效率。

    推薦理由:Mistral AI 同時提供開源微調 SDK、la Plateforme 無伺服器微調服務及客製訓練,呈現不同基礎設施與資料需求下的模型調整途徑。

6月4日週二
5月30日週四
5月29日週三
  1. Mistral AI69

    Mistral AI 發佈 22B 開放權重程式碼模型 Codestral

    Mistral AI 發佈 22B 開放權重程式碼生成模型 Codestral,支援 80+ 種程式語言,並提供 32k 上下文窗口。其評測圖表稱,Codestral 在 RepoBench 長距離程式碼生成評測中超越其他模型;模型亦可補全程式碼、編寫測試及以 fill-in-the-middle 機制補完片段。

    推薦理由:文章列明 Codestral 的研究與測試授權、商業授權申請方式,以及專用 endpoint 的免費 beta 和候補名單,呈現不同使用入口的條件。

  2. Mistral AI68

    Mistral AI 推出 MNPL 非生產許可證,並以此許可發佈 Codestral

    Mistral AI 推出 MNPL 非生產許可證,允許開發者將其技術用於非商業用途及研究工作,並按此許可發佈 Codestral。Mistral AI 表示會繼續按 Apache 2.0 發佈模型和程式碼,並逐步整合採用 Apache 2.0 和 MNPL 的兩個產品系列。

    推薦理由:公告交代 MNPL 對非商業用途與研究工作的許可範圍,並説明 Codestral 和 Apache 2.0 的發佈安排,有助理解 Mistral AI 不同產品系列的許可路線。

5月28日週二
  1. Hugging Face Blog66

    使用 Sentence Transformers 訓練及微調嵌入模型

    Sentence Transformers 指南示範如何微調嵌入模型以配合特定任務,並説明亦可從頭訓練新模型。內容講解資料集、損失函數、訓練參數、評估器與 Trainer,並示範從 Hugging Face Hub 或本機載入資料及多資料集訓練。文中 AllNLI 三元組範例以餘弦相似度計算,開發集及測試集準確率分別為 90.04% 和 91.5%;訓練前基礎模型的開發集準確率為 68.32%。

    推薦理由:文章拆解資料集格式、損失函數、訓練參數、評估器與 Trainer 的配合,並展示多資料集搭配不同損失函數的訓練方式,方便轉用於不同嵌入任務。

5月24日週五
  1. Hugging Face Blog58

    Falcon 2 發佈 11B LLM 與 11B VLM,LLM 以逾 5000B tokens 訓練並涵蓋 11 種語言

    TII 發佈 Falcon 2 系列的 11B LLM 與 11B VLM,VLM 可接收圖像並回答相關問題。LLM 使用逾 5000B tokens 訓練,主要支援英語,並對另外 10 種語言具備良好能力。VLM 結合 CLIP ViT-L/14 視覺編碼器,先以 558K 圖像描述配對訓練多模態投影器,再以 1.2M 圖像文字指令資料微調。

5月22日週三
5月21日週二
5月16日週四
5月15日週三
5月14日週二
  1. Hugging Face Blog71

    PaliGemma:Google 的前沿開源視覺語言模型

    Google 發佈 PaliGemma,一系列可接收圖像與文字並輸出文字的開源視覺語言模型。模型結合 SigLIP-So400m 圖像編碼器與 Gemma-2B 文字解碼器,提供 PT、Mix、FT 三類檢查點及 224x224、448x448、896x896 三種解像度。PaliGemma 是單輪模型,不適用於對話;Mix 檢查點適合以自由文字提示進行通用推理,但僅供研究用途。

    推薦理由:文章整理 PT、Mix、FT 檢查點的用途,並指出高解像度會增加記憶體需求、多數任務的質素提升有限,有助按任務需要選擇模型。

5月13日週一
  1. Hugging Face Blog70

    Hugging Face 發佈 Transformers Agents 2.0,新增兩種可迭代的智能體

    Hugging Face 發佈 Transformers Agents 2.0,新增 ReactCodeAgent 和 ReactJsonAgent,能根據過往觀察迭代。框架以簡潔、模組化,以及工具和提示詞透明為設計目標。使用 Llama-3-70B-Instruct 的智能體在完整 GAIA 基準中排名第 4,超越多個基於 GPT-4 的智能體。

    推薦理由:文中比較 Code 與 JSON 智能體在不同模型上的表現,並展示 Llama-3-70B-Instruct 智能體於 GAIA 的名次,可作為評估 Agent 架構與模型搭配的具體參照。

5月9日週四