跳到正文
目前篩選:一手
9月22日週一
  1. Hugging Face Blog46

    SyGra:為 LLM 和 SLM 建構資料的一站式框架

    SyGra 是面向 LLM 和 SLM 的低程式碼/無程式碼框架,用於簡化資料集建立、轉換與對齊,讓團隊可專注於提示詞工程。它透過 Python 程式庫整合現有 ML 工作流程,支援 vLLM、Hugging Face TGI、Triton 和 Ollama 等推理後端。框架可生成 Q&A、DPO、推理及多語言資料,亦支援篩選和整理資料。

9月11日週四
  1. Hugging Face Blog67

    Together AI 支援微調 Hugging Face Hub 上的兼容 LLM

    Together AI 宣佈可透過其平台微調 Hugging Face Hub 上兼容的 LLM,微調後模型可供推理、下載或推回 Hub。流程以 Together 官方目錄中的基礎模型提供訓練配置,自選的 Hugging Face 模型則是實際微調對象;文中稱一般預期支援 100B params 以下的 CausalLM 模型。

    推薦理由:文章交代了基礎模型提供訓練配置、自選 Hub 模型作為微調對象的分工,並列出讀取私有模型與將訓練結果推回 Hub 的接入流程。

9月9日週二
9月4日週四
  1. Hugging Face Blog67

    Google 發佈 EmbeddingGemma 多語言嵌入模型

    Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。

    推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。

9月1日週一
  1. Berkeley AI Research49

    word2vec 究竟學到了甚麼?

    研究提出 word2vec 學習過程的定量理論,證明在若干實際可行條件下,其學習可化為無權最小二乘矩陣分解,最終表示由 PCA 給出。從接近零的隨機初始化出發,word2vec 以離散步驟逐一學得正交線性子空間,每步提高嵌入矩陣的秩;這些特徵對應由語料統計及演算法超參數定義的目標矩陣頂部特徵向量。

8月8日週五
  1. Hugging Face Blog67

    Hugging Face 推出開源 AI Sheets,供用户無代碼建立、豐富及轉換資料集

    Hugging Face 推出開源無代碼工具 AI Sheets,讓用户使用 AI 模型建立、豐富及轉換資料集。它以試算表介面新增提示詞欄位,支援透過 Inference Providers 使用 Hugging Face Hub 上數以千計的開放模型,也可使用本地模型,並可本機部署或部署至 Hub。

    推薦理由:AI Sheets 將提示詞生成、人工校訂與資料集匯出串成工作流,校訂及按讚的儲存格可作為 few-shot 範例供後續生成重用。

8月1日週五
7月29日週二
7月23日週三
7月16日週三
  1. Hugging Face Blog68

    Ettin Suite 發佈 17M-1B 參數的配對編碼器與解碼器模型

    Ettin Suite 發佈涵蓋 17M-1B 參數的配對編碼器與解碼器模型,兩者使用相同的 2T tokens 公開數據及訓練配方。編碼器在各項任務及規模上超越 ModernBERT,解碼器則勝過或追平 Llama 3.2 和 SmolLM2。同條件測試中,編碼器在分類和檢索任務較佔優,解碼器在生成任務較佔優;模型涵蓋六種規模,訓練數據公開且可重現。

    推薦理由:Ettin 在相同的數據、模型規模與訓練配方下比較編碼器和解碼器,呈現兩類架構在分類、檢索和生成任務上的不同優勢。

5月21日週三
  1. Hugging Face Blog47

    Falcon-Arabic:阿拉伯語言模型的一項突破

    阿聯酋 Technology Innovation Institute(TII)推出 Falcon-Arabic,這款基於 Falcon 3 架構的 7B 參數模型支援阿拉伯語、英語及其他語言。它在 OALL v2 評測中勝過同規模阿拉伯語 LLM,並超越規模大至 4× 的模型。其上下文窗口為 32,000 tokens,可處理長文件並支援 RAG 等應用。

2月12日週三
  1. Hugging Face Blog58

    如何為影片生成建立優質資料集

    Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。

12月16日週一
  1. Hugging Face Blog61

    Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言建立數據集

    Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言描述需求,無需編寫程式碼即可生成文字分類或聊天數據集。

    推薦理由:文章展示由自然語言描述生成分類或聊天數據集,再用 Argilla 審核並交由 AutoTrain 訓練模型的流程,也説明如何自訂模型與生成配置。

12月10日週二
12月9日週一
11月4日週一
10月24日週四
10月9日週三
  1. Hugging Face Blog60

    Hugging Face + Dask 如何擴展 AI 資料處理

    Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。

    推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。

10月1日週二
9月17日週二
  1. Hugging Face Blog69

    Hugging Face 為 Datasets 推出 SQL Console

    Hugging Face 在 Hub 的資料集頁面推出 SQL Console,讓用户直接在瀏覽器以 SQL 查詢和篩選資料集。它由 DuckDB WASM 驅動,不需伺服器或後端;非 Parquet 格式的資料集會自動轉換前 5GB,查詢結果可匯出為 Parquet,公開資料集的結果亦可透過連結分享。

    推薦理由:SQL Console 以 DuckDB WASM 在瀏覽器查詢資料集,並示範用 SQL 將 Alpaca 格式轉為對話格式,提供一個可參照的資料整理流程。

8月20日週二
8月7日週三
8月6日週二
7月18日週四
7月16日週二
  1. Hugging Face Blog64

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型及 SmolLM-Corpus

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。

    推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。

7月10日週三
  1. Hugging Face Blog45

    Hugging Face 試驗在 Dataset Hub 以 Presidio 自動偵測 PII

    Hugging Face 正在 Dataset Hub 試驗 Presidio 報告功能,估算資料集內個人識別資訊(PII)的存在情況。Presidio 是開源 PII 偵測工具,透過偵測模式和機器學習模型識別 PII;報告可供使用者在訓練前評估資料集,也讓擁有者檢查 PII 過濾流程。示例報告在預訓練資料集中偵測到少量電郵地址及敏感 PII。

6月24日週一
  1. Hugging Face Blog45

    Hugging Face 倫理與社會通訊 #6:打造更好的 AI:數據質素的重要性

    Hugging Face《倫理與社會通訊》第 6 期闡述高質素數據如何支撐更好的 AI,並強調數據須切合具體用途,而非只看準確度或數量。文章列出相關性、全面性、時效性及偏見緩解等質素要素,並指出優質數據有助提升模型表現、穩健性、效率與包容性。數據整理、去重、內容篩選、人類回饋、參與式收集、治理框架及定期評估,都是改善數據質素的做法。

6月20日週四
6月12日週三
  1. Hugging Face Blog63

    Hugging Face 在 TRL 推出 RLOO Trainer,作為 PPO 的線上 RLHF 替代方案

    Hugging Face 在 TRL 引入 RLOO Trainer,這是一種較 PPO 更易實作、較省 GPU 記憶體的線上 RLHF 訓練方法。測試顯示,RLOO 約比 PPO 少用 50–70% vRAM,1B 模型快 2 倍、6.9B 模型最高快 3 倍;6.9B checkpoint 的 GPT4 評審偏好率為 78.7%(k=2)。

    推薦理由:文章對照 RLOO 與 PPO 的 GPU 記憶體用量、訓練速度及回答勝率,並披露 bf16 下 RLOO 有較多批次資料的梯度被清零。

6月5日週三
  1. Mistral AI67

    Mistral AI 推出模型客製化方案,提供三種微調入口

    Mistral AI 在 la Plateforme 推出模型客製化方案,提供自有基礎設施微調 SDK、無伺服器微調服務和客製訓練三種入口。開源工具 mistral-finetune 採用 LoRA 訓練範式;平台微調服務目前支援 Mistral 7B 和 Mistral Small,並使用 LoRA adapters,以保留基礎模型知識及提升服務效率。

    推薦理由:Mistral AI 同時提供開源微調 SDK、la Plateforme 無伺服器微調服務及客製訓練,呈現不同基礎設施與資料需求下的模型調整途徑。

5月28日週二
  1. Hugging Face Blog66

    使用 Sentence Transformers 訓練及微調嵌入模型

    Sentence Transformers 指南示範如何微調嵌入模型以配合特定任務,並説明亦可從頭訓練新模型。內容講解資料集、損失函數、訓練參數、評估器與 Trainer,並示範從 Hugging Face Hub 或本機載入資料及多資料集訓練。文中 AllNLI 三元組範例以餘弦相似度計算,開發集及測試集準確率分別為 90.04% 和 91.5%;訓練前基礎模型的開發集準確率為 68.32%。

    推薦理由:文章拆解資料集格式、損失函數、訓練參數、評估器與 Trainer 的配合,並展示多資料集搭配不同損失函數的訓練方式,方便轉用於不同嵌入任務。

5月7日週二
  1. OpenAI News27

    OpenAI 對數據與 AI 的方針

    OpenAI 説明其對數據與 AI 的方針,並介紹一款面向創作者及內容所有者的全新 Media Manager。ChatGPT 推出一年多後,AI 正改變人們的生活、工作與學習方式,亦引發關於 AI 時代數據的重要討論;OpenAI 並談及未來方向。

4月4日週四
3月20日週三
3月4日週一
2月28日週三
  1. Hugging Face Blog72

    BigCode 發佈 StarCoder2 模型系列及 The Stack v2 程式碼數據集

    BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。

    推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。

2月23日週五