跳到正文
11月5日週三
10月27日週一
  1. Hugging Face Blog67

    Hugging Face 改進 datasets 與 huggingface_hub 串流功能,啟動請求最多減少 100 倍

    Hugging Face 改進 datasets 與 huggingface_hub 的資料集串流,資料檔解析快 10 倍、啟動請求最多減少 100 倍,串流速度最高提升至原來的 2 倍。

    推薦理由:文章拆解跨 DataLoader workers 快取與 Parquet 預取如何改善資料解析和吞吐,並列出 256 workers 下的請求量及穩定性結果,呈現大規模串流訓練的優化方向。

10月24日週五
  1. Hugging Face Blog75

    LeRobot v0.4.0 升級開源機械人學習工具鏈

    LeRobot 發佈 v0.4.0,加入 Datasets v3.0、VLA 模型 PI0 和 PI0.5、GR00T N1.5,以及硬件插件系統。Datasets v3.0 採用分塊 episode 格式並支援串流,可處理 OXE 級(> 400GB)資料集。

    推薦理由:資料集規模化、模擬評測、多 GPU 訓練和硬件插件同時更新,勾勒出 LeRobot 從資料處理到機械人控制的工具鏈演進。

10月14日週二
  1. Hugging Face Blog63

    NVIDIA 發佈 Nemotron-Personas-India 印度合成人物設定數據集

    NVIDIA 發佈 Nemotron-Personas-India,一套依印度人口、地理及文化分佈合成的人物設定數據集,採用 CC BY 4.0 授權。數據集包含 21 million 個人物設定(3M 條記錄、每條 7 個設定),支援英語及以天城文、拉丁字母書寫的印地語,並有 27 個欄位和 7.7 billion tokens。

    推薦理由:數據集以印度人口、地域分佈為基礎,涵蓋英語及兩種文字形式的印地語,並採 CC BY 4.0 授權,呈現其作為區域模型訓練素材的語言覆蓋與使用條件。

9月26日週五
  1. Hugging Face Blog58

    NVIDIA 發佈面向主權 AI 的日本合成數據集 Nemotron-Personas-Japan

    NVIDIA 發佈 Nemotron-Personas-Japan,一個按日本人口與勞動統計構建、以 CC BY 4.0 授權的開放合成數據集,包含 100 萬條記錄、共 600 萬個日語人物設定。每條記錄含 22 項資料,數據集約有 14 億 tokens,並涵蓋 1500 種以上職業類別。數據集不含個人可識別資訊,可用於日語模型微調、合成對話生成及偏差與公平性測試。

9月22日週一
  1. Hugging Face Blog46

    SyGra:為 LLM 和 SLM 建構資料的一站式框架

    SyGra 是面向 LLM 和 SLM 的低程式碼/無程式碼框架,用於簡化資料集建立、轉換與對齊,讓團隊可專注於提示詞工程。它透過 Python 程式庫整合現有 ML 工作流程,支援 vLLM、Hugging Face TGI、Triton 和 Ollama 等推理後端。框架可生成 Q&A、DPO、推理及多語言資料,亦支援篩選和整理資料。

9月11日週四
  1. Hugging Face Blog67

    Together AI 支援微調 Hugging Face Hub 上的兼容 LLM

    Together AI 宣佈可透過其平台微調 Hugging Face Hub 上兼容的 LLM,微調後模型可供推理、下載或推回 Hub。流程以 Together 官方目錄中的基礎模型提供訓練配置,自選的 Hugging Face 模型則是實際微調對象;文中稱一般預期支援 100B params 以下的 CausalLM 模型。

    推薦理由:文章交代了基礎模型提供訓練配置、自選 Hub 模型作為微調對象的分工,並列出讀取私有模型與將訓練結果推回 Hub 的接入流程。

9月9日週二
9月4日週四
  1. Hugging Face Blog67

    Google 發佈 EmbeddingGemma 多語言嵌入模型

    Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。

    推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。

9月1日週一
  1. Berkeley AI Research49

    word2vec 究竟學到了甚麼?

    研究提出 word2vec 學習過程的定量理論,證明在若干實際可行條件下,其學習可化為無權最小二乘矩陣分解,最終表示由 PCA 給出。從接近零的隨機初始化出發,word2vec 以離散步驟逐一學得正交線性子空間,每步提高嵌入矩陣的秩;這些特徵對應由語料統計及演算法超參數定義的目標矩陣頂部特徵向量。

8月8日週五
  1. Hugging Face Blog67

    Hugging Face 推出開源 AI Sheets,供用户無代碼建立、豐富及轉換資料集

    Hugging Face 推出開源無代碼工具 AI Sheets,讓用户使用 AI 模型建立、豐富及轉換資料集。它以試算表介面新增提示詞欄位,支援透過 Inference Providers 使用 Hugging Face Hub 上數以千計的開放模型,也可使用本地模型,並可本機部署或部署至 Hub。

    推薦理由:AI Sheets 將提示詞生成、人工校訂與資料集匯出串成工作流,校訂及按讚的儲存格可作為 few-shot 範例供後續生成重用。

8月5日週二
8月1日週五
7月29日週二
7月23日週三
7月21日週一
  1. OpenAI Developers55

    OpenAI 監督式微調(SFT)指南概覽與平台逐步停用説明

    OpenAI 的監督式微調(SFT)指南介紹以示例為特定用途訓練模型的流程,並指出微調平台正逐步停止服務。新用户已無法使用平台,現有用户在未來數月仍可建立訓練工作;所有微調模型可繼續推理,直至其基礎模型棄用。指南建議先建立 evals,從 50 個精心設計的示例開始,並以 JSONL 格式準備訓練資料。

7月18日週五
7月16日週三
  1. Hugging Face Blog68

    Ettin Suite 發佈 17M-1B 參數的配對編碼器與解碼器模型

    Ettin Suite 發佈涵蓋 17M-1B 參數的配對編碼器與解碼器模型,兩者使用相同的 2T tokens 公開數據及訓練配方。編碼器在各項任務及規模上超越 ModernBERT,解碼器則勝過或追平 Llama 3.2 和 SmolLM2。同條件測試中,編碼器在分類和檢索任務較佔優,解碼器在生成任務較佔優;模型涵蓋六種規模,訓練數據公開且可重現。

    推薦理由:Ettin 在相同的數據、模型規模與訓練配方下比較編碼器和解碼器,呈現兩類架構在分類、檢索和生成任務上的不同優勢。

5月23日週五
  1. OpenAI Developers60

    OpenAI 指南探討如何為強化微調設計模型評分器

    OpenAI 的指南示範如何為 o4-mini 設計模型評分器,並以臨牀對話結果預測任務進行強化微調(RFT)。實驗使用 100 個訓練樣本和 100 個驗證樣本,採用 gpt-4.1 模型評分器後,微調模型的驗證評分較基礎 o4-mini 提高約 5 個百分點。指南亦展示詞面評分可能誘發模型加入同義詞、劑量或治療方案來刷分,並建議以領域專家檢查評分器和資料品質。

5月21日週三
  1. Hugging Face Blog47

    Falcon-Arabic:阿拉伯語言模型的一項突破

    阿聯酋 Technology Innovation Institute(TII)推出 Falcon-Arabic,這款基於 Falcon 3 架構的 7B 參數模型支援阿拉伯語、英語及其他語言。它在 OALL v2 評測中勝過同規模阿拉伯語 LLM,並超越規模大至 4× 的模型。其上下文窗口為 32,000 tokens,可處理長文件並支援 RAG 等應用。

2月12日週三
  1. Hugging Face Blog58

    如何為影片生成建立優質資料集

    Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。

2月10日週一
  1. Sam Altman:Blog62

    Sam Altman 提出 AI 經濟的三項觀察

    Sam Altman提出三項關於AI經濟的觀察,認為模型智能大致隨訓練及推理計算資源的對數增加,智能的社會經濟價值則呈超指數增長。他指出,同等 AI 水平的使用成本約每 12 個月下降 10x;以 GPT-4 於 2023 年初和 GPT-4o 於 2024 年中的每個 token 價格相比,價格約下降 150x。

12月16日週一
  1. Hugging Face Blog61

    Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言建立數據集

    Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言描述需求,無需編寫程式碼即可生成文字分類或聊天數據集。

    推薦理由:文章展示由自然語言描述生成分類或聊天數據集,再用 Argilla 審核並交由 AutoTrain 訓練模型的流程,也説明如何自訂模型與生成配置。

12月10日週二
12月9日週一
11月4日週一
10月24日週四
10月9日週三
  1. Hugging Face Blog60

    Hugging Face + Dask 如何擴展 AI 資料處理

    Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。

    推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。

10月1日週二
9月17日週二
  1. Hugging Face Blog69

    Hugging Face 為 Datasets 推出 SQL Console

    Hugging Face 在 Hub 的資料集頁面推出 SQL Console,讓用户直接在瀏覽器以 SQL 查詢和篩選資料集。它由 DuckDB WASM 驅動,不需伺服器或後端;非 Parquet 格式的資料集會自動轉換前 5GB,查詢結果可匯出為 Parquet,公開資料集的結果亦可透過連結分享。

    推薦理由:SQL Console 以 DuckDB WASM 在瀏覽器查詢資料集,並示範用 SQL 將 Alpaca 格式轉為對話格式,提供一個可參照的資料整理流程。

8月20日週二
8月7日週三
8月6日週二
7月18日週四
7月16日週二
  1. Hugging Face Blog64

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型及 SmolLM-Corpus

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。

    推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。

7月10日週三
  1. Hugging Face Blog45

    Hugging Face 試驗在 Dataset Hub 以 Presidio 自動偵測 PII

    Hugging Face 正在 Dataset Hub 試驗 Presidio 報告功能,估算資料集內個人識別資訊(PII)的存在情況。Presidio 是開源 PII 偵測工具,透過偵測模式和機器學習模型識別 PII;報告可供使用者在訓練前評估資料集,也讓擁有者檢查 PII 過濾流程。示例報告在預訓練資料集中偵測到少量電郵地址及敏感 PII。

6月24日週一
  1. Hugging Face Blog45

    Hugging Face 倫理與社會通訊 #6:打造更好的 AI:數據質素的重要性

    Hugging Face《倫理與社會通訊》第 6 期闡述高質素數據如何支撐更好的 AI,並強調數據須切合具體用途,而非只看準確度或數量。文章列出相關性、全面性、時效性及偏見緩解等質素要素,並指出優質數據有助提升模型表現、穩健性、效率與包容性。數據整理、去重、內容篩選、人類回饋、參與式收集、治理框架及定期評估,都是改善數據質素的做法。

6月20日週四