SyGra:為 LLM 和 SLM 建構資料的一站式框架
SyGra 是面向 LLM 和 SLM 的低程式碼/無程式碼框架,用於簡化資料集建立、轉換與對齊,讓團隊可專注於提示詞工程。它透過 Python 程式庫整合現有 ML 工作流程,支援 vLLM、Hugging Face TGI、Triton 和 Ollama 等推理後端。框架可生成 Q&A、DPO、推理及多語言資料,亦支援篩選和整理資料。
SyGra 是面向 LLM 和 SLM 的低程式碼/無程式碼框架,用於簡化資料集建立、轉換與對齊,讓團隊可專注於提示詞工程。它透過 Python 程式庫整合現有 ML 工作流程,支援 vLLM、Hugging Face TGI、Triton 和 Ollama 等推理後端。框架可生成 Q&A、DPO、推理及多語言資料,亦支援篩選和整理資料。
Together AI 宣佈可透過其平台微調 Hugging Face Hub 上兼容的 LLM,微調後模型可供推理、下載或推回 Hub。流程以 Together 官方目錄中的基礎模型提供訓練配置,自選的 Hugging Face 模型則是實際微調對象;文中稱一般預期支援 100B params 以下的 CausalLM 模型。
推薦理由:文章交代了基礎模型提供訓練配置、自選 Hub 模型作為微調對象的分工,並列出讀取私有模型與將訓練結果推回 Hub 的接入流程。
mmBERT 以 ModernBERT 為基礎推出,使用超過 3T tokens 的多語言文本訓練,並在最後階段納入 FineWeb2 的 1,833 種語言。
推薦理由:mmBERT 展示分階段擴充語言、逐步降低遮罩率的訓練設計,並報告在最後 100B tokens 才納入的低資源語言上取得明顯提升。
Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。
推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。
研究提出 word2vec 學習過程的定量理論,證明在若干實際可行條件下,其學習可化為無權最小二乘矩陣分解,最終表示由 PCA 給出。從接近零的隨機初始化出發,word2vec 以離散步驟逐一學得正交線性子空間,每步提高嵌入矩陣的秩;這些特徵對應由語料統計及演算法超參數定義的目標矩陣頂部特徵向量。
Hugging Face 推出開源無代碼工具 AI Sheets,讓用户使用 AI 模型建立、豐富及轉換資料集。它以試算表介面新增提示詞欄位,支援透過 Inference Providers 使用 Hugging Face Hub 上數以千計的開放模型,也可使用本地模型,並可本機部署或部署至 Hub。
推薦理由:AI Sheets 將提示詞生成、人工校訂與資料集匯出串成工作流,校訂及按讚的儲存格可作為 few-shot 範例供後續生成重用。
Mistral 以 Aerial Image Dataset 微調 Pixtral-12B,將衞星影像分類的整體準確率由 0.56 提升至 0.91,幻覺比例則由 5% 降至 0.1%。
Hugging Face 推出免費開源的實驗追蹤 Python 庫 Trackio,提供本地 Gradio dashboard,並可同步至 Hugging Face Spaces 分享。
Mistral AI 公佈其 LLM 生命週期環境影響研究,披露 Mistral Large 2 及 Le Chat 的碳、水與資源消耗數據。
Ettin Suite 發佈涵蓋 17M-1B 參數的配對編碼器與解碼器模型,兩者使用相同的 2T tokens 公開數據及訓練配方。編碼器在各項任務及規模上超越 ModernBERT,解碼器則勝過或追平 Llama 3.2 和 SmolLM2。同條件測試中,編碼器在分類和檢索任務較佔優,解碼器在生成任務較佔優;模型涵蓋六種規模,訓練數據公開且可重現。
推薦理由:Ettin 在相同的數據、模型規模與訓練配方下比較編碼器和解碼器,呈現兩類架構在分類、檢索和生成任務上的不同優勢。
Falcon-LLM Team 發佈 Falcon-H1 開放權重混合架構模型系列,涵蓋六種規模、由 0.5B 至 34B,並提供 base 與 instruction-tuned 版本。
推薦理由:文中對照 Qwen2.5-32B 的短、長上下文吞吐,並説明混合 Attention-SSM 設計,呈現 Falcon-H1 隨序列長度變化的效率取捨。
阿聯酋 Technology Innovation Institute(TII)推出 Falcon-Arabic,這款基於 Falcon 3 架構的 7B 參數模型支援阿拉伯語、英語及其他語言。它在 OALL v2 評測中勝過同規模阿拉伯語 LLM,並超越規模大至 4× 的模型。其上下文窗口為 32,000 tokens,可處理長文件並支援 RAG 等應用。
Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。
Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言描述需求,無需編寫程式碼即可生成文字分類或聊天數據集。
推薦理由:文章展示由自然語言描述生成分類或聊天數據集,再用 Argilla 審核並交由 AutoTrain 訓練模型的流程,也説明如何自訂模型與生成配置。
Hugging Face 與 Entalpic 宣佈啟動開源協作計劃 LeMaterial,並發布首個數據集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD,含 6.7M 條目及 7 項材料屬性,採用 CC-BY-4.0 授權。
Data is Better Together 社羣發佈採 Apache 2.0 授權的文生圖偏好數據集 open-image-preferences-v1,涵蓋多種生成類別、模型系列及提示詞複雜度。
Argilla 2.4 新增免程式 UI 工作流程,讓使用者從 Hugging Face Hub 匯入資料集、配置欄位與問題,再收集人工回饋以整理微調或評測資料。首版只支援公開 Hub 資料集;部署在 Spaces 時,預設啟用 Hugging Face OAuth,讓 Hub 使用者參與標註。
Cohere For AI 發佈 Aya Expanse 8B 和 32B 開放權重模型,並公開多語言訓練流程的技術細節。
推薦理由:文章拆解多語言訓練中的模型池數據仲裁、離線與線上偏好訓練及模型合併流程,呈現改善多語言表現的具體技術路徑。
Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。
推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。
OpenAI 的 API 模型蒸餾可在 OpenAI 平台上,使用大型前沿模型的輸出微調較具成本效益的模型。
推薦理由:這項 API 流程把大型前沿模型的輸出用於微調較具成本效益的模型,概述了在 OpenAI 平台內進行模型蒸餾的基本做法。
Hugging Face 在 Hub 的資料集頁面推出 SQL Console,讓用户直接在瀏覽器以 SQL 查詢和篩選資料集。它由 DuckDB WASM 驅動,不需伺服器或後端;非 Parquet 格式的資料集會自動轉換前 5GB,查詢結果可匯出為 Parquet,公開資料集的結果亦可透過連結分享。
推薦理由:SQL Console 以 DuckDB WASM 在瀏覽器查詢資料集,並示範用 SQL 將 Alpaca 格式轉為對話格式,提供一個可參照的資料整理流程。
OpenAI 現已開放 GPT-4o 微調。
Mistral AI 宣佈在 La Plateforme 開放旗下旗艦及專用模型自訂,並推出 Agents 早期版本及 mistralai 1.0 客户端 SDK。
推薦理由:這次發布把模型自訂、Agents 工作流程與客户端 SDK 更新並列,呈現 Mistral AI 如何涵蓋應用構建中的模型調整、流程編排和程式接入環節。
Hugging Face Blog 介紹 TextImage Augmentation,這套與 Albumentations AI 合作開發的流程可同步增強文件圖像及其中的文字標註。它可隨機插入、刪除或交換文字,並搭配圖像變換生成多樣化訓練樣本。變更後文字及對應 bounding box 可提取,用於模型訓練。
Hugging Face 發佈 Docmatix 文件視覺問答數據集,包含 2.4 million 張圖片及 9.5 million 組問答,規模較先前數據集增加 240X。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
Hugging Face 正在 Dataset Hub 試驗 Presidio 報告功能,估算資料集內個人識別資訊(PII)的存在情況。Presidio 是開源 PII 偵測工具,透過偵測模式和機器學習模型識別 PII;報告可供使用者在訓練前評估資料集,也讓擁有者檢查 PII 過濾流程。示例報告在預訓練資料集中偵測到少量電郵地址及敏感 PII。
Hugging Face《倫理與社會通訊》第 6 期闡述高質素數據如何支撐更好的 AI,並強調數據須切合具體用途,而非只看準確度或數量。文章列出相關性、全面性、時效性及偏見緩解等質素要素,並指出優質數據有助提升模型表現、穩健性、效率與包容性。數據整理、去重、內容篩選、人類回饋、參與式收集、治理框架及定期評估,都是改善數據質素的做法。
OpenAI 改進一致性模型的訓練技術。一致性模型是一類新興生成模型,無需對抗式訓練即可一步生成高質素數據。
OpenAI 提出一套面向真實世界內容審核的整體方法,旨在建立穩健且實用的自然語言分類系統,用於偵測不當內容。
Hugging Face 在 TRL 引入 RLOO Trainer,這是一種較 PPO 更易實作、較省 GPU 記憶體的線上 RLHF 訓練方法。測試顯示,RLOO 約比 PPO 少用 50–70% vRAM,1B 模型快 2 倍、6.9B 模型最高快 3 倍;6.9B checkpoint 的 GPT4 評審偏好率為 78.7%(k=2)。
推薦理由:文章對照 RLOO 與 PPO 的 GPU 記憶體用量、訓練速度及回答勝率,並披露 bf16 下 RLOO 有較多批次資料的梯度被清零。
Mistral AI 在 la Plateforme 推出模型客製化方案,提供自有基礎設施微調 SDK、無伺服器微調服務和客製訓練三種入口。開源工具 mistral-finetune 採用 LoRA 訓練範式;平台微調服務目前支援 Mistral 7B 和 Mistral Small,並使用 LoRA adapters,以保留基礎模型知識及提升服務效率。
推薦理由:Mistral AI 同時提供開源微調 SDK、la Plateforme 無伺服器微調服務及客製訓練,呈現不同基礎設施與資料需求下的模型調整途徑。
Sentence Transformers 指南示範如何微調嵌入模型以配合特定任務,並説明亦可從頭訓練新模型。內容講解資料集、損失函數、訓練參數、評估器與 Trainer,並示範從 Hugging Face Hub 或本機載入資料及多資料集訓練。文中 AllNLI 三元組範例以餘弦相似度計算,開發集及測試集準確率分別為 90.04% 和 91.5%;訓練前基礎模型的開發集準確率為 68.32%。
推薦理由:文章拆解資料集格式、損失函數、訓練參數、評估器與 Trainer 的配合,並展示多資料集搭配不同損失函數的訓練方式,方便轉用於不同嵌入任務。
OpenAI 説明其對數據與 AI 的方針,並介紹一款面向創作者及內容所有者的全新 Media Manager。ChatGPT 推出一年多後,AI 正改變人們的生活、工作與學習方式,亦引發關於 AI 時代數據的重要討論;OpenAI 並談及未來方向。
OpenAI 為微調 API 增添新功能,並擴展自訂模型計劃,提供更多建立自訂模型的方式。新功能旨在讓開發者更能掌控微調。
Hugging Face 發佈 Cosmopedia,這套合成數據集旨在重現 Phi-1.5 的訓練數據,供大語言模型預訓練使用。
推薦理由:文章拆解 Cosmopedia 從種子資料、提示詞擴展到去污染與訓練的流程,並交代如何藉由受眾和文體變化擴大提示詞規模。
Argilla 與 Hugging Face 發起 Data is Better Together 實驗,透過社羣協作建立提示詞排序偏好資料集,並邀請社羣加入首批共建項目。
BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。
推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。
Hugging Face Blog 示範如何使用 Hugging Face Transformers 和 PEFT,透過 LoRA 微調 Gemma 模型,並涵蓋 GPU 與 Cloud TPU 設定。
Hugging Face Blog 介紹 Matryoshka Embedding 模型的訓練與使用方法,並比較向量截短後與一般嵌入模型的表現。
推薦理由:文章把 Sentence Transformers 訓練方式與 STSBenchmark 實測相連,量化向量縮至原大小 8.3% 後仍保留 98.37% 表現。