Kakao Brain 發佈 ViT、ALIGN 模型及包含 700 million 對圖文的 COYO 資料集
Kakao Brain 與 Hugging Face 公開 ViT、ALIGN 視覺語言模型,以及由 700 million 對圖文構成的開源 COYO 資料集。
推薦理由:ViT 與 ALIGN 連同 COYO 訓練資料一併開放,並提供與 Google 版本的任務比較,呈現資料可取得性對視覺語言研究復現的價值。
開源模型、框架與倉庫動態:權重開放、社區項目爆火、開源與閉源的力量消長。
Kakao Brain 與 Hugging Face 公開 ViT、ALIGN 視覺語言模型,以及由 700 million 對圖文構成的開源 COYO 資料集。
推薦理由:ViT 與 ALIGN 連同 COYO 訓練資料一併開放,並提供與 Google 版本的任務比較,呈現資料可取得性對視覺語言研究復現的價值。
Hugging Face 的 Diffusers for Mac 1.1 已在 Mac App Store 提供,更新效能與介面,並會按電腦自動選擇加速器。文中稱,視乎電腦配置,文字生成圖像速度最高可達原來的兩倍;測試列出 GPU 與 ANE 在不同 Mac 上的表現。
推薦理由:文章按多款 Mac 和 Stable Diffusion 型號列出 GPU、ANE 的生成基準,並指出 M1 Max 上 GPU 較快、標準 M1 上 ANE 較快,呈現加速器選擇受硬件配置影響。
Hugging Face Blog 梳理 RLHF 的三階段訓練流程,包括預訓練語言模型、收集偏好數據並訓練獎勵模型,以及以強化學習微調模型。人類標註者透過比較並排序同一提示下生成的文本來建立偏好數據;PPO 微調時,KL 懲罰用於限制策略偏離初始模型。
推薦理由:文章拆解 RLHF 的三階段訓練流程,並説明偏好排序如何訓練獎勵模型,以及 KL 懲罰如何約束後續策略更新。
Hugging Face 介紹如何以開源模型建立 Document AI 方案,並按任務梳理文件分類、版面分析、文件解析、表格處理及文件問答。文中以 RVL-CDIP 為例,列出 BERT-base、DiT、LayoutLMv3 和 Donut 的文件分類準確率分別為 89%、92% 及 95%,並討論授權、數據準備、微調與評估等實作考量。
推薦理由:文章按文件類型與任務梳理 Document AI 模型選擇,並串連授權、數據準備和評估考量,提供從小規模微調起步的實作思路。
MTEB 是一套評估文本嵌入模型在多種任務上表現的大型基準測試,並以排行榜彙整模型成績。該基準涵蓋 56 個數據集、8 類任務及最多 112 種語言,排行榜彙整 >2000 項結果。
推薦理由:MTEB 把 56 個數據集、8 類任務納入同一排行榜,並提供自行測試及提交結果的流程,方便按具體任務比較文本嵌入模型。
Hugging Face 的 Evaluation on the Hub 現已支援免寫程式對 Hub 上的因果語言模型進行零樣本分類評估,最高支援 66 billion parameters。
推薦理由:文章説明如何用 Evaluation on the Hub 比較不同規模模型,並以 WinoBias 案例展示零樣本評估如何檢視職業性別偏見。
Hugging Face 説明 Transformers 的 TensorFlow 設計取向,將模型和層設為 Keras Model 與 Keras Layer,讓使用者可直接調用 fit()、compile() 和 predict()。
推薦理由:文章梳理 Hugging Face Transformers 對 TensorFlow 的六項設計取向,並以 Keras 訓練、資料管線、XLA 與部署示例,呈現這些取捨如何落實到模型訓練和部署流程。
BLOOM 已正式發佈,這款具 176 billion parameters 的開放多語言大語言模型可生成 46 種自然語言及 13 種程式語言文本。最後一輪訓練歷時 117 days,並公開訓練中間 checkpoint 與 optimizer states,供研究者下載、運行及研究。
推薦理由:BLOOM 除模型外亦公開訓練中間 checkpoint 與 optimizer states,並提供下載及本地或雲端使用途徑,讓研究者能檢視模型行為與訓練過程。
Hugging Face 推出由 AutoTrain 驅動的 Evaluation on the Hub,讓使用者無需編寫程式,即可用任意資料集與指標評估 Hub 上的模型。評估結果會提交至模型卡的 Hub pull request,平台亦提供排行榜,方便比較模型在不同資料集切分與指標上的表現。
推薦理由:它讓使用者可在 Hub 選擇模型、資料集和指標,免寫程式完成評估;結果回寫模型卡,排行榜便於比較表現及重用評估設定。
Hugging Face Hub 推出 Pull Request 和 Discussions 協作功能,現已向所有模型、資料集及 Spaces 倉庫開放。社羣成員可在 Community 分頁提問、分享建議,並透過網站開啟、評論、合併或關閉 Pull Request。Pull Request 使用直接儲存在來源倉庫的自訂 refs,無需為模型或資料集的每個新版本建立 fork。
推薦理由:Hugging Face Hub 以來源倉庫內的 refs 處理 Pull Request,免去為模型或資料集每個新版本建立 fork,呈現其針對 ML 倉庫簡化協作流程的做法。
Hugging Face 宣佈完成由 Lux Capital 領投的 $100 Million C 輪融資,Sequoia、Coatue 等也參與投資。Hugging Face Hub 當時託管 100,000 個預訓練模型及 10,000 個數據集,超過 10,000 家公司使用 Hugging Face 建構機器學習技術。公司表示將加大研究、開源、產品及負責任地普及 AI 的投入。
推薦理由:融資用途涵蓋研究、開源、產品與負責任地普及 AI,讀者可從中瞭解 Hugging Face 此輪募資要加速的方向。
Hugging Face 收購 Gradio,並將與 Gradio 團隊繼續發展這套用於建立及分享機器學習模型 demo 的開源工具。Gradio 自 2019 年推出以來,已建立超過 300,000 個 demos,應用範圍涵蓋電腦視覺、文字、語音和影片。團隊表示,合作目標是讓任何能連接互聯網並使用瀏覽器的人都能接觸和使用機器學習模型。
推薦理由:文章把收購置於 Gradio 推動模型易於展示、試用和收集回饋的脈絡中,並列出超過 300,000 個 demos 的既有使用規模。
OpenAI 發佈 Triton 1.0,這是一種用於神經網絡 GPU 程式設計的類 Python 開源語言。它讓沒有 CUDA 經驗的研究人員也能編寫高效 GPU 程式碼;OpenAI 稱,多數情況下這些程式碼可媲美專家所能產出。
推薦理由:Triton 1.0 以類 Python 語言降低神經網絡 GPU 程式設計門檻,讓沒有 CUDA 經驗的研究人員也能編寫高效程式碼,OpenAI 稱多數情況下可媲美專家產出。
Hugging Face Hub 接入 spaCy,讓使用者可分享 spaCy pipelines,並在瀏覽器試用或透過 Inference API 調用模型。
推薦理由:這次整合把 spaCy pipeline 上傳、瀏覽器試用、NER 推理和安裝入口放在 Hub,呈現模型分享後如何被測試與接入應用。
Gradio 2.0 讓使用者可用一行程式碼透過 GUI 載入並使用幾乎任何 Hugging Face 模型。預設會使用 Hugging Face 託管的 Inference API,可提供自己的 API key 或免 key 使用;亦可執行 `pip install transformers` 在本機運算。它支援多個模型並行或串聯,文中示範以 3 行程式碼翻譯並摘要芬蘭新聞文章。
推薦理由:文章展示 Gradio 2.0 如何以一行程式碼建立模型 GUI,並串聯或並行組合 Hugging Face 模型,提供比較模型及串接多步任務的實作參考。
Hugging Face 推出 Accelerate,PyTorch 訓練腳本加入五行程式碼後,即可支援不同分散式設定及混合精度訓練。Accelerate 提供統一 API,準備模型、最佳化器及 DataLoader,並處理裝置配置和反向傳播。
推薦理由:Accelerate 將 PyTorch 分散式訓練及混合精度所需樣板封裝成少量 API 改動,並提供統一啟動器,呈現減少訓練腳本跨環境改動的實作方式。
OpenAI 將內部項目 OpenAI Baselines 開源,目標是以與已發表結果相當的性能復現強化學習算法。首批發佈包含 DQN 及其三種變體,其他算法計劃在未來數月陸續釋出。
推薦理由:首批開源內容包括 DQN 及三種變體,可看出 OpenAI Baselines 的起始復現範圍;項目目標是讓強化學習算法達到與已發表結果相當的性能。