如何用 Sentence Transformers 和 Gradio 構建歌單生成器
作者以 Sentence Transformers 和 Gradio 構建歌單生成器,透過對歌詞嵌入向量進行語義搜索,按文字提示找出相關歌曲。由於所選模型的最大序列長度為 512 word pieces,歌曲歌詞先按 verse 切分並逐段嵌入;設置 top_k=20 時,作者實測幾乎總能得到至少 9 首不同歌曲。
作者以 Sentence Transformers 和 Gradio 構建歌單生成器,透過對歌詞嵌入向量進行語義搜索,按文字提示找出相關歌曲。由於所選模型的最大序列長度為 512 word pieces,歌曲歌詞先按 verse 切分並逐段嵌入;設置 top_k=20 時,作者實測幾乎總能得到至少 9 首不同歌曲。
BLOOM 已正式發佈,這款具 176 billion parameters 的開放多語言大語言模型可生成 46 種自然語言及 13 種程式語言文本。最後一輪訓練歷時 117 days,並公開訓練中間 checkpoint 與 optimizer states,供研究者下載、運行及研究。
推薦理由:BLOOM 除模型外亦公開訓練中間 checkpoint 與 optimizer states,並提供下載及本地或雲端使用途徑,讓研究者能檢視模型行為與訓練過程。
Hugging Face 提供 Twitter 情感分析入門指南,示範適用於程式開發者與非程式開發者的操作流程。程式開發者可用 Tweepy 收集推文,透過 Inference API 分析正面、負面或中性情緒,並將結果視覺化;非程式開發者則可用 Zapier 分析推文,並將結果傳送至 Google Sheets。
Hugging Face 深度強化學習課程第 5 單元以 PyTorch 從零實作 REINFORCE,並在 CartPole-v1、PixelCopter 和 Pong 測試其穩健性。策略梯度以梯度上升直接最佳化策略,毋須先學習價值函數;隨機策略可促進探索,在高維及連續動作空間中亦較有效。其限制包括可能收斂至局部極值、訓練時間較長及高方差。
這篇入門指南以 Sentence Transformers 為例,介紹初學者如何理解文本嵌入向量與語義搜尋,並規劃首個自主機器學習項目。文章建議先盤點工具能力、挑選感興趣的資料集,再配合一項熟悉的輔助工具構思項目。
Hugging Face 推出由 AutoTrain 驅動的 Evaluation on the Hub,讓使用者無需編寫程式,即可用任意資料集與指標評估 Hub 上的模型。評估結果會提交至模型卡的 Hub pull request,平台亦提供排行榜,方便比較模型在不同資料集切分與指標上的表現。
推薦理由:它讓使用者可在 Hub 選擇模型、資料集和指標,免寫程式完成評估;結果回寫模型卡,排行榜便於比較表現及重用評估設定。
Hugging Face Blog 以 Medicare FAQ 示範語義搜尋流程,使用 Inference API 生成嵌入向量,再以使用者查詢比對相似 FAQ。示範選用 sentence-transformers/all-MiniLM-L6-v2 將 13 條 FAQ 編碼為 384 維向量,並把向量資料集上載至 Hub,以餘弦相似度找出最相近的 5 條 FAQ。
Hugging Face 示範了將 Transformers 模型匯出為 ONNX 的三種方法,涵蓋低階 `torch.onnx`、中階 `transformers.onnx` 和高階 Optimum。
Hugging Face 宣佈 Intel 加入其 Hardware Partner Program,雙方將透過 Optimum 加速 Transformers 訓練、微調和推理。示例以 Optimum Intel 對微調後的 DistilBERT 分類模型進行訓練後動態量化,準確率由 0.574 降至 0.546,評估步驟快 1.34x。
Hugging Face 深度強化學習課程第 3 單元介紹 Deep Q-Learning,並以 Space Invaders 説明神經網絡如何取代 Q-table,估算各動作的 Q 值。
Graphcore 與 Hugging Face 擴大 Hugging Face Optimum 的 IPU-ready Transformers 陣容,現提供涵蓋自然語言處理、語音及電腦視覺的 10 款模型。各模型附有 IPU 設定檔,以及可直接使用的預訓練和微調權重。開源函式庫 Hugging Face Optimum 提供針對 Graphcore IPU 最佳化的現成模型,方便開發者使用。
Hugging Face Hub 推出 Pull Request 和 Discussions 協作功能,現已向所有模型、資料集及 Spaces 倉庫開放。社羣成員可在 Community 分頁提問、分享建議,並透過網站開啟、評論、合併或關閉 Pull Request。Pull Request 使用直接儲存在來源倉庫的自訂 refs,無需為模型或資料集的每個新版本建立 fork。
推薦理由:Hugging Face Hub 以來源倉庫內的 refs 處理 Pull Request,免去為模型或資料集每個新版本建立 fork,呈現其針對 ML 倉庫簡化協作流程的做法。
Hugging Face 的 Deep Reinforcement Learning Class 第二部分講解 Q-Learning,並帶領學員從零實作強化學習智能體。
Hugging Face 多模態學習團隊為研究項目制定倫理章程,把倫理原則納入機器學習研究生命週期。章程列明須防範歧視、侵犯私隱與權利、生成個人識別資料及有害虛假資訊,並警示醫療、法律、金融和移民等高風險用途。文件截至 2022 年 5 月仍在完善,倡議透明、開放可重現、公平、自我批判及尊重貢獻。
Hugging Face 深度強化學習課程第 2 單元第 1 部分講解價值型強化學習方法,為 Q-Learning 作鋪墊。內容説明狀態價值函數與動作價值函數,並比較蒙地卡羅學習和時間差分學習。本單元第二部分將介紹 Q-Learning 演算法,從零實作智能體,並在 Frozen-Lake-v1 及自動的士環境中訓練。
Hugging Face 推出 Fellowship 計劃,支持不同背景的開源機器學習貢獻者擴大影響力,並鼓勵更多人參與。支援內容按個人需要而定,包括運算資源、周邊物資及 Hugging Face 官方認可;成為 Fellow 須由 Hugging Face 團隊成員或 Fellow 提名。
Hugging Face 研究科學家 Sasha Luccioni 在訪談中談及她對機器學習模型與數據集的倫理、社會影響及環境足跡研究。她擔任 Big Science Workshop 碳足跡工作組共同主席,探討電子郵件排放與製造成本等環境影響,並參與數據整理和多語言工作,避免語料過度偏重英語。
Gradio 3.0 正式推出,全面重設前端,並加入可在 Python 中構建自訂 Web app 的低階 Gradio Blocks API。前端採用 Svelte 等技術,文章稱載荷更小、頁面載入更快;Dataframe 經改良,並新增 Gallery 和 TabbedInterface。
推薦理由:Gradio Blocks 的 Python 範例展示如何組合元件、事件與版面,構建多步驟互動介面,提供可借鑑的實作思路。
Hugging Face 開放首屆學生大使計劃申請,邀請修讀機器學習或在社羣推廣 ML 的學生參與,截止日期為 2022 年 6 月 13 日。計劃於 2022 年 6 月 30 日開始、12 月 31 日結束;獲選者可獲同儕交流網絡、Hugging Face 團隊工作坊與支援、最新項目及功能資訊、周邊商品與素材,以及官方大使認可。
Hugging Face 宣佈完成由 Lux Capital 領投的 $100 Million C 輪融資,Sequoia、Coatue 等也參與投資。Hugging Face Hub 當時託管 100,000 個預訓練模型及 10,000 個數據集,超過 10,000 家公司使用 Hugging Face 建構機器學習技術。公司表示將加大研究、開源、產品及負責任地普及 AI 的投入。
推薦理由:融資用途涵蓋研究、開源、產品與負責任地普及 AI,讀者可從中瞭解 Hugging Face 此輪募資要加速的方向。
Hugging Face Hub 接入 fastai,讓 fastai 使用者可用單行 Python 程式碼上傳 Learner,亦可從 Hub 載入模型。文章介紹 `push_to_hub_fastai` 和 `from_pretrained_fastai`,並示範 fastai 與 Blurr 的模型分享流程。
Hugging Face 的 Deep Reinforcement Learning Class 第一章介紹深度強化學習的基本框架,説明智能體如何透過與環境互動、採取行動並接收獎勵來學習。
作者結合 Kili 與 Hugging Face AutoTrain,為 Google Play 上 Medium 應用程式的評論建立主動學習分類流程,並對分類結果進行情感分析。
文章示範以 amazon_reviews_multi 的英文資料微調 microsoft/deberta-v3-base,建立五類情感分類模型以篩選最不滿意的客户訊息。測試中,模型識別出約 95% 的極度不滿意訊息,並把約 12% 的中立或滿意訊息誤判為需要回覆。按每日 10,000 則訊息的假設估算,人工工作量可減少約 83%;文章指出,實際應用需要貼近業務情境的高質素訓練數據。
推薦理由:文章由任務界定、資料集篩選延伸至微調與業務指標設計,展示如何把模型評估對準客服實際處理目標。
Hugging Face Hub 可用 huggingface_hub 的 emissions_thresholds 按模型訓練 CO2 排放篩選模型,Transformers 則可透過 CodeCarbonCallback 記錄訓練排放。
Hugging Face《Machine Learning Experts》專訪 Lewis Tunstall,談其 Transformers 工作及新書《NLP with Transformers》。他介紹 Transformers library 可將 PyTorch 模型匯出為 ONNX 格式,讓工程師進一步降低延遲、提高吞吐量。
Hugging Face 將 Decision Transformer 這種離線強化學習方法整合至 🤗 Transformers 函式庫及 Hugging Face Hub。
Hugging Face 宣佈推出為期 9 個月的 AI 研究駐留計劃,協助參加者開展或深化機器學習研究。參加者將與 Science Team 研究員共同選定研究問題,以開放協作方式開發機器學習技術;計劃只提供全職形式,並可在現居地工作。申請截止日期為 2022 年 4 月 3 日。
Hugging Face Blog 提供以自訂資料集微調 SegFormer 語義分割模型的教程,涵蓋資料準備、訓練和推理。示例使用自建的人行道標註資料集微調預訓練的 SegFormer B0,並以 mIoU 評估分割結果。教程亦介紹將模型推送至 Hugging Face Hub,並透過推理小工具試用。
🤗 datasets 教程示範為 10,000 張來自 British Library 數碼化書籍的插圖建立文字搜圖流程。作者使用 sentence_transformers 的 CLIP 將圖片和文字提示詞轉成嵌入向量,再以 FAISS 檢索相似圖片;完整數據集網址為 https://doi.org/10.21250/db17。
Hugging Face 提供端到端教程,示範如何以 Hugging Face Transformers、Amazon SageMaker 和 AWS Inferentia 加速 BERT 文本分類推理。
這篇教程示範使用 🤗 Datasets 與 🤗 Transformers,將預訓練模型 google/vit-base-patch16-224-in21k 微調為豆類葉片圖像分類器。
推薦理由:文章以 beans 葉片分類串起資料載入、ViT 圖像預處理、Trainer 微調與評估,並展示資料即時轉換及訓練參數設定。
Hugging Face 將 Stable-Baselines3 整合至 Hugging Face Hub,讓使用者可託管已儲存的模型,並載入社羣模型。Stable-Baselines3 是 PyTorch 深度強化學習程式庫,整合支援透過 `load_from_hub` 載入模型,並以 `push_to_hub` 上傳分享。
Hugging Face 收購 Gradio,並將與 Gradio 團隊繼續發展這套用於建立及分享機器學習模型 demo 的開源工具。Gradio 自 2019 年推出以來,已建立超過 300,000 個 demos,應用範圍涵蓋電腦視覺、文字、語音和影片。團隊表示,合作目標是讓任何能連接互聯網並使用瀏覽器的人都能接觸和使用機器學習模型。
推薦理由:文章把收購置於 Gradio 推動模型易於展示、試用和收集回饋的脈絡中,並列出超過 300,000 個 demos 的既有使用規模。
Hugging Face 推出開源 Data Measurements Tool,提供 Python 程式庫及免程式碼介面,供使用者探索、測量和比較 NLP 資料集。工具可呈現缺失值、詞彙與標籤分佈、重複項及嵌入聚類,並以詞對 nPMI 協助檢視資料中的刻板印象。alpha 版本(v0)目前以數個常見英文資料集示範功能,包括 SQuAD、imdb 和 C4。
Hugging Face 宣佈課程第二部分將於 11 月 15 日推出,並於 11 月 15 日至 16 日舉辦社羣活動。課程涵蓋 token 分類、因果與遮罩語言建模、翻譯、摘要和問答,並深入介紹 🤗 Datasets 與 🤗 Tokenizers。活動包括兩日演講及以 NLP 任務微調模型的團隊項目;AWS 將透過 Amazon SageMaker 向參與者提供免費運算資源。
Hugging Face 與 Graphcore 合作,讓開發者可在 Graphcore IPU 上以生產規模部署最佳化 Transformers。開源工具庫 Optimum 將提供經 Hugging Face 認證的硬件最佳化模型,首批 IPU 最佳化模型將於今年稍後登上 Optimum。
Hugging Face Hub 接入 spaCy,讓使用者可分享 spaCy pipelines,並在瀏覽器試用或透過 Inference API 調用模型。
推薦理由:這次整合把 spaCy pipeline 上傳、瀏覽器試用、NER 推理和安裝入口放在 Hub,呈現模型分享後如何被測試與接入應用。
Hugging Face 推出適用於 Amazon SageMaker 的 Inference DLC 和 Inference Toolkit,支援部署已訓練模型及 Model Hub 上 10,000+ 個公開模型。
推薦理由:文章分別示範訓練完成後、從 Amazon S3 檢查點及從 Model Hub 部署模型,並附上建立 SageMaker 推理端點的程式範例。
Hugging Face Hub 為 Sentence Transformers 推出特徵擷取與句子相似度兩款小工具,並提供 Inference API 端點供程式調用模型。Hub 收錄超過 90 個預訓練 Sentence Transformers 模型,涵蓋超過 100 種語言,使用者可直接載入使用。
推薦理由:文章梳理 Sentence Transformers 模型接入 Hugging Face Hub 的分享與使用流程,涵蓋自動生成模型卡、互動小工具及 Inference API,並交代模型在 Hub 上的展示、調用與發現方式。