跳到正文

#Hugging Face

今日 0 條
4月25日週一
  1. Hugging Face Blog61

    Hugging Face 示範以機器學習篩選不滿意客户訊息

    文章示範以 amazon_reviews_multi 的英文資料微調 microsoft/deberta-v3-base,建立五類情感分類模型以篩選最不滿意的客户訊息。測試中,模型識別出約 95% 的極度不滿意訊息,並把約 12% 的中立或滿意訊息誤判為需要回覆。按每日 10,000 則訊息的假設估算,人工工作量可減少約 83%;文章指出,實際應用需要貼近業務情境的高質素訓練數據。

    推薦理由:文章由任務界定、資料集篩選延伸至微調與業務指標設計,展示如何把模型評估對準客服實際處理目標。

4月22日週五
4月13日週三
3月28日週一
3月22日週二
  1. Hugging Face Blog37

    Hugging Face 宣佈推出 AI 研究駐留計劃

    Hugging Face 宣佈推出為期 9 個月的 AI 研究駐留計劃,協助參加者開展或深化機器學習研究。參加者將與 Science Team 研究員共同選定研究問題,以開放協作方式開發機器學習技術;計劃只提供全職形式,並可在現居地工作。申請截止日期為 2022 年 4 月 3 日。

3月17日週四
3月16日週三
2月11日週五
1月21日週五
12月21日週二
  1. Hugging Face Blog68

    Hugging Face 收購 Gradio

    Hugging Face 收購 Gradio,並將與 Gradio 團隊繼續發展這套用於建立及分享機器學習模型 demo 的開源工具。Gradio 自 2019 年推出以來,已建立超過 300,000 個 demos,應用範圍涵蓋電腦視覺、文字、語音和影片。團隊表示,合作目標是讓任何能連接互聯網並使用瀏覽器的人都能接觸和使用機器學習模型。

    推薦理由:文章把收購置於 Gradio 推動模型易於展示、試用和收集回饋的脈絡中,並列出超過 300,000 個 demos 的既有使用規模。

11月29日週一
  1. Hugging Face Blog50

    Hugging Face 推出 Data Measurements Tool,供互動檢視資料集

    Hugging Face 推出開源 Data Measurements Tool,提供 Python 程式庫及免程式碼介面,供使用者探索、測量和比較 NLP 資料集。工具可呈現缺失值、詞彙與標籤分佈、重複項及嵌入聚類,並以詞對 nPMI 協助檢視資料中的刻板印象。alpha 版本(v0)目前以數個常見英文資料集示範功能,包括 SQuAD、imdb 和 C4。

10月26日週二
  1. Hugging Face Blog53

    Hugging Face 課程第二部分將於 11 月 15 日推出,並舉辦社羣活動

    Hugging Face 宣佈課程第二部分將於 11 月 15 日推出,並於 11 月 15 日至 16 日舉辦社羣活動。課程涵蓋 token 分類、因果與遮罩語言建模、翻譯、摘要和問答,並深入介紹 🤗 Datasets 與 🤗 Tokenizers。活動包括兩日演講及以 NLP 任務微調模型的團隊項目;AWS 將透過 Amazon SageMaker 向參與者提供免費運算資源。

9月14日週二
7月13日週二
7月8日週四
6月28日週一
  1. Hugging Face Blog61

    Hugging Face Hub 推出 Sentence Transformers 特徵擷取與句子相似度小工具

    Hugging Face Hub 為 Sentence Transformers 推出特徵擷取與句子相似度兩款小工具,並提供 Inference API 端點供程式調用模型。Hub 收錄超過 90 個預訓練 Sentence Transformers 模型,涵蓋超過 100 種語言,使用者可直接載入使用。

    推薦理由:文章梳理 Sentence Transformers 模型接入 Hugging Face Hub 的分享與使用流程,涵蓋自動生成模型卡、互動小工具及 Inference API,並交代模型在 Hub 上的展示、調用與發現方式。

5月25日週二
  1. Hugging Face Blog66

    如何使用 Gradio 2.0 載入及組合 Hugging Face 模型

    Gradio 2.0 讓使用者可用一行程式碼透過 GUI 載入並使用幾乎任何 Hugging Face 模型。預設會使用 Hugging Face 託管的 Inference API,可提供自己的 API key 或免 key 使用;亦可執行 `pip install transformers` 在本機運算。它支援多個模型並行或串聯,文中示範以 3 行程式碼翻譯並摘要芬蘭新聞文章。

    推薦理由:文章展示 Gradio 2.0 如何以一行程式碼建立模型 GUI,並串聯或並行組合 Hugging Face 模型,提供比較模型及串接多步任務的實作參考。

4月20日週二
  1. Hugging Face Blog58

    Hugging Face 解説 BERT 在 CPU 上的推理擴展(第一部分)

    Hugging Face 首篇系列文章以 BERT 為例,測試並分析 CPU 核心配置、NUMA 親和性與多模型實例如何影響推理延遲及吞吐量。結果顯示,小型及中型問題使用單一 socket 通常延遲較佳,大型問題則可利用雙 socket;多實例方案的吞吐量接近線性擴展。文中舉例,8 核實例為 0.808$/h,48 核機器則為 4.848$/h,前者成本降低 6x。

4月16日週五
  1. Hugging Face Blog63

    Hugging Face 推出 Accelerate,簡化 PyTorch 分散式訓練與混合精度支援

    Hugging Face 推出 Accelerate,PyTorch 訓練腳本加入五行程式碼後,即可支援不同分散式設定及混合精度訓練。Accelerate 提供統一 API,準備模型、最佳化器及 DataLoader,並處理裝置配置和反向傳播。

    推薦理由:Accelerate 將 PyTorch 分散式訓練及混合精度所需樣板封裝成少量 API 改動,並提供統一啟動器,呈現減少訓練腳本跨環境改動的實作方式。

3月23日週二
  1. Hugging Face Blog60

    Hugging Face 與 Amazon 宣佈戰略合作,推出 Amazon SageMaker Deep Learning Containers

    Hugging Face 與 Amazon 宣佈戰略合作,推出 Hugging Face Deep Learning Containers,讓用户可在 Amazon SageMaker 訓練 Hugging Face Transformer 模型。

    推薦理由:文章展示 Hugging Face 模型在 SageMaker 的訓練接入方式,並稱 SDK 擴展可把實驗設定與執行所需時間由數天縮至數分鐘。

3月12日週五
  1. Hugging Face Blog63

    如何使用 Hugging Face Transformers 微調 Wav2Vec2 英語語音辨識模型

    Hugging Face 教學示範如何使用 Transformers 將預訓練的 Wav2Vec2 base 微調為英語自動語音辨識模型。示範使用含 5h 訓練資料的 TIMIT,並在不使用語言模型的情況下以 CTC 訓練。模型在 TIMIT 測試集的 WER 為 0.221(22.1%)。

    推薦理由:這篇教學把資料清理、詞彙表與處理器設定、音訊取樣率處理、CTC 訓練及 WER 評估串成完整流程,並以 5h 的 TIMIT 訓練資料示範英語 ASR 微調。

2月9日週二
1月26日週二
3月1日週日
  1. Hugging Face Blog60

    如何使用 Transformers 的不同解碼方法生成文字

    Hugging Face 的 Transformers 教程以 GPT2 示範如何實作多種文字生成解碼方法。文章介紹貪心搜尋、束搜尋、temperature、Top-K 及 Top-p 採樣,説明各方法對重複、流暢度與隨機性的影響,並指出沒有一種方法適用所有開放式生成場景。

    推薦理由:文章以 GPT2 和 Transformers 範例比較貪心搜尋、Beam search 與 Top-K、Top-p 採樣,呈現各方法在生成重複、流暢度與隨機性上的取捨。