Hugging Face 宣佈推出 Fellowship 計劃
Hugging Face 推出 Fellowship 計劃,支持不同背景的開源機器學習貢獻者擴大影響力,並鼓勵更多人參與。支援內容按個人需要而定,包括運算資源、周邊物資及 Hugging Face 官方認可;成為 Fellow 須由 Hugging Face 團隊成員或 Fellow 提名。
Hugging Face 推出 Fellowship 計劃,支持不同背景的開源機器學習貢獻者擴大影響力,並鼓勵更多人參與。支援內容按個人需要而定,包括運算資源、周邊物資及 Hugging Face 官方認可;成為 Fellow 須由 Hugging Face 團隊成員或 Fellow 提名。
Hugging Face 研究科學家 Sasha Luccioni 在訪談中談及她對機器學習模型與數據集的倫理、社會影響及環境足跡研究。她擔任 Big Science Workshop 碳足跡工作組共同主席,探討電子郵件排放與製造成本等環境影響,並參與數據整理和多語言工作,避免語料過度偏重英語。
Gradio 3.0 正式推出,全面重設前端,並加入可在 Python 中構建自訂 Web app 的低階 Gradio Blocks API。前端採用 Svelte 等技術,文章稱載荷更小、頁面載入更快;Dataframe 經改良,並新增 Gallery 和 TabbedInterface。
推薦理由:Gradio Blocks 的 Python 範例展示如何組合元件、事件與版面,構建多步驟互動介面,提供可借鑑的實作思路。
Hugging Face 第 2 部分 SaaS 專題彙集 Salesforce、Amplitude 等企業機器學習主管的觀點,聚焦 ML 的應用效益、落地挑戰與未來發展。
Hugging Face 開放首屆學生大使計劃申請,邀請修讀機器學習或在社羣推廣 ML 的學生參與,截止日期為 2022 年 6 月 13 日。計劃於 2022 年 6 月 30 日開始、12 月 31 日結束;獲選者可獲同儕交流網絡、Hugging Face 團隊工作坊與支援、最新項目及功能資訊、周邊商品與素材,以及官方大使認可。
Hugging Face 宣佈完成由 Lux Capital 領投的 $100 Million C 輪融資,Sequoia、Coatue 等也參與投資。Hugging Face Hub 當時託管 100,000 個預訓練模型及 10,000 個數據集,超過 10,000 家公司使用 Hugging Face 建構機器學習技術。公司表示將加大研究、開源、產品及負責任地普及 AI 的投入。
推薦理由:融資用途涵蓋研究、開源、產品與負責任地普及 AI,讀者可從中瞭解 Hugging Face 此輪募資要加速的方向。
Hugging Face Hub 接入 fastai,讓 fastai 使用者可用單行 Python 程式碼上傳 Learner,亦可從 Hub 載入模型。文章介紹 `push_to_hub_fastai` 和 `from_pretrained_fastai`,並示範 fastai 與 Blurr 的模型分享流程。
OpenAI 宣佈多項高層職務變動,稱這些調整反映近期進展,並將確保團隊持續朝下一個重大里程碑推進。
Hugging Face 的 Deep Reinforcement Learning Class 第一章介紹深度強化學習的基本框架,説明智能體如何透過與環境互動、採取行動並接收獎勵來學習。
作者結合 Kili 與 Hugging Face AutoTrain,為 Google Play 上 Medium 應用程式的評論建立主動學習分類流程,並對分類結果進行情感分析。
文章示範以 amazon_reviews_multi 的英文資料微調 microsoft/deberta-v3-base,建立五類情感分類模型以篩選最不滿意的客户訊息。測試中,模型識別出約 95% 的極度不滿意訊息,並把約 12% 的中立或滿意訊息誤判為需要回覆。按每日 10,000 則訊息的假設估算,人工工作量可減少約 83%;文章指出,實際應用需要貼近業務情境的高質素訓練數據。
推薦理由:文章由任務界定、資料集篩選延伸至微調與業務指標設計,展示如何把模型評估對準客服實際處理目標。
Hugging Face Hub 可用 huggingface_hub 的 emissions_thresholds 按模型訓練 CO2 排放篩選模型,Transformers 則可透過 CodeCarbonCallback 記錄訓練排放。
Hugging Face《Machine Learning Experts》專訪 Lewis Tunstall,談其 Transformers 工作及新書《NLP with Transformers》。他介紹 Transformers library 可將 PyTorch 模型匯出為 ONNX 格式,讓工程師進一步降低延遲、提高吞吐量。
Hugging Face 將 Decision Transformer 這種離線強化學習方法整合至 🤗 Transformers 函式庫及 Hugging Face Hub。
Hugging Face 宣佈推出為期 9 個月的 AI 研究駐留計劃,協助參加者開展或深化機器學習研究。參加者將與 Science Team 研究員共同選定研究問題,以開放協作方式開發機器學習技術;計劃只提供全職形式,並可在現居地工作。申請截止日期為 2022 年 4 月 3 日。
Hugging Face Blog 提供以自訂資料集微調 SegFormer 語義分割模型的教程,涵蓋資料準備、訓練和推理。示例使用自建的人行道標註資料集微調預訓練的 SegFormer B0,並以 mIoU 評估分割結果。教程亦介紹將模型推送至 Hugging Face Hub,並透過推理小工具試用。
🤗 datasets 教程示範為 10,000 張來自 British Library 數碼化書籍的插圖建立文字搜圖流程。作者使用 sentence_transformers 的 CLIP 將圖片和文字提示詞轉成嵌入向量,再以 FAISS 檢索相似圖片;完整數據集網址為 https://doi.org/10.21250/db17。
Hugging Face 提供端到端教程,示範如何以 Hugging Face Transformers、Amazon SageMaker 和 AWS Inferentia 加速 BERT 文本分類推理。
OpenAI 發佈 GPT-3 和 Codex 新版本,讓模型可以編輯或插入既有文本內容,而非只接續文本。
推薦理由:新版本把 GPT-3 和 Codex 的操作從接續既有文本擴展到編輯或插入內容,清楚呈現兩種文本處理方式的差異。
OpenAI 分享對已部署模型的安全與濫用問題的最新思考,期望協助其他 AI 開發者應對相關問題。
OpenAI 徵求大型語言模型經濟影響研究的意向,供有意探討該議題者表達研究興趣。
這篇教程示範使用 🤗 Datasets 與 🤗 Transformers,將預訓練模型 google/vit-base-patch16-224-in21k 微調為豆類葉片圖像分類器。
推薦理由:文章以 beans 葉片分類串起資料載入、ViT 圖像預處理、Trainer 微調與評估,並展示資料即時轉換及訓練參數設定。
OpenAI 表示,透過對齊研究訓練的 InstructGPT 比 GPT-3 更能遵循用户意圖,同時回答更真實、毒性更低。這些由人類參與訓練的模型已部署為 OpenAI API 的預設語言模型。
推薦理由:材料交代了 InstructGPT 相較 GPT-3 的改進方向、人類參與訓練方式及 API 預設部署,呈現對齊研究如何落到實際服務。
OpenAI 在 API 新增嵌入向量端點,支援自然語言與程式碼任務。端點可用於語義搜尋、聚類、主題建模和分類。
推薦理由:新端點涵蓋語義搜尋、聚類、主題建模與分類,呈現嵌入向量在自然語言及程式碼任務中的應用範圍。
Hugging Face 將 Stable-Baselines3 整合至 Hugging Face Hub,讓使用者可託管已儲存的模型,並載入社羣模型。Stable-Baselines3 是 PyTorch 深度強化學習程式庫,整合支援透過 `load_from_hub` 載入模型,並以 `push_to_hub` 上傳分享。
Hugging Face 收購 Gradio,並將與 Gradio 團隊繼續發展這套用於建立及分享機器學習模型 demo 的開源工具。Gradio 自 2019 年推出以來,已建立超過 300,000 個 demos,應用範圍涵蓋電腦視覺、文字、語音和影片。團隊表示,合作目標是讓任何能連接互聯網並使用瀏覽器的人都能接觸和使用機器學習模型。
推薦理由:文章把收購置於 Gradio 推動模型易於展示、試用和收集回饋的脈絡中,並列出超過 300,000 個 demos 的既有使用規模。
OpenAI 微調 GPT-3,讓它透過文字式網頁瀏覽器更準確地回答開放式問題。
OpenAI 宣佈推出 OpenAI Residency,作為支持及培育 AI 人才工作的一部分。
Hugging Face 推出開源 Data Measurements Tool,提供 Python 程式庫及免程式碼介面,供使用者探索、測量和比較 NLP 資料集。工具可呈現缺失值、詞彙與標籤分佈、重複項及嵌入聚類,並以詞對 nPMI 協助檢視資料中的刻板印象。alpha 版本(v0)目前以數個常見英文資料集示範功能,包括 SQuAD、imdb 和 C4。
OpenAI 宣佈其 API 現已不設候補名單,服務可用範圍進一步擴大。公告指出,擴大開放是安全方面進展促成的。
推薦理由:OpenAI API 免候補即可使用的變化,連結到安全方面的進展,提供了理解其擴大開放背景的線索。
Hugging Face 宣佈課程第二部分將於 11 月 15 日推出,並於 11 月 15 日至 16 日舉辦社羣活動。課程涵蓋 token 分類、因果與遮罩語言建模、翻譯、摘要和問答,並深入介紹 🤗 Datasets 與 🤗 Tokenizers。活動包括兩日演講及以 NLP 任務微調模型的團隊項目;AWS 將透過 Amazon SageMaker 向參與者提供免費運算資源。
Hugging Face 與 Graphcore 合作,讓開發者可在 Graphcore IPU 上以生產規模部署最佳化 Transformers。開源工具庫 Optimum 將提供經 Hugging Face 認證的硬件最佳化模型,首批 IPU 最佳化模型將於今年稍後登上 Optimum。
OpenAI 宣佈任命 Helen Toner 加入其董事會。
OpenAI 發佈改進版 Codex,這套 AI 系統可將自然語言轉換為程式碼,並自今日起透過 API 開放私人測試。
推薦理由:公告同時交代 Codex 的自然語言轉程式碼定位和 API 私人測試安排,讀者可掌握其用途與當時的接入範圍。
OpenAI 發佈 Triton 1.0,這是一種用於神經網絡 GPU 程式設計的類 Python 開源語言。它讓沒有 CUDA 經驗的研究人員也能編寫高效 GPU 程式碼;OpenAI 稱,多數情況下這些程式碼可媲美專家所能產出。
推薦理由:Triton 1.0 以類 Python 語言降低神經網絡 GPU 程式設計門檻,讓沒有 CUDA 經驗的研究人員也能編寫高效程式碼,OpenAI 稱多數情況下可媲美專家產出。
Hugging Face Hub 接入 spaCy,讓使用者可分享 spaCy pipelines,並在瀏覽器試用或透過 Inference API 調用模型。
推薦理由:這次整合把 spaCy pipeline 上傳、瀏覽器試用、NER 推理和安裝入口放在 Hub,呈現模型分享後如何被測試與接入應用。
Hugging Face 推出適用於 Amazon SageMaker 的 Inference DLC 和 Inference Toolkit,支援部署已訓練模型及 Model Hub 上 10,000+ 個公開模型。
推薦理由:文章分別示範訓練完成後、從 Amazon S3 檢查點及從 Model Hub 部署模型,並附上建立 SageMaker 推理端點的程式範例。
Hugging Face Hub 為 Sentence Transformers 推出特徵擷取與句子相似度兩款小工具,並提供 Inference API 端點供程式調用模型。Hub 收錄超過 90 個預訓練 Sentence Transformers 模型,涵蓋超過 100 種語言,使用者可直接載入使用。
推薦理由:文章梳理 Sentence Transformers 模型接入 Hugging Face Hub 的分享與使用流程,涵蓋自動生成模型卡、互動小工具及 Inference API,並交代模型在 Hub 上的展示、調用與發現方式。
OpenAI 最新研究發現,使用小型精選資料集進行微調,可改善語言模型在特定行為價值方面的表現。
Gradio 2.0 讓使用者可用一行程式碼透過 GUI 載入並使用幾乎任何 Hugging Face 模型。預設會使用 Hugging Face 託管的 Inference API,可提供自己的 API key 或免 key 使用;亦可執行 `pip install transformers` 在本機運算。它支援多個模型並行或串聯,文中示範以 3 行程式碼翻譯並摘要芬蘭新聞文章。
推薦理由:文章展示 Gradio 2.0 如何以一行程式碼建立模型 GUI,並串聯或並行組合 Hugging Face 模型,提供比較模型及串接多步任務的實作參考。