使用 AWS 帳户訂閲 Hugging Face Enterprise Hub
Hugging Face 現可讓組織透過 AWS 帳户,在 AWS Marketplace 訂閲並升級至 Enterprise Hub,費用由 AWS 帳户管理。
Hugging Face 現可讓組織透過 AWS 帳户,在 AWS Marketplace 訂閲並升級至 Enterprise Hub,費用由 AWS 帳户管理。
Hugging Face 推出專為希伯來語 LLM 設計的開放排行榜,以語言專屬基準評估模型對希伯來語的理解與生成能力。排行榜涵蓋希伯來語問答、情感準確度、Winograd Schema Challenge 及英希互譯四項任務,採用 few-shot 提示詞;提交模型會透過 HuggingFace Inference Endpoints 部署,並由 lighteval 經 API 評估。
Hugging Face 引入 Artificial Analysis LLM Performance Leaderboard,集中比較逾 100 個無伺服器 LLM API 端點的品質、價格與速度。
推薦理由:榜單把逾 100 個無伺服器 LLM API 端點的品質、價格與速度指標集中呈現,並以多種提示長度和並行查詢組合供工程師比較。
Hugging Face 示範透過自訂 inference handler,在 Hugging Face Inference Endpoints 將 ASR、説話人分離與推測解碼整合至單一 API endpoint。
推薦理由:文章展示如何把 ASR、説話人分離與推測解碼組成單一端點,並以長短音訊基準説明推測解碼的效益會隨輸入長度改變。
StarCoder2-15B-Instruct-v0.1 採用全透明、寬鬆授權的自對齊流程訓練,未使用人工標註或大型專有 LLM 的蒸餾數據。流程以 StarCoder2-15B 從 The Stack V1 的種子函數生成指令,並透過沙箱執行測試篩選回答,最終形成包含 50k 組指令與回答的 SFT 數據集。
推薦理由:文章梳理了從 The Stack V1 種子函數生成指令,再以執行測試篩選回答的自對齊流程,説明程式碼模型如何利用自身生成數據進行微調。
Hugging Face 推出 Open CoT Leaderboard,透過比較 LLM 使用與不使用 CoT 提示時的準確率差值,衡量 CoT 帶來的準確率增益。
Open Medical-LLM Leaderboard 為醫療大語言模型提供標準化評測平台,按多種醫療任務與資料集比較表現。平台以準確率為主要指標,涵蓋 MedQA、MedMCQA、PubMedQA 及 MMLU 的醫學與生物學子集。
Meta 發佈開源大語言模型 Llama 3,提供 8B、70B 兩種參數規模,各有 base 與指令微調版本。模型上下文窗口為 8K tokens,另有以 Llama 3 8B 微調的 Llama Guard 2;授權允許再分發、微調和衍生作品,並要求衍生模型名稱以 Llama 3 開頭,衍生作品或服務標示 Built with Meta Llama 3。
推薦理由:文章梳理了 Llama 3 的型號、授權要求,以及 Hugging Face 上的推理部署和微調入口,呈現從模型取得到實際使用的主要路徑。
Zama 團隊示範如何透過 Hugging Face Endpoints 部署 Concrete ML 預編譯模型,讓使用者在加密資料上執行推理。文章以垃圾郵件決策樹為例,説明 Endpoint 部署、客户端設定及自製預編譯模型的流程。文中指出,CPU Endpoint 當時最多提供 8 vCPU 和 16 GB RAM,FHE 評估密鑰存於 Endpoint 的 RAM,重啟後需要重新傳送。
LiveCodeBench Leaderboard 推出,基於 UC Berkeley、MIT 和 Cornell 研究人員開發的 LiveCodeBench 基準評估程式碼大語言模型。
Ryght 藉助 Hugging Face 的專家支援,打造面向醫療及生命科學領域的生成式 AI 平台。平台採用可插拔 LLM 架構,並整合 TGI、TEI 及 Inference Endpoints,支援模型切換與開源嵌入模型服務。Ryght Preview 已向生命科學從業者公開,並以免費、安全平台提供。
Gradio reload mode 可在不重啟 Gradio server 的情況下載入來源檔案的最新變更,文章以此快速構建 AI 文件問答應用。
推薦理由:文章透過文件問答應用示範 Gradio reload mode,並説明如何用 gr.NO_RELOAD 保留客户端,減少開發迭代時重建資源的等待。
Hugging Face 發佈 Idefics2,這款 8B 參數多模態模型可接收文字與圖像序列並生成文字回應。模型權重採 Apache-2.0 授權,並已整合至 Transformers,支援圖像問答、OCR、圖表與文件理解。團隊亦公開 The Cauldron,收錄 50 個人工整理、供多輪對話使用的資料集。
推薦理由:Idefics2 同時公開 8B 權重、Apache-2.0 授權與多項視覺問答基準成績,便於對照小型多模態模型的效能表現和使用條件。
Hugging Face 推出 Deploy on Google Cloud 整合,讓用户可把 Hub 上的開放模型部署至 Vertex AI 或 GKE。所有帶有「text-generation-inference」標籤的模型均獲支援;Vertex Model Garden 提供數百個熱門開放 LLM 的即用測試硬件配置。
推薦理由:這項整合串起 Hugging Face 模型探索與 Google Cloud 部署,並為數百個熱門開放 LLM 提供測試硬件配置,呈現更直接的雲端部署流程。
Google 發佈面向程式碼的大語言模型家族 CodeGemma,推出 2B base、7B base 和 7B instruct 三種版本。模型以 Gemma checkpoint 為基礎,額外訓練 500 billion tokens,三款模型均採用 8K token 上下文窗口。
推薦理由:文章交代 CodeGemma 三種版本的用途,並列出 HumanEval 表現及 Hugging Face 的部署與量化整合,方便比較版本定位、基準表現和使用路徑。
Hugging Face 宣佈與 Wiz 合作,提升其平台及整體 AI/ML 生態的安全性。Wiz 研究團隊利用 pickle 在 Hugging Face 的沙盒計算環境中執行任意程式碼,發現環境缺陷;Hugging Face 表示已修復所有與 exploit 相關問題。
Hugging Face Blog 示範以 DuckDB-NSQL-7B 結合 Hugging Face Dataset Viewer API 和 DuckDB,將自然語言問題轉為 SQL 查詢資料集中的資料。
Hugging Face Blog 示範使用 🤗 Optimum Intel 對 SetFit 模型進行靜態訓練後量化,在 Intel Xeon CPU 上推理時,最高吞吐量較原始 Transformers fp32 模型提升 7.8x。
Lighthouz AI 與 Hugging Face 推出 Chatbot Guardrails Arena,讓社羣以對抗式對話測試聊天機械人防止敏感資料外洩的能力。
Hugging Face 發佈 Cosmopedia,這套合成數據集旨在重現 Phi-1.5 的訓練數據,供大語言模型預訓練使用。
推薦理由:文章拆解 Cosmopedia 從種子資料、提示詞擴展到去污染與訓練的流程,並交代如何藉由受眾和文體變化擴大提示詞規模。
Argilla 與 Hugging Face 發起 Data is Better Together 實驗,透過社羣協作建立提示詞排序偏好資料集,並邀請社羣加入首批共建項目。
BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。
推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。
Hugging Face 推出 TTS Arena,讓用户輸入文字、盲聽兩個文字轉語音模型合成的語音,並投票選出聽起來較自然的一方。模型名稱會在投票提交後揭示,結果將按類似 Elo 評分系統的算法生成公開排行榜,累積足夠票數後模型才會逐步顯示。啟動時納入 ElevenLabs(專有)、MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS。
Hugging Face Blog 示範如何使用 Hugging Face Transformers 和 PEFT,透過 LoRA 微調 Gemma 模型,並涵蓋 GPU 與 Cloud TPU 設定。
Hugging Face Blog 介紹 Matryoshka Embedding 模型的訓練與使用方法,並比較向量截短後與一般嵌入模型的表現。
推薦理由:文章把 Sentence Transformers 訓練方式與 STSBenchmark 實測相連,量化向量縮至原大小 8.3% 後仍保留 98.37% 表現。
Google 發佈 Gemma 開放大語言模型系列,提供 2B、7B 兩種規模,各有基礎版與指令微調版,所有版本的上下文窗口為 8K tokens。Hugging Face 將模型上架 Hub,整合 Transformers 4.38、Google Cloud 和 Inference Endpoints,並提供以 TRL 微調的示例。
推薦理由:文中將 Gemma 2B、7B 基礎模型與其他開放模型的 LLM Leaderboard 成績並列,呈現其不同參數規模下的相對表現。
Hugging Face 的 PEFT 新增多種面向 LoRA adapter 的合併方法,使用者可透過 `add_weighted_adapter()` 試驗不同組合。
推薦理由:文章逐項比較 cat、linear、SVD、TIES 與 DARE 等 LoRA 合併方法,並整理 rank、density 和 GPU 記憶體需求對實作選擇的影響。
Hugging Face 宣佈 TGI 自 1.4.0 起提供兼容 OpenAI Chat Completion API 的 Messages API,並將其提供於 Inference Endpoints。
推薦理由:文中以 Python、JavaScript、LangChain 和 LlamaIndex 示範如何沿用 OpenAI 相容介面接入開放模型,並交代 function calling 等限制。
Explosion 推出 Prodigy-HF,將 Prodigy 與 Hugging Face 生態系直接整合,支援以標註資料訓練及重用 Hugging Face 模型。插件可透過命令列微調命名實體識別及文本分類模型,並將訓練模型儲存至磁碟後上載至 Hugging Face Hub。使用者亦可把已標註資料集發佈至 Hugging Face Hub,供社羣共享。
Hugging Face Hub 為 Enterprise Hub 推出 Storage Regions,讓組織選擇模型與資料集的儲存區域。Enterprise Hub 組織可查看現有儲存庫所在區域,並選擇新儲存庫的區域;目前支援 US、EU,亞太區即將推出。
Hugging Face 示範以其 GitHub 組織內按 stargazers 排名前 10 的公開程式碼庫,微調 StarCoder 製作個人化程式碼助手 HugCoder。
推薦理由:文章示範以 Hugging Face 公開程式碼庫微調個人化程式碼助手,並對照 QLoRA 與全量微調的成本和 HumanEval 結果,呈現訓練資源與表現的取捨。
Renumics Spotlight 可直接讀取 Hugging Face datasets,讓使用者以一行程式碼建立互動式視覺化,檢視資料樣本與羣集。文章以 speech_commands 和 CIFAR-100 示範加入模型預測與嵌入向量,並利用相似度圖、混淆矩陣等視圖分析資料羣集及模型失敗模式。
Hugging Face 在 🤗 Diffusers 中測試多種 SDXL 推理優化方法,並於 A100 GPU(40 GB)比較其記憶體佔用和推理延遲。未優化管線為 28.09GB、72,200.5ms;fp16 + SDPA 降至 21.72GB、11,413.0ms,加入 torch.compile 後延遲為 10,296.7ms。
推薦理由:文章以 A100 測試數據對照 SDXL 加速與省記憶體方案的取捨,並説明 Tiny Autoencoder 可能省略部分圖像細節,提供按硬件限制與生成用途選擇配置的參考。
Hugging Face 推出 Inference for PROs,為 PRO 用户開放精選模型的專屬 API 端點,並提高免費 Inference API 的使用速率限制。服務提供可直接使用的 HTTP 端點,方便試驗及原型開發;文章指出它不適合重型生產應用,並建議此類用途使用 Inference Endpoints。
推薦理由:文中列出 PRO 可用的精選模型、端點呼叫方式及服務不適用於重型生產應用的邊界,便於評估其原型測試用途。
Hugging Face Blog 示範在 Diffusers 中優化 AudioLDM 2 推理,將 10.24 秒音頻樣本的生成時間由約 14 秒縮短至不足 1 秒,音質下降幅度輕微。
Code Llama 推出 7B、13B 和 34B 參數版本,是以 Llama 2 為基礎、專攻編碼任務的模型家族。基礎模型以 500 billion tokens 的程式碼資料訓練,另有 Python 專用版和指令微調版;模型採用與 Llama 2 相同的社羣授權,可商用。
推薦理由:文章並列 7B、13B、34B 參數規模、Python 與指令微調變體,以及 Hugging Face 接入方式,便於比較模型選擇和部署路徑。
Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。
推薦理由:文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。
Hugging Face 推出 SafeCoder 企業程式碼助手方案,讓客户在自家基礎設施訓練及部署,程式碼於訓練和推理期間不離開 VPC。SafeCoder 初始版本以 StarCoder 為基礎,可按客户私有程式碼庫微調;程式碼補全建議會對照 The Stack,顯示其是否匹配資料集中的程式碼及相關授權。SafeCoder 與 VMware 合作推出,現向 VMware 企業客户提供。
Hugging Face 發佈 IDEFICS,作為 Flamingo 的開放取用復現模型,可接收圖像與文字序列並生成文字。模型提供 9B 和 80B 規模及對話用途的 instruct 版本,訓練資料包括 Wikipedia、Public Multimodal Dataset、LAION 和 115B tokens 的 OBELICS。
推薦理由:IDEFICS 同時交代訓練資料、互動式資料集瀏覽工具、對抗提示評估與基礎模型授權,呈現開放多模態模型的建構和使用邊界。
Hugging Face 將 Hugging Face Hub 上架 AWS Marketplace,組織可透過 AWS 帳户訂閲並支付 Hugging Face 託管服務的用量費用。Inference Endpoints、Spaces Hardware Upgrades 和 AutoTrain 等服務的費用會併入 AWS 帳單,定價與 Hugging Face 公開價格相同。