跳到正文

#Hugging Face

今日 0 條
5月14日週三
5月13日週二
4月16日週三
4月14日週一
  1. Hugging Face Blog68

    Hugging Face 收購 Pollen Robotics,開始銷售 Reachy 2 開源人形機械人

    Hugging Face 收購 Pollen Robotics,並開始銷售其開源人形機械人 Reachy 2。Reachy 2 可透過 sales@pollen-robotics.com 電郵訂購,價格為 $70,000,適用於研究、教育和具身 AI 實驗,並兼容 VR。

    推薦理由:這宗收購把 Hugging Face 的 LeRobot 開源機械人項目與 Pollen Robotics 的硬件團隊納入同一組織,呈現其軟硬件佈局。

4月9日週三
4月5日週六
3月28日週五
3月27日週四
  1. Hugging Face Blog77

    DeepSeek-V3 0324 登上 Hugging Face Hub,四項基準分數均上升

    DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。

    推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。

3月21日週五
  1. Hugging Face Blog46

    Inference Endpoints 分析儀錶板煥新

    Hugging Face 更新 Inference Endpoints 分析儀錶板,加入即時指標、自訂時間範圍、自動重新整理及副本生命週期檢視。儀錶板會即時顯示請求延遲、回應時間及錯誤率,後端亦經重新設計以加快載入,尤其是高流量端點。副本檢視可追蹤副本由初始化至終止的狀態轉換。

3月20日週四
3月18日週二
3月12日週三
  1. Hugging Face Blog78

    Google 發佈 Gemma 3 開放權重模型,4B、12B、27B 版支援圖像、140+ 種語言及 128k tokens 上下文

    Google 發佈 Gemma 3 開放權重模型系列,提供 1B、4B、12B、27B 四種規模及預訓練、指令微調版本。4B、12B、27B 版本支援圖像和文字、140+ 種語言及 128k tokens 上下文;1B 版本僅支援文字和英文,提供 32k 上下文。

    推薦理由:文章整理 Gemma 3 各版本的上下文、圖像與語言支援差異,並列出 Transformers、MLX 和 llama.cpp 的推理入口,方便比較使用路徑。

3月7日週五
  1. Hugging Face Blog61

    用 React Native 在手機上本地執行 LLM 的入門指南

    Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。

    推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。

3月4日週二
  1. Hugging Face Blog64

    Hugging Face 與 JFrog 合作,將 JFrog 掃描器整合至 Hugging Face Hub

    Hugging Face 與 JFrog 合作,將 JFrog 掃描器整合至 Hugging Face Hub,以分析模型權重中的程式碼並減少誤報。現有 picklescan 按模組名稱作模式匹配,JFrog 則會解析程式碼、檢查潛在惡意用法,並可捕捉 pickle 與 Keras Lambda layers 的相關利用方式。

    推薦理由:JFrog 會解析模型權重中的程式碼,補充 picklescan 以模組名稱作模式匹配的檢查方式,並讓公開模型倉庫自動納入掃描。

  2. Hugging Face Blog69

    深入解析 Aya Vision:多語言多模態模型的技術設計與評測

    Cohere For AI 發佈 Aya Vision 8B 和 32B,這組開放權重視覺語言模型支援 23 種語言。Aya Vision 32B 在 mWildVision 的 23 種語言平均比較中,對參數量超過其 2 倍的模型取得 52% 至 72% 勝率。團隊亦公開 AyaVisionBench,涵蓋 23 種語言、9 類任務,每種語言有 135 組圖像與問題配對,供研究使用。

    推薦理由:文章拆解合成標註、多語言資料擴充與多模態模型合併等訓練做法,呈現 Aya Vision 的多語言視覺語言建模路徑。

2月25日週二
  1. Hugging Face Blog62

    Hugging Face 推出 FastRTC,支援以 Python 建構即時音訊與影片 AI 應用

    Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。

    推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。

2月21日週五
  1. Hugging Face Blog63

    Google 發佈 SigLIP 2 多語言視覺語言編碼器系列

    Google 發佈 SigLIP 2 多語言視覺語言編碼器系列,加入新的訓練目標以提升語義理解、定位及密集特徵表現。訓練加入圖像描述與區域定位解碼器、自蒸餾的 Global-Local Loss 和 Masked Prediction Loss,並提供動態解析度 naflex 版本。

    推薦理由:SigLIP 2 把解碼器監督、自蒸餾與遮罩預測納入訓練,並提供動態解析度版本,展示提升局部語義表徵與適應不同長寬比的訓練思路。

2月20日週四
  1. Hugging Face Blog68

    SmolVLM2 將影片理解帶到各類裝置

    Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。

    推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。

2月18日週二
2月14日週五
2月13日週四
  1. Hugging Face Blog60

    分類、文本嵌入與視覺嵌入處理 1B 筆輸入的成本與延遲評測

    這項基準測試比較文字分類、文本嵌入及視覺嵌入的推理配置,估算處理 1B 筆輸入的成本與延遲。在 nvidia-L4($0.8/hr)上,三類任務每 1B 筆輸入的成本分別為 $253.82、$409.44 和 $44,496.51;測試程式碼見 https://github.com/datavistics/encoder-analysis。

    推薦理由:三類實測呈現 GPU、batch size 與並行 VUs 對成本和延遲的影響,並提供可替換模型與硬件重跑的流程,供讀者估算自有配置處理 1B 筆輸入的開支。

2月12日週三
  1. Hugging Face Blog58

    如何為影片生成建立優質資料集

    Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。

2月10日週一
2月4日週二
  1. Hugging Face Blog53

    DABstep:面向多步推理的數據智能體基準

    Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。

1月28日週二
  1. Hugging Face Blog70

    Hugging Face Hub 整合 fal、Replicate、Sambanova 和 Together AI 的無伺服器推理服務

    Hugging Face 將 fal、Replicate、Sambanova 和 Together AI 四家無伺服器推理服務整合至 Hub 模型頁面及 JS、Python SDK。用户可使用自己的供應商 API key 直接呼叫並由供應商收費,也可透過 Hugging Face 路由請求,按供應商標準 API 價格計費且不加價。

    推薦理由:四家無伺服器推理服務接入 Hub 模型頁面及 SDK,文章亦交代自帶供應商 API key 與 Hugging Face 路由的調用和計費差異,便於評估接入方式。

1月27日週一
  1. Hugging Face Blog69

    Diffusers 中開源影片生成模型的現況

    Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。

    推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。

1月24日週五
  1. Hugging Face Blog62

    Hugging Face 為 smolagents 加入視覺語言模型支援

    Hugging Face 為 smolagents 加入視覺支援,使視覺語言模型可原生用於智能體流程。圖片可以在 agent.run() 時一次傳入,也可透過 step callback 動態加入 ActionStep;文章並以 helium 示範視覺網頁瀏覽智能體。

    推薦理由:文章整理了 smolagents 接收初始圖片與逐步加入截圖的兩種方式,並以網頁瀏覽智能體示範如何用 callback 更新執行記憶。

1月23日週四
  1. Hugging Face Blog67

    SmolVLM 推出 256M 與 500M 視覺語言模型

    Hugging Face 發佈 SmolVLM-256M 與 SmolVLM-500M 兩款視覺語言模型。兩款模型各有 base 及 instruction fine-tuned checkpoints,支援 Transformers、MLX 和 ONNX,另有 WebGPU 示範。

    推薦理由:文章交代兩款模型的定位,以及較小視覺編碼器和 tokenization 調整等設計取捨,呈現小型 VLM 如何兼顧效率與多模態能力。

1月16日週四
1月15日週三
1月13日週一
  1. Hugging Face Blog51

    AI 智能體已經到來,Hugging Face 探討其風險與未來方向

    Hugging Face 從倫理角度分析 AI 智能體,指出自主性愈高、人類交出的控制愈多,相關風險也隨之增加,並建議不要開發完全自主的智能體。文章認為,半自主智能體的效益與風險取決於自主程度、可執行任務及人類控制方式,並梳理準確性、私隱、安全和信任等面向的取捨。作者建議建立嚴謹評估、追蹤社會影響並加強透明披露,也認為開源有助擴大參與和問責。

12月31日週二
  1. Hugging Face Blog70

    Hugging Face 推出 smolagents 智能體程式庫,支援以程式碼編寫動作

    Hugging Face 推出 smolagents,讓語言模型智能體可用程式碼編寫動作。它提供以程式碼運作的 CodeAgent,也支援以 JSON/text 編寫動作的 ToolCallingAgent,並可透過 E2B 在沙盒環境執行。

    推薦理由:文章説明程式碼表達動作在組合與重用上的優勢,並展示 smolagents 仍支援 JSON/text 工具調用。

12月23日週一
12月19日週四
12月18日週三
  1. Hugging Face Blog67

    Bamba-9B 混合 Mamba2 模型發佈,vLLM 測試吞吐量最高達 Meta Llama 3.1 8B 的 2.5 倍

    IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。

    推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。

12月17日週二
12月16日週一
  1. Hugging Face Blog61

    Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言建立數據集

    Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言描述需求,無需編寫程式碼即可生成文字分類或聊天數據集。

    推薦理由:文章展示由自然語言描述生成分類或聊天數據集,再用 Argilla 審核並交由 AutoTrain 訓練模型的流程,也説明如何自訂模型與生成配置。

12月10日週二
12月9日週一
  1. Hugging Face Blog61

    Hugging Face 83 款開源模型現可在 Amazon Bedrock Marketplace 部署

    Hugging Face 的 83 款開源模型現可透過 Amazon Bedrock Marketplace 部署,模型端點由 Amazon SageMaker JumpStart 管理,並支援 Amazon Bedrock API。

    推薦理由:材料交代 Hugging Face 的 83 款開源模型如何在 Bedrock Marketplace 部署,以及 SageMaker JumpStart 管理端點、Bedrock API 負責調用的服務銜接方式。