Kaggle 推出 Hugging Face 模型整合,串連模型頁與 Notebook
Kaggle 推出與 Hugging Face 的整合,讓 Hugging Face 模型可在 Kaggle 上被發現並連接至 Notebook 使用。
Kaggle 推出與 Hugging Face 的整合,讓 Hugging Face 模型可在 Kaggle 上被發現並連接至 Notebook 使用。
Hugging Face 為 Inference Endpoints 推出新的 OpenAI Whisper 部署方案,效能較前一版本最高提升 8 倍。
推薦理由:文章比較三款 Whisper 變體與 Transformers 基線的轉錄速度及 WER,呈現 Large V3 接近 8 倍的 RTFx 提升與各款相若的 WER 表現。
Gradio 不只是另一個 UI 函式庫,而是透過介面與 API 連接機器學習模型的框架,並提供效能、安全及回應能力保障。它可從單一實作自動生成 REST API 端點及 API 文件,並提供 API Recorder(4.26 引入)、Gradio 5.0 的伺服器端渲染(SSR)、佇列管理和即時串流等功能。
Hugging Face 收購 Pollen Robotics,並開始銷售其開源人形機械人 Reachy 2。Reachy 2 可透過 sales@pollen-robotics.com 電郵訂購,價格為 $70,000,適用於研究、教育和具身 AI 實驗,並兼容 VR。
推薦理由:這宗收購把 Hugging Face 的 LeRobot 開源機械人項目與 Pollen Robotics 的硬件團隊納入同一組織,呈現其軟硬件佈局。
Hugging Face 與 Cloudflare 合作,讓 FastRTC 開發者可透過 Hugging Face token 使用 Cloudflare 的企業級 WebRTC 基礎設施。
Hugging Face 將 Llama 4 Maverick (~400B) 與 Scout (~109B) 的權重上架 Hub,並宣佈 Transformers 與 TGI 支援。
推薦理由:文章整理了長上下文所用的 NoPE、分塊注意力與 temperature tuning 設計,讓讀者瞭解 Llama 4 延伸上下文窗口的架構取捨。
Hugging Face 將 Intel Gaudi 硬件支援原生整合至 Text Generation Inference(TGI)主線程式碼,令大語言模型推理服務可直接部署於 Gaudi。整合支援 Gaudi1、Gaudi2、Gaudi3、多卡推理、視覺語言模型及 FP8 量化,並提供版本為 3.2.1-gaudi 的官方 Docker 映像。
DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。
推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。
Hugging Face 更新 Inference Endpoints 分析儀錶板,加入即時指標、自訂時間範圍、自動重新整理及副本生命週期檢視。儀錶板會即時顯示請求延遲、回應時間及錯誤率,後端亦經重新設計以加快載入,尤其是高流量端點。副本檢視可追蹤副本由初始化至終止的狀態轉換。
Open R1 的指南示範如何在本機設定 OlympicCoder 7B,並將它接入 VS Code 作為編碼助手。流程使用 LM Studio 載入 LMStudio Community 的 4bit GGUF 版本,再透過 Continue.dev 連接至本機服務 http://localhost:1234/v1。
Hugging Face 已將首批模型與數據集倉庫由 LFS 遷移至 Xet 儲存,總量 4.5 TB,並把 Hub 約 6% 的下載流量切至 Xet 基礎設施。
推薦理由:文章以首批倉庫遷移為例,交代下載開銷與節點負載失衡如何在真實流量下浮現,以及分階段遷移如何避免服務中斷。
Google 發佈 Gemma 3 開放權重模型系列,提供 1B、4B、12B、27B 四種規模及預訓練、指令微調版本。4B、12B、27B 版本支援圖像和文字、140+ 種語言及 128k tokens 上下文;1B 版本僅支援文字和英文,提供 32k 上下文。
推薦理由:文章整理 Gemma 3 各版本的上下文、圖像與語言支援差異,並列出 Transformers、MLX 和 llama.cpp 的推理入口,方便比較使用路徑。
Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。
推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。
Hugging Face 與 JFrog 合作,將 JFrog 掃描器整合至 Hugging Face Hub,以分析模型權重中的程式碼並減少誤報。現有 picklescan 按模組名稱作模式匹配,JFrog 則會解析程式碼、檢查潛在惡意用法,並可捕捉 pickle 與 Keras Lambda layers 的相關利用方式。
推薦理由:JFrog 會解析模型權重中的程式碼,補充 picklescan 以模組名稱作模式匹配的檢查方式,並讓公開模型倉庫自動納入掃描。
Cohere For AI 發佈 Aya Vision 8B 和 32B,這組開放權重視覺語言模型支援 23 種語言。Aya Vision 32B 在 mWildVision 的 23 種語言平均比較中,對參數量超過其 2 倍的模型取得 52% 至 72% 勝率。團隊亦公開 AyaVisionBench,涵蓋 23 種語言、9 類任務,每種語言有 135 組圖像與問題配對,供研究使用。
推薦理由:文章拆解合成標註、多語言資料擴充與多模態模型合併等訓練做法,呈現 Aya Vision 的多語言視覺語言建模路徑。
Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。
推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。
Google 發佈 SigLIP 2 多語言視覺語言編碼器系列,加入新的訓練目標以提升語義理解、定位及密集特徵表現。訓練加入圖像描述與區域定位解碼器、自蒸餾的 Global-Local Loss 和 Masked Prediction Loss,並提供動態解析度 naflex 版本。
推薦理由:SigLIP 2 把解碼器監督、自蒸餾與遮罩預測納入訓練,並提供動態解析度版本,展示提升局部語義表徵與適應不同長寬比的訓練思路。
Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。
推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家無伺服器推理服務商,並將它們接入模型頁面及 JavaScript、Python 客户端 SDK。
Hugging Face Hub 新增 Fireworks.ai 推理服務支援,用户可在模型頁面及 HF 工具與函式庫中使用無伺服器推理。
這項基準測試比較文字分類、文本嵌入及視覺嵌入的推理配置,估算處理 1B 筆輸入的成本與延遲。在 nvidia-L4($0.8/hr)上,三類任務每 1B 筆輸入的成本分別為 $253.82、$409.44 和 $44,496.51;測試程式碼見 https://github.com/datavistics/encoder-analysis。
推薦理由:三類實測呈現 GPU、batch size 與並行 VUs 對成本和延遲的影響,並提供可替換模型與硬件重跑的流程,供讀者估算自有配置處理 1B 筆輸入的開支。
Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。
Open Arabic LLM Leaderboard 2 更新阿拉伯語大語言模型評測基準,移除飽和及機器翻譯任務,採用原生阿拉伯語或人工翻譯基準。
Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。
Hugging Face 將 fal、Replicate、Sambanova 和 Together AI 四家無伺服器推理服務整合至 Hub 模型頁面及 JS、Python SDK。用户可使用自己的供應商 API key 直接呼叫並由供應商收費,也可透過 Hugging Face 路由請求,按供應商標準 API 價格計費且不加價。
推薦理由:四家無伺服器推理服務接入 Hub 模型頁面及 SDK,文章亦交代自帶供應商 API key 與 Hugging Face 路由的調用和計費差異,便於評估接入方式。
Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。
推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。
Hugging Face 為 smolagents 加入視覺支援,使視覺語言模型可原生用於智能體流程。圖片可以在 agent.run() 時一次傳入,也可透過 step callback 動態加入 ActionStep;文章並以 helium 示範視覺網頁瀏覽智能體。
推薦理由:文章整理了 smolagents 接收初始圖片與逐步加入截圖的兩種方式,並以網頁瀏覽智能體示範如何用 callback 更新執行記憶。
Hugging Face 發佈 SmolVLM-256M 與 SmolVLM-500M 兩款視覺語言模型。兩款模型各有 base 及 instruction fine-tuned checkpoints,支援 Transformers、MLX 和 ONNX,另有 WebGPU 示範。
推薦理由:文章交代兩款模型的定位,以及較小視覺編碼器和 tokenization 調整等設計取捨,呈現小型 VLM 如何兼顧效率與多模態能力。
Hugging Face 為 Text Generation Inference(TGI)引入多後端架構,讓 TGI 作為統一前端接入不同推理引擎,並按模型、硬件及效能需求切換後端。團隊正與 NVIDIA TensorRT-LLM 團隊合作,並計劃於 Q1 '25 將 vLLM 整合為 TGI 後端。TGI Backends 將很快可於 Inference Endpoints 使用。
Hugging Face Blog 公開兩款靜態嵌入模型,稱其 CPU 推理比常見嵌入模型快 100 至 400 倍,且多項基準保留至少 85% 表現。
推薦理由:文章公開兩款模型的訓練配方與資料集,並以 NanoBEIR 結果呈現靜態嵌入模型在 CPU 速度與檢索品質間的取捨。
Hugging Face 從倫理角度分析 AI 智能體,指出自主性愈高、人類交出的控制愈多,相關風險也隨之增加,並建議不要開發完全自主的智能體。文章認為,半自主智能體的效益與風險取決於自主程度、可執行任務及人類控制方式,並梳理準確性、私隱、安全和信任等面向的取捨。作者建議建立嚴謹評估、追蹤社會影響並加強透明披露,也認為開源有助擴大參與和問責。
Hugging Face 推出 smolagents,讓語言模型智能體可用程式碼編寫動作。它提供以程式碼運作的 CodeAgent,也支援以 JSON/text 編寫動作的 ToolCallingAgent,並可透過 E2B 在沙盒環境執行。
推薦理由:文章説明程式碼表達動作在組合與重用上的優勢,並展示 smolagents 仍支援 JSON/text 工具調用。
Hugging Face Blog 介紹 NVIDIA 的 LogitsProcessorZoo,示範如何透過 logits 處理器控制語言模型的生成結果。示例涵蓋調整輸出長度、依據提示詞引導內容、強制加入指定結尾短語,以及讓模型在選擇題中只輸出選項。
Answer.AI 與 LightOn 發佈 ModernBERT,提供 base(149M params)及 large(395M params)兩種僅編碼器版本。
推薦理由:文章將 ModernBERT 的架構、效率與訓練改動連結至長上下文檢索及程式碼檢索場景,呈現編碼器更新對實際應用的意義。
IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。
推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。
Technology Innovation Institute(TII)發佈 Falcon3 開放模型系列,推出 Falcon3-1B-Base、Falcon3-3B-Base、Falcon3-7B-Base、Falcon3-10B-Base 及 Falcon3-Mamba-7B-Base 五款基礎模型。
Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言描述需求,無需編寫程式碼即可生成文字分類或聊天數據集。
推薦理由:文章展示由自然語言描述生成分類或聊天數據集,再用 Argilla 審核並交由 AutoTrain 訓練模型的流程,也説明如何自訂模型與生成配置。
Hugging Face 與 Entalpic 宣佈啟動開源協作計劃 LeMaterial,並發布首個數據集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD,含 6.7M 條目及 7 項材料屬性,採用 CC-BY-4.0 授權。
Hugging Face 的 83 款開源模型現可透過 Amazon Bedrock Marketplace 部署,模型端點由 Amazon SageMaker JumpStart 管理,並支援 Amazon Bedrock API。
推薦理由:材料交代 Hugging Face 的 83 款開源模型如何在 Bedrock Marketplace 部署,以及 SageMaker JumpStart 管理端點、Bedrock API 負責調用的服務銜接方式。
Data is Better Together 社羣發佈採 Apache 2.0 授權的文生圖偏好數據集 open-image-preferences-v1,涵蓋多種生成類別、模型系列及提示詞複雜度。