用開放模型提升 OCR 流程
Hugging Face 更新開放 OCR 模型指南,加入 Chandra、OlmOCR-2 及模型在 OlmOCR Benchmark 的比較分數。指南對照多款模型的輸出格式、語言支援、功能與成本,並介紹 OmniDocBenchmark、OlmOCR-Bench 和 CC-OCR 等評測基準。
推薦理由:文章對照模型能力、輸出格式、評測基準與部署成本,並建議以代表性樣本檢驗不同文件和語言下的表現。
Hugging Face 更新開放 OCR 模型指南,加入 Chandra、OlmOCR-2 及模型在 OlmOCR Benchmark 的比較分數。指南對照多款模型的輸出格式、語言支援、功能與成本,並介紹 OmniDocBenchmark、OlmOCR-Bench 和 CC-OCR 等評測基準。
推薦理由:文章對照模型能力、輸出格式、評測基準與部署成本,並建議以代表性樣本檢驗不同文件和語言下的表現。
Hugging Face Blog 提供以 Optimum Intel 和 OpenVINO 在 Intel CPU 上本地運行 SmolVLM2-256M-Video-Instruct 的三步教程,涵蓋模型轉換、量化及推理。
推薦理由:文章展示 VLM 在 Intel CPU 上以 OpenVINO 完成轉換、兩種量化和推理的三步流程,並交代靜態量化校準與精度影響。
OpenAI 與 Broadcom 宣佈多年合作,計劃在 2029 年前部署 10 gigawatts 的 OpenAI 設計 AI 加速器。雙方亦將共同開發下一代系統及以太網方案,以支援可擴展且具能源效益的 AI 基礎設施。
推薦理由:這項多年合作把加速器部署、下一代系統共同開發與以太網方案連在一起,呈現其 AI 基礎設施建設所涵蓋的環節。
AMD 與 OpenAI 宣佈多年合作,計劃部署 6 gigawatts AMD Instinct GPUs,以支援 OpenAI 下一代 AI 基礎設施並加快全球 AI 創新。部署將於 2026 年從 1 gigawatt 開始。
推薦理由:合作涵蓋 6 gigawatts AMD Instinct GPUs,並安排 2026 年先部署 1 gigawatt,呈現 OpenAI 下一代 AI 基礎設施的建置規模與時間節點。
Hugging Face Blog 記錄將 RedNote 的 dots.ocr 視覺編碼器轉換至 Core ML,作為探索以 Core ML 和 MLX 在裝置端運行 OCR 的三篇系列首篇。
Samsung 與 SK 加入 OpenAI 的 Stargate 計劃,以擴大全球 AI 基礎設施。合作將擴充先進記憶體晶片產能,並在韓國建設新一代數據中心。
推薦理由:合作內容同時涵蓋先進記憶體晶片產能擴大與韓國新一代數據中心建設,呈現 Stargate 推進全球 AI 基礎設施的兩條實體建設路徑。
OpenAI 建立系統,快速擷取合約資料並轉化為可搜尋資料。系統縮短了處理時間,也讓團隊更容易取得所需細節。
OpenAI 運用 AI 改善支援服務,縮短回應時間、提升支援質素,並擴大支援規模以配合高速增長。
OpenAI、Oracle 與 SoftBank 宣佈 Stargate 新增五個 AI 數據中心站點,並加快美國 $500B、10-gigawatt 的基礎設施建設。該建設旨在支援下一代 AI,並創造數以萬計個職位。
推薦理由:公告將新增五個站點放在 $500B、10-gigawatt 的美國基建計劃中,並交代其支援下一代 AI 和創造數以萬計職位的目標。
Public AI 現已成為 Hugging Face Inference Providers 的支援服務商,用户可在 Hub 模型頁面及 Python、JS SDK 調用其推理服務。
Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。
推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。
Hugging Face 介紹如何在 ZeroGPU Spaces 使用 PyTorch AoT 編譯,將模型預先編譯後在不同程序中載入,以減少即時編譯造成的冷啟動開銷。
推薦理由:文章拆解 ZeroGPU Spaces 的 PyTorch AoT 編譯流程,並展示量化、動態形狀與區域編譯等可遷移的優化做法。
OpenAI 發佈 GPT OSS 開源模型系列,包含 117B 參數的 gpt-oss-120b 和 21B 參數的 gpt-oss-20b。兩款均為 MoE 推理模型,採用 MXFP4 4-bit 量化;gpt-oss-120b 可在單張 80 GB GPU 運行,gpt-oss-20b 可在 16GB 記憶體內運行。
推薦理由:文章將兩款模型的量化方式、硬件需求與多種部署路徑整理在一起,便於評估本地推理的資源門檻及接入方式。
OpenAI 宣佈啟動 Stargate Norway,這是其在 OpenAI for Countries 計劃下於歐洲的首個 AI 數據中心計劃。Stargate 是 OpenAI 的整體基礎設施平台,也是其長期願景中向所有人提供 AI 益處的重要部分。
Mistral AI 發佈 Codestral 25.08,並推出整合程式碼補全、語意檢索、Devstral 智能體工作流及 Mistral Code IDE 外掛的企業編碼技術棧。
推薦理由:文章把 Codestral 25.08、程式碼檢索、Devstral 智能體工作流與 IDE 管理整合為企業方案,並交代部署選項及安全治理設計。
Oracle 與 OpenAI 達成協議,將在美國開發 Stargate 額外 4.5 gigawatts 的數據中心容量。Stargate 是 OpenAI 的 AI 基礎設施平台,這項協議亦是該計劃的重要里程碑。OpenAI 表示,這項投資將創造新職位、加快美國再工業化並推進美國 AI 領導地位。
推薦理由:這項協議把 Stargate 在美國的新增數據中心容量明確為 4.5 gigawatts,呈現 OpenAI 與 Oracle 推進 AI 基礎設施建設的合作規模。
NVIDIA NIM 現可透過單一 Docker 容器部署 Hugging Face 上逾 100,000 個 LLM。NIM 會自動識別模型格式、架構和量化格式,並在 NVIDIA TensorRT-LLM、vLLM 與 SGLang 間選擇後端及套用預設設定。
推薦理由:文章展示 NIM 如何按模型格式、架構與量化方式自動選擇推理後端,並以部署示例説明從 Hugging Face 模型到 Docker 服務的操作流程。
Hugging Face 推出 ScreenEnv,這是一個可在 Docker 容器中建立隔離 Ubuntu 桌面環境、用於測試和部署 GUI 智能體的 Python 程式庫。
推薦理由:ScreenEnv 將桌面控制、Docker 隔離與 MCP/API 接入整合在同一工具,並以 smolagents 範例展示如何建立和執行桌面任務智能體。
Mistral AI 推出 AI for Citizens 協作倡議,協助各國政府及公共機構按本地需要制定 AI 策略並建設公共服務方案。倡議涵蓋自託管、由 Mistral AI 及本地夥伴營運的 AI 數據中心、SaaS 和無伺服器 API,並支援數據留在主權範圍內及按本地語言、文化和用途定製模型。
Hugging Face Blog 示範如何使用 Sentence Transformers 訓練及微調稀疏嵌入模型,介紹 SPLADE、Inference-free SPLADE、CSR 架構,以及資料、損失函數、評估器和訓練器的配置。
推薦理由:文章按 SPLADE、Inference-free SPLADE 與 CSR 的適用情境梳理架構選擇,並以實作例子串連資料、損失函數和評估器配置。
SGLang 新增 Hugging Face Transformers 後端整合,讓 Transformers 兼容模型可由 SGLang 執行,未獲原生支援時會自動切換至 Transformers 實作。
OpenAI 推出 OpenAI for Government,旨在向美國各地公務人員提供其最先進的 AI 工具。該計劃支持美國政府採用一流技術,並將這些工具用於服務公眾利益。
Hugging Face 將 Groq 加入 Inference Providers,讓使用者可在 Hub 模型頁面及 Python、JS 客户端 SDK 中透過 Groq 調用模型。
TNG 指出,長提示詞的 prefill 會阻塞後續請求,並在與 decode 共用 GPU 時拖慢已開始生成的請求。vLLM 的並行 partial prefill 可降低短請求的 time-to-first-token;例如可設定最多並行 4 個請求,當中最多 1 個的 prompt 超過 10,000 tokens。
Featherless AI 現已成為 Hugging Face Hub 支援的 Inference Provider,接入模型頁面及 Python、JS SDK 的無伺服器推理服務。
Mistral AI 推出 Mistral Compute,提供可按客户需求配置的私有整合式 AI 基礎設施,形態涵蓋裸金屬伺服器至全託管 PaaS。服務整合 GPU、編排、API、產品及服務,將提供最新 NVIDIA 參考架構,GPU 可用量達數萬枚,並於未來數年快速擴充。
推薦理由:Mistral Compute 將 GPU、編排、API、產品及服務整合為私有 AI 基礎設施,讓客户按需求配置,並提供由裸金屬伺服器至全託管 PaaS 的部署形態。
Hugging Face 與 NVIDIA 宣佈合作推出 Training Cluster as a Service,讓研究機構可按訓練需求申請 GPU 叢集,並按訓練運行時長付費。
推薦理由:服務將 GPU 叢集申請、算力採購、部署和訓練排程串起來,並按訓練時長付費,呈現研究機構如何依地區、規模與訓練週期取得所需算力。
Mistral AI 推出 Mistral Code,將編碼模型、IDE 助手、部署選項及企業管理工具整合為面向企業的 AI 編碼助手。產品現已為 JetBrains IDEs 和 VSCode 開放私測,正式版計劃稍後推出,部署方式包括 serverless、雲端及自託管。
OpenAI 正啟動 Stargate UAE,這是其 AI 基礎設施平台 Stargate 的首個國際部署。
推薦理由:原文將 Stargate UAE 定位為 Stargate 的國際部署,提供理解 OpenAI AI 基礎設施平台海外部署脈絡的具體案例。
Hugging Face Diffusers 文章比較五種量化後端在 FLUX.1-dev 上的記憶體佔用與推理時間。BF16 載入後約佔 31.447 GB,bitsandbytes 4-bit 為 12.584 GB、推理需 12 秒;torchao int4_weight_only 為 10.635 GB,但推理需 109 秒。
Microsoft 與 Hugging Face 擴大合作,Azure AI Foundry 現提供 10,000+ 個 Hugging Face 模型供部署,涵蓋文字、音訊和圖像等任務。
Hugging Face 表示,Transformers 將朝跨框架模型定義標準化發展,目標是讓其支援的模型架構更易被其他生態工具採用。目前 Transformers 支援 300+ 種模型架構,平均每週新增約 3 種;團隊計劃簡化建模程式碼和 API,並加強模組化模型定義。
推薦理由:文章交代 Transformers 希望成為跨框架模型定義的共同基礎,並列出簡化模型貢獻流程、提升訓練與推理工具互通的具體方向。
Mistral AI 推出由 Mistral Medium 3 驅動的 Le Chat Enterprise,將企業搜索、知識整合及自訂 AI 智能體納入同一平台。
推薦理由:Le Chat Enterprise 將企業搜索、知識整合、無代碼智能體建構與多種部署方式整合於同一方案,並交代首批連接器和功能推出節奏。
Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。
推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。
Gradio 不只是另一個 UI 函式庫,而是透過介面與 API 連接機器學習模型的框架,並提供效能、安全及回應能力保障。它可從單一實作自動生成 REST API 端點及 API 文件,並提供 API Recorder(4.26 引入)、Gradio 5.0 的伺服器端渲染(SSR)、佇列管理和即時串流等功能。
Hugging Face 與 Cloudflare 合作,讓 FastRTC 開發者可透過 Hugging Face token 使用 Cloudflare 的企業級 WebRTC 基礎設施。
Hugging Face 將 Llama 4 Maverick (~400B) 與 Scout (~109B) 的權重上架 Hub,並宣佈 Transformers 與 TGI 支援。
推薦理由:文章整理了長上下文所用的 NoPE、分塊注意力與 temperature tuning 設計,讓讀者瞭解 Llama 4 延伸上下文窗口的架構取捨。
Hugging Face 將 Intel Gaudi 硬件支援原生整合至 Text Generation Inference(TGI)主線程式碼,令大語言模型推理服務可直接部署於 Gaudi。整合支援 Gaudi1、Gaudi2、Gaudi3、多卡推理、視覺語言模型及 FP8 量化,並提供版本為 3.2.1-gaudi 的官方 Docker 映像。
DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。
推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。
Hugging Face 更新 Inference Endpoints 分析儀錶板,加入即時指標、自訂時間範圍、自動重新整理及副本生命週期檢視。儀錶板會即時顯示請求延遲、回應時間及錯誤率,後端亦經重新設計以加快載入,尤其是高流量端點。副本檢視可追蹤副本由初始化至終止的狀態轉換。