Hugging Face Inference Endpoints 推出 OpenAI Whisper 高速轉錄部署方案
Hugging Face 為 Inference Endpoints 推出新的 OpenAI Whisper 部署方案,效能較前一版本最高提升 8 倍。
推薦理由:文章比較三款 Whisper 變體與 Transformers 基線的轉錄速度及 WER,呈現 Large V3 接近 8 倍的 RTFx 提升與各款相若的 WER 表現。
Hugging Face 為 Inference Endpoints 推出新的 OpenAI Whisper 部署方案,效能較前一版本最高提升 8 倍。
推薦理由:文章比較三款 Whisper 變體與 Transformers 基線的轉錄速度及 WER,呈現 Large V3 接近 8 倍的 RTFx 提升與各款相若的 WER 表現。
OpenAI 在亞洲推出資料駐留,相關安排建基於其支援全球客户的企業級資料私隱、安全及合規計劃。
Mistral AI 推出由 Mistral Medium 3 驅動的 Le Chat Enterprise,將企業搜索、知識整合及自訂 AI 智能體納入同一平台。
推薦理由:Le Chat Enterprise 將企業搜索、知識整合、無代碼智能體建構與多種部署方式整合於同一方案,並交代首批連接器和功能推出節奏。
Lowe’s 與 OpenAI 合作打造 Mylow 和 Mylow Companion,為顧客及門市員工提供 AI 專家協助。這些工具讓複雜的家居改善項目更易規劃、推進及完成。
OpenAI 已在 ChatGPT 撤回上週的 GPT-4o 更新,用户目前改用行為較平衡的早期版本。被撤回的更新過度奉承或迎合,常被形容為 sycophantic。
推薦理由:公告同時交代撤回更新的原因與回退後的版本狀態,呈現 GPT-4o 行為調整對 ChatGPT 用户的直接影響。
Hugging Face 與 Cloudflare 合作,讓 FastRTC 開發者可透過 Hugging Face token 使用 Cloudflare 的企業級 WebRTC 基礎設施。
Hugging Face 將 Intel Gaudi 硬件支援原生整合至 Text Generation Inference(TGI)主線程式碼,令大語言模型推理服務可直接部署於 Gaudi。整合支援 Gaudi1、Gaudi2、Gaudi3、多卡推理、視覺語言模型及 FP8 量化,並提供版本為 3.2.1-gaudi 的官方 Docker 映像。
OpenAI 在 GPT‑4o 中推出原生圖像生成,並提升文字渲染與指令遵循能力。原文亦提及 ChatGPT Images 2.5。
推薦理由:原生圖像生成之外,文字渲染與指令遵循是明確列出的改進點,讀者可據此掌握 GPT‑4o 圖像功能此次更新的着力處。
Hugging Face 更新 Inference Endpoints 分析儀錶板,加入即時指標、自訂時間範圍、自動重新整理及副本生命週期檢視。儀錶板會即時顯示請求延遲、回應時間及錯誤率,後端亦經重新設計以加快載入,尤其是高流量端點。副本檢視可追蹤副本由初始化至終止的狀態轉換。
OpenAI 介紹 API 新一代音訊模型,文字轉語音模型可按開發者指示採用特定説話方式。例如,開發者可要求模型「像富有同理心的客服智能體那樣説話」,為語音智能體提供更多自訂空間。
推薦理由:開發者可用指示控制文字轉語音模型的説話方式,例如採用富有同理心的客服智能體語氣,讓語音智能體的表達方式有更多自訂空間。
OpenAI 分享 ChatGPT for Business 2025 年 3 月的最新發布。內容指出,ChatGPT 正變得更具互動性,可按團隊工作方式度身訂製,並更具智能體特性。
Hugging Face 已將首批模型與數據集倉庫由 LFS 遷移至 Xet 儲存,總量 4.5 TB,並把 Hub 約 6% 的下載流量切至 Xet 基礎設施。
推薦理由:文章以首批倉庫遷移為例,交代下載開銷與節點負載失衡如何在真實流量下浮現,以及分階段遷移如何避免服務中斷。
Mistral AI 推出 Mistral OCR 文件理解 API,可解析圖片與 PDF,並抽取文字、圖像、表格及公式。API mistral-ocr-latest 已在 la Plateforme 開放,每美元可處理 1000 頁,批次推理下每美元可處理頁數約增至兩倍;Mistral OCR 亦可在 le Chat 免費試用。
推薦理由:Mistral OCR 可解析 PDF、圖片中的表格與公式,並支援 JSON 輸出,展示文件接入 RAG 與 Agent 工作流的實際做法。
Hugging Face 與 JFrog 合作,將 JFrog 掃描器整合至 Hugging Face Hub,以分析模型權重中的程式碼並減少誤報。現有 picklescan 按模組名稱作模式匹配,JFrog 則會解析程式碼、檢查潛在惡意用法,並可捕捉 pickle 與 Keras Lambda layers 的相關利用方式。
推薦理由:JFrog 會解析模型權重中的程式碼,補充 picklescan 以模組名稱作模式匹配的檢查方式,並讓公開模型倉庫自動納入掃描。
Mercari 運用 GPT-4o mini 和 GPT-4 簡化賣家銷售流程、改善商品刊登並提升銷售。其線上市集功能包括 AI Listing Support 和 Mercari AI Assistant,為賣家提供支援並推動平台轉型。
Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。
推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家無伺服器推理服務商,並將它們接入模型頁面及 JavaScript、Python 客户端 SDK。
Hugging Face Hub 新增 Fireworks.ai 推理服務支援,用户可在模型頁面及 HF 工具與函式庫中使用無伺服器推理。
Open Arabic LLM Leaderboard 2 更新阿拉伯語大語言模型評測基準,移除飽和及機器翻譯任務,採用原生阿拉伯語或人工翻譯基準。
Mistral AI 推出全新 le Chat AI 助手,面向生活與工作場景,並開始提供 iOS、Android 版本及 Pro、Team 方案。它支援網頁搜尋、文件上傳與摘要、圖像生成及沙盒程式碼執行;Flash Answers 預覽版向所有用户開放,速度最高可達 ~1000 words / sec。
推薦理由:le Chat 整合文件分析、Code interpreter、圖像生成與日常助理用途,並以免費、Pro、Team及企業私有部署方案覆蓋不同場景。
OpenAI 在歐洲推出數據駐留;此安排建基於其支援全球客户的企業級數據私隱、安全及合規計劃。
OpenAI 推出 deep research,這個智能體會運用推理整合大量網上資訊,並替用户完成多步驟研究任務。功能現時向 Pro 用户開放,Plus 和 Team 用户隨後可用。
推薦理由:公告交代 deep research 如何處理網上資訊整合與多步驟研究任務,並列出 Pro、Plus、Team 的開放次序,方便了解其適用工作場景。
Hugging Face 將 fal、Replicate、Sambanova 和 Together AI 四家無伺服器推理服務整合至 Hub 模型頁面及 JS、Python SDK。用户可使用自己的供應商 API key 直接呼叫並由供應商收費,也可透過 Hugging Face 路由請求,按供應商標準 API 價格計費且不加價。
推薦理由:四家無伺服器推理服務接入 Hub 模型頁面及 SDK,文章亦交代自帶供應商 API key 與 Hugging Face 路由的調用和計費差異,便於評估接入方式。
Hugging Face 為 smolagents 加入視覺支援,使視覺語言模型可原生用於智能體流程。圖片可以在 agent.run() 時一次傳入,也可透過 step callback 動態加入 ActionStep;文章並以 helium 示範視覺網頁瀏覽智能體。
推薦理由:文章整理了 smolagents 接收初始圖片與逐步加入截圖的兩種方式,並以網頁瀏覽智能體示範如何用 callback 更新執行記憶。
Mistral AI 與 AFP 建立全球合作,將 AFP 新聞線稿接入 AI 助理 Le Chat,讓回答納入可靠、最新的新聞資訊。AFP 每日以法語、英語、西班牙語、葡萄牙語、德語及阿拉伯語製作 2,300 則新聞線稿,全球有 1,700 名記者。整合功能將於未來數週逐步向所有 Le Chat 用户推出。
Hugging Face 為 Text Generation Inference(TGI)引入多後端架構,讓 TGI 作為統一前端接入不同推理引擎,並按模型、硬件及效能需求切換後端。團隊正與 NVIDIA TensorRT-LLM 團隊合作,並計劃於 Q1 '25 將 vLLM 整合為 TGI 後端。TGI Backends 將很快可於 Inference Endpoints 使用。
Hugging Face 推出 smolagents,讓語言模型智能體可用程式碼編寫動作。它提供以程式碼運作的 CodeAgent,也支援以 JSON/text 編寫動作的 ToolCallingAgent,並可透過 E2B 在沙盒環境執行。
推薦理由:文章説明程式碼表達動作在組合與重用上的優勢,並展示 smolagents 仍支援 JSON/text 工具調用。
Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言描述需求,無需編寫程式碼即可生成文字分類或聊天數據集。
推薦理由:文章展示由自然語言描述生成分類或聊天數據集,再用 Argilla 審核並交由 AutoTrain 訓練模型的流程,也説明如何自訂模型與生成配置。
Hugging Face 與 Entalpic 宣佈啟動開源協作計劃 LeMaterial,並發布首個數據集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD,含 6.7M 條目及 7 項材料屬性,採用 CC-BY-4.0 授權。
Hugging Face 的 83 款開源模型現可透過 Amazon Bedrock Marketplace 部署,模型端點由 Amazon SageMaker JumpStart 管理,並支援 Amazon Bedrock API。
推薦理由:材料交代 Hugging Face 的 83 款開源模型如何在 Bedrock Marketplace 部署,以及 SageMaker JumpStart 管理端點、Bedrock API 負責調用的服務銜接方式。
Data is Better Together 社羣發佈採 Apache 2.0 授權的文生圖偏好數據集 open-image-preferences-v1,涵蓋多種生成類別、模型系列及提示詞複雜度。
OpenAI 推出 ChatGPT Pro,並以「擴大前沿 AI 的使用範圍」概括其方向;正文未提供更多產品功能、價格或可用性資訊。
BAAI 的 FlagEval Debate 平台讓大型模型透過多語言辯論賽互相比試,以評估其推理與語言能力。平台支援中文、英文、韓文和阿拉伯文,讓模型直接交鋒,供評估者比較觀點、邏輯推理及論證策略。評估結合辯論專家評審和用户投票,並允許模型團隊調整參數、策略與對話風格。
Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。
推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。
Mistral AI 推出 Batch API,讓 La Plateforme 上的 Mistral 模型以批次方式處理高流量請求,成本比同步 API 呼叫低 50%。
推薦理由:Batch API 將高流量請求的成本降至同步 API 呼叫的一半,並以檔案提交、處理後下載的流程,適合不要求同步回覆的批量任務。
Mistral AI 發佈 Mistral Moderation API,該 API 亦為 Le Chat 的審核服務提供支援。其 LLM 分類器按 9 個政策類別分類文本,並提供原始文本和對話內容兩種端點;對話端點會結合上下文分類最後一則訊息。
Argilla 2.4 新增免程式 UI 工作流程,讓使用者從 Hugging Face Hub 匯入資料集、配置欄位與問題,再收集人工回饋以整理微調或評測資料。首版只支援公開 Hub 資料集;部署在 Spaces 時,預設啟用 Hugging Face OAuth,讓 Hub 使用者參與標註。
OpenAI 推出 ChatGPT search,提供快速、及時的答案,並附上相關網頁來源連結。
推薦理由:ChatGPT search 提供快速、及時的答案並附相關網頁來源連結,材料呈現了它的核心搜尋回答形式。
Google DeepMind 與 Hugging Face 宣佈在 Transformers v4.46.0 推出 SynthID Text,讓生成時可加入文字水印,並透過分類器檢測水印。
推薦理由:文章梳理 SynthID Text 從生成端配置到分類器訓練的部署流程,並説明改寫、翻譯與事實性回答對水印效果的限制,便於評估適用場景。
Hugging Face 宣佈與 Protect AI 合作,並將 Guardian 整合至 Hub 掃描套件,所有公開模型倉庫在推送檔案後都會自動接受掃描。