跳到正文

全部動態

今日 8 條
3月4日週二
  1. Hugging Face Blog64

    Hugging Face 與 JFrog 合作,將 JFrog 掃描器整合至 Hugging Face Hub

    Hugging Face 與 JFrog 合作,將 JFrog 掃描器整合至 Hugging Face Hub,以分析模型權重中的程式碼並減少誤報。現有 picklescan 按模組名稱作模式匹配,JFrog 則會解析程式碼、檢查潛在惡意用法,並可捕捉 pickle 與 Keras Lambda layers 的相關利用方式。

    推薦理由:JFrog 會解析模型權重中的程式碼,補充 picklescan 以模組名稱作模式匹配的檢查方式,並讓公開模型倉庫自動納入掃描。

  2. Hugging Face Blog69

    深入解析 Aya Vision:多語言多模態模型的技術設計與評測

    Cohere For AI 發佈 Aya Vision 8B 和 32B,這組開放權重視覺語言模型支援 23 種語言。Aya Vision 32B 在 mWildVision 的 23 種語言平均比較中,對參數量超過其 2 倍的模型取得 52% 至 72% 勝率。團隊亦公開 AyaVisionBench,涵蓋 23 種語言、9 類任務,每種語言有 135 組圖像與問題配對,供研究使用。

    推薦理由:文章拆解合成標註、多語言資料擴充與多模態模型合併等訓練做法,呈現 Aya Vision 的多語言視覺語言建模路徑。

2月28日週五
2月27日週四
2月25日週二
  1. OpenAI News29

    deep research 系統卡

    OpenAI 的 deep research 系統卡概述產品推出前完成的安全工作。這些工作包括外部紅隊測試、依據 Preparedness Framework 進行的前沿風險評估,以及針對主要風險領域內置的緩解措施。

  2. Hugging Face Blog62

    Hugging Face 推出 FastRTC,支援以 Python 建構即時音訊與影片 AI 應用

    Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。

    推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。

2月21日週五
  1. Hugging Face Blog63

    Google 發佈 SigLIP 2 多語言視覺語言編碼器系列

    Google 發佈 SigLIP 2 多語言視覺語言編碼器系列,加入新的訓練目標以提升語義理解、定位及密集特徵表現。訓練加入圖像描述與區域定位解碼器、自蒸餾的 Global-Local Loss 和 Masked Prediction Loss,並提供動態解析度 naflex 版本。

    推薦理由:SigLIP 2 把解碼器監督、自蒸餾與遮罩預測納入訓練,並提供動態解析度版本,展示提升局部語義表徵與適應不同長寬比的訓練思路。

2月20日週四
  1. Hugging Face Blog68

    SmolVLM2 將影片理解帶到各類裝置

    Hugging Face 發佈 SmolVLM2,提供 2.2B、500M 和 256M 三種影片理解模型,並從推出首日起支援 Transformers 和 MLX,後者提供 Python 及 Swift API。

    推薦理由:文章同時列出 2.2B、500M、256M 規模及 Video-MME 表現,方便比較不同參數量下的影片理解能力取捨。

2月19日週三
  1. Hugging Face Blog55

    Google 發佈 PaliGemma 2 Mix 指令式視覺語言模型

    Google 發佈 PaliGemma 2 Mix,這組視覺語言模型是在 OCR、長短圖像描述等任務上微調的 PaliGemma 2 版本。模型提供 3B、10B、28B 三種規模,以及 224 和 448 兩種解析度。模型涵蓋視覺問答、文件理解、圖中文字辨識和物件定位;物件偵測與圖像分割需使用任務前綴,其餘任務使用開放式提示詞表現較佳。

2月18日週二
2月17日週一
  1. Mistral AI55

    Mistral AI 推出 24B 區域語言模型 Mistral Saba

    Mistral 推出 24B 參數的區域語言模型 Mistral Saba,支援阿拉伯語及多種印度源語言,並在 Tamil 等南印度源語言上表現尤佳。Mistral 稱,Mistral Saba 的回答比規模超過其 5 倍的模型更準確、相關,且速度更快、成本更低。它可透過 API 使用,也可在客户安全環境內本地部署,並能在單 GPU 系統上以每秒超過 150 tokens 的速度回應。

2月14日週五
2月13日週四
  1. Hugging Face Blog60

    分類、文本嵌入與視覺嵌入處理 1B 筆輸入的成本與延遲評測

    這項基準測試比較文字分類、文本嵌入及視覺嵌入的推理配置,估算處理 1B 筆輸入的成本與延遲。在 nvidia-L4($0.8/hr)上,三類任務每 1B 筆輸入的成本分別為 $253.82、$409.44 和 $44,496.51;測試程式碼見 https://github.com/datavistics/encoder-analysis。

    推薦理由:三類實測呈現 GPU、batch size 與並行 VUs 對成本和延遲的影響,並提供可替換模型與硬件重跑的流程,供讀者估算自有配置處理 1B 筆輸入的開支。

2月12日週三
  1. Hugging Face Blog58

    如何為影片生成建立優質資料集

    Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。

2月10日週一
  1. OpenAI News46

    OpenAI 介紹智能時代

    OpenAI 首次在超級碗期間播放電視廣告,藉此引發公眾對 AI 新可能性的好奇。廣告希望人們認識到,AI 能像過往工具一樣,為生活帶來更多滿足感並提升生產力。

2月7日週五
  1. Mistral AI75

    Mistral AI 推出全新 le Chat,面向生活與工作場景

    Mistral AI 推出全新 le Chat AI 助手,面向生活與工作場景,並開始提供 iOS、Android 版本及 Pro、Team 方案。它支援網頁搜尋、文件上傳與摘要、圖像生成及沙盒程式碼執行;Flash Answers 預覽版向所有用户開放,速度最高可達 ~1000 words / sec。

    推薦理由:le Chat 整合文件分析、Code interpreter、圖像生成與日常助理用途,並以免費、Pro、Team及企業私有部署方案覆蓋不同場景。

2月6日週四
2月4日週二
  1. Hugging Face Blog53

    DABstep:面向多步推理的數據智能體基準

    Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。

2月3日週一
  1. OpenAI News76

    OpenAI 推出 deep research 研究智能體

    OpenAI 推出 deep research,這個智能體會運用推理整合大量網上資訊,並替用户完成多步驟研究任務。功能現時向 Pro 用户開放,Plus 和 Team 用户隨後可用。

    推薦理由:公告交代 deep research 如何處理網上資訊整合與多步驟研究任務,並列出 Pro、Plus、Team 的開放次序,方便了解其適用工作場景。

2月1日週六