跳到正文

多模態

文本之外的能力:視覺理解、圖文混合、音訊與影片的輸入輸出的模型與產品進展。

最新精選

第 61–80 條 · 共 83 條
1月24日週五
  1. Hugging Face Blog62

    Hugging Face 為 smolagents 加入視覺語言模型支援

    Hugging Face 為 smolagents 加入視覺支援,使視覺語言模型可原生用於智能體流程。圖片可以在 agent.run() 時一次傳入,也可透過 step callback 動態加入 ActionStep;文章並以 helium 示範視覺網頁瀏覽智能體。

    推薦理由:文章整理了 smolagents 接收初始圖片與逐步加入截圖的兩種方式,並以網頁瀏覽智能體示範如何用 callback 更新執行記憶。

1月23日週四
  1. Hugging Face Blog67

    SmolVLM 推出 256M 與 500M 視覺語言模型

    Hugging Face 發佈 SmolVLM-256M 與 SmolVLM-500M 兩款視覺語言模型。兩款模型各有 base 及 instruction fine-tuned checkpoints,支援 Transformers、MLX 和 ONNX,另有 WebGPU 示範。

    推薦理由:文章交代兩款模型的定位,以及較小視覺編碼器和 tokenization 調整等設計取捨,呈現小型 VLM 如何兼顧效率與多模態能力。

12月5日週四
  1. Hugging Face Blog61

    Google 發佈 PaliGemma 2 視覺語言模型

    Google 發佈 PaliGemma 2 視覺語言模型,提供 3B、10B、28B 三種規模及 224x224、448x448、896x896 三種輸入解析度。

    推薦理由:PaliGemma 2 將前代單一 3B 規格擴展至 3B、10B、28B,並提供三種輸入解析度,呈現下游微調時在品質與效率間選擇的彈性。

11月26日週二
  1. Hugging Face Blog66

    Hugging Face 發佈 2B 視覺語言模型系列 SmolVLM,開放模型與訓練流程

    Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。

    推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。

11月18日週一
  1. Mistral AI76

    Mistral AI 為 le Chat 推出多項免費 beta 功能

    Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。

    推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。

10月1日週二
9月25日週三
  1. Hugging Face Blog79

    Meta 發佈 Llama 3.2,涵蓋視覺模型與裝置端小型模型

    Meta 發佈 Llama 3.2,共有 10 個開放權重模型,包括 5 個多模態模型和 5 個純文字模型,涵蓋 11B、90B 視覺模型及面向裝置端的 1B、3B 純文字模型。

    推薦理由:Llama 3.2 涵蓋 11B、90B 視覺模型與 1B、3B 裝置端純文字模型,並列出 Transformers、llama.cpp 等運行示例,可作為選擇部署路徑的參考。

9月17日週二
  1. Mistral AI70

    Mistral AI 發佈 Pixtral 12B 多模態模型

    Mistral AI 發佈 Pixtral 12B,這款多模態模型採用基於 Mistral Nemo 的 12B 參數解碼器,以及從零訓練的 400M 參數視覺編碼器。它支援不同尺寸與長寬比的圖像,並可在 128K tokens 上下文窗口中處理多張圖片;在 MMMU 推理基準上取得 52.5%。模型採用 Apache 2.0 授權,可透過 Le Chat 或 La Plateforme 試用。

    推薦理由:Mistral AI 以相同評測流程比較 Pixtral 12B 與多個開源及閉源模型,並列出 MMMU 52.5% 等基準結果,便於理解其多模態表現。

6月24日週一
  1. Hugging Face Blog63

    Florence-2 微調教程:Microsoft 視覺語言模型的 DocVQA 實作

    Hugging Face Blog 示範以 DocVQA 微調 Microsoft 的 Florence-2,使其適配視覺問答任務。訓練 7 個 epochs 後,驗證集 Levenshtein 相似度由 0 升至 57.0。文中提供凍結視覺編碼器、batch size 6 的低資源方案,並記錄以 8 張 H100、batch size 64 微調全模型需時 70 分鐘。

    推薦理由:文章以 DocVQA 示範 Florence-2 微調,並列出驗證集表現及不同 GPU 配置,可供評估下游任務適配與訓練資源。

5月14日週二
  1. Hugging Face Blog71

    PaliGemma:Google 的前沿開源視覺語言模型

    Google 發佈 PaliGemma,一系列可接收圖像與文字並輸出文字的開源視覺語言模型。模型結合 SigLIP-So400m 圖像編碼器與 Gemma-2B 文字解碼器,提供 PT、Mix、FT 三類檢查點及 224x224、448x448、896x896 三種解像度。PaliGemma 是單輪模型,不適用於對話;Mix 檢查點適合以自由文字提示進行通用推理,但僅供研究用途。

    推薦理由:文章整理 PT、Mix、FT 檢查點的用途,並指出高解像度會增加記憶體需求、多數任務的質素提升有限,有助按任務需要選擇模型。

  2. Sam Altman:Blog89

    GPT-4o 在 ChatGPT 免費提供,並推出新語音及影片模式

    OpenAI 在 ChatGPT 免費提供 GPT-4o,並推出新的語音及影片模式。Sam Altman 形容新模式的回應速度和表達能力達到人類水平,令與電腦交談感覺自然。他亦提到,會加入可選的個人化、存取用户資訊及代用户採取行動等能力。

    推薦理由:文章並列 GPT-4o 免費提供與新語音、影片模式,呈現 OpenAI 擴大高能力 AI 使用範圍和改善人機互動的兩個方向。

5月13日週一
4月15日週一
  1. Hugging Face Blog71

    Hugging Face 發佈 8B 多模態模型 Idefics2,採 Apache-2.0 授權

    Hugging Face 發佈 Idefics2,這款 8B 參數多模態模型可接收文字與圖像序列並生成文字回應。模型權重採 Apache-2.0 授權,並已整合至 Transformers,支援圖像問答、OCR、圖表與文件理解。團隊亦公開 The Cauldron,收錄 50 個人工整理、供多輪對話使用的資料集。

    推薦理由:Idefics2 同時公開 8B 權重、Apache-2.0 授權與多項視覺問答基準成績,便於對照小型多模態模型的效能表現和使用條件。

2月15日週四
  1. OpenAI News77

    OpenAI 探討影片生成模型作為世界模擬器,並介紹 Sora

    OpenAI 訓練文字條件式擴散模型,最大模型 Sora 可生成一分鐘高保真影片。模型在不同時長、解析度和長寬比的影片與圖像上聯合訓練,並以 Transformer 架構處理影片和圖像的時空區塊及潛在編碼。研究結果認為,擴大影片生成模型規模是構建通用物理世界模擬器的一條有前景路徑。

    推薦理由:文章交代影片與圖像的聯合訓練方式及時空區塊架構,並呈現 OpenAI 將影片生成規模化連結至物理世界模擬器的研究思路。

11月6日週一
9月25日週一
8月22日週二
  1. Hugging Face Blog69

    Hugging Face 發佈 IDEFICS,開放復現 Flamingo 視覺語言模型

    Hugging Face 發佈 IDEFICS,作為 Flamingo 的開放取用復現模型,可接收圖像與文字序列並生成文字。模型提供 9B 和 80B 規模及對話用途的 instruct 版本,訓練資料包括 Wikipedia、Public Multimodal Dataset、LAION 和 115B tokens 的 OBELICS。

    推薦理由:IDEFICS 同時交代訓練資料、互動式資料集瀏覽工具、對抗提示評估與基礎模型授權,呈現開放多模態模型的建構和使用邊界。

3月14日週二
  1. OpenAI News87

    OpenAI 發佈 GPT-4 多模態模型

    OpenAI 發佈 GPT-4,這是一款可接收圖像和文字輸入、輸出文字的大型多模態模型。它在多項專業及學術基準上達到人類水平表現,但在許多真實場景中的能力仍不及人類。

    推薦理由:材料同時交代 GPT-4 的圖像與文字輸入、文字輸出形式,以及基準表現和真實場景能力的差異,可幫助讀者把握其能力描述的範圍。