Hugging Face 為 smolagents 加入視覺語言模型支援
Hugging Face 為 smolagents 加入視覺支援,使視覺語言模型可原生用於智能體流程。圖片可以在 agent.run() 時一次傳入,也可透過 step callback 動態加入 ActionStep;文章並以 helium 示範視覺網頁瀏覽智能體。
推薦理由:文章整理了 smolagents 接收初始圖片與逐步加入截圖的兩種方式,並以網頁瀏覽智能體示範如何用 callback 更新執行記憶。
文本之外的能力:視覺理解、圖文混合、音訊與影片的輸入輸出的模型與產品進展。
Hugging Face 為 smolagents 加入視覺支援,使視覺語言模型可原生用於智能體流程。圖片可以在 agent.run() 時一次傳入,也可透過 step callback 動態加入 ActionStep;文章並以 helium 示範視覺網頁瀏覽智能體。
推薦理由:文章整理了 smolagents 接收初始圖片與逐步加入截圖的兩種方式,並以網頁瀏覽智能體示範如何用 callback 更新執行記憶。
Hugging Face 發佈 SmolVLM-256M 與 SmolVLM-500M 兩款視覺語言模型。兩款模型各有 base 及 instruction fine-tuned checkpoints,支援 Transformers、MLX 和 ONNX,另有 WebGPU 示範。
推薦理由:文章交代兩款模型的定位,以及較小視覺編碼器和 tokenization 調整等設計取捨,呈現小型 VLM 如何兼顧效率與多模態能力。
Google 發佈 PaliGemma 2 視覺語言模型,提供 3B、10B、28B 三種規模及 224x224、448x448、896x896 三種輸入解析度。
推薦理由:PaliGemma 2 將前代單一 3B 規格擴展至 3B、10B、28B,並提供三種輸入解析度,呈現下游微調時在品質與效率間選擇的彈性。
Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。
推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。
Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。
推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。
Mistral AI 發佈 Pixtral Large,一款基於 Mistral Large 2 的 124B 開放權重多模態模型,支援 128K 上下文窗口。
推薦理由:Pixtral Large 在 MathVista 得分 69.4%,並於 ChartQA、DocVQA 超越 GPT-4o 和 Gemini-1.5 Pro;這些結果提供數學視覺推理、圖表與文件理解的具體比較參照。
OpenAI 為微調 API 加入圖像支援,開發者現在可用圖像與文本微調 GPT-4o。此功能旨在提升 GPT-4o 的視覺能力。
推薦理由:這項更新把圖像納入 GPT-4o 的微調資料,並可與文本一同使用,讓開發者能用兩種資料形式針對視覺能力進行調整。
Meta 發佈 Llama 3.2,共有 10 個開放權重模型,包括 5 個多模態模型和 5 個純文字模型,涵蓋 11B、90B 視覺模型及面向裝置端的 1B、3B 純文字模型。
推薦理由:Llama 3.2 涵蓋 11B、90B 視覺模型與 1B、3B 裝置端純文字模型,並列出 Transformers、llama.cpp 等運行示例,可作為選擇部署路徑的參考。
Mistral AI 公佈多項更新,包括 Mistral Small v24.09、la Plateforme 免費層、模型降價及 le Chat 免費提供 Pixtral 12B 圖像理解。
推薦理由:免費層涵蓋開發者的實驗、評估與原型製作,價格表亦列出模型新舊費率及降幅,呈現試用門檻和 API 成本的變化。
Mistral AI 發佈 Pixtral 12B,這款多模態模型採用基於 Mistral Nemo 的 12B 參數解碼器,以及從零訓練的 400M 參數視覺編碼器。它支援不同尺寸與長寬比的圖像,並可在 128K tokens 上下文窗口中處理多張圖片;在 MMMU 推理基準上取得 52.5%。模型採用 Apache 2.0 授權,可透過 Le Chat 或 La Plateforme 試用。
推薦理由:Mistral AI 以相同評測流程比較 Pixtral 12B 與多個開源及閉源模型,並列出 MMMU 52.5% 等基準結果,便於理解其多模態表現。
Hugging Face Blog 示範以 DocVQA 微調 Microsoft 的 Florence-2,使其適配視覺問答任務。訓練 7 個 epochs 後,驗證集 Levenshtein 相似度由 0 升至 57.0。文中提供凍結視覺編碼器、batch size 6 的低資源方案,並記錄以 8 張 H100、batch size 64 微調全模型需時 70 分鐘。
推薦理由:文章以 DocVQA 示範 Florence-2 微調,並列出驗證集表現及不同 GPU 配置,可供評估下游任務適配與訓練資源。
Google 發佈 PaliGemma,一系列可接收圖像與文字並輸出文字的開源視覺語言模型。模型結合 SigLIP-So400m 圖像編碼器與 Gemma-2B 文字解碼器,提供 PT、Mix、FT 三類檢查點及 224x224、448x448、896x896 三種解像度。PaliGemma 是單輪模型,不適用於對話;Mix 檢查點適合以自由文字提示進行通用推理,但僅供研究用途。
推薦理由:文章整理 PT、Mix、FT 檢查點的用途,並指出高解像度會增加記憶體需求、多數任務的質素提升有限,有助按任務需要選擇模型。
OpenAI 在 ChatGPT 免費提供 GPT-4o,並推出新的語音及影片模式。Sam Altman 形容新模式的回應速度和表達能力達到人類水平,令與電腦交談感覺自然。他亦提到,會加入可選的個人化、存取用户資訊及代用户採取行動等能力。
推薦理由:文章並列 GPT-4o 免費提供與新語音、影片模式,呈現 OpenAI 擴大高能力 AI 使用範圍和改善人機互動的兩個方向。
OpenAI 宣佈 GPT-4 Omni(GPT-4o)為新的旗艦模型。該模型可即時跨音訊、視覺和文字進行推理。
推薦理由:公告把 GPT-4o 定位為新旗艦模型,並明確列出音訊、視覺和文字的即時推理能力,讓讀者掌握此次宣佈的多模態重點。
Hugging Face 發佈 Idefics2,這款 8B 參數多模態模型可接收文字與圖像序列並生成文字回應。模型權重採 Apache-2.0 授權,並已整合至 Transformers,支援圖像問答、OCR、圖表與文件理解。團隊亦公開 The Cauldron,收錄 50 個人工整理、供多輪對話使用的資料集。
推薦理由:Idefics2 同時公開 8B 權重、Apache-2.0 授權與多項視覺問答基準成績,便於對照小型多模態模型的效能表現和使用條件。
OpenAI 訓練文字條件式擴散模型,最大模型 Sora 可生成一分鐘高保真影片。模型在不同時長、解析度和長寬比的影片與圖像上聯合訓練,並以 Transformer 架構處理影片和圖像的時空區塊及潛在編碼。研究結果認為,擴大影片生成模型規模是構建通用物理世界模擬器的一條有前景路徑。
推薦理由:文章交代影片與圖像的聯合訓練方式及時空區塊架構,並呈現 OpenAI 將影片生成規模化連結至物理世界模擬器的研究思路。
OpenAI 在 DevDay 公佈 GPT-4 Turbo、GPT-4 Turbo with Vision、DALL·E 3 API、新的 Assistants API 等模型與開發者產品。GPT-4 Turbo 配備 128K 上下文窗口,價格較低。
推薦理由:GPT-4 Turbo 的 128K 上下文窗口與較低價格,連同 Vision 及多項 API,勾勒出 DevDay 公佈的模型與開發者產品範圍。
ChatGPT 現可看、聽及説話。
Hugging Face 發佈 IDEFICS,作為 Flamingo 的開放取用復現模型,可接收圖像與文字序列並生成文字。模型提供 9B 和 80B 規模及對話用途的 instruct 版本,訓練資料包括 Wikipedia、Public Multimodal Dataset、LAION 和 115B tokens 的 OBELICS。
推薦理由:IDEFICS 同時交代訓練資料、互動式資料集瀏覽工具、對抗提示評估與基礎模型授權,呈現開放多模態模型的建構和使用邊界。
OpenAI 發佈 GPT-4,這是一款可接收圖像和文字輸入、輸出文字的大型多模態模型。它在多項專業及學術基準上達到人類水平表現,但在許多真實場景中的能力仍不及人類。
推薦理由:材料同時交代 GPT-4 的圖像與文字輸入、文字輸出形式,以及基準表現和真實場景能力的差異,可幫助讀者把握其能力描述的範圍。