跳到正文

多模態

文本之外的能力:視覺理解、圖文混合、音訊與影片的輸入輸出的模型與產品進展。

最新精選

第 81–83 條 · 共 83 條
3月6日週一
11月21日週一
  1. Hugging Face Blog64

    Hugging Face 分享以開源模型加速 Document AI 的方法

    Hugging Face 介紹如何以開源模型建立 Document AI 方案,並按任務梳理文件分類、版面分析、文件解析、表格處理及文件問答。文中以 RVL-CDIP 為例,列出 BERT-base、DiT、LayoutLMv3 和 Donut 的文件分類準確率分別為 89%、92% 及 95%,並討論授權、數據準備、微調與評估等實作考量。

    推薦理由:文章按文件類型與任務梳理 Document AI 模型選擇,並串連授權、數據準備和評估考量,提供從小規模微調起步的實作思路。

1月5日週二
  1. OpenAI News74

    OpenAI 推出 CLIP,以自然語言監督學習視覺概念

    OpenAI 推出神經網絡 CLIP,讓模型透過自然語言監督高效學習視覺概念。只需提供待識別的視覺類別名稱,CLIP 即可套用於任何視覺分類基準,其零樣本能力類似 GPT-2 和 GPT-3。

    推薦理由:CLIP 將自然語言監督與視覺分類連接,並以類別名稱作為套用基準的入口,呈現其零樣本使用方式。