Kakao Brain 發佈 ViT、ALIGN 模型及包含 700 million 對圖文的 COYO 資料集
Kakao Brain 與 Hugging Face 公開 ViT、ALIGN 視覺語言模型,以及由 700 million 對圖文構成的開源 COYO 資料集。
推薦理由:ViT 與 ALIGN 連同 COYO 訓練資料一併開放,並提供與 Google 版本的任務比較,呈現資料可取得性對視覺語言研究復現的價值。
文本之外的能力:視覺理解、圖文混合、音訊與影片的輸入輸出的模型與產品進展。
Kakao Brain 與 Hugging Face 公開 ViT、ALIGN 視覺語言模型,以及由 700 million 對圖文構成的開源 COYO 資料集。
推薦理由:ViT 與 ALIGN 連同 COYO 訓練資料一併開放,並提供與 Google 版本的任務比較,呈現資料可取得性對視覺語言研究復現的價值。
Hugging Face 介紹如何以開源模型建立 Document AI 方案,並按任務梳理文件分類、版面分析、文件解析、表格處理及文件問答。文中以 RVL-CDIP 為例,列出 BERT-base、DiT、LayoutLMv3 和 Donut 的文件分類準確率分別為 89%、92% 及 95%,並討論授權、數據準備、微調與評估等實作考量。
推薦理由:文章按文件類型與任務梳理 Document AI 模型選擇,並串連授權、數據準備和評估考量,提供從小規模微調起步的實作思路。
OpenAI 推出神經網絡 CLIP,讓模型透過自然語言監督高效學習視覺概念。只需提供待識別的視覺類別名稱,CLIP 即可套用於任何視覺分類基準,其零樣本能力類似 GPT-2 和 GPT-3。
推薦理由:CLIP 將自然語言監督與視覺分類連接,並以類別名稱作為套用基準的入口,呈現其零樣本使用方式。