跳到正文
原文
Hugging Face Blog·· 2024-06-24精選AI 評分63

Florence-2 微調教程:Microsoft 視覺語言模型的 DocVQA 實作

Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models

AI 導讀

Hugging Face Blog 示範以 DocVQA 微調 Microsoft 的 Florence-2,使其適配視覺問答任務。訓練 7 個 epochs 後,驗證集 Levenshtein 相似度由 0 升至 57.0。文中提供凍結視覺編碼器、batch size 6 的低資源方案,並記錄以 8 張 H100、batch size 64 微調全模型需時 70 分鐘。

推薦理由

文章以 DocVQA 示範 Florence-2 微調,並列出驗證集表現及不同 GPU 配置,可供評估下游任務適配與訓練資源。

來源:Hugging Face Blog · huggingface.co