跳到正文
原文
Hugging Face Blog·· 2025-07-23AI 評分50

TimeScope:大型多模態模型能理解多長的影片?

TimeScope: How Long Can Your Video Large Multimodal Model Go?

AI 導讀

Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。

來源:Hugging Face Blog · huggingface.co