Google開發視覺編碼器VideoPrism,在通用影片理解任務表現優異

Google開發了一個針對廣泛影片理解任務設計的基礎視覺編碼器VideoPrism,研究人員藉由新的預訓練資料和建模策略,使其可以用於分類、定位(Localization)、檢索、字幕和問答等影片理解任務,並且在多個基準測試中表現優於專門為任務設計的模型。