Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Yuan, Liping, Wang, Jiawei, Sun, Haomiao, Zhang, Yuchen, Lin, Yuan
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!