Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Liu, Yudong, Sun, Jingwei, Lin, Yueqian, Zhang, Jingyang, Yin, Ming, Wang, Qinsi, Zhang, Jianyi, Li, Hai, Chen, Yiran
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!