VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Cheng, Zesen, Leng, Sicong, Zhang, Hang, Xin, Yifei, Li, Xin, Chen, Guanzheng, Zhu, Yongxin, Zhang, Wenqi, Luo, Ziyang, Zhao, Deli, Bing, Lidong
Format: Preprint
Publié: 2024
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!