VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Wang, Yueqian, Meng, Xiaojun, Wang, Yuxuan, Liang, Jianxin, Wei, Jiansheng, Zhang, Huishuai, Zhao, Dongyan
Formato: Preprint
Publicado: 2024
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!