LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Geng, Tiantian, Zhang, Jinrui, Wang, Qingni, Wang, Teng, Duan, Jinming, Zheng, Feng
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!