Geng, T., Zhang, J., Wang, Q., Wang, T., Duan, J., & Zheng, F. (2024). LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos.
Chicago-Zitierstil (17. Ausg.)Geng, Tiantian, Jinrui Zhang, Qingni Wang, Teng Wang, Jinming Duan, und Feng Zheng. LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos. 2024.
MLA-Zitierstil (9. Ausg.)Geng, Tiantian, et al. LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos. 2024.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.