Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Li, Zinuo, Zhang, Xian, Guo, Yongxin, Bennamoun, Mohammed, Boussaid, Farid, Dwivedi, Girish, Gong, Luqi, Ke, Qiuhong
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!