SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Wang, Jiankang, Zhang, Zhihan, Liu, Zhihang, Li, Yang, Ge, Jiannan, Xie, Hongtao, Zhang, Yongdong
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!

Documenti analoghi