SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wang, Jiankang, Zhang, Zhihan, Liu, Zhihang, Li, Yang, Ge, Jiannan, Xie, Hongtao, Zhang, Yongdong
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!