SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jiankang, Zhang, Zhihan, Liu, Zhihang, Li, Yang, Ge, Jiannan, Xie, Hongtao, Zhang, Yongdong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens
di: Lu, Zhuqiang, et al.
Pubblicazione: (2024)
di: Lu, Zhuqiang, et al.
Pubblicazione: (2024)
AlignZeg: Mitigating Objective Misalignment for Zero-shot Semantic Segmentation
di: Ge, Jiannan, et al.
Pubblicazione: (2024)
di: Ge, Jiannan, et al.
Pubblicazione: (2024)
Hallucination Mitigation Prompts Long-term Video Understanding
di: Sun, Yiwei, et al.
Pubblicazione: (2024)
di: Sun, Yiwei, et al.
Pubblicazione: (2024)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025)
di: Gao, Shida, et al.
Pubblicazione: (2025)
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
di: Tu, Xuezhen, et al.
Pubblicazione: (2026)
di: Tu, Xuezhen, et al.
Pubblicazione: (2026)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
di: Fan, Rong, et al.
Pubblicazione: (2026)
di: Fan, Rong, et al.
Pubblicazione: (2026)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
di: Yang, Zaiquan, et al.
Pubblicazione: (2025)
di: Yang, Zaiquan, et al.
Pubblicazione: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models
di: Seo, Jinhwan, et al.
Pubblicazione: (2025)
di: Seo, Jinhwan, et al.
Pubblicazione: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
di: Zhang, Jinglei, et al.
Pubblicazione: (2025)
di: Zhang, Jinglei, et al.
Pubblicazione: (2025)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025)
di: Yao, Jiali, et al.
Pubblicazione: (2025)
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2025)
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2025)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
di: Zhang, Huatian, et al.
Pubblicazione: (2026)
di: Zhang, Huatian, et al.
Pubblicazione: (2026)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
di: Li, Zeqian, et al.
Pubblicazione: (2025)
di: Li, Zeqian, et al.
Pubblicazione: (2025)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
Video-Language Alignment via Spatio-Temporal Graph Transformer
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
Expand VSR Benchmark for VLLM to Expertize in Spatial Rules
di: Xie, Peijin, et al.
Pubblicazione: (2024)
di: Xie, Peijin, et al.
Pubblicazione: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
VideoMamba: Spatio-Temporal Selective State Space Model
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
di: Zhao, Fufangchen, et al.
Pubblicazione: (2025)
di: Zhao, Fufangchen, et al.
Pubblicazione: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
IGD: Instructional Graphic Design with Multimodal Layer Generation
di: Qu, Yadong, et al.
Pubblicazione: (2025)
di: Qu, Yadong, et al.
Pubblicazione: (2025)
Attribute-formed Class-specific Concept Space: Endowing Language Bottleneck Model with Better Interpretability and Scalability
di: Zhang, Jianyang, et al.
Pubblicazione: (2025)
di: Zhang, Jianyang, et al.
Pubblicazione: (2025)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
di: Li, Jiaze, et al.
Pubblicazione: (2026)
di: Li, Jiaze, et al.
Pubblicazione: (2026)
EventMamba: Enhancing Spatio-Temporal Locality with State Space Models for Event-Based Video Reconstruction
di: Ge, Chengjie, et al.
Pubblicazione: (2025)
di: Ge, Chengjie, et al.
Pubblicazione: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
di: Gu, Xin, et al.
Pubblicazione: (2025)
di: Gu, Xin, et al.
Pubblicazione: (2025)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
Spatio-temporal Prompting Network for Robust Video Feature Extraction
di: Sun, Guanxiong, et al.
Pubblicazione: (2024)
di: Sun, Guanxiong, et al.
Pubblicazione: (2024)
Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models
di: Xia, Hou, et al.
Pubblicazione: (2025)
di: Xia, Hou, et al.
Pubblicazione: (2025)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
di: Lin, Xinying, et al.
Pubblicazione: (2026)
di: Lin, Xinying, et al.
Pubblicazione: (2026)
EtC: Temporal Boundary Expand then Clarify for Weakly Supervised Video Grounding with Multimodal Large Language Model
di: Li, Guozhang, et al.
Pubblicazione: (2023)
di: Li, Guozhang, et al.
Pubblicazione: (2023)
Temporal Grounding of Activities using Multimodal Large Language Models
di: Song, Young Chol
Pubblicazione: (2024)
di: Song, Young Chol
Pubblicazione: (2024)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens
di: Lu, Zhuqiang, et al.
Pubblicazione: (2024) -
AlignZeg: Mitigating Objective Misalignment for Zero-shot Semantic Segmentation
di: Ge, Jiannan, et al.
Pubblicazione: (2024) -
Hallucination Mitigation Prompts Long-term Video Understanding
di: Sun, Yiwei, et al.
Pubblicazione: (2024) -
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025) -
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
di: Tu, Xuezhen, et al.
Pubblicazione: (2026)