Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Sugandhika, Chinthani, Li, Chen, Rajan, Deepu, Fernando, Basura |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
Situational Scene Graph for Structured Human-centric Situation Understanding
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2024)
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2024)
IMoRe: Implicit Program-Guided Reasoning for Human Motion Q&A
di: Li, Chen, et al.
Pubblicazione: (2025)
di: Li, Chen, et al.
Pubblicazione: (2025)
Modelling Spatio-Temporal Interactions For Compositional Action Recognition
di: Rajendiran, Ramanathan, et al.
Pubblicazione: (2023)
di: Rajendiran, Ramanathan, et al.
Pubblicazione: (2023)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
di: Li, Chen, et al.
Pubblicazione: (2025)
di: Li, Chen, et al.
Pubblicazione: (2025)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025)
di: Gao, Shida, et al.
Pubblicazione: (2025)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2025)
di: Gu, Xin, et al.
Pubblicazione: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
Next-Frame Feature Prediction for Multimodal Deepfake Detection and Temporal Localization
di: Anshul, Ashutosh, et al.
Pubblicazione: (2025)
di: Anshul, Ashutosh, et al.
Pubblicazione: (2025)
VISTA: Video Interaction Spatio-Temporal Analysis Benchmark
di: Aparcedo, Alejandro, et al.
Pubblicazione: (2026)
di: Aparcedo, Alejandro, et al.
Pubblicazione: (2026)
Effectively Leveraging CLIP for Generating Situational Summaries of Images and Videos
di: Verma, Dhruv, et al.
Pubblicazione: (2024)
di: Verma, Dhruv, et al.
Pubblicazione: (2024)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
RCA: Region Conditioned Adaptation for Visual Abductive Reasoning
di: Zhang, Hao, et al.
Pubblicazione: (2023)
di: Zhang, Hao, et al.
Pubblicazione: (2023)
Improving Temporal Action Segmentation via Constraint-Aware Decoding
di: Ee, Yeo Keat, et al.
Pubblicazione: (2026)
di: Ee, Yeo Keat, et al.
Pubblicazione: (2026)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025)
di: Yao, Jiali, et al.
Pubblicazione: (2025)
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
di: Tu, Xuezhen, et al.
Pubblicazione: (2026)
di: Tu, Xuezhen, et al.
Pubblicazione: (2026)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
di: Zhao, Heng, et al.
Pubblicazione: (2026)
di: Zhao, Heng, et al.
Pubblicazione: (2026)
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
Predicting the Next Action by Modeling the Abstract Goal
di: Roy, Debaditya, et al.
Pubblicazione: (2022)
di: Roy, Debaditya, et al.
Pubblicazione: (2022)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
di: Yang, Zaiquan, et al.
Pubblicazione: (2025)
di: Yang, Zaiquan, et al.
Pubblicazione: (2025)
Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding
di: Kumar, Akash, et al.
Pubblicazione: (2025)
di: Kumar, Akash, et al.
Pubblicazione: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
di: Gu, Xin, et al.
Pubblicazione: (2025)
di: Gu, Xin, et al.
Pubblicazione: (2025)
Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
di: Fernando, Basura, et al.
Pubblicazione: (2025)
di: Fernando, Basura, et al.
Pubblicazione: (2025)
Inferring Past Human Actions in Homes with Abductive Reasoning
di: Tan, Clement, et al.
Pubblicazione: (2022)
di: Tan, Clement, et al.
Pubblicazione: (2022)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models
di: Seo, Jinhwan, et al.
Pubblicazione: (2025)
di: Seo, Jinhwan, et al.
Pubblicazione: (2025)
VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis
di: Park, Jinho, et al.
Pubblicazione: (2026)
di: Park, Jinho, et al.
Pubblicazione: (2026)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding
di: Li, Jinxuan, et al.
Pubblicazione: (2025)
di: Li, Jinxuan, et al.
Pubblicazione: (2025)
Video-Language Alignment via Spatio-Temporal Graph Transformer
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering
di: Parmar, Paritosh, et al.
Pubblicazione: (2025)
di: Parmar, Paritosh, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025) -
Situational Scene Graph for Structured Human-centric Situation Understanding
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2024) -
IMoRe: Implicit Program-Guided Reasoning for Human Motion Q&A
di: Li, Chen, et al.
Pubblicazione: (2025) -
Modelling Spatio-Temporal Interactions For Compositional Action Recognition
di: Rajendiran, Ramanathan, et al.
Pubblicazione: (2023) -
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)