Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Seo, Jinhwan, Cho, Yoonki, Noh, Junhyug, Yoon, Sung-eui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalizable Person Re-identification via Balancing Alignment and Uniformity
di: Cho, Yoonki, et al.
Pubblicazione: (2024)
di: Cho, Yoonki, et al.
Pubblicazione: (2024)
Radiometrically Consistent Gaussian Surfels for Inverse Rendering
di: Han, Kyu Beom, et al.
Pubblicazione: (2026)
di: Han, Kyu Beom, et al.
Pubblicazione: (2026)
Learning Event-guided Exposure-agnostic Video Frame Interpolation via Adaptive Feature Blending
di: Jung, Junsik, et al.
Pubblicazione: (2025)
di: Jung, Junsik, et al.
Pubblicazione: (2025)
Towards Test-time Efficient Visual Place Recognition via Asymmetric Query Processing
di: Kim, Jaeyoon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyoon, et al.
Pubblicazione: (2025)
Enhancing Visual Re-ranking through Denoising Nearest Neighbor Graph via Continuous CRF
di: Kim, Jaeyoon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoon, et al.
Pubblicazione: (2024)
AegisRF: Adversarial Perturbations Guided with Sensitivity for Protecting Intellectual Property of Neural Radiance Fields
di: Kim, Woo Jae, et al.
Pubblicazione: (2025)
di: Kim, Woo Jae, et al.
Pubblicazione: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025)
di: Gao, Shida, et al.
Pubblicazione: (2025)
What and When to Look?: Temporal Span Proposal Network for Video Relation Detection
di: Woo, Sangmin, et al.
Pubblicazione: (2021)
di: Woo, Sangmin, et al.
Pubblicazione: (2021)
Beyond Softmax: Dual-Branch Sigmoid Architecture for Accurate Class Activation Maps
di: Oh, Yoojin, et al.
Pubblicazione: (2025)
di: Oh, Yoojin, et al.
Pubblicazione: (2025)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
di: Fan, Rong, et al.
Pubblicazione: (2026)
di: Fan, Rong, et al.
Pubblicazione: (2026)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding
di: Hannan, Tanveer, et al.
Pubblicazione: (2025)
di: Hannan, Tanveer, et al.
Pubblicazione: (2025)
Moment Quantization for Video Temporal Grounding
di: Sun, Xiaolong, et al.
Pubblicazione: (2025)
di: Sun, Xiaolong, et al.
Pubblicazione: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
di: Yang, Zaiquan, et al.
Pubblicazione: (2025)
di: Yang, Zaiquan, et al.
Pubblicazione: (2025)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
di: Wang, Chendong, et al.
Pubblicazione: (2025)
di: Wang, Chendong, et al.
Pubblicazione: (2025)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
di: Chen, Qirui, et al.
Pubblicazione: (2024)
di: Chen, Qirui, et al.
Pubblicazione: (2024)
Grounding Everything in Tokens for Multimodal Large Language Models
di: Ren, Xiangxuan, et al.
Pubblicazione: (2025)
di: Ren, Xiangxuan, et al.
Pubblicazione: (2025)
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
di: Zhuang, Weijun, et al.
Pubblicazione: (2025)
di: Zhuang, Weijun, et al.
Pubblicazione: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
Beyond the Patch: Exploring Vulnerabilities of Visuomotor Policies via Viewpoint-Consistent 3D Adversarial Object
di: Lee, Chanmi, et al.
Pubblicazione: (2026)
di: Lee, Chanmi, et al.
Pubblicazione: (2026)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
di: Yoon, Hyungjun, et al.
Pubblicazione: (2024)
di: Yoon, Hyungjun, et al.
Pubblicazione: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
di: Huang, Xiaoshuang, et al.
Pubblicazione: (2024)
di: Huang, Xiaoshuang, et al.
Pubblicazione: (2024)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
di: Chen, Zheng, et al.
Pubblicazione: (2024)
di: Chen, Zheng, et al.
Pubblicazione: (2024)
Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
di: Xiong, Yuanhao, et al.
Pubblicazione: (2023)
di: Xiong, Yuanhao, et al.
Pubblicazione: (2023)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
di: Li, Jiaze, et al.
Pubblicazione: (2026)
di: Li, Jiaze, et al.
Pubblicazione: (2026)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery
di: Wang, Guankun, et al.
Pubblicazione: (2025)
di: Wang, Guankun, et al.
Pubblicazione: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
di: Gu, Xin, et al.
Pubblicazione: (2025)
di: Gu, Xin, et al.
Pubblicazione: (2025)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)
LLM4VG: Large Language Models Evaluation for Video Grounding
di: Feng, Wei, et al.
Pubblicazione: (2023)
di: Feng, Wei, et al.
Pubblicazione: (2023)
VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model
di: Wang, Hanqing, et al.
Pubblicazione: (2026)
di: Wang, Hanqing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Generalizable Person Re-identification via Balancing Alignment and Uniformity
di: Cho, Yoonki, et al.
Pubblicazione: (2024) -
Radiometrically Consistent Gaussian Surfels for Inverse Rendering
di: Han, Kyu Beom, et al.
Pubblicazione: (2026) -
Learning Event-guided Exposure-agnostic Video Frame Interpolation via Adaptive Feature Blending
di: Jung, Junsik, et al.
Pubblicazione: (2025) -
Towards Test-time Efficient Visual Place Recognition via Asymmetric Query Processing
di: Kim, Jaeyoon, et al.
Pubblicazione: (2025) -
Enhancing Visual Re-ranking through Denoising Nearest Neighbor Graph via Continuous CRF
di: Kim, Jaeyoon, et al.
Pubblicazione: (2024)