Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Seo, Jinhwan, Cho, Yoonki, Noh, Junhyug, Yoon, Sung-eui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Generalizable Person Re-identification via Balancing Alignment and Uniformity
von: Cho, Yoonki, et al.
Veröffentlicht: (2024)
von: Cho, Yoonki, et al.
Veröffentlicht: (2024)
Radiometrically Consistent Gaussian Surfels for Inverse Rendering
von: Han, Kyu Beom, et al.
Veröffentlicht: (2026)
von: Han, Kyu Beom, et al.
Veröffentlicht: (2026)
Learning Event-guided Exposure-agnostic Video Frame Interpolation via Adaptive Feature Blending
von: Jung, Junsik, et al.
Veröffentlicht: (2025)
von: Jung, Junsik, et al.
Veröffentlicht: (2025)
Towards Test-time Efficient Visual Place Recognition via Asymmetric Query Processing
von: Kim, Jaeyoon, et al.
Veröffentlicht: (2025)
von: Kim, Jaeyoon, et al.
Veröffentlicht: (2025)
Enhancing Visual Re-ranking through Denoising Nearest Neighbor Graph via Continuous CRF
von: Kim, Jaeyoon, et al.
Veröffentlicht: (2024)
von: Kim, Jaeyoon, et al.
Veröffentlicht: (2024)
AegisRF: Adversarial Perturbations Guided with Sensitivity for Protecting Intellectual Property of Neural Radiance Fields
von: Kim, Woo Jae, et al.
Veröffentlicht: (2025)
von: Kim, Woo Jae, et al.
Veröffentlicht: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
von: Wang, Jiankang, et al.
Veröffentlicht: (2025)
von: Wang, Jiankang, et al.
Veröffentlicht: (2025)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
von: Gao, Shida, et al.
Veröffentlicht: (2025)
von: Gao, Shida, et al.
Veröffentlicht: (2025)
What and When to Look?: Temporal Span Proposal Network for Video Relation Detection
von: Woo, Sangmin, et al.
Veröffentlicht: (2021)
von: Woo, Sangmin, et al.
Veröffentlicht: (2021)
Beyond Softmax: Dual-Branch Sigmoid Architecture for Accurate Class Activation Maps
von: Oh, Yoojin, et al.
Veröffentlicht: (2025)
von: Oh, Yoojin, et al.
Veröffentlicht: (2025)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
von: Fan, Rong, et al.
Veröffentlicht: (2026)
von: Fan, Rong, et al.
Veröffentlicht: (2026)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
von: Wu, Jianlong, et al.
Veröffentlicht: (2025)
von: Wu, Jianlong, et al.
Veröffentlicht: (2025)
SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding
von: Hannan, Tanveer, et al.
Veröffentlicht: (2025)
von: Hannan, Tanveer, et al.
Veröffentlicht: (2025)
Moment Quantization for Video Temporal Grounding
von: Sun, Xiaolong, et al.
Veröffentlicht: (2025)
von: Sun, Xiaolong, et al.
Veröffentlicht: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
von: Wasim, Syed Talal, et al.
Veröffentlicht: (2023)
von: Wasim, Syed Talal, et al.
Veröffentlicht: (2023)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
von: Sugandhika, Chinthani, et al.
Veröffentlicht: (2025)
von: Sugandhika, Chinthani, et al.
Veröffentlicht: (2025)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
von: Yang, Zaiquan, et al.
Veröffentlicht: (2025)
von: Yang, Zaiquan, et al.
Veröffentlicht: (2025)
Context-Guided Spatio-Temporal Video Grounding
von: Gu, Xin, et al.
Veröffentlicht: (2024)
von: Gu, Xin, et al.
Veröffentlicht: (2024)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
von: Wang, Chendong, et al.
Veröffentlicht: (2025)
von: Wang, Chendong, et al.
Veröffentlicht: (2025)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
von: Chen, Qirui, et al.
Veröffentlicht: (2024)
von: Chen, Qirui, et al.
Veröffentlicht: (2024)
Grounding Everything in Tokens for Multimodal Large Language Models
von: Ren, Xiangxuan, et al.
Veröffentlicht: (2025)
von: Ren, Xiangxuan, et al.
Veröffentlicht: (2025)
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
von: Zhuang, Weijun, et al.
Veröffentlicht: (2025)
von: Zhuang, Weijun, et al.
Veröffentlicht: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
von: Gu, Xin, et al.
Veröffentlicht: (2026)
von: Gu, Xin, et al.
Veröffentlicht: (2026)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
von: Ahmad, Ghazi Shazan, et al.
Veröffentlicht: (2025)
von: Ahmad, Ghazi Shazan, et al.
Veröffentlicht: (2025)
Beyond the Patch: Exploring Vulnerabilities of Visuomotor Policies via Viewpoint-Consistent 3D Adversarial Object
von: Lee, Chanmi, et al.
Veröffentlicht: (2026)
von: Lee, Chanmi, et al.
Veröffentlicht: (2026)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
von: Yoon, Hyungjun, et al.
Veröffentlicht: (2024)
von: Yoon, Hyungjun, et al.
Veröffentlicht: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
von: Huang, Xiaoshuang, et al.
Veröffentlicht: (2024)
von: Huang, Xiaoshuang, et al.
Veröffentlicht: (2024)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
von: Chen, Zheng, et al.
Veröffentlicht: (2024)
von: Chen, Zheng, et al.
Veröffentlicht: (2024)
Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
von: Xiong, Yuanhao, et al.
Veröffentlicht: (2023)
von: Xiong, Yuanhao, et al.
Veröffentlicht: (2023)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
von: Li, Jiaze, et al.
Veröffentlicht: (2026)
von: Li, Jiaze, et al.
Veröffentlicht: (2026)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
von: Munasinghe, Shehan, et al.
Veröffentlicht: (2024)
von: Munasinghe, Shehan, et al.
Veröffentlicht: (2024)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
von: Maaz, Muhammad, et al.
Veröffentlicht: (2025)
von: Maaz, Muhammad, et al.
Veröffentlicht: (2025)
EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery
von: Wang, Guankun, et al.
Veröffentlicht: (2025)
von: Wang, Guankun, et al.
Veröffentlicht: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
von: Gu, Xin, et al.
Veröffentlicht: (2025)
von: Gu, Xin, et al.
Veröffentlicht: (2025)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
von: Zhou, Zhiyu, et al.
Veröffentlicht: (2026)
von: Zhou, Zhiyu, et al.
Veröffentlicht: (2026)
LLM4VG: Large Language Models Evaluation for Video Grounding
von: Feng, Wei, et al.
Veröffentlicht: (2023)
von: Feng, Wei, et al.
Veröffentlicht: (2023)
VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model
von: Wang, Hanqing, et al.
Veröffentlicht: (2026)
von: Wang, Hanqing, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Generalizable Person Re-identification via Balancing Alignment and Uniformity
von: Cho, Yoonki, et al.
Veröffentlicht: (2024) -
Radiometrically Consistent Gaussian Surfels for Inverse Rendering
von: Han, Kyu Beom, et al.
Veröffentlicht: (2026) -
Learning Event-guided Exposure-agnostic Video Frame Interpolation via Adaptive Feature Blending
von: Jung, Junsik, et al.
Veröffentlicht: (2025) -
Towards Test-time Efficient Visual Place Recognition via Asymmetric Query Processing
von: Kim, Jaeyoon, et al.
Veröffentlicht: (2025) -
Enhancing Visual Re-ranking through Denoising Nearest Neighbor Graph via Continuous CRF
von: Kim, Jaeyoon, et al.
Veröffentlicht: (2024)