Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Shida, Xue, Feng, Wang, Xiangfeng, Ming, Anlong, Lin, Zhaowen, Zhang, Haiyang, Long, Teng, Sebe, Nicu, Shao, Yihua, Wang, Haozhe, Wang, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
An Efficient Learning-based Solver Comparable to Metaheuristics for the Capacitated Arc Routing Problem
di: Guo, Runze, et al.
Pubblicazione: (2024)
di: Guo, Runze, et al.
Pubblicazione: (2024)
Cues3D: Unleashing the Power of Sole NeRF for Consistent and Unique Instances in Open-Vocabulary 3D Panoptic Segmentation
di: Xue, Feng, et al.
Pubblicazione: (2025)
di: Xue, Feng, et al.
Pubblicazione: (2025)
SM4Depth: Seamless Monocular Metric Depth Estimation across Multiple Cameras and Scenes by One Model
di: Liu, Yihao, et al.
Pubblicazione: (2024)
di: Liu, Yihao, et al.
Pubblicazione: (2024)
Indoor Obstacle Discovery on Reflective Ground via Monocular Camera
di: Xue, Feng, et al.
Pubblicazione: (2024)
di: Xue, Feng, et al.
Pubblicazione: (2024)
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
Open-World Deepfake Attribution via Confidence-Aware Asymmetric Learning
di: Zheng, Haiyang, et al.
Pubblicazione: (2025)
di: Zheng, Haiyang, et al.
Pubblicazione: (2025)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
di: Li, Jinlong, et al.
Pubblicazione: (2026)
di: Li, Jinlong, et al.
Pubblicazione: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
AlignCAT: Visual-Linguistic Alignment of Category and Attribute for Weakly Supervised Visual Grounding
di: Wang, Yidan, et al.
Pubblicazione: (2025)
di: Wang, Yidan, et al.
Pubblicazione: (2025)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
di: Lin, Xinying, et al.
Pubblicazione: (2026)
di: Lin, Xinying, et al.
Pubblicazione: (2026)
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
di: Zhu, Lu, et al.
Pubblicazione: (2025)
di: Zhu, Lu, et al.
Pubblicazione: (2025)
The Devil Is in Gradient Entanglement: Energy-Aware Gradient Coordinator for Robust Generalized Category Discovery
di: Zheng, Haiyang, et al.
Pubblicazione: (2026)
di: Zheng, Haiyang, et al.
Pubblicazione: (2026)
RankFeat&RankWeight: Rank-1 Feature/Weight Removal for Out-of-distribution Detection
di: Song, Yue, et al.
Pubblicazione: (2023)
di: Song, Yue, et al.
Pubblicazione: (2023)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers
di: Li, Wenhao, et al.
Pubblicazione: (2025)
di: Li, Wenhao, et al.
Pubblicazione: (2025)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
Asymmetric GANs for Image-to-Image Translation
di: Tang, Hao, et al.
Pubblicazione: (2019)
di: Tang, Hao, et al.
Pubblicazione: (2019)
Efficient Traffic Prediction Through Spatio-Temporal Distillation
di: Zhang, Qianru, et al.
Pubblicazione: (2025)
di: Zhang, Qianru, et al.
Pubblicazione: (2025)
Superpowering Open-Vocabulary Object Detectors for X-ray Vision
di: Garcia-Fernandez, Pablo, et al.
Pubblicazione: (2025)
di: Garcia-Fernandez, Pablo, et al.
Pubblicazione: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos
di: Zuo, Zhi, et al.
Pubblicazione: (2025)
di: Zuo, Zhi, et al.
Pubblicazione: (2025)
Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving
di: Sun, Jiangxin, et al.
Pubblicazione: (2026)
di: Sun, Jiangxin, et al.
Pubblicazione: (2026)
Prototypical Hash Encoding for On-the-Fly Fine-Grained Category Discovery
di: Zheng, Haiyang, et al.
Pubblicazione: (2024)
di: Zheng, Haiyang, et al.
Pubblicazione: (2024)
Generalized Fine-Grained Category Discovery with Multi-Granularity Conceptual Experts
di: Zheng, Haiyang, et al.
Pubblicazione: (2025)
di: Zheng, Haiyang, et al.
Pubblicazione: (2025)
Textual Knowledge Matters: Cross-Modality Co-Teaching for Generalized Visual Class Discovery
di: Zheng, Haiyang, et al.
Pubblicazione: (2024)
di: Zheng, Haiyang, et al.
Pubblicazione: (2024)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
Rethinking the Learning Paradigm for Facial Expression Recognition
di: Wang, Weijie, et al.
Pubblicazione: (2022)
di: Wang, Weijie, et al.
Pubblicazione: (2022)
Loomis Painter: Reconstructing the Painting Process
di: Pobitzer, Markus, et al.
Pubblicazione: (2025)
di: Pobitzer, Markus, et al.
Pubblicazione: (2025)
Discriminative Anchor Learning for Efficient Multi-view Clustering
di: Qin, Yalan, et al.
Pubblicazione: (2024)
di: Qin, Yalan, et al.
Pubblicazione: (2024)
Event‐Triggered Distributed Secondary Control for Communication‐Efficient Frequency Restoration and Accurate Power Sharing in Islanded Microgrids
di: Anlong Yang, et al.
Pubblicazione: (2026)
di: Anlong Yang, et al.
Pubblicazione: (2026)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
Phase Error Sensitivity to Injection Signals in Multi-Phase Injection-Locked Ring Oscillators
di: Wang, Zhaowen
Pubblicazione: (2025)
di: Wang, Zhaowen
Pubblicazione: (2025)
Amplitude-to-Phase Conversion in Injection-Locked CMOS Ring Oscillators
di: Wang, Zhaowen
Pubblicazione: (2024)
di: Wang, Zhaowen
Pubblicazione: (2024)
Enhanced Multi-Scale Cross-Attention for Person Image Generation
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
Graph Transformer GANs with Graph Masked Modeling for Architectural Layout Generation
di: Tang, Hao, et al.
Pubblicazione: (2024)
di: Tang, Hao, et al.
Pubblicazione: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
Large Language Models for Multimodal Deformable Image Registration
di: Ma, Mingrui, et al.
Pubblicazione: (2024)
di: Ma, Mingrui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
An Efficient Learning-based Solver Comparable to Metaheuristics for the Capacitated Arc Routing Problem
di: Guo, Runze, et al.
Pubblicazione: (2024) -
Cues3D: Unleashing the Power of Sole NeRF for Consistent and Unique Instances in Open-Vocabulary 3D Panoptic Segmentation
di: Xue, Feng, et al.
Pubblicazione: (2025) -
SM4Depth: Seamless Monocular Metric Depth Estimation across Multiple Cameras and Scenes by One Model
di: Liu, Yihao, et al.
Pubblicazione: (2024) -
Indoor Obstacle Discovery on Reflective Ground via Monocular Camera
di: Xue, Feng, et al.
Pubblicazione: (2024) -
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
di: Tang, Hao, et al.
Pubblicazione: (2025)