Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yue, Feng, Zhang, Zhaoxing, Jiao, Junming, Liang, Zhengyu, Cao, Shiwen, Zhang, Feifei, Shen, Rong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MASR: Self-Reflective Reasoning through Multimodal Hierarchical Attention Focusing for Agent-based Video Understanding
par: Cao, Shiwen, et autres
Publié: (2025)
par: Cao, Shiwen, et autres
Publié: (2025)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
par: Chen, Ruizhe, et autres
Publié: (2025)
par: Chen, Ruizhe, et autres
Publié: (2025)
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
par: Liu, Ye, et autres
Publié: (2024)
par: Liu, Ye, et autres
Publié: (2024)
EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding
par: Ahn, Geo, et autres
Publié: (2026)
par: Ahn, Geo, et autres
Publié: (2026)
Test-Time Temporal Sampling for Efficient MLLM Video Understanding
par: Wang, Kaibin, et autres
Publié: (2025)
par: Wang, Kaibin, et autres
Publié: (2025)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
par: Dong, Lu, et autres
Publié: (2025)
par: Dong, Lu, et autres
Publié: (2025)
MASRA: MLLM-Assisted Semantic-Relational Consistent Alignment for Video Temporal Grounding
par: Ran, Ran, et autres
Publié: (2026)
par: Ran, Ran, et autres
Publié: (2026)
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
par: Jung, Minjoon, et autres
Publié: (2026)
par: Jung, Minjoon, et autres
Publié: (2026)
Temporally Grounding Instructional Diagrams in Unconstrained Videos
par: Zhang, Jiahao, et autres
Publié: (2024)
par: Zhang, Jiahao, et autres
Publié: (2024)
Efficient Temporal Sentence Grounding in Videos with Multi-Teacher Knowledge Distillation
par: Liang, Renjie, et autres
Publié: (2023)
par: Liang, Renjie, et autres
Publié: (2023)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
par: Xu, Qi'ao, et autres
Publié: (2025)
par: Xu, Qi'ao, et autres
Publié: (2025)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
par: Ding, Yang, et autres
Publié: (2025)
par: Ding, Yang, et autres
Publié: (2025)
Context-Guided Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
Learning Temporally Consistent Video Depth from Video Diffusion Priors
par: Shao, Jiahao, et autres
Publié: (2024)
par: Shao, Jiahao, et autres
Publié: (2024)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
par: Gao, Shida, et autres
Publié: (2025)
par: Gao, Shida, et autres
Publié: (2025)
End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning
par: Zhang, Jinrong, et autres
Publié: (2023)
par: Zhang, Jinrong, et autres
Publié: (2023)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
par: Luo, Fuwen, et autres
Publié: (2025)
par: Luo, Fuwen, et autres
Publié: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2026)
par: Gu, Xin, et autres
Publié: (2026)
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
par: Zhang, Xiaowen, et autres
Publié: (2026)
par: Zhang, Xiaowen, et autres
Publié: (2026)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
par: Wang, Ye, et autres
Publié: (2025)
par: Wang, Ye, et autres
Publié: (2025)
Efficient Motion-Aware Video MLLM
par: Zhao, Zijia, et autres
Publié: (2025)
par: Zhao, Zijia, et autres
Publié: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
TempoControl: Temporal Attention Guidance for Text-to-Video Models
par: Schiber, Shira, et autres
Publié: (2025)
par: Schiber, Shira, et autres
Publié: (2025)
Moment Quantization for Video Temporal Grounding
par: Sun, Xiaolong, et autres
Publié: (2025)
par: Sun, Xiaolong, et autres
Publié: (2025)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Multi-Scale Contrastive Learning for Video Temporal Grounding
par: Nguyen, Thong Thanh, et autres
Publié: (2024)
par: Nguyen, Thong Thanh, et autres
Publié: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
par: Zeng, Wenzheng, et autres
Publié: (2025)
par: Zeng, Wenzheng, et autres
Publié: (2025)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
par: Guo, Chaohong, et autres
Publié: (2026)
par: Guo, Chaohong, et autres
Publié: (2026)
SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse
par: Sun, Yiming, et autres
Publié: (2025)
par: Sun, Yiming, et autres
Publié: (2025)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
par: Shen, Leqi, et autres
Publié: (2024)
par: Shen, Leqi, et autres
Publié: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
par: Wasim, Syed Talal, et autres
Publié: (2023)
par: Wasim, Syed Talal, et autres
Publié: (2023)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding
par: Ren, Junlong, et autres
Publié: (2025)
par: Ren, Junlong, et autres
Publié: (2025)
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
par: Li, Yunheng, et autres
Publié: (2025)
par: Li, Yunheng, et autres
Publié: (2025)
Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
par: Hu, Jingjing, et autres
Publié: (2024)
par: Hu, Jingjing, et autres
Publié: (2024)
FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding
par: Cao, Zhuo, et autres
Publié: (2024)
par: Cao, Zhuo, et autres
Publié: (2024)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
par: Cheng, Zixu, et autres
Publié: (2026)
par: Cheng, Zixu, et autres
Publié: (2026)
Documents similaires
-
MASR: Self-Reflective Reasoning through Multimodal Hierarchical Attention Focusing for Agent-based Video Understanding
par: Cao, Shiwen, et autres
Publié: (2025) -
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
par: Chen, Ruizhe, et autres
Publié: (2025) -
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
par: Liu, Ye, et autres
Publié: (2024) -
EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding
par: Ahn, Geo, et autres
Publié: (2026) -
Test-Time Temporal Sampling for Efficient MLLM Video Understanding
par: Wang, Kaibin, et autres
Publié: (2025)