VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
Fuente:
arXiv
Guardado en:
| Autores principales: | Dong, Lu, Zhang, Haiyu, Lin, Han, Yan, Ziang, Zeng, Xiangyu, Zhang, Hongjie, Huang, Yifei, Wang, Yi, Ling, Zhen-Hua, Wang, Limin, Wang, Yali |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining
por: Dong, Lu, et al.
Publicado: (2025)
por: Dong, Lu, et al.
Publicado: (2025)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
por: Li, Xinhao, et al.
Publicado: (2025)
por: Li, Xinhao, et al.
Publicado: (2025)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025)
por: Yan, Ziang, et al.
Publicado: (2025)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
por: Zeng, Xiangyu, et al.
Publicado: (2026)
por: Zeng, Xiangyu, et al.
Publicado: (2026)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
por: Zhang, Hongjie, et al.
Publicado: (2023)
por: Zhang, Hongjie, et al.
Publicado: (2023)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)
por: Zeng, Xiangyu, et al.
Publicado: (2024)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
por: Wang, Chenting, et al.
Publicado: (2025)
por: Wang, Chenting, et al.
Publicado: (2025)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
por: Chen, Houlun, et al.
Publicado: (2026)
por: Chen, Houlun, et al.
Publicado: (2026)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
por: Wang, Yi, et al.
Publicado: (2024)
por: Wang, Yi, et al.
Publicado: (2024)
Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
por: Yang, Min, et al.
Publicado: (2024)
por: Yang, Min, et al.
Publicado: (2024)
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Video-R1: Reinforcing Video Reasoning in MLLMs
por: Feng, Kaituo, et al.
Publicado: (2025)
por: Feng, Kaituo, et al.
Publicado: (2025)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
por: Yue, Feng, et al.
Publicado: (2025)
por: Yue, Feng, et al.
Publicado: (2025)
Moment Quantization for Video Temporal Grounding
por: Sun, Xiaolong, et al.
Publicado: (2025)
por: Sun, Xiaolong, et al.
Publicado: (2025)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
por: Chen, Ruizhe, et al.
Publicado: (2025)
por: Chen, Ruizhe, et al.
Publicado: (2025)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
por: Yue, Zhengrong, et al.
Publicado: (2025)
por: Yue, Zhengrong, et al.
Publicado: (2025)
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
por: Li, Xinhao, et al.
Publicado: (2024)
por: Li, Xinhao, et al.
Publicado: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
por: Li, Kunchang, et al.
Publicado: (2024)
por: Li, Kunchang, et al.
Publicado: (2024)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
por: Wang, Zikang, et al.
Publicado: (2025)
por: Wang, Zikang, et al.
Publicado: (2025)
Make Your Training Flexible: Towards Deployment-Efficient Video Models
por: Wang, Chenting, et al.
Publicado: (2025)
por: Wang, Chenting, et al.
Publicado: (2025)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
por: Zeng, Xiangyu, et al.
Publicado: (2025)
por: Zeng, Xiangyu, et al.
Publicado: (2025)
VRAgent-R1: Boosting Video Recommendation with MLLM-based Agents via Reinforcement Learning
por: Chen, Siran, et al.
Publicado: (2025)
por: Chen, Siran, et al.
Publicado: (2025)
RIVER: A Real-Time Interaction Benchmark for Video LLMs
por: Shi, Yansong, et al.
Publicado: (2026)
por: Shi, Yansong, et al.
Publicado: (2026)
End-to-End Dense Video Grounding via Parallel Regression
por: Shi, Fengyuan, et al.
Publicado: (2021)
por: Shi, Fengyuan, et al.
Publicado: (2021)
VideoChat: Chat-Centric Video Understanding
por: Li, KunChang, et al.
Publicado: (2023)
por: Li, KunChang, et al.
Publicado: (2023)
AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset
por: Zhang, Haiyu, et al.
Publicado: (2025)
por: Zhang, Haiyu, et al.
Publicado: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025)
por: Meng, Jiahao, et al.
Publicado: (2025)
Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph
por: Wang, Wentao, et al.
Publicado: (2025)
por: Wang, Wentao, et al.
Publicado: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
por: Wang, Shihao, et al.
Publicado: (2025)
por: Wang, Shihao, et al.
Publicado: (2025)
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
por: Jung, Minjoon, et al.
Publicado: (2026)
por: Jung, Minjoon, et al.
Publicado: (2026)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
por: Chen, Guo, et al.
Publicado: (2024)
por: Chen, Guo, et al.
Publicado: (2024)
Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding
por: Ren, Junlong, et al.
Publicado: (2025)
por: Ren, Junlong, et al.
Publicado: (2025)
Online Video Understanding: OVBench and VideoChat-Online
por: Huang, Zhenpeng, et al.
Publicado: (2024)
por: Huang, Zhenpeng, et al.
Publicado: (2024)
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
por: Li, Kunchang, et al.
Publicado: (2023)
por: Li, Kunchang, et al.
Publicado: (2023)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
por: Yue, Zhengrong, et al.
Publicado: (2025)
por: Yue, Zhengrong, et al.
Publicado: (2025)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
por: Wang, Ye, et al.
Publicado: (2025)
por: Wang, Ye, et al.
Publicado: (2025)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
por: Luo, Fuwen, et al.
Publicado: (2025)
por: Luo, Fuwen, et al.
Publicado: (2025)
Harvest Video Foundation Models via Efficient Post-Pretraining
por: Li, Yizhuo, et al.
Publicado: (2023)
por: Li, Yizhuo, et al.
Publicado: (2023)
Ejemplares similares
-
Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining
por: Dong, Lu, et al.
Publicado: (2025) -
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
por: Li, Xinhao, et al.
Publicado: (2025) -
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025) -
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
por: Zeng, Xiangyu, et al.
Publicado: (2026) -
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
por: Zhang, Hongjie, et al.
Publicado: (2023)