Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Houlun, Wang, Xin, Li, Guangyao, Zhou, Yuwei, Chen, Yihan, Jia, Jia, Zhu, Wenwu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
par: Chen, Houlun, et autres
Publié: (2024)
par: Chen, Houlun, et autres
Publié: (2024)
LLM4VG: Large Language Models Evaluation for Video Grounding
par: Feng, Wei, et autres
Publié: (2023)
par: Feng, Wei, et autres
Publié: (2023)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
par: Liu, Wenqi, et autres
Publié: (2026)
par: Liu, Wenqi, et autres
Publié: (2026)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
par: Deng, Andong, et autres
Publié: (2024)
par: Deng, Andong, et autres
Publié: (2024)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
par: Luo, Mi, et autres
Publié: (2025)
par: Luo, Mi, et autres
Publié: (2025)
Multi-sentence Video Grounding for Long Video Generation
par: Feng, Wei, et autres
Publié: (2024)
par: Feng, Wei, et autres
Publié: (2024)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
par: Zeng, Xiangyu, et autres
Publié: (2024)
par: Zeng, Xiangyu, et autres
Publié: (2024)
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
par: Zhan, Yu-Wei, et autres
Publié: (2025)
par: Zhan, Yu-Wei, et autres
Publié: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
par: Chen, Ruizhe, et autres
Publié: (2025)
par: Chen, Ruizhe, et autres
Publié: (2025)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
par: Lee, Daeun, et autres
Publié: (2026)
par: Lee, Daeun, et autres
Publié: (2026)
Motion-o: Trajectory-Grounded Video Reasoning
par: Galoaa, Bishoy, et autres
Publié: (2026)
par: Galoaa, Bishoy, et autres
Publié: (2026)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
par: Ding, Yang, et autres
Publié: (2025)
par: Ding, Yang, et autres
Publié: (2025)
A Survey of Video Datasets for Grounded Event Understanding
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
par: Liu, Huabin, et autres
Publié: (2025)
par: Liu, Huabin, et autres
Publié: (2025)
DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos
par: Lu, Zijia, et autres
Publié: (2025)
par: Lu, Zijia, et autres
Publié: (2025)
ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding
par: Liu, Xiao, et autres
Publié: (2026)
par: Liu, Xiao, et autres
Publié: (2026)
Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
par: Li, Jialuo, et autres
Publié: (2025)
par: Li, Jialuo, et autres
Publié: (2025)
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
par: Singh, Shivam, et autres
Publié: (2026)
par: Singh, Shivam, et autres
Publié: (2026)
VIMI: Grounding Video Generation through Multi-modal Instruction
par: Fang, Yuwei, et autres
Publié: (2024)
par: Fang, Yuwei, et autres
Publié: (2024)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
VCA: Video Curious Agent for Long Video Understanding
par: Yang, Zeyuan, et autres
Publié: (2024)
par: Yang, Zeyuan, et autres
Publié: (2024)
Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding
par: Ma, Kaijing, et autres
Publié: (2024)
par: Ma, Kaijing, et autres
Publié: (2024)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
par: Zheng, Xinyi, et autres
Publié: (2026)
par: Zheng, Xinyi, et autres
Publié: (2026)
Personalized Video Summarization by Multimodal Video Understanding
par: Chen, Brian, et autres
Publié: (2024)
par: Chen, Brian, et autres
Publié: (2024)
Multi-weather Cross-view Geo-localization Using Denoising Diffusion Models
par: Feng, Tongtong, et autres
Publié: (2024)
par: Feng, Tongtong, et autres
Publié: (2024)
Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes
par: Linghu, Xiongkun, et autres
Publié: (2025)
par: Linghu, Xiongkun, et autres
Publié: (2025)
Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding
par: Yan, Qingyang, et autres
Publié: (2025)
par: Yan, Qingyang, et autres
Publié: (2025)
Video Panels for Long Video Understanding
par: Doorenbos, Lars, et autres
Publié: (2025)
par: Doorenbos, Lars, et autres
Publié: (2025)
VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization
par: Cao, Xinye, et autres
Publié: (2025)
par: Cao, Xinye, et autres
Publié: (2025)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
par: Zhang, Xiaoyi, et autres
Publié: (2025)
par: Zhang, Xiaoyi, et autres
Publié: (2025)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
Documents similaires
-
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
par: Chen, Houlun, et autres
Publié: (2024) -
LLM4VG: Large Language Models Evaluation for Video Grounding
par: Feng, Wei, et autres
Publié: (2023) -
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
par: Liu, Wenqi, et autres
Publié: (2026) -
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
par: Deng, Andong, et autres
Publié: (2024) -
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)