Video-R1: Reinforcing Video Reasoning in MLLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Kaituo, Gong, Kaixiong, Li, Bohao, Guo, Zonghao, Wang, Yibing, Peng, Tianshuo, Wu, Junfei, Zhang, Xiaoying, Wang, Benyou, Yue, Xiangyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
di: Fan, Kaixuan, et al.
Pubblicazione: (2025)
di: Fan, Kaixuan, et al.
Pubblicazione: (2025)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
di: Gong, Kaixiong, et al.
Pubblicazione: (2024)
di: Gong, Kaixiong, et al.
Pubblicazione: (2024)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
di: Ouyang, Kun, et al.
Pubblicazione: (2025)
di: Ouyang, Kun, et al.
Pubblicazione: (2025)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
di: Wu, Junfei, et al.
Pubblicazione: (2025)
di: Wu, Junfei, et al.
Pubblicazione: (2025)
OneThinker: All-in-one Reasoning Model for Image and Video
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
di: Yan, Ziang, et al.
Pubblicazione: (2025)
di: Yan, Ziang, et al.
Pubblicazione: (2025)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
di: Zhao, Zijia, et al.
Pubblicazione: (2024)
di: Zhao, Zijia, et al.
Pubblicazione: (2024)
AdaTooler-V: Adaptive Tool-Use for Images and Videos
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Reinforcing Consistency in Video MLLMs with Structured Rewards
di: Quan, Yihao, et al.
Pubblicazione: (2026)
di: Quan, Yihao, et al.
Pubblicazione: (2026)
Manifold-Aware Exploration for Reinforcement Learning in Video Generation
di: Zheng, Mingzhe, et al.
Pubblicazione: (2026)
di: Zheng, Mingzhe, et al.
Pubblicazione: (2026)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
di: Meng, Desen, et al.
Pubblicazione: (2025)
di: Meng, Desen, et al.
Pubblicazione: (2025)
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
di: Xu, Zishan, et al.
Pubblicazione: (2025)
di: Xu, Zishan, et al.
Pubblicazione: (2025)
Touch-R1: Reinforcing Touch Reasoning in MLLMs
di: Lai, Yingxin, et al.
Pubblicazione: (2026)
di: Lai, Yingxin, et al.
Pubblicazione: (2026)
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning
di: Liu, Ming, et al.
Pubblicazione: (2026)
di: Liu, Ming, et al.
Pubblicazione: (2026)
Reinforcing Video Reasoning with Focused Thinking
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs
di: Zhu, Rui, et al.
Pubblicazione: (2026)
di: Zhu, Rui, et al.
Pubblicazione: (2026)
UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
ViSS-R1: Self-Supervised Reinforcement Video Reasoning
di: Fang, Bo, et al.
Pubblicazione: (2025)
di: Fang, Bo, et al.
Pubblicazione: (2025)
Unhackable Temporal Rewarding for Scalable Video MLLMs
di: Yu, En, et al.
Pubblicazione: (2025)
di: Yu, En, et al.
Pubblicazione: (2025)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization
di: Wang, Peiyao, et al.
Pubblicazione: (2025)
di: Wang, Peiyao, et al.
Pubblicazione: (2025)
Video-KTR: Reinforcing Video Reasoning via Key Token Attribution
di: Wang, Ziyue, et al.
Pubblicazione: (2026)
di: Wang, Ziyue, et al.
Pubblicazione: (2026)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
Will Pre-Training Ever End? A First Step Toward Next-Generation Foundation MLLMs via Self-Improving Systematic Cognition
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
From Web to Pixels: Bringing Agentic Search into Visual Perception
di: Yang, Bokang, et al.
Pubblicazione: (2026)
di: Yang, Bokang, et al.
Pubblicazione: (2026)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
di: Han, Su Ho, et al.
Pubblicazione: (2025)
di: Han, Su Ho, et al.
Pubblicazione: (2025)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
di: Huang, Zhe, et al.
Pubblicazione: (2025)
di: Huang, Zhe, et al.
Pubblicazione: (2025)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
di: Gong, Sitong, et al.
Pubblicazione: (2025)
di: Gong, Sitong, et al.
Pubblicazione: (2025)
Gen-Searcher: Reinforcing Agentic Search for Image Generation
di: Feng, Kaituo, et al.
Pubblicazione: (2026)
di: Feng, Kaituo, et al.
Pubblicazione: (2026)
Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs
di: Wu, Jingze, et al.
Pubblicazione: (2026)
di: Wu, Jingze, et al.
Pubblicazione: (2026)
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
di: Lin, Wang, et al.
Pubblicazione: (2025)
di: Lin, Wang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
di: Fan, Kaixuan, et al.
Pubblicazione: (2025) -
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
di: Gong, Kaixiong, et al.
Pubblicazione: (2024) -
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025) -
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
di: Ouyang, Kun, et al.
Pubblicazione: (2025) -
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
di: Wang, Qi, et al.
Pubblicazione: (2025)