ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Congzhi, Wang, Zhibin, Ma, Yinchao, Peng, Jiawei, Wang, Yihan, Zhou, Qiang, Song, Jun, Zheng, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
di: Ma, Yinchao, et al.
Pubblicazione: (2026)
di: Ma, Yinchao, et al.
Pubblicazione: (2026)
VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism
di: Zhang, Congzhi, et al.
Pubblicazione: (2025)
di: Zhang, Congzhi, et al.
Pubblicazione: (2025)
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
di: Liu, Chengwen, et al.
Pubblicazione: (2026)
di: Liu, Chengwen, et al.
Pubblicazione: (2026)
A hybrid reconstruction of piece-wise smooth functions from non-uniform Fourier data
di: Song, Guohui, et al.
Pubblicazione: (2026)
di: Song, Guohui, et al.
Pubblicazione: (2026)
Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning
di: Zhang, Fanrui, et al.
Pubblicazione: (2025)
di: Zhang, Fanrui, et al.
Pubblicazione: (2025)
SWaT: Statistical Modeling of Video Watch Time through User Behavior Analysis
di: Yang, Shentao, et al.
Pubblicazione: (2024)
di: Yang, Shentao, et al.
Pubblicazione: (2024)
DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning
di: Xu, Xinrun, et al.
Pubblicazione: (2025)
di: Xu, Xinrun, et al.
Pubblicazione: (2025)
DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing
di: Yang, Hanqing, et al.
Pubblicazione: (2026)
di: Yang, Hanqing, et al.
Pubblicazione: (2026)
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
di: Wang, Lu, et al.
Pubblicazione: (2026)
di: Wang, Lu, et al.
Pubblicazione: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
di: Wang, Qunzhong, et al.
Pubblicazione: (2025)
di: Wang, Qunzhong, et al.
Pubblicazione: (2025)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
di: Sun, Zhongxiang, et al.
Pubblicazione: (2025)
di: Sun, Zhongxiang, et al.
Pubblicazione: (2025)
SEED: Accelerating Reasoning Tree Construction via Scheduled Speculative Decoding
di: Wang, Zhenglin, et al.
Pubblicazione: (2024)
di: Wang, Zhenglin, et al.
Pubblicazione: (2024)
Unified Thinker: A General Reasoning Modular Core for Image Generation
di: Zhou, Sashuai, et al.
Pubblicazione: (2026)
di: Zhou, Sashuai, et al.
Pubblicazione: (2026)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
Agentar-Fin-R1: Enhancing Financial Intelligence through Domain Expertise, Training Efficiency, and Advanced Reasoning
di: Zheng, Yanjun, et al.
Pubblicazione: (2025)
di: Zheng, Yanjun, et al.
Pubblicazione: (2025)
MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs
di: Ma, Junpeng, et al.
Pubblicazione: (2025)
di: Ma, Junpeng, et al.
Pubblicazione: (2025)
ReCreate: Reasoning and Creating Domain Agents Driven by Experience
di: Hao, Zhezheng, et al.
Pubblicazione: (2026)
di: Hao, Zhezheng, et al.
Pubblicazione: (2026)
Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis
di: Jiao, Zhengbo, et al.
Pubblicazione: (2026)
di: Jiao, Zhengbo, et al.
Pubblicazione: (2026)
Agentic Systems as Boosting Weak Reasoning Models
di: Sunkaraneni, Varun, et al.
Pubblicazione: (2026)
di: Sunkaraneni, Varun, et al.
Pubblicazione: (2026)
Video-R1: Reinforcing Video Reasoning in MLLMs
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
di: Jia, Furong, et al.
Pubblicazione: (2026)
di: Jia, Furong, et al.
Pubblicazione: (2026)
Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding
di: Ma, Ruiqi, et al.
Pubblicazione: (2025)
di: Ma, Ruiqi, et al.
Pubblicazione: (2025)
Mitigating Hallucination in Large Language Models (LLMs): An Application-Oriented Survey on RAG, Reasoning, and Agentic Systems
di: Li, Yihan, et al.
Pubblicazione: (2025)
di: Li, Yihan, et al.
Pubblicazione: (2025)
Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation
di: Zhang, Jing, et al.
Pubblicazione: (2026)
di: Zhang, Jing, et al.
Pubblicazione: (2026)
GraCoRe: Benchmarking Graph Comprehension and Complex Reasoning in Large Language Models
di: Yuan, Zike, et al.
Pubblicazione: (2024)
di: Yuan, Zike, et al.
Pubblicazione: (2024)
Library Video Tutorials to Support Large Undergraduate Labs: Will They Watch?
di: Colosimo, April L., et al.
Pubblicazione: (2012)
di: Colosimo, April L., et al.
Pubblicazione: (2012)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding
di: Zheng, Muyang, et al.
Pubblicazione: (2026)
di: Zheng, Muyang, et al.
Pubblicazione: (2026)
Efficient Adaptation of Large Vision Transformer via Adapter Re-Composing
di: Dong, Wei, et al.
Pubblicazione: (2023)
di: Dong, Wei, et al.
Pubblicazione: (2023)
Watch and Learn: Learning to Use Computers from Online Videos
di: Song, Chan Hee, et al.
Pubblicazione: (2025)
di: Song, Chan Hee, et al.
Pubblicazione: (2025)
BoostTaxo: Zero-Shot Taxonomy Induction via Boosting-Style Agentic Reasoning and Constraint-Aware Calibration
di: Ling, Yancheng, et al.
Pubblicazione: (2026)
di: Ling, Yancheng, et al.
Pubblicazione: (2026)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning
di: Ying, Yuchen, et al.
Pubblicazione: (2026)
di: Ying, Yuchen, et al.
Pubblicazione: (2026)
Anyprefer: An Agentic Framework for Preference Data Synthesis
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
Advancing Abductive Reasoning in Knowledge Graphs through Complex Logical Hypothesis Generation
di: Bai, Jiaxin, et al.
Pubblicazione: (2023)
di: Bai, Jiaxin, et al.
Pubblicazione: (2023)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
di: Yuan, Liping, et al.
Pubblicazione: (2025)
di: Yuan, Liping, et al.
Pubblicazione: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
di: Li, Chenglin, et al.
Pubblicazione: (2026)
di: Li, Chenglin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
di: Ma, Yinchao, et al.
Pubblicazione: (2026) -
VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism
di: Zhang, Congzhi, et al.
Pubblicazione: (2025) -
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
di: Liu, Chengwen, et al.
Pubblicazione: (2026) -
A hybrid reconstruction of piece-wise smooth functions from non-uniform Fourier data
di: Song, Guohui, et al.
Pubblicazione: (2026) -
Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning
di: Zhang, Fanrui, et al.
Pubblicazione: (2025)