Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Haoji, Gu, Xin, Li, Jiawen, Ma, Chixiang, Bai, Sule, Zhang, Chubin, Zhang, Bowen, Zhou, Zhichao, He, Dongliang, Tang, Yansong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
por: Bai, Sule, et al.
Publicado: (2025)
por: Bai, Sule, et al.
Publicado: (2025)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
Hierarchical Memory for Long Video QA
por: Wang, Yiqin, et al.
Publicado: (2024)
por: Wang, Yiqin, et al.
Publicado: (2024)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation
por: Bai, Sule, et al.
Publicado: (2024)
por: Bai, Sule, et al.
Publicado: (2024)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
por: Gu, Xin, et al.
Publicado: (2025)
por: Gu, Xin, et al.
Publicado: (2025)
Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams
por: Zhang, Haoji, et al.
Publicado: (2024)
por: Zhang, Haoji, et al.
Publicado: (2024)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
por: Chen, Houlun, et al.
Publicado: (2026)
por: Chen, Houlun, et al.
Publicado: (2026)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
por: Ding, Yang, et al.
Publicado: (2025)
por: Ding, Yang, et al.
Publicado: (2025)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos
por: Zhang, Chubin, et al.
Publicado: (2026)
por: Zhang, Chubin, et al.
Publicado: (2026)
LongVideoAgent: Multi-Agent Reasoning with Long Videos
por: Liu, Runtao, et al.
Publicado: (2025)
por: Liu, Runtao, et al.
Publicado: (2025)
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
por: Yang, Zuhao, et al.
Publicado: (2025)
por: Yang, Zuhao, et al.
Publicado: (2025)
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
por: Wang, Yiqin, et al.
Publicado: (2024)
por: Wang, Yiqin, et al.
Publicado: (2024)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
por: Tong, Jingqi, et al.
Publicado: (2025)
por: Tong, Jingqi, et al.
Publicado: (2025)
Reinforcing Video Reasoning with Focused Thinking
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
Narrative Action Evaluation with Prompt-Guided Multimodal Interaction
por: Zhang, Shiyi, et al.
Publicado: (2024)
por: Zhang, Shiyi, et al.
Publicado: (2024)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
por: Li, Fu, et al.
Publicado: (2025)
por: Li, Fu, et al.
Publicado: (2025)
MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling
por: Li, Wenjie, et al.
Publicado: (2026)
por: Li, Wenjie, et al.
Publicado: (2026)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
por: Zhang, Peng, et al.
Publicado: (2026)
por: Zhang, Peng, et al.
Publicado: (2026)
VCoME: Verbal Video Composition with Multimodal Editing Effects
por: Gong, Weibo, et al.
Publicado: (2024)
por: Gong, Weibo, et al.
Publicado: (2024)
Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation
por: Zhu, Tianrui, et al.
Publicado: (2025)
por: Zhu, Tianrui, et al.
Publicado: (2025)
Thinking with Spatial Code for Physical-World Video Reasoning
por: Chen, Jieneng, et al.
Publicado: (2026)
por: Chen, Jieneng, et al.
Publicado: (2026)
VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
por: Lu, Guanxing, et al.
Publicado: (2025)
por: Lu, Guanxing, et al.
Publicado: (2025)
LOGO: A Long-Form Video Dataset for Group Action Quality Assessment
por: Zhang, Shiyi, et al.
Publicado: (2024)
por: Zhang, Shiyi, et al.
Publicado: (2024)
UVCG: Leveraging Temporal Consistency for Universal Video Protection
por: Li, KaiZhou, et al.
Publicado: (2024)
por: Li, KaiZhou, et al.
Publicado: (2024)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning
por: Cheng, Qianjia, et al.
Publicado: (2026)
por: Cheng, Qianjia, et al.
Publicado: (2026)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
por: Wang, Zikang, et al.
Publicado: (2025)
por: Wang, Zikang, et al.
Publicado: (2025)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
por: Zhang, Jinglei, et al.
Publicado: (2025)
por: Zhang, Jinglei, et al.
Publicado: (2025)
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
por: Shen, Xiaoqian, et al.
Publicado: (2025)
por: Shen, Xiaoqian, et al.
Publicado: (2025)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
Thinking Isn't an Illusion: Overcoming the Limitations of Reasoning Models via Tool Augmentations
por: Song, Zhao, et al.
Publicado: (2025)
por: Song, Zhao, et al.
Publicado: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
por: Chen, Harold Haodong, et al.
Publicado: (2025)
por: Chen, Harold Haodong, et al.
Publicado: (2025)
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
por: Gao, Zhe, et al.
Publicado: (2026)
por: Gao, Zhe, et al.
Publicado: (2026)
GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation
por: Zhang, Chubin, et al.
Publicado: (2024)
por: Zhang, Chubin, et al.
Publicado: (2024)
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
por: Jiang, Haonan, et al.
Publicado: (2026)
por: Jiang, Haonan, et al.
Publicado: (2026)
Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding
por: Zhang, Yuanhan, et al.
Publicado: (2025)
por: Zhang, Yuanhan, et al.
Publicado: (2025)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
por: Xie, Yuan, et al.
Publicado: (2025)
por: Xie, Yuan, et al.
Publicado: (2025)
Open-Vocabulary Segmentation with Semantic-Assisted Calibration
por: Liu, Yong, et al.
Publicado: (2023)
por: Liu, Yong, et al.
Publicado: (2023)
Ejemplares similares
-
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
por: Bai, Sule, et al.
Publicado: (2025) -
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
por: Wang, Yuji, et al.
Publicado: (2025) -
Hierarchical Memory for Long Video QA
por: Wang, Yiqin, et al.
Publicado: (2024) -
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
por: Zhang, Haoji, et al.
Publicado: (2025) -
Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation
por: Bai, Sule, et al.
Publicado: (2024)