VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Mingyuan, Yang, Jingcheng, Jiang, Jize, Li, Meitang, Yan, Kaizhuo, Yu, Hanchao, Zhang, Minjia, Zhai, Chengxiang, Nahrstedt, Klara |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Aha Moment Revisited: Are VLMs Truly Capable of Self Verification in Inference-time Scaling?
by: Wu, Mingyuan, et al.
Published: (2025)
by: Wu, Mingyuan, et al.
Published: (2025)
Cache-of-Thought: Master-Apprentice Framework for Cost-Effective Vision Language Model Reasoning
by: Wu, Mingyuan, et al.
Published: (2025)
by: Wu, Mingyuan, et al.
Published: (2025)
Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning
by: Chi, Banghao, et al.
Published: (2026)
by: Chi, Banghao, et al.
Published: (2026)
Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
by: Yang, Jingcheng, et al.
Published: (2026)
by: Yang, Jingcheng, et al.
Published: (2026)
UOUO: Uncontextualized Uncommon Objects for Measuring Knowledge Horizons of Vision Language Models
by: Pi, Xinyu, et al.
Published: (2024)
by: Pi, Xinyu, et al.
Published: (2024)
QoS-QoE Translation with Large Language Model
by: Yu, Yingjie, et al.
Published: (2026)
by: Yu, Yingjie, et al.
Published: (2026)
AquaVLM: Improving Underwater Situation Awareness with Mobile Vision Language Models
by: Tian, Beitong, et al.
Published: (2025)
by: Tian, Beitong, et al.
Published: (2025)
ACT360: An Efficient 360-Degree Action Detection and Summarization Framework for Mission-Critical Training and Debriefing
by: Tiwari, Aditi, et al.
Published: (2025)
by: Tiwari, Aditi, et al.
Published: (2025)
Performance Characterization of Containers in Edge Computing
by: Gupta, Ragini, et al.
Published: (2025)
by: Gupta, Ragini, et al.
Published: (2025)
Viewport-based Neural 360° Image Compression
by: Liao, Jingwei, et al.
Published: (2026)
by: Liao, Jingwei, et al.
Published: (2026)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
by: Su, Zhaochen, et al.
Published: (2025)
by: Su, Zhaochen, et al.
Published: (2025)
AquaScope: Reliable Underwater Image Transmission on Mobile Devices
by: Tian, Beitong, et al.
Published: (2025)
by: Tian, Beitong, et al.
Published: (2025)
Spatio-Temporal LLM: Reasoning about Environments and Actions
by: Zheng, Haozhen, et al.
Published: (2025)
by: Zheng, Haozhen, et al.
Published: (2025)
Federated Transfer Learning with Task Personalization for Condition Monitoring in Ultrasonic Metal Welding
by: Eslaminia, Ahmadreza, et al.
Published: (2024)
by: Eslaminia, Ahmadreza, et al.
Published: (2024)
Adaptive Unknown Fault Detection and Few-Shot Continual Learning for Condition Monitoring in Ultrasonic Metal Welding
by: Eslaminia, Ahmadreza, et al.
Published: (2026)
by: Eslaminia, Ahmadreza, et al.
Published: (2026)
TraceNet: Segment one thing efficiently
by: Wu, Mingyuan, et al.
Published: (2024)
by: Wu, Mingyuan, et al.
Published: (2024)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
by: Lu, Meng, et al.
Published: (2025)
by: Lu, Meng, et al.
Published: (2025)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
by: Li, Hengjia, et al.
Published: (2026)
by: Li, Hengjia, et al.
Published: (2026)
Report on the NSF Workshop on Sustainable Computing for Sustainability (NSF WSCS 2024)
by: Guérin, Roch, et al.
Published: (2024)
by: Guérin, Roch, et al.
Published: (2024)
Pseudo Dataset Generation for Out-of-Domain Multi-Camera View Recommendation
by: Lee, Kuan-Ying, et al.
Published: (2024)
by: Lee, Kuan-Ying, et al.
Published: (2024)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
by: Zhang, Haoji, et al.
Published: (2025)
by: Zhang, Haoji, et al.
Published: (2025)
Image Recognition with Vision and Language Embeddings of VLMs
by: Volkov, Illia, et al.
Published: (2025)
by: Volkov, Illia, et al.
Published: (2025)
Tool-R1: Sample-Efficient Reinforcement Learning for Agentic Tool Use
by: Zhang, Yabo, et al.
Published: (2025)
by: Zhang, Yabo, et al.
Published: (2025)
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
by: Gao, Shujian, et al.
Published: (2026)
by: Gao, Shujian, et al.
Published: (2026)
Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning
by: Yu, Hao, et al.
Published: (2026)
by: Yu, Hao, et al.
Published: (2026)
Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints
by: Kumar, Sunil, et al.
Published: (2025)
by: Kumar, Sunil, et al.
Published: (2025)
Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents
by: Tan, Weiting, et al.
Published: (2025)
by: Tan, Weiting, et al.
Published: (2025)
EcoLens: Leveraging Multi-Objective Bayesian Optimization for Energy-Efficient Video Processing on Edge Devices
by: Civjan, Benjamin, et al.
Published: (2025)
by: Civjan, Benjamin, et al.
Published: (2025)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
by: Feng, Jiazhan, et al.
Published: (2025)
by: Feng, Jiazhan, et al.
Published: (2025)
Enhancing Neural Adaptive Wireless Video Streaming via Lower-Layer Information Exposure and Online Tuning
by: Zhao, Lingzhi, et al.
Published: (2025)
by: Zhao, Lingzhi, et al.
Published: (2025)
Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RL
by: Zhai, Skylar, et al.
Published: (2026)
by: Zhai, Skylar, et al.
Published: (2026)
MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
by: Lu, Meng, et al.
Published: (2026)
by: Lu, Meng, et al.
Published: (2026)
ERA: Transforming VLMs into Embodied Agents via Embodied Prior Learning and Online Reinforcement Learning
by: Chen, Hanyang, et al.
Published: (2025)
by: Chen, Hanyang, et al.
Published: (2025)
TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens
by: Cheng, Jianpeng, et al.
Published: (2026)
by: Cheng, Jianpeng, et al.
Published: (2026)
Listener-Rewarded Thinking in VLMs for Image Preferences
by: Gambashidze, Alexander, et al.
Published: (2025)
by: Gambashidze, Alexander, et al.
Published: (2025)
Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
by: Yang, Dongchao, et al.
Published: (2025)
by: Yang, Dongchao, et al.
Published: (2025)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
by: Jiang, Dongfu, et al.
Published: (2025)
by: Jiang, Dongfu, et al.
Published: (2025)
Revisiting Disaggregated Large Language Model Serving for Performance and Energy Implications
by: Li, Jiaxi, et al.
Published: (2025)
by: Li, Jiaxi, et al.
Published: (2025)
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
by: Jiang, Bo, et al.
Published: (2025)
by: Jiang, Bo, et al.
Published: (2025)
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
by: Zheng, Ziwei, et al.
Published: (2025)
by: Zheng, Ziwei, et al.
Published: (2025)
Similar Items
-
Aha Moment Revisited: Are VLMs Truly Capable of Self Verification in Inference-time Scaling?
by: Wu, Mingyuan, et al.
Published: (2025) -
Cache-of-Thought: Master-Apprentice Framework for Cost-Effective Vision Language Model Reasoning
by: Wu, Mingyuan, et al.
Published: (2025) -
Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning
by: Chi, Banghao, et al.
Published: (2026) -
Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
by: Yang, Jingcheng, et al.
Published: (2026) -
UOUO: Uncontextualized Uncommon Objects for Measuring Knowledge Horizons of Vision Language Models
by: Pi, Xinyu, et al.
Published: (2024)