Visual Reasoning through Tool-supervised Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Dong, Qihua, Sahin, Gozde, Wang, Pei, Cai, Zhaowei, Shrestha, Robik, Yang, Hao, Modolo, Davide |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
von: Shrestha, Robik, et al.
Veröffentlicht: (2020)
von: Shrestha, Robik, et al.
Veröffentlicht: (2020)
Are Bias Mitigation Techniques for Deep Learning Effective?
von: Shrestha, Robik, et al.
Veröffentlicht: (2021)
von: Shrestha, Robik, et al.
Veröffentlicht: (2021)
Hyperbolic Learning with Synthetic Captions for Open-World Detection
von: Kong, Fanjie, et al.
Veröffentlicht: (2024)
von: Kong, Fanjie, et al.
Veröffentlicht: (2024)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
von: Chen, Yuxiao, et al.
Veröffentlicht: (2026)
von: Chen, Yuxiao, et al.
Veröffentlicht: (2026)
Improving Multimodal Large Language Models Using Continual Learning
von: Srivastava, Shikhar, et al.
Veröffentlicht: (2024)
von: Srivastava, Shikhar, et al.
Veröffentlicht: (2024)
VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection
von: Huang, Zeyi, et al.
Veröffentlicht: (2025)
von: Huang, Zeyi, et al.
Veröffentlicht: (2025)
Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
von: Chen, Yang, et al.
Veröffentlicht: (2025)
von: Chen, Yang, et al.
Veröffentlicht: (2025)
Mixed-Query Transformer: A Unified Image Segmentation Architecture
von: Wang, Pei, et al.
Veröffentlicht: (2024)
von: Wang, Pei, et al.
Veröffentlicht: (2024)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
von: Zhang, Zhaoyang, et al.
Veröffentlicht: (2023)
von: Zhang, Zhaoyang, et al.
Veröffentlicht: (2023)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
von: Ding, Shengyuan, et al.
Veröffentlicht: (2025)
von: Ding, Shengyuan, et al.
Veröffentlicht: (2025)
FairRAG: Fair Human Generation via Fair Retrieval Augmentation
von: Shrestha, Robik, et al.
Veröffentlicht: (2024)
von: Shrestha, Robik, et al.
Veröffentlicht: (2024)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
Grounded Reinforcement Learning for Visual Reasoning
von: Sarch, Gabriel, et al.
Veröffentlicht: (2025)
von: Sarch, Gabriel, et al.
Veröffentlicht: (2025)
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
von: Dong, Qihua, et al.
Veröffentlicht: (2026)
von: Dong, Qihua, et al.
Veröffentlicht: (2026)
OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis
von: Fan, Yuxuan, et al.
Veröffentlicht: (2026)
von: Fan, Yuxuan, et al.
Veröffentlicht: (2026)
epsilon-Mesh Attack: A Surface-based Adversarial Point Cloud Attack for Facial Expression Recognition
von: Cengiz, Batuhan, et al.
Veröffentlicht: (2024)
von: Cengiz, Batuhan, et al.
Veröffentlicht: (2024)
PCLD: Point Cloud Layerwise Diffusion for Adversarial Purification
von: Gulsen, Mert, et al.
Veröffentlicht: (2024)
von: Gulsen, Mert, et al.
Veröffentlicht: (2024)
Reinforced Visual Perception with Tools
von: Zhou, Zetong, et al.
Veröffentlicht: (2025)
von: Zhou, Zetong, et al.
Veröffentlicht: (2025)
Reinforcement Learning Meets Visual Odometry
von: Messikommer, Nico, et al.
Veröffentlicht: (2024)
von: Messikommer, Nico, et al.
Veröffentlicht: (2024)
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning
von: Huang, Xinyu, et al.
Veröffentlicht: (2025)
von: Huang, Xinyu, et al.
Veröffentlicht: (2025)
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
von: Yang, Jiacheng, et al.
Veröffentlicht: (2026)
von: Yang, Jiacheng, et al.
Veröffentlicht: (2026)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
von: Dong, Qihua, et al.
Veröffentlicht: (2026)
von: Dong, Qihua, et al.
Veröffentlicht: (2026)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
von: Wang, Jianghui, et al.
Veröffentlicht: (2023)
von: Wang, Jianghui, et al.
Veröffentlicht: (2023)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
von: Lu, Meng, et al.
Veröffentlicht: (2025)
von: Lu, Meng, et al.
Veröffentlicht: (2025)
EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning
von: Li, Zhihao, et al.
Veröffentlicht: (2024)
von: Li, Zhihao, et al.
Veröffentlicht: (2024)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
von: Liu, Yuqi, et al.
Veröffentlicht: (2025)
von: Liu, Yuqi, et al.
Veröffentlicht: (2025)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
von: Zhang, Zirui, et al.
Veröffentlicht: (2026)
von: Zhang, Zirui, et al.
Veröffentlicht: (2026)
Revisiting Multi-Modal LLM Evaluation
von: Lu, Jian, et al.
Veröffentlicht: (2024)
von: Lu, Jian, et al.
Veröffentlicht: (2024)
BloomVQA: Assessing Hierarchical Multi-modal Comprehension
von: Gong, Yunye, et al.
Veröffentlicht: (2023)
von: Gong, Yunye, et al.
Veröffentlicht: (2023)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
ODTrack: Online Dense Temporal Token Learning for Visual Tracking
von: Zheng, Yaozong, et al.
Veröffentlicht: (2024)
von: Zheng, Yaozong, et al.
Veröffentlicht: (2024)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
von: Zhang, Bob, et al.
Veröffentlicht: (2025)
von: Zhang, Bob, et al.
Veröffentlicht: (2025)
TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
von: Ding, Hao, et al.
Veröffentlicht: (2026)
von: Ding, Hao, et al.
Veröffentlicht: (2026)
Boundary-aware Contrastive Learning for Semi-supervised Nuclei Instance Segmentation
von: Zhang, Ye, et al.
Veröffentlicht: (2024)
von: Zhang, Ye, et al.
Veröffentlicht: (2024)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
von: He, Ruozhen, et al.
Veröffentlicht: (2026)
von: He, Ruozhen, et al.
Veröffentlicht: (2026)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
von: Zhao, Shijie, et al.
Veröffentlicht: (2025)
von: Zhao, Shijie, et al.
Veröffentlicht: (2025)
Coherent Video Inpainting Using Optical Flow-Guided Efficient Diffusion
von: Gu, Bohai, et al.
Veröffentlicht: (2024)
von: Gu, Bohai, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
von: Shrestha, Robik, et al.
Veröffentlicht: (2020) -
Are Bias Mitigation Techniques for Deep Learning Effective?
von: Shrestha, Robik, et al.
Veröffentlicht: (2021) -
Hyperbolic Learning with Synthetic Captions for Open-World Detection
von: Kong, Fanjie, et al.
Veröffentlicht: (2024) -
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
von: Chen, Yuxiao, et al.
Veröffentlicht: (2026) -
Improving Multimodal Large Language Models Using Continual Learning
von: Srivastava, Shikhar, et al.
Veröffentlicht: (2024)