OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Su, Zhaochen, Li, Linjie, Song, Mingyang, Hao, Yunzhuo, Yang, Zhengyuan, Zhang, Jun, Chen, Guanjie, Gu, Jiawei, Li, Juntao, Qu, Xiaoye, Cheng, Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models
von: Song, Mingyang, et al.
Veröffentlicht: (2025)
von: Song, Mingyang, et al.
Veröffentlicht: (2025)
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
von: Gu, Jiawei, et al.
Veröffentlicht: (2025)
von: Gu, Jiawei, et al.
Veröffentlicht: (2025)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
von: Hao, Yunzhuo, et al.
Veröffentlicht: (2025)
von: Hao, Yunzhuo, et al.
Veröffentlicht: (2025)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
von: Li, Hengjia, et al.
Veröffentlicht: (2026)
von: Li, Hengjia, et al.
Veröffentlicht: (2026)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
Timo: Towards Better Temporal Reasoning for Language Models
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026)
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026)
Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning
von: Wang, Futing, et al.
Veröffentlicht: (2026)
von: Wang, Futing, et al.
Veröffentlicht: (2026)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
von: He, Zefeng, et al.
Veröffentlicht: (2025)
von: He, Zefeng, et al.
Veröffentlicht: (2025)
From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data Calibration
von: Song, Mingyang, et al.
Veröffentlicht: (2025)
von: Song, Mingyang, et al.
Veröffentlicht: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
von: Wu, Mingyuan, et al.
Veröffentlicht: (2025)
von: Wu, Mingyuan, et al.
Veröffentlicht: (2025)
ConflictBank: A Benchmark for Evaluating the Influence of Knowledge Conflicts in LLM
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
von: Chen, Guanjie, et al.
Veröffentlicht: (2025)
von: Chen, Guanjie, et al.
Veröffentlicht: (2025)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
von: Luo, Yuechen, et al.
Veröffentlicht: (2025)
von: Luo, Yuechen, et al.
Veröffentlicht: (2025)
Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think
von: Tian, Jie, et al.
Veröffentlicht: (2025)
von: Tian, Jie, et al.
Veröffentlicht: (2025)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
von: Wan, Xu, et al.
Veröffentlicht: (2025)
von: Wan, Xu, et al.
Veröffentlicht: (2025)
MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
von: Lu, Meng, et al.
Veröffentlicht: (2026)
von: Lu, Meng, et al.
Veröffentlicht: (2026)
Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization
von: Chen, Zhengyu, et al.
Veröffentlicht: (2025)
von: Chen, Zhengyu, et al.
Veröffentlicht: (2025)
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
Learning to Think Fast and Slow for Visual Language Models
von: Lin, Chenyu, et al.
Veröffentlicht: (2025)
von: Lin, Chenyu, et al.
Veröffentlicht: (2025)
Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis
von: Jiang, Yankai, et al.
Veröffentlicht: (2025)
von: Jiang, Yankai, et al.
Veröffentlicht: (2025)
Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs
von: Wang, Jingyao, et al.
Veröffentlicht: (2025)
von: Wang, Jingyao, et al.
Veröffentlicht: (2025)
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
von: Li, Xueheng, et al.
Veröffentlicht: (2026)
von: Li, Xueheng, et al.
Veröffentlicht: (2026)
Think-J: Learning to Think for Generative LLM-as-a-Judge
von: Huang, Hui, et al.
Veröffentlicht: (2025)
von: Huang, Hui, et al.
Veröffentlicht: (2025)
LATTE: Learning to Think with Vision Specialists
von: Ma, Zixian, et al.
Veröffentlicht: (2024)
von: Ma, Zixian, et al.
Veröffentlicht: (2024)
Visual Planning: Let's Think Only with Images
von: Xu, Yi, et al.
Veröffentlicht: (2025)
von: Xu, Yi, et al.
Veröffentlicht: (2025)
AdaptThink: Reasoning Models Can Learn When to Think
von: Zhang, Jiajie, et al.
Veröffentlicht: (2025)
von: Zhang, Jiajie, et al.
Veröffentlicht: (2025)
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
von: Gao, Shujian, et al.
Veröffentlicht: (2026)
von: Gao, Shujian, et al.
Veröffentlicht: (2026)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
von: Liao, Jiaqi, et al.
Veröffentlicht: (2025)
von: Liao, Jiaqi, et al.
Veröffentlicht: (2025)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
von: Li, Yafu, et al.
Veröffentlicht: (2025)
von: Li, Yafu, et al.
Veröffentlicht: (2025)
Reinforcement Learning for Latent-Space Thinking in LLMs
von: Özeren, Enes, et al.
Veröffentlicht: (2025)
von: Özeren, Enes, et al.
Veröffentlicht: (2025)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
von: Wang, Shijian, et al.
Veröffentlicht: (2025)
von: Wang, Shijian, et al.
Veröffentlicht: (2025)
Model Checking for Reinforcement Learning in Autonomous Driving: One Can Do More Than You Think!
von: Gu, Rong
Veröffentlicht: (2024)
von: Gu, Rong
Veröffentlicht: (2024)
Ähnliche Einträge
-
PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models
von: Song, Mingyang, et al.
Veröffentlicht: (2025) -
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
von: Su, Zhaochen, et al.
Veröffentlicht: (2025) -
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
von: Gu, Jiawei, et al.
Veröffentlicht: (2025) -
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
von: Hao, Yunzhuo, et al.
Veröffentlicht: (2025) -
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
von: Li, Hengjia, et al.
Veröffentlicht: (2026)