DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Ziwei, Yang, Michael, Hong, Jack, Zhao, Chenxiao, Xu, Guohai, Yang, Le, Shen, Chao, Yu, Xing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DeepEyesV2: Toward Agentic Multimodal Model
by: Hong, Jack, et al.
Published: (2025)
by: Hong, Jack, et al.
Published: (2025)
DeepEye: A Steerable Self-driving Data Agent System
by: Li, Boyan, et al.
Published: (2026)
by: Li, Boyan, et al.
Published: (2026)
Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement
by: Li, Xudong, et al.
Published: (2026)
by: Li, Xudong, et al.
Published: (2026)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
by: Su, Zhaochen, et al.
Published: (2025)
by: Su, Zhaochen, et al.
Published: (2025)
Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection
by: Yang, Le, et al.
Published: (2024)
by: Yang, Le, et al.
Published: (2024)
DeepEye-SQL: A Software-Engineering-Inspired Text-to-SQL Framework
by: Li, Boyan, et al.
Published: (2025)
by: Li, Boyan, et al.
Published: (2025)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
by: Luo, Yuechen, et al.
Published: (2025)
by: Luo, Yuechen, et al.
Published: (2025)
R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning
by: Yang, Qi, et al.
Published: (2025)
by: Yang, Qi, et al.
Published: (2025)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
by: Yang, Wenhao, et al.
Published: (2025)
by: Yang, Wenhao, et al.
Published: (2025)
Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis
by: Jiang, Yankai, et al.
Published: (2025)
by: Jiang, Yankai, et al.
Published: (2025)
Thinking with Images via Self-Calling Agent
by: Yang, Wenxi, et al.
Published: (2025)
by: Yang, Wenxi, et al.
Published: (2025)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
by: Yang, Senqiao, et al.
Published: (2025)
by: Yang, Senqiao, et al.
Published: (2025)
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
by: Li, Xueheng, et al.
Published: (2026)
by: Li, Xueheng, et al.
Published: (2026)
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
by: Yang, Zuhao, et al.
Published: (2025)
by: Yang, Zuhao, et al.
Published: (2025)
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
by: Cao, Meng, et al.
Published: (2025)
by: Cao, Meng, et al.
Published: (2025)
Seeing It or Not? Interpretable Vision-aware Latent Steering to Mitigate Object Hallucinations
by: Chen, Boxu, et al.
Published: (2025)
by: Chen, Boxu, et al.
Published: (2025)
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
by: Yue, Yang, et al.
Published: (2025)
by: Yue, Yang, et al.
Published: (2025)
RL-I2IT: Image-to-Image Translation with Deep Reinforcement Learning
by: Hu, Jing, et al.
Published: (2023)
by: Hu, Jing, et al.
Published: (2023)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
by: Li, Hengjia, et al.
Published: (2026)
by: Li, Hengjia, et al.
Published: (2026)
DeepEyeNet: Generating Medical Report for Retinal Images
by: Huang, Jia-Hong
Published: (2025)
by: Huang, Jia-Hong
Published: (2025)
All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
by: Tian, Xinyu, et al.
Published: (2026)
by: Tian, Xinyu, et al.
Published: (2026)
MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
by: Lu, Meng, et al.
Published: (2026)
by: Lu, Meng, et al.
Published: (2026)
TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs
by: Kan, Zhehan, et al.
Published: (2025)
by: Kan, Zhehan, et al.
Published: (2025)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
by: Wang, Jiaqi, et al.
Published: (2025)
by: Wang, Jiaqi, et al.
Published: (2025)
BEVPlace: Learning LiDAR-based Place Recognition using Bird's Eye View Images
by: Luo, Lun, et al.
Published: (2023)
by: Luo, Lun, et al.
Published: (2023)
Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation
by: Gou, Yunhao, et al.
Published: (2024)
by: Gou, Yunhao, et al.
Published: (2024)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
by: Yang, Jie, et al.
Published: (2025)
by: Yang, Jie, et al.
Published: (2025)
MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling
by: Li, Wenjie, et al.
Published: (2026)
by: Li, Wenjie, et al.
Published: (2026)
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
by: Yang, Hongji, et al.
Published: (2025)
by: Yang, Hongji, et al.
Published: (2025)
RL-Selector: Reinforcement Learning-Guided Data Selection via Redundancy Assessment
by: Yang, Suorong, et al.
Published: (2025)
by: Yang, Suorong, et al.
Published: (2025)
Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis
by: Wang, Pengfei, et al.
Published: (2025)
by: Wang, Pengfei, et al.
Published: (2025)
Image Classification with Deep Reinforcement Active Learning
by: Jiu, Mingyuan, et al.
Published: (2024)
by: Jiu, Mingyuan, et al.
Published: (2024)
Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues
by: Hou, Wenjin, et al.
Published: (2026)
by: Hou, Wenjin, et al.
Published: (2026)
Fine-grained Dynamic Network for Generic Event Boundary Detection
by: Zheng, Ziwei, et al.
Published: (2024)
by: Zheng, Ziwei, et al.
Published: (2024)
Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning
by: Bai, Hongbo, et al.
Published: (2026)
by: Bai, Hongbo, et al.
Published: (2026)
Reliable Thinking with Images
by: Li, Haobin, et al.
Published: (2026)
by: Li, Haobin, et al.
Published: (2026)
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
by: Mao, Weijia, et al.
Published: (2025)
by: Mao, Weijia, et al.
Published: (2025)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
by: Wang, Qi, et al.
Published: (2025)
by: Wang, Qi, et al.
Published: (2025)
Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving
by: Wu, Yang, et al.
Published: (2026)
by: Wu, Yang, et al.
Published: (2026)
Similar Items
-
DeepEyesV2: Toward Agentic Multimodal Model
by: Hong, Jack, et al.
Published: (2025) -
DeepEye: A Steerable Self-driving Data Agent System
by: Li, Boyan, et al.
Published: (2026) -
Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement
by: Li, Xudong, et al.
Published: (2026) -
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
by: Su, Zhaochen, et al.
Published: (2025) -
Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection
by: Yang, Le, et al.
Published: (2024)