Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Ming, Zhong, Jike, Zhao, Shitian, Lai, Yuxiang, Zhang, Haoquan, Zhu, Wang Bill, Zhang, Kaipeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
von: Lai, Yuxiang, et al.
Veröffentlicht: (2025)
von: Lai, Yuxiang, et al.
Veröffentlicht: (2025)
ThinkGen: Generalized Thinking for Visual Generation
von: Jiao, Siyu, et al.
Veröffentlicht: (2025)
von: Jiao, Siyu, et al.
Veröffentlicht: (2025)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
von: Gu, Xin, et al.
Veröffentlicht: (2025)
von: Gu, Xin, et al.
Veröffentlicht: (2025)
PyVision-RL: Forging Open Agentic Vision Models via RL
von: Zhao, Shitian, et al.
Veröffentlicht: (2026)
von: Zhao, Shitian, et al.
Veröffentlicht: (2026)
PyVision: Agentic Vision with Dynamic Tooling
von: Zhao, Shitian, et al.
Veröffentlicht: (2025)
von: Zhao, Shitian, et al.
Veröffentlicht: (2025)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
von: Luo, Yuechen, et al.
Veröffentlicht: (2025)
von: Luo, Yuechen, et al.
Veröffentlicht: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
von: Zhao, Kesen, et al.
Veröffentlicht: (2026)
von: Zhao, Kesen, et al.
Veröffentlicht: (2026)
Think3D: Thinking with Space for Spatial Reasoning
von: Zhang, Zaibin, et al.
Veröffentlicht: (2026)
von: Zhang, Zaibin, et al.
Veröffentlicht: (2026)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
von: Li, Hengjia, et al.
Veröffentlicht: (2026)
von: Li, Hengjia, et al.
Veröffentlicht: (2026)
Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?
von: Lai, Yuxiang, et al.
Veröffentlicht: (2025)
von: Lai, Yuxiang, et al.
Veröffentlicht: (2025)
Thinking in 360°: Humanoid Visual Search in the Wild
von: Yu, Heyang, et al.
Veröffentlicht: (2025)
von: Yu, Heyang, et al.
Veröffentlicht: (2025)
Reinforcing Video Reasoning with Focused Thinking
von: Dang, Jisheng, et al.
Veröffentlicht: (2025)
von: Dang, Jisheng, et al.
Veröffentlicht: (2025)
EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark
von: Li, Ming, et al.
Veröffentlicht: (2024)
von: Li, Ming, et al.
Veröffentlicht: (2024)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think
von: Garcia, Gonzalo Martin, et al.
Veröffentlicht: (2024)
von: Garcia, Gonzalo Martin, et al.
Veröffentlicht: (2024)
Think Before You Diffuse: Infusing Physical Rules into Video Diffusion
von: Zhang, Ke, et al.
Veröffentlicht: (2025)
von: Zhang, Ke, et al.
Veröffentlicht: (2025)
ConFoThinking: Consolidated Focused Attention Driven Thinking for Visual Question Answering
von: Wu, Zhaodong, et al.
Veröffentlicht: (2026)
von: Wu, Zhaodong, et al.
Veröffentlicht: (2026)
Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
von: Li, Xuchen, et al.
Veröffentlicht: (2026)
von: Li, Xuchen, et al.
Veröffentlicht: (2026)
Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search
von: Zhang, Jingdong, et al.
Veröffentlicht: (2026)
von: Zhang, Jingdong, et al.
Veröffentlicht: (2026)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
Context Matters: Learning Global Semantics via Object-Centric Representation
von: Zhong, Jike, et al.
Veröffentlicht: (2025)
von: Zhong, Jike, et al.
Veröffentlicht: (2025)
See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs
von: Dai, Ziyun, et al.
Veröffentlicht: (2025)
von: Dai, Ziyun, et al.
Veröffentlicht: (2025)
Thinking Before Matching: A Reinforcement Reasoning Paradigm Towards General Person Re-Identification
von: Zhang, Quan, et al.
Veröffentlicht: (2026)
von: Zhang, Quan, et al.
Veröffentlicht: (2026)
Thyme: Think Beyond Images
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference
von: Hojjat, Ali, et al.
Veröffentlicht: (2025)
von: Hojjat, Ali, et al.
Veröffentlicht: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
Learning to Think Fast and Slow for Visual Language Models
von: Lin, Chenyu, et al.
Veröffentlicht: (2025)
von: Lin, Chenyu, et al.
Veröffentlicht: (2025)
CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think
von: Sun, Zening, et al.
Veröffentlicht: (2026)
von: Sun, Zening, et al.
Veröffentlicht: (2026)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
von: Xiang, Kun, et al.
Veröffentlicht: (2024)
von: Xiang, Kun, et al.
Veröffentlicht: (2024)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
von: Guo, Zirun, et al.
Veröffentlicht: (2025)
von: Guo, Zirun, et al.
Veröffentlicht: (2025)
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
MindGYM: What Matters in Question Synthesis for Thinking-Centric Fine-Tuning?
von: Xu, Zhe, et al.
Veröffentlicht: (2025)
von: Xu, Zhe, et al.
Veröffentlicht: (2025)
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
von: Guan, Yiran, et al.
Veröffentlicht: (2026)
von: Guan, Yiran, et al.
Veröffentlicht: (2026)
Thinking in Streaming Video
von: Liu, Zikang, et al.
Veröffentlicht: (2026)
von: Liu, Zikang, et al.
Veröffentlicht: (2026)
On the Faithfulness of Visual Thinking: Measurement and Enhancement
von: Liu, Zujing, et al.
Veröffentlicht: (2025)
von: Liu, Zujing, et al.
Veröffentlicht: (2025)
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
von: Li, Xueheng, et al.
Veröffentlicht: (2026)
von: Li, Xueheng, et al.
Veröffentlicht: (2026)
LATTE: Learning to Think with Vision Specialists
von: Ma, Zixian, et al.
Veröffentlicht: (2024)
von: Ma, Zixian, et al.
Veröffentlicht: (2024)
Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization
von: Ji, Yuxiang, et al.
Veröffentlicht: (2026)
von: Ji, Yuxiang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
von: Li, Ming, et al.
Veröffentlicht: (2025) -
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
von: Lai, Yuxiang, et al.
Veröffentlicht: (2025) -
ThinkGen: Generalized Thinking for Visual Generation
von: Jiao, Siyu, et al.
Veröffentlicht: (2025) -
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
von: Su, Zhaochen, et al.
Veröffentlicht: (2025) -
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
von: Gu, Xin, et al.
Veröffentlicht: (2025)