From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sharif, Omar, Hossain, Eftekhar, Ng, Patrick |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcing Multimodal Reasoning Against Visual Degradation
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
par: Liu, Xiaoyuan, et autres
Publié: (2024)
par: Liu, Xiaoyuan, et autres
Publié: (2024)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
par: Shangguan, Ziyao, et autres
Publié: (2024)
par: Shangguan, Ziyao, et autres
Publié: (2024)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
par: Tian, Changyuan, et autres
Publié: (2026)
par: Tian, Changyuan, et autres
Publié: (2026)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
par: Sun, Haoyuan, et autres
Publié: (2025)
par: Sun, Haoyuan, et autres
Publié: (2025)
You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
par: Lawrence, Logan, et autres
Publié: (2025)
par: Lawrence, Logan, et autres
Publié: (2025)
InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
par: Li, Kaican, et autres
Publié: (2025)
par: Li, Kaican, et autres
Publié: (2025)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
par: Tang, Liyan, et autres
Publié: (2025)
par: Tang, Liyan, et autres
Publié: (2025)
DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
par: Xu, Shilin, et autres
Publié: (2025)
par: Xu, Shilin, et autres
Publié: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
par: Guo, Zichun, et autres
Publié: (2026)
par: Guo, Zichun, et autres
Publié: (2026)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
par: Yang, Cheng, et autres
Publié: (2026)
par: Yang, Cheng, et autres
Publié: (2026)
TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual Reasoning
par: von Klinski, Maximilian, et autres
Publié: (2026)
par: von Klinski, Maximilian, et autres
Publié: (2026)
Imp: Highly Capable Large Multimodal Models for Mobile Devices
par: Shao, Zhenwei, et autres
Publié: (2024)
par: Shao, Zhenwei, et autres
Publié: (2024)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
par: Zhu, Chenming, et autres
Publié: (2024)
par: Zhu, Chenming, et autres
Publié: (2024)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
par: Zhu, Wenxin, et autres
Publié: (2025)
par: Zhu, Wenxin, et autres
Publié: (2025)
Evaluating Linguistic Capabilities of Multimodal LLMs in the Lens of Few-Shot Learning
par: Dogan, Mustafa, et autres
Publié: (2024)
par: Dogan, Mustafa, et autres
Publié: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
par: Hua, Jiacheng, et autres
Publié: (2026)
par: Hua, Jiacheng, et autres
Publié: (2026)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
par: Duan, Chengqi, et autres
Publié: (2025)
par: Duan, Chengqi, et autres
Publié: (2025)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
par: Huang, Yixu, et autres
Publié: (2026)
par: Huang, Yixu, et autres
Publié: (2026)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
par: Zhang, Huanyu, et autres
Publié: (2025)
par: Zhang, Huanyu, et autres
Publié: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
par: Shi, Weikang, et autres
Publié: (2025)
par: Shi, Weikang, et autres
Publié: (2025)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start
par: Wei, Lai, et autres
Publié: (2025)
par: Wei, Lai, et autres
Publié: (2025)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
par: Zhang, Xiaofeng, et autres
Publié: (2024)
par: Zhang, Xiaofeng, et autres
Publié: (2024)
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
par: Deng, Haolin, et autres
Publié: (2026)
par: Deng, Haolin, et autres
Publié: (2026)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
par: Jiang, Houcheng, et autres
Publié: (2026)
par: Jiang, Houcheng, et autres
Publié: (2026)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
par: Yang, Zheyuan, et autres
Publié: (2026)
par: Yang, Zheyuan, et autres
Publié: (2026)
VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
par: Yuan, Ruifeng, et autres
Publié: (2025)
par: Yuan, Ruifeng, et autres
Publié: (2025)
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
par: Chen, Zhanpeng, et autres
Publié: (2025)
par: Chen, Zhanpeng, et autres
Publié: (2025)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
par: Chen, Shuang, et autres
Publié: (2025)
par: Chen, Shuang, et autres
Publié: (2025)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
par: Cao, Qinglong, et autres
Publié: (2026)
par: Cao, Qinglong, et autres
Publié: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Documents similaires
-
Reinforcing Multimodal Reasoning Against Visual Degradation
par: Liu, Rui, et autres
Publié: (2026) -
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
par: Liu, Xiaoyuan, et autres
Publié: (2024) -
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
par: Shangguan, Ziyao, et autres
Publié: (2024) -
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
par: Tian, Changyuan, et autres
Publié: (2026) -
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
par: Sun, Haoyuan, et autres
Publié: (2025)