Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Haoyuan, Wu, Jiaqi, Xia, Bo, Luo, Yifu, Zhao, Yifei, Qin, Kai, Lv, Xufei, Zhang, Tiantian, Chang, Yongzhe, Wang, Xueqian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
by: Luo, Yifu, et al.
Published: (2025)
by: Luo, Yifu, et al.
Published: (2025)
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
by: Sun, Haoyuan, et al.
Published: (2024)
by: Sun, Haoyuan, et al.
Published: (2024)
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
by: Luo, Yifu, et al.
Published: (2025)
by: Luo, Yifu, et al.
Published: (2025)
Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping
by: Sun, Haoyuan, et al.
Published: (2026)
by: Sun, Haoyuan, et al.
Published: (2026)
Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization
by: Luo, Yifu, et al.
Published: (2025)
by: Luo, Yifu, et al.
Published: (2025)
Unveiling the Generalization Power of Fine-Tuned Large Language Models
by: Yang, Haoran, et al.
Published: (2024)
by: Yang, Haoran, et al.
Published: (2024)
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning
by: Wu, Jiaqi, et al.
Published: (2025)
by: Wu, Jiaqi, et al.
Published: (2025)
Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning
by: Qin, Kai, et al.
Published: (2025)
by: Qin, Kai, et al.
Published: (2025)
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
by: Cao, Qinglong, et al.
Published: (2026)
by: Cao, Qinglong, et al.
Published: (2026)
Let the Agent Search: Autonomous Exploration Beats Rigid Workflows in Temporal Question Answering
by: Lv, Xufei, et al.
Published: (2026)
by: Lv, Xufei, et al.
Published: (2026)
A Method on Searching Better Activation Functions
by: Sun, Haoyuan, et al.
Published: (2024)
by: Sun, Haoyuan, et al.
Published: (2024)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
by: Wang, Qi, et al.
Published: (2025)
by: Wang, Qi, et al.
Published: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
by: Zhang, Wenqiao, et al.
Published: (2024)
by: Zhang, Wenqiao, et al.
Published: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
by: Zhai, Yuexiang, et al.
Published: (2024)
by: Zhai, Yuexiang, et al.
Published: (2024)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
by: Wang, Yibin, et al.
Published: (2025)
by: Wang, Yibin, et al.
Published: (2025)
ReFT: Reasoning with Reinforced Fine-Tuning
by: Luong, Trung Quoc, et al.
Published: (2024)
by: Luong, Trung Quoc, et al.
Published: (2024)
Learn from Downstream and Be Yourself in Multimodal Large Language Model Fine-Tuning
by: Huang, Wenke, et al.
Published: (2024)
by: Huang, Wenke, et al.
Published: (2024)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
by: Xu, Qinwu, et al.
Published: (2026)
by: Xu, Qinwu, et al.
Published: (2026)
CrisisSense-LLM: Instruction Fine-Tuned Large Language Model for Multi-label Social Media Text Classification in Disaster Informatics
by: Yin, Kai, et al.
Published: (2024)
by: Yin, Kai, et al.
Published: (2024)
Enhancing Non-English Capabilities of English-Centric Large Language Models through Deep Supervision Fine-Tuning
by: Huo, Wenshuai, et al.
Published: (2025)
by: Huo, Wenshuai, et al.
Published: (2025)
Hyperbolic Fine-Tuning for Large Language Models
by: Yang, Menglin, et al.
Published: (2024)
by: Yang, Menglin, et al.
Published: (2024)
UACER: An Uncertainty-Adaptive Critic Ensemble Framework for Robust Adversarial Reinforcement Learning
by: Wu, Jiaxi, et al.
Published: (2025)
by: Wu, Jiaxi, et al.
Published: (2025)
Enhancing the Reasoning Capabilities of Small Language Models via Solution Guidance Fine-Tuning
by: Bi, Jing, et al.
Published: (2024)
by: Bi, Jing, et al.
Published: (2024)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
by: Qi, Zhangyang, et al.
Published: (2025)
by: Qi, Zhangyang, et al.
Published: (2025)
SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
by: Zhao, Yanxiao, et al.
Published: (2025)
by: Zhao, Yanxiao, et al.
Published: (2025)
Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology
by: Wu, Kaiyu, et al.
Published: (2026)
by: Wu, Kaiyu, et al.
Published: (2026)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
by: Guo, Yifu, et al.
Published: (2025)
by: Guo, Yifu, et al.
Published: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
by: Tan, Huajie, et al.
Published: (2025)
by: Tan, Huajie, et al.
Published: (2025)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
by: Hua, Jiacheng, et al.
Published: (2026)
by: Hua, Jiacheng, et al.
Published: (2026)
From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models
by: Liu, Jinyi, et al.
Published: (2025)
by: Liu, Jinyi, et al.
Published: (2025)
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
by: Ming, Yifei, et al.
Published: (2023)
by: Ming, Yifei, et al.
Published: (2023)
MeTA-LoRA: Data-Efficient Multi-Task Fine-Tuning for Large Language Models
by: Cheng, Bo, et al.
Published: (2025)
by: Cheng, Bo, et al.
Published: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
by: Huang, Wenxuan, et al.
Published: (2025)
by: Huang, Wenxuan, et al.
Published: (2025)
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
by: Zhou, Zewei, et al.
Published: (2025)
by: Zhou, Zewei, et al.
Published: (2025)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
by: Xu, Shilin, et al.
Published: (2025)
by: Xu, Shilin, et al.
Published: (2025)
Knowledge Graph-Infused Fine-Tuning for Structured Reasoning in Large Language Models
by: Zhang, Wuyang, et al.
Published: (2025)
by: Zhang, Wuyang, et al.
Published: (2025)
Long-Short Chain-of-Thought Mixture Supervised Fine-Tuning Eliciting Efficient Reasoning in Large Language Models
by: Yu, Bin, et al.
Published: (2025)
by: Yu, Bin, et al.
Published: (2025)
Interpretable Logical Anomaly Classification via Constraint Decomposition and Instruction Fine-Tuning
by: Zhang, Xufei, et al.
Published: (2026)
by: Zhang, Xufei, et al.
Published: (2026)
Visual-RFT: Visual Reinforcement Fine-Tuning
by: Liu, Ziyu, et al.
Published: (2025)
by: Liu, Ziyu, et al.
Published: (2025)
Brainstorming Brings Power to Large Language Models of Knowledge Reasoning
by: Qin, Zining, et al.
Published: (2024)
by: Qin, Zining, et al.
Published: (2024)
Similar Items
-
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
by: Luo, Yifu, et al.
Published: (2025) -
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
by: Sun, Haoyuan, et al.
Published: (2024) -
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
by: Luo, Yifu, et al.
Published: (2025) -
Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping
by: Sun, Haoyuan, et al.
Published: (2026) -
Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization
by: Luo, Yifu, et al.
Published: (2025)