Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wei, Lai, Li, Yuting, Zheng, Kaipeng, Wang, Chen, Wang, Yue, Kong, Linghe, Sun, Lichao, Huang, Weiran |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
von: Wei, Lai, et al.
Veröffentlicht: (2025)
von: Wei, Lai, et al.
Veröffentlicht: (2025)
Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation
von: Li, Yuting, et al.
Veröffentlicht: (2025)
von: Li, Yuting, et al.
Veröffentlicht: (2025)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023)
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
IDER: IDempotent Experience Replay for Reliable Continual Learning
von: Liu, Zhanwang, et al.
Veröffentlicht: (2026)
von: Liu, Zhanwang, et al.
Veröffentlicht: (2026)
Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR
von: Hu, Ruina, et al.
Veröffentlicht: (2026)
von: Hu, Ruina, et al.
Veröffentlicht: (2026)
Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
von: Wei, Lai, et al.
Veröffentlicht: (2026)
von: Wei, Lai, et al.
Veröffentlicht: (2026)
MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets
von: Wei, Lai, et al.
Veröffentlicht: (2023)
von: Wei, Lai, et al.
Veröffentlicht: (2023)
VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
von: Yuan, Ruifeng, et al.
Veröffentlicht: (2025)
von: Yuan, Ruifeng, et al.
Veröffentlicht: (2025)
OTMatch: Improving Semi-Supervised Learning with Optimal Transport
von: Tan, Zhiquan, et al.
Veröffentlicht: (2023)
von: Tan, Zhiquan, et al.
Veröffentlicht: (2023)
Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction
von: Xu, Chengzhi, et al.
Veröffentlicht: (2025)
von: Xu, Chengzhi, et al.
Veröffentlicht: (2025)
Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
von: Chen, Kun, et al.
Veröffentlicht: (2025)
von: Chen, Kun, et al.
Veröffentlicht: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
von: Song, Dingjie, et al.
Veröffentlicht: (2024)
von: Song, Dingjie, et al.
Veröffentlicht: (2024)
Reinforcing Multimodal Reasoning Against Visual Degradation
von: Liu, Rui, et al.
Veröffentlicht: (2026)
von: Liu, Rui, et al.
Veröffentlicht: (2026)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
von: Tian, Changyuan, et al.
Veröffentlicht: (2026)
von: Tian, Changyuan, et al.
Veröffentlicht: (2026)
From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning
von: Sharif, Omar, et al.
Veröffentlicht: (2026)
von: Sharif, Omar, et al.
Veröffentlicht: (2026)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
von: Liu, Chengzhi, et al.
Veröffentlicht: (2025)
von: Liu, Chengzhi, et al.
Veröffentlicht: (2025)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
von: Hua, Jiacheng, et al.
Veröffentlicht: (2026)
von: Hua, Jiacheng, et al.
Veröffentlicht: (2026)
Toward Robust Incomplete Multimodal Sentiment Analysis via Hierarchical Representation Learning
von: Li, Mingcheng, et al.
Veröffentlicht: (2024)
von: Li, Mingcheng, et al.
Veröffentlicht: (2024)
RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows
von: Zhang, Kai, et al.
Veröffentlicht: (2025)
von: Zhang, Kai, et al.
Veröffentlicht: (2025)
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
von: Yue, Yang, et al.
Veröffentlicht: (2025)
von: Yue, Yang, et al.
Veröffentlicht: (2025)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
Open-Vocabulary Federated Learning with Multimodal Prototyping
von: Zeng, Huimin, et al.
Veröffentlicht: (2024)
von: Zeng, Huimin, et al.
Veröffentlicht: (2024)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
von: Guo, Jarvis, et al.
Veröffentlicht: (2024)
von: Guo, Jarvis, et al.
Veröffentlicht: (2024)
SciMDR: Advancing Scientific Multimodal Document Reasoning
von: Chen, Ziyu, et al.
Veröffentlicht: (2026)
von: Chen, Ziyu, et al.
Veröffentlicht: (2026)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
Agri-R1: Agricultural Reasoning for Disease Diagnosis via Automated-Synthesis and Reinforcement Learning
von: Zhang, Wentao, et al.
Veröffentlicht: (2026)
von: Zhang, Wentao, et al.
Veröffentlicht: (2026)
Enhanced Continual Learning of Vision-Language Models with Model Fusion
von: Gao, Haoyuan, et al.
Veröffentlicht: (2025)
von: Gao, Haoyuan, et al.
Veröffentlicht: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
von: Chen, Yi, et al.
Veröffentlicht: (2025)
von: Chen, Yi, et al.
Veröffentlicht: (2025)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
von: Zhang, Xiaofeng, et al.
Veröffentlicht: (2024)
von: Zhang, Xiaofeng, et al.
Veröffentlicht: (2024)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
von: Liang, Jianxin, et al.
Veröffentlicht: (2025)
von: Liang, Jianxin, et al.
Veröffentlicht: (2025)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
von: Xie, Yuxuan, et al.
Veröffentlicht: (2024)
von: Xie, Yuxuan, et al.
Veröffentlicht: (2024)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
von: Wang, Weiyun, et al.
Veröffentlicht: (2025)
von: Wang, Weiyun, et al.
Veröffentlicht: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
von: Yu, En, et al.
Veröffentlicht: (2025)
von: Yu, En, et al.
Veröffentlicht: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
von: Lu, Meng, et al.
Veröffentlicht: (2025)
von: Lu, Meng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
von: Wei, Lai, et al.
Veröffentlicht: (2025) -
Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation
von: Li, Yuting, et al.
Veröffentlicht: (2025) -
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
von: Chen, Shuang, et al.
Veröffentlicht: (2025) -
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023) -
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)