R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Jingyi, Huang, Jiaxing, Yao, Huanjin, Liu, Shunyu, Zhang, Xikun, Lu, Shijian, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
von: Zhang, Jingyi, et al.
Veröffentlicht: (2026)
von: Zhang, Jingyi, et al.
Veröffentlicht: (2026)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
A Survey on Agentic Multimodal Large Language Models
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
Improving Large Language Models with Concept-Aware Fine-Tuning
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
A Survey on Evaluation of Multimodal Large Language Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
von: Yao, Huanjin, et al.
Veröffentlicht: (2024)
von: Yao, Huanjin, et al.
Veröffentlicht: (2024)
Open-Vocabulary Object Detection via Language Hierarchy
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
Vision-Language Models for Vision Tasks: A Survey
von: Zhang, Jingyi, et al.
Veröffentlicht: (2023)
von: Zhang, Jingyi, et al.
Veröffentlicht: (2023)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
Historical Test-time Prompt Tuning for Vision Foundation Models
von: Zhang, Jingyi, et al.
Veröffentlicht: (2024)
von: Zhang, Jingyi, et al.
Veröffentlicht: (2024)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
von: Zhang, Junjie, et al.
Veröffentlicht: (2025)
von: Zhang, Junjie, et al.
Veröffentlicht: (2025)
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
von: Yao, Huanjin, et al.
Veröffentlicht: (2026)
von: Yao, Huanjin, et al.
Veröffentlicht: (2026)
R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
von: Lu, Jinghui, et al.
Veröffentlicht: (2026)
von: Lu, Jinghui, et al.
Veröffentlicht: (2026)
Read and Think: An Efficient Step-wise Multimodal Language Model for Document Understanding and Reasoning
von: Zhang, Jinxu
Veröffentlicht: (2024)
von: Zhang, Jinxu
Veröffentlicht: (2024)
Foundation Models for Remote Sensing and Earth Observation: A Survey
von: Xiao, Aoran, et al.
Veröffentlicht: (2024)
von: Xiao, Aoran, et al.
Veröffentlicht: (2024)
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
von: Cheng, Shuang, et al.
Veröffentlicht: (2025)
von: Cheng, Shuang, et al.
Veröffentlicht: (2025)
EventVL: Understand Event Streams via Multimodal Large Language Model
von: Li, Pengteng, et al.
Veröffentlicht: (2025)
von: Li, Pengteng, et al.
Veröffentlicht: (2025)
VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning
von: Wang, Yibo, et al.
Veröffentlicht: (2026)
von: Wang, Yibo, et al.
Veröffentlicht: (2026)
AgriGPT-VL: Agricultural Vision-Language Understanding Suite
von: Yang, Bo, et al.
Veröffentlicht: (2025)
von: Yang, Bo, et al.
Veröffentlicht: (2025)
Learning to Prompt Segment Anything Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
von: Xu, Huimin, et al.
Veröffentlicht: (2025)
von: Xu, Huimin, et al.
Veröffentlicht: (2025)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
von: Wen, Zichen, et al.
Veröffentlicht: (2026)
von: Wen, Zichen, et al.
Veröffentlicht: (2026)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
von: HyperAI Team, et al.
Veröffentlicht: (2025)
von: HyperAI Team, et al.
Veröffentlicht: (2025)
Is Sarcasm Detection A Step-by-Step Reasoning Process in Large Language Models?
von: Yao, Ben, et al.
Veröffentlicht: (2024)
von: Yao, Ben, et al.
Veröffentlicht: (2024)
Large Language Models as an Indirect Reasoner: Contrapositive and Contradiction for Automated Reasoning
von: Zhang, Yanfang, et al.
Veröffentlicht: (2024)
von: Zhang, Yanfang, et al.
Veröffentlicht: (2024)
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
von: Jin, Zhao, et al.
Veröffentlicht: (2025)
von: Jin, Zhao, et al.
Veröffentlicht: (2025)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
von: Qiu, Han, et al.
Veröffentlicht: (2024)
von: Qiu, Han, et al.
Veröffentlicht: (2024)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
von: Tu, Rong-Cheng, et al.
Veröffentlicht: (2025)
von: Tu, Rong-Cheng, et al.
Veröffentlicht: (2025)
Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models
von: Gu, Xiaojie, et al.
Veröffentlicht: (2026)
von: Gu, Xiaojie, et al.
Veröffentlicht: (2026)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
von: Zhang, Kongcheng, et al.
Veröffentlicht: (2025)
von: Zhang, Kongcheng, et al.
Veröffentlicht: (2025)
Large Language Model for Multi-objective Evolutionary Optimization
von: Liu, Fei, et al.
Veröffentlicht: (2023)
von: Liu, Fei, et al.
Veröffentlicht: (2023)
GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
von: Su, Yanzhou, et al.
Veröffentlicht: (2025)
von: Su, Yanzhou, et al.
Veröffentlicht: (2025)
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
von: Nie, Ming, et al.
Veröffentlicht: (2026)
von: Nie, Ming, et al.
Veröffentlicht: (2026)
Boosting Reasoning in Large Multimodal Models via Activation Replay
von: Xing, Yun, et al.
Veröffentlicht: (2025)
von: Xing, Yun, et al.
Veröffentlicht: (2025)
VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
von: Yuan, Ruifeng, et al.
Veröffentlicht: (2025)
von: Yuan, Ruifeng, et al.
Veröffentlicht: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
von: Chen, Jiaxing, et al.
Veröffentlicht: (2024)
von: Chen, Jiaxing, et al.
Veröffentlicht: (2024)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
von: Lai, Xin, et al.
Veröffentlicht: (2024)
von: Lai, Xin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
von: Zhang, Jingyi, et al.
Veröffentlicht: (2026) -
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
von: Yao, Huanjin, et al.
Veröffentlicht: (2025) -
A Survey on Agentic Multimodal Large Language Models
von: Yao, Huanjin, et al.
Veröffentlicht: (2025) -
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
von: Yao, Huanjin, et al.
Veröffentlicht: (2025) -
Improving Large Language Models with Concept-Aware Fine-Tuning
von: Chen, Michael K., et al.
Veröffentlicht: (2025)