Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
Fuente:
arXiv
Salvato in:
| Autori principali: | Yue, Yang, Chen, Zhiqi, Lu, Rui, Zhao, Andrew, Wang, Zhaokai, Song, Shiji, Huang, Gao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2025)
di: Wang, Shenzhi, et al.
Pubblicazione: (2025)
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
di: Huang, Shulin, et al.
Pubblicazione: (2025)
di: Huang, Shulin, et al.
Pubblicazione: (2025)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
EfficientTrain++: Generalized Curriculum Learning for Efficient Visual Backbone Training
di: Wang, Yulin, et al.
Pubblicazione: (2024)
di: Wang, Yulin, et al.
Pubblicazione: (2024)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2026)
di: Wang, Shenzhi, et al.
Pubblicazione: (2026)
Cross-Modal Adapter for Vision-Language Retrieval
di: Jiang, Haojun, et al.
Pubblicazione: (2022)
di: Jiang, Haojun, et al.
Pubblicazione: (2022)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
di: Lu, Meng, et al.
Pubblicazione: (2025)
di: Lu, Meng, et al.
Pubblicazione: (2025)
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
di: Geigle, Gregor, et al.
Pubblicazione: (2024)
di: Geigle, Gregor, et al.
Pubblicazione: (2024)
CheXWorld: Exploring Image World Modeling for Radiograph Representation Learning
di: Yue, Yang, et al.
Pubblicazione: (2025)
di: Yue, Yang, et al.
Pubblicazione: (2025)
Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs
di: Yang, Wanli, et al.
Pubblicazione: (2026)
di: Yang, Wanli, et al.
Pubblicazione: (2026)
EchoWorld: Learning Motion-Aware World Models for Echocardiography Probe Guidance
di: Yue, Yang, et al.
Pubblicazione: (2025)
di: Yue, Yang, et al.
Pubblicazione: (2025)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
di: Gong, Kaixiong, et al.
Pubblicazione: (2024)
di: Gong, Kaixiong, et al.
Pubblicazione: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
di: Cai, Zhenyang, et al.
Pubblicazione: (2025)
di: Cai, Zhenyang, et al.
Pubblicazione: (2025)
Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start
di: Wei, Lai, et al.
Pubblicazione: (2025)
di: Wei, Lai, et al.
Pubblicazione: (2025)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
di: Zhong, Yufeng, et al.
Pubblicazione: (2025)
di: Zhong, Yufeng, et al.
Pubblicazione: (2025)
Agri-R1: Agricultural Reasoning for Disease Diagnosis via Automated-Synthesis and Reinforcement Learning
di: Zhang, Wentao, et al.
Pubblicazione: (2026)
di: Zhang, Wentao, et al.
Pubblicazione: (2026)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code
di: Zhao, Yuze, et al.
Pubblicazione: (2026)
di: Zhao, Yuze, et al.
Pubblicazione: (2026)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
di: Xu, Yige, et al.
Pubblicazione: (2026)
di: Xu, Yige, et al.
Pubblicazione: (2026)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
di: DeepSeek-AI, et al.
Pubblicazione: (2025)
di: DeepSeek-AI, et al.
Pubblicazione: (2025)
AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards
di: Pan, Yiming, et al.
Pubblicazione: (2026)
di: Pan, Yiming, et al.
Pubblicazione: (2026)
Are VLMs Really Blind
di: Singh, Ayush, et al.
Pubblicazione: (2024)
di: Singh, Ayush, et al.
Pubblicazione: (2024)
Veracity Bias and Beyond: Uncovering LLMs' Hidden Beliefs in Problem-Solving Reasoning
di: Zhou, Yue, et al.
Pubblicazione: (2025)
di: Zhou, Yue, et al.
Pubblicazione: (2025)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
di: Guo, Zichun, et al.
Pubblicazione: (2026)
di: Guo, Zichun, et al.
Pubblicazione: (2026)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering
di: Li, Yangfu, et al.
Pubblicazione: (2025)
di: Li, Yangfu, et al.
Pubblicazione: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
di: Zhao, Andrew, et al.
Pubblicazione: (2025)
di: Zhao, Andrew, et al.
Pubblicazione: (2025)
Enhancing Chest X-ray Classification through Knowledge Injection in Cross-Modality Learning
di: Yan, Yang, et al.
Pubblicazione: (2025)
di: Yan, Yang, et al.
Pubblicazione: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
Reinforcing Multimodal Reasoning Against Visual Degradation
di: Liu, Rui, et al.
Pubblicazione: (2026)
di: Liu, Rui, et al.
Pubblicazione: (2026)
MiRAGeNews: Multimodal Realistic AI-Generated News Detection
di: Huang, Runsheng, et al.
Pubblicazione: (2024)
di: Huang, Runsheng, et al.
Pubblicazione: (2024)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2025) -
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2025) -
Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
di: Huang, Shulin, et al.
Pubblicazione: (2025) -
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
di: Wang, Haozhe, et al.
Pubblicazione: (2025) -
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
di: Wen, Xumeng, et al.
Pubblicazione: (2025)