The Debate on RLVR Reasoning Capability Boundary: Shrinkage, Expansion, or Both? A Two-Stage Dynamic View
Fuente:
arXiv
Salvato in:
| Autori principali: | Yao, Xinhao, Yu, Lu, Hu, Xiaolin, Teng, Fengwei, Cui, Qing, Zhou, Jun, Liu, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
di: Shen, Minghe, et al.
Pubblicazione: (2025)
di: Shen, Minghe, et al.
Pubblicazione: (2025)
Enhancing In-Context Learning Performance with just SVD-Based Weight Pruning: A Theoretical Perspective
di: Yao, Xinhao, et al.
Pubblicazione: (2024)
di: Yao, Xinhao, et al.
Pubblicazione: (2024)
Mol-Debate: Multi-Agent Debate Improves Structural Reasoning in Molecular Design
di: Zhang, Wengyu, et al.
Pubblicazione: (2026)
di: Zhang, Wengyu, et al.
Pubblicazione: (2026)
Skip-Connected Policy Optimization for Implicit Advantage
di: Teng, Fengwei, et al.
Pubblicazione: (2026)
di: Teng, Fengwei, et al.
Pubblicazione: (2026)
Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning
di: Alam, Md Tanvirul, et al.
Pubblicazione: (2025)
di: Alam, Md Tanvirul, et al.
Pubblicazione: (2025)
Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate
di: Wang, Cunda, et al.
Pubblicazione: (2026)
di: Wang, Cunda, et al.
Pubblicazione: (2026)
Disentangling Feature Structure: A Mathematically Provable Two-Stage Training Dynamics in Transformers
di: Gong, Zixuan, et al.
Pubblicazione: (2025)
di: Gong, Zixuan, et al.
Pubblicazione: (2025)
When Two LLMs Debate, Both Think They'll Win
di: Prasad, Pradyumna Shyama, et al.
Pubblicazione: (2025)
di: Prasad, Pradyumna Shyama, et al.
Pubblicazione: (2025)
From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
di: Xu, Donglai, et al.
Pubblicazione: (2025)
di: Xu, Donglai, et al.
Pubblicazione: (2025)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
di: Huang, Kexin, et al.
Pubblicazione: (2026)
di: Huang, Kexin, et al.
Pubblicazione: (2026)
Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
di: Chen, Xiaolin, et al.
Pubblicazione: (2025)
di: Chen, Xiaolin, et al.
Pubblicazione: (2025)
Take A Step Back: Rethinking the Two Stages in Visual Reasoning
di: Zhang, Mingyu, et al.
Pubblicazione: (2024)
di: Zhang, Mingyu, et al.
Pubblicazione: (2024)
OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models
di: Kim, Jaehoon, et al.
Pubblicazione: (2026)
di: Kim, Jaehoon, et al.
Pubblicazione: (2026)
Generalization of RLVR Using Causal Reasoning as a Testbed
di: Lu, Brian, et al.
Pubblicazione: (2025)
di: Lu, Brian, et al.
Pubblicazione: (2025)
From Reasoning LLMs to BERT: A Two-Stage Distillation Framework for Search Relevance
di: Xia, Runze, et al.
Pubblicazione: (2025)
di: Xia, Runze, et al.
Pubblicazione: (2025)
Dual Consensus: Escaping from Spurious Majority in Unsupervised RLVR via Two-Stage Vote Mechanism
di: Du, Kaixuan, et al.
Pubblicazione: (2026)
di: Du, Kaixuan, et al.
Pubblicazione: (2026)
On the Necessity of Two-Stage Estimation for Learning Dynamical Systems under Both Noise and Node-Wise Attacks
di: Kim, Jihun, et al.
Pubblicazione: (2026)
di: Kim, Jihun, et al.
Pubblicazione: (2026)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
di: Chen, Yan, et al.
Pubblicazione: (2025)
di: Chen, Yan, et al.
Pubblicazione: (2025)
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
UniGeM: Unifying Data Mixing and Selection via Geometric Exploration and Mining
di: Wang, Changhao, et al.
Pubblicazione: (2026)
di: Wang, Changhao, et al.
Pubblicazione: (2026)
Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR
di: Wang, Jiakang, et al.
Pubblicazione: (2025)
di: Wang, Jiakang, et al.
Pubblicazione: (2025)
Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs
di: Lu, Jinda, et al.
Pubblicazione: (2026)
di: Lu, Jinda, et al.
Pubblicazione: (2026)
Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR
di: Ingle, Yash, et al.
Pubblicazione: (2026)
di: Ingle, Yash, et al.
Pubblicazione: (2026)
GRIP: Geometric Refinement and Adaptive Information Potential for Data Efficiency
di: Wang, Changhao, et al.
Pubblicazione: (2026)
di: Wang, Changhao, et al.
Pubblicazione: (2026)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
di: Gu, Hengrui, et al.
Pubblicazione: (2026)
di: Gu, Hengrui, et al.
Pubblicazione: (2026)
A State-of-the-Art SQL Reasoning Model using RLVR
di: Ali, Alnur, et al.
Pubblicazione: (2025)
di: Ali, Alnur, et al.
Pubblicazione: (2025)
FOOGD: Federated Collaboration for Both Out-of-distribution Generalization and Detection
di: Liao, Xinting, et al.
Pubblicazione: (2024)
di: Liao, Xinting, et al.
Pubblicazione: (2024)
On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR
di: Ye, Hao, et al.
Pubblicazione: (2026)
di: Ye, Hao, et al.
Pubblicazione: (2026)
Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning
di: Xie, Can, et al.
Pubblicazione: (2025)
di: Xie, Can, et al.
Pubblicazione: (2025)
Best-of-Both-Worlds Fair Allocation of Indivisible and Mixed Goods
di: Bu, Xiaolin, et al.
Pubblicazione: (2024)
di: Bu, Xiaolin, et al.
Pubblicazione: (2024)
RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
Self-Distilled RLVR
di: Yang, Chenxu, et al.
Pubblicazione: (2026)
di: Yang, Chenxu, et al.
Pubblicazione: (2026)
A New Perspective of the Meese-Rogoff Puzzle: Application of Sparse Dynamic Shrinkage
di: Fan, Zheng, et al.
Pubblicazione: (2025)
di: Fan, Zheng, et al.
Pubblicazione: (2025)
Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
di: Huang, Fanding, et al.
Pubblicazione: (2025)
di: Huang, Fanding, et al.
Pubblicazione: (2025)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
di: Wu, Junkang, et al.
Pubblicazione: (2025)
di: Wu, Junkang, et al.
Pubblicazione: (2025)
Two-Stage Learning of Stabilizing Neural Controllers via Zubov Sampling and Iterative Domain Expansion
di: Li, Haoyu, et al.
Pubblicazione: (2025)
di: Li, Haoyu, et al.
Pubblicazione: (2025)
Compositional Generalization from Learned Skills via CoT Training: A Theoretical and Structural Analysis for Reasoning
di: Yao, Xinhao, et al.
Pubblicazione: (2025)
di: Yao, Xinhao, et al.
Pubblicazione: (2025)
Theoretical Insights into Fine-Tuning Attention Mechanism: Generalization and Optimization
di: Yao, Xinhao, et al.
Pubblicazione: (2024)
di: Yao, Xinhao, et al.
Pubblicazione: (2024)
Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer Compression
di: Ye, Hancheng, et al.
Pubblicazione: (2024)
di: Ye, Hancheng, et al.
Pubblicazione: (2024)
Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks
di: Hegazy, Mahmood
Pubblicazione: (2024)
di: Hegazy, Mahmood
Pubblicazione: (2024)
Documenti analoghi
-
Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
di: Shen, Minghe, et al.
Pubblicazione: (2025) -
Enhancing In-Context Learning Performance with just SVD-Based Weight Pruning: A Theoretical Perspective
di: Yao, Xinhao, et al.
Pubblicazione: (2024) -
Mol-Debate: Multi-Agent Debate Improves Structural Reasoning in Molecular Design
di: Zhang, Wengyu, et al.
Pubblicazione: (2026) -
Skip-Connected Policy Optimization for Implicit Advantage
di: Teng, Fengwei, et al.
Pubblicazione: (2026) -
Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning
di: Alam, Md Tanvirul, et al.
Pubblicazione: (2025)