Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing
Fuente:
arXiv
Guardado en:
| Autores principales: | Pang, Yujuan, Li, Jiaxin, Sheng, Xin, Peng, Ran, Ma, Yong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Spurious Rewards: Rethinking Training Signals in RLVR
por: Shao, Rulin, et al.
Publicado: (2025)
por: Shao, Rulin, et al.
Publicado: (2025)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
por: Mou, Chaoli, et al.
Publicado: (2026)
por: Mou, Chaoli, et al.
Publicado: (2026)
Beyond One-Way Pruning: Bidirectional Pruning-Regrowth for Extreme Accuracy-Sparsity Tradeoff
por: Liu, Junchen, et al.
Publicado: (2025)
por: Liu, Junchen, et al.
Publicado: (2025)
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
por: Miao, Yuchun, et al.
Publicado: (2026)
por: Miao, Yuchun, et al.
Publicado: (2026)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
por: Duo, Jiangshan, et al.
Publicado: (2026)
por: Duo, Jiangshan, et al.
Publicado: (2026)
The Path Not Taken: RLVR Provably Learns Off the Principals
por: Zhu, Hanqing, et al.
Publicado: (2025)
por: Zhu, Hanqing, et al.
Publicado: (2025)
On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR
por: Ye, Hao, et al.
Publicado: (2026)
por: Ye, Hao, et al.
Publicado: (2026)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
por: Li, Yuhan, et al.
Publicado: (2026)
por: Li, Yuhan, et al.
Publicado: (2026)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
por: Huang, Kexin, et al.
Publicado: (2026)
por: Huang, Kexin, et al.
Publicado: (2026)
Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics
por: Shihab, Ibne Farabi, et al.
Publicado: (2026)
por: Shihab, Ibne Farabi, et al.
Publicado: (2026)
Dual Randomized Smoothing: Beyond Global Noise Variance
por: Sun, Chenhao, et al.
Publicado: (2025)
por: Sun, Chenhao, et al.
Publicado: (2025)
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
por: Huang, Zhuoxu, et al.
Publicado: (2026)
por: Huang, Zhuoxu, et al.
Publicado: (2026)
VL Norm: Rethink Loss Aggregation in RLVR
por: He, Zhiyuan, et al.
Publicado: (2025)
por: He, Zhiyuan, et al.
Publicado: (2025)
Quantifying Empirical Compute-Supervision Tradeoffs in RLVR
por: Mitsuhashi, Ryo, et al.
Publicado: (2026)
por: Mitsuhashi, Ryo, et al.
Publicado: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
por: Zhang, Jiaying, et al.
Publicado: (2026)
por: Zhang, Jiaying, et al.
Publicado: (2026)
Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR
por: Bounhar, Abdelaziz, et al.
Publicado: (2025)
por: Bounhar, Abdelaziz, et al.
Publicado: (2025)
Generalization of RLVR Using Causal Reasoning as a Testbed
por: Lu, Brian, et al.
Publicado: (2025)
por: Lu, Brian, et al.
Publicado: (2025)
RLVR-World: Training World Models with Reinforcement Learning
por: Wu, Jialong, et al.
Publicado: (2025)
por: Wu, Jialong, et al.
Publicado: (2025)
Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective
por: Hao, Zhezheng, et al.
Publicado: (2025)
por: Hao, Zhezheng, et al.
Publicado: (2025)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
por: Wu, Junkang, et al.
Publicado: (2025)
por: Wu, Junkang, et al.
Publicado: (2025)
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
por: Chen, Zhipeng, et al.
Publicado: (2026)
por: Chen, Zhipeng, et al.
Publicado: (2026)
The Debate on RLVR Reasoning Capability Boundary: Shrinkage, Expansion, or Both? A Two-Stage Dynamic View
por: Yao, Xinhao, et al.
Publicado: (2025)
por: Yao, Xinhao, et al.
Publicado: (2025)
HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment
por: Liu, Zhanyu, et al.
Publicado: (2026)
por: Liu, Zhanyu, et al.
Publicado: (2026)
Event-Aware Prompt Learning for Dynamic Graphs
por: Yu, Xingtong, et al.
Publicado: (2025)
por: Yu, Xingtong, et al.
Publicado: (2025)
Part II: ROLL Flash -- Accelerating RLVR and Agentic Training with Asynchrony
por: Lu, Han, et al.
Publicado: (2025)
por: Lu, Han, et al.
Publicado: (2025)
Linear Attention for Efficient Bidirectional Sequence Modeling
por: Afzal, Arshia, et al.
Publicado: (2025)
por: Afzal, Arshia, et al.
Publicado: (2025)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
por: Helff, Lukas, et al.
Publicado: (2026)
por: Helff, Lukas, et al.
Publicado: (2026)
The Multiple Ticket Hypothesis: Random Sparse Subnetworks Suffice for RLVR
por: Adewuyi, Israel, et al.
Publicado: (2026)
por: Adewuyi, Israel, et al.
Publicado: (2026)
VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction
por: Cai, Xin-Qiang, et al.
Publicado: (2026)
por: Cai, Xin-Qiang, et al.
Publicado: (2026)
Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning
por: Luo, Yu, et al.
Publicado: (2026)
por: Luo, Yu, et al.
Publicado: (2026)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
por: Chen, Kun, et al.
Publicado: (2026)
por: Chen, Kun, et al.
Publicado: (2026)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
por: Yang, Zhicheng, et al.
Publicado: (2025)
por: Yang, Zhicheng, et al.
Publicado: (2025)
EPLKG: Efficient Prompt Learning with Knowledge Graph
por: Lim, YongTaek, et al.
Publicado: (2023)
por: Lim, YongTaek, et al.
Publicado: (2023)
Open-Medical-R1: How to Choose Data for RLVR Training at Medicine Domain
por: Qiu, Zhongxi, et al.
Publicado: (2025)
por: Qiu, Zhongxi, et al.
Publicado: (2025)
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
por: Le, Thanh-Long V., et al.
Publicado: (2025)
por: Le, Thanh-Long V., et al.
Publicado: (2025)
Personalized Federated Continual Learning via Multi-granularity Prompt
por: Yu, Hao, et al.
Publicado: (2024)
por: Yu, Hao, et al.
Publicado: (2024)
Beyond the Norm: A Survey of Synthetic Data Generation for Rare Events
por: Gu, Jingyi, et al.
Publicado: (2025)
por: Gu, Jingyi, et al.
Publicado: (2025)
Robust Knowledge Distillation Based on Feature Variance Against Backdoored Teacher Model
por: Chen, Jinyin, et al.
Publicado: (2024)
por: Chen, Jinyin, et al.
Publicado: (2024)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
por: Xu, Huimin, et al.
Publicado: (2026)
por: Xu, Huimin, et al.
Publicado: (2026)
Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains
por: Samineni, Soumya Rani, et al.
Publicado: (2025)
por: Samineni, Soumya Rani, et al.
Publicado: (2025)
Ejemplares similares
-
Spurious Rewards: Rethinking Training Signals in RLVR
por: Shao, Rulin, et al.
Publicado: (2025) -
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
por: Mou, Chaoli, et al.
Publicado: (2026) -
Beyond One-Way Pruning: Bidirectional Pruning-Regrowth for Extreme Accuracy-Sparsity Tradeoff
por: Liu, Junchen, et al.
Publicado: (2025) -
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
por: Miao, Yuchun, et al.
Publicado: (2026) -
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
por: Duo, Jiangshan, et al.
Publicado: (2026)