VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cai, Xin-Qiang, Sugiyama, Masashi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025)
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
von: Li, Yingru, et al.
Veröffentlicht: (2026)
von: Li, Yingru, et al.
Veröffentlicht: (2026)
RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
von: Zha, Kaiwen, et al.
Veröffentlicht: (2025)
von: Zha, Kaiwen, et al.
Veröffentlicht: (2025)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
von: Yao, Jiarui, et al.
Veröffentlicht: (2025)
von: Yao, Jiarui, et al.
Veröffentlicht: (2025)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
von: Wen, Xuexiang, et al.
Veröffentlicht: (2026)
von: Wen, Xuexiang, et al.
Veröffentlicht: (2026)
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
von: Huang, Luke J., et al.
Veröffentlicht: (2026)
von: Huang, Luke J., et al.
Veröffentlicht: (2026)
Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers
von: Sareen, Kusha, et al.
Veröffentlicht: (2025)
von: Sareen, Kusha, et al.
Veröffentlicht: (2025)
Horizon Reduction Makes RL Scalable
von: Park, Seohong, et al.
Veröffentlicht: (2025)
von: Park, Seohong, et al.
Veröffentlicht: (2025)
RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
von: Bhatia, Abhinav, et al.
Veröffentlicht: (2023)
von: Bhatia, Abhinav, et al.
Veröffentlicht: (2023)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
von: Zhang, Qiang, et al.
Veröffentlicht: (2026)
von: Zhang, Qiang, et al.
Veröffentlicht: (2026)
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
von: Wu, Jiahao, et al.
Veröffentlicht: (2026)
von: Wu, Jiahao, et al.
Veröffentlicht: (2026)
Token-Efficient RL for LLM Reasoning
von: Lee, Alan, et al.
Veröffentlicht: (2025)
von: Lee, Alan, et al.
Veröffentlicht: (2025)
RL for Reasoning by Adaptively Revealing Rationales
von: Amani, Mohammad Hossein, et al.
Veröffentlicht: (2025)
von: Amani, Mohammad Hossein, et al.
Veröffentlicht: (2025)
COOL-MC: Verifying and Explaining RL Policies for Platelet Inventory Management
von: Gross, Dennis
Veröffentlicht: (2026)
von: Gross, Dennis
Veröffentlicht: (2026)
VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL
von: Hu, Zengjie, et al.
Veröffentlicht: (2025)
von: Hu, Zengjie, et al.
Veröffentlicht: (2025)
CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution
von: Pan, Teng, et al.
Veröffentlicht: (2026)
von: Pan, Teng, et al.
Veröffentlicht: (2026)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
von: Huang, Yu, et al.
Veröffentlicht: (2026)
von: Huang, Yu, et al.
Veröffentlicht: (2026)
COSMO-RL: Towards Trustworthy LMRMs via Joint Safety and Stability
von: Ding, Yizhuo, et al.
Veröffentlicht: (2025)
von: Ding, Yizhuo, et al.
Veröffentlicht: (2025)
FASTER: Value-Guided Sampling for Fast RL
von: Dong, Perry, et al.
Veröffentlicht: (2026)
von: Dong, Perry, et al.
Veröffentlicht: (2026)
Q-Guided Stein Variational Model Predictive Control via RL-informed Policy Prior
von: Cai, Shizhe, et al.
Veröffentlicht: (2025)
von: Cai, Shizhe, et al.
Veröffentlicht: (2025)
COOL-MC: Verifying and Explaining RL Policies for Multi-bridge Network Maintenance
von: Gross, Dennis
Veröffentlicht: (2026)
von: Gross, Dennis
Veröffentlicht: (2026)
STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order
von: Gu, Chengyang, et al.
Veröffentlicht: (2026)
von: Gu, Chengyang, et al.
Veröffentlicht: (2026)
GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control
von: Xu, Haofeng, et al.
Veröffentlicht: (2026)
von: Xu, Haofeng, et al.
Veröffentlicht: (2026)
Escaping the Verifier: Learning to Reason via Demonstrations
von: Cai, Locke, et al.
Veröffentlicht: (2025)
von: Cai, Locke, et al.
Veröffentlicht: (2025)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
von: Pavlenko, Kirill, et al.
Veröffentlicht: (2026)
von: Pavlenko, Kirill, et al.
Veröffentlicht: (2026)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
von: Mark, Max Sobol, et al.
Veröffentlicht: (2024)
von: Mark, Max Sobol, et al.
Veröffentlicht: (2024)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
von: Brantley, Kianté, et al.
Veröffentlicht: (2025)
von: Brantley, Kianté, et al.
Veröffentlicht: (2025)
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
von: Yang, Rui, et al.
Veröffentlicht: (2026)
von: Yang, Rui, et al.
Veröffentlicht: (2026)
Verification-Guided Falsification for Safe RL via Explainable Abstraction and Risk-Aware Exploration
von: Le, Tuan, et al.
Veröffentlicht: (2025)
von: Le, Tuan, et al.
Veröffentlicht: (2025)
Out-of-Distribution Adaptation in Offline RL: Counterfactual Reasoning via Causal Normalizing Flows
von: Cho, Minjae, et al.
Veröffentlicht: (2024)
von: Cho, Minjae, et al.
Veröffentlicht: (2024)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
von: Wu, Xian, et al.
Veröffentlicht: (2026)
von: Wu, Xian, et al.
Veröffentlicht: (2026)
Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use
von: Goldie, Anna, et al.
Veröffentlicht: (2025)
von: Goldie, Anna, et al.
Veröffentlicht: (2025)
An Empirical Study on the Effectiveness of Incorporating Offline RL As Online RL Subroutines
von: Su, Jianhai, et al.
Veröffentlicht: (2025)
von: Su, Jianhai, et al.
Veröffentlicht: (2025)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
von: Romeo, Carlo, et al.
Veröffentlicht: (2026)
von: Romeo, Carlo, et al.
Veröffentlicht: (2026)
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
von: Shen, Guobin, et al.
Veröffentlicht: (2026)
von: Shen, Guobin, et al.
Veröffentlicht: (2026)
How Can LLM Guide RL? A Value-Based Approach
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)
RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs
von: Samineni, Soumya Rani, et al.
Veröffentlicht: (2025)
von: Samineni, Soumya Rani, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025) -
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
von: Li, Yingru, et al.
Veröffentlicht: (2026) -
RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
von: Zha, Kaiwen, et al.
Veröffentlicht: (2025) -
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
von: Yao, Jiarui, et al.
Veröffentlicht: (2025) -
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
von: Wen, Xuexiang, et al.
Veröffentlicht: (2026)