Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dave, Rudray, Dubey, Vedang, Deoghare, Smit, Mishra, Sudhakar |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
par: Cai, Xin-Qiang, et autres
Publié: (2025)
par: Cai, Xin-Qiang, et autres
Publié: (2025)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
par: Lu, Xiaodong, et autres
Publié: (2026)
par: Lu, Xiaodong, et autres
Publié: (2026)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
par: Yan, Kai, et autres
Publié: (2026)
par: Yan, Kai, et autres
Publié: (2026)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
par: Zhang, Feng, et autres
Publié: (2026)
par: Zhang, Feng, et autres
Publié: (2026)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
par: Yoon, Deokgyu, et autres
Publié: (2026)
par: Yoon, Deokgyu, et autres
Publié: (2026)
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
par: Hu, Haoyu, et autres
Publié: (2026)
par: Hu, Haoyu, et autres
Publié: (2026)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR
par: Ingle, Yash, et autres
Publié: (2026)
par: Ingle, Yash, et autres
Publié: (2026)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
par: Wang, Zhen, et autres
Publié: (2025)
par: Wang, Zhen, et autres
Publié: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026)
par: Ackermann, Johannes, et autres
Publié: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
par: Nguyen, Hieu Trung, et autres
Publié: (2026)
par: Nguyen, Hieu Trung, et autres
Publié: (2026)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
par: Stojanovski, Zafir, et autres
Publié: (2025)
par: Stojanovski, Zafir, et autres
Publié: (2025)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
par: Zhang, Zijing, et autres
Publié: (2025)
par: Zhang, Zijing, et autres
Publié: (2025)
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
par: Frans, Kevin, et autres
Publié: (2024)
par: Frans, Kevin, et autres
Publié: (2024)
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
par: Rocamonde, Juan, et autres
Publié: (2023)
par: Rocamonde, Juan, et autres
Publié: (2023)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
par: Ma, Zhengzhao, et autres
Publié: (2026)
par: Ma, Zhengzhao, et autres
Publié: (2026)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
par: Wang, Longwen, et autres
Publié: (2026)
par: Wang, Longwen, et autres
Publié: (2026)
Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
par: Cho, Dongkyu Derek, et autres
Publié: (2025)
par: Cho, Dongkyu Derek, et autres
Publié: (2025)
The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward
par: Li, Long, et autres
Publié: (2025)
par: Li, Long, et autres
Publié: (2025)
DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay
par: Li, Long, et autres
Publié: (2026)
par: Li, Long, et autres
Publié: (2026)
An Imperfect Verifier is Good Enough: Learning with Noisy Rewards
par: Plesner, Andreas, et autres
Publié: (2026)
par: Plesner, Andreas, et autres
Publié: (2026)
CuRLA: Curriculum Learning Based Deep Reinforcement Learning for Autonomous Driving
par: Uppuluri, Bhargava, et autres
Publié: (2025)
par: Uppuluri, Bhargava, et autres
Publié: (2025)
Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards
par: Rad, Ali, et autres
Publié: (2026)
par: Rad, Ali, et autres
Publié: (2026)
Reward Hacking Mitigation using Verifiable Composite Rewards
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards
par: Bai, Bizhe, et autres
Publié: (2026)
par: Bai, Bizhe, et autres
Publié: (2026)
Language-Guided Reinforcement Learning for Hard Attention in Few-Shot Learning
par: Nikpour, Bahareh, et autres
Publié: (2023)
par: Nikpour, Bahareh, et autres
Publié: (2023)
A Review of Reward Functions for Reinforcement Learning in the context of Autonomous Driving
par: Abouelazm, Ahmed, et autres
Publié: (2024)
par: Abouelazm, Ahmed, et autres
Publié: (2024)
Reinforcement Learning-based Approach for Vehicle-to-Building Charging with Heterogeneous Agents and Long Term Rewards
par: Liu, Fangqi, et autres
Publié: (2025)
par: Liu, Fangqi, et autres
Publié: (2025)
Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers
par: Dong, Juncheng, et autres
Publié: (2026)
par: Dong, Juncheng, et autres
Publié: (2026)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning
par: Wachi, Akifumi, et autres
Publié: (2026)
par: Wachi, Akifumi, et autres
Publié: (2026)
RLSR: Reinforcement Learning from Self Reward
par: Simonds, Toby, et autres
Publié: (2025)
par: Simonds, Toby, et autres
Publié: (2025)
Curriculum-Guided Antifragile Reinforcement Learning for Secure UAV Deconfliction under Observation-Space Attacks
par: Panda, Deepak Kumar, et autres
Publié: (2025)
par: Panda, Deepak Kumar, et autres
Publié: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
par: Jiang, Xitai, et autres
Publié: (2026)
par: Jiang, Xitai, et autres
Publié: (2026)
Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents
par: K, Deeraj S, et autres
Publié: (2026)
par: K, Deeraj S, et autres
Publié: (2026)
Preventing Curriculum Collapse in Self-Evolving Reasoning Systems
par: Mishra, Vaibhav
Publié: (2026)
par: Mishra, Vaibhav
Publié: (2026)
One-Shot Clustering for Federated Learning
par: Zuziak, Maciej Krzysztof, et autres
Publié: (2025)
par: Zuziak, Maciej Krzysztof, et autres
Publié: (2025)
Reinforcement Learning with Symbolic Reward Machines
par: Krug, Thomas, et autres
Publié: (2026)
par: Krug, Thomas, et autres
Publié: (2026)
Reinforcement Learning with Exogenous States and Rewards
par: Trimponias, George, et autres
Publié: (2023)
par: Trimponias, George, et autres
Publié: (2023)
Documents similaires
-
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
par: Cai, Xin-Qiang, et autres
Publié: (2025) -
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
par: Huang, Yu, et autres
Publié: (2026) -
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
par: Lu, Xiaodong, et autres
Publié: (2026) -
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
par: Yan, Kai, et autres
Publié: (2026) -
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
par: Zhang, Feng, et autres
Publié: (2026)