Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
Fuente:
arXiv
Saved in:
| Main Authors: | Nguyen, Hieu Trung, Nguyen, Bao, Ma, Wenao, Zhao, Yuzhi, She, Ruifeng, Nguyen, Viet Anh |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reasoning Planning for Language Models
by: Nguyen, Bao, et al.
Published: (2025)
by: Nguyen, Bao, et al.
Published: (2025)
Generative Conditional Distributions by Neural (Entropic) Optimal Transport
by: Nguyen, Bao, et al.
Published: (2024)
by: Nguyen, Bao, et al.
Published: (2024)
Structured Pruning for Diverse Best-of-N Reasoning Optimization
by: Nguyen, Hieu Trung, et al.
Published: (2025)
by: Nguyen, Hieu Trung, et al.
Published: (2025)
Adaptive Correlation-Weighted Intrinsic Rewards for Reinforcement Learning
by: Nguyen, Viet Bac, et al.
Published: (2026)
by: Nguyen, Viet Bac, et al.
Published: (2026)
Task-driven Layerwise Additive Activation Intervention
by: Nguyen, Hieu Trung, et al.
Published: (2025)
by: Nguyen, Hieu Trung, et al.
Published: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
by: Lu, Xiaodong, et al.
Published: (2026)
by: Lu, Xiaodong, et al.
Published: (2026)
Empowering Contrastive Federated Sequential Recommendation with LLMs
by: Nguyen, Thi Minh Chau, et al.
Published: (2026)
by: Nguyen, Thi Minh Chau, et al.
Published: (2026)
VietMix: A Naturally-Occurring Parallel Corpus and Augmentation Framework for Vietnamese-English Code-Mixed Machine Translation
by: Tran, Hieu, et al.
Published: (2025)
by: Tran, Hieu, et al.
Published: (2025)
ViLLM-Eval: A Comprehensive Evaluation Suite for Vietnamese Large Language Models
by: Nguyen, Trong-Hieu, et al.
Published: (2024)
by: Nguyen, Trong-Hieu, et al.
Published: (2024)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
by: Xu, Yixuan Even, et al.
Published: (2025)
by: Xu, Yixuan Even, et al.
Published: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
by: Gunjal, Anisha, et al.
Published: (2025)
by: Gunjal, Anisha, et al.
Published: (2025)
Probe-Free Low-Rank Activation Intervention
by: Jiang, Chonghe, et al.
Published: (2025)
by: Jiang, Chonghe, et al.
Published: (2025)
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
by: Hu, Haoyu, et al.
Published: (2026)
by: Hu, Haoyu, et al.
Published: (2026)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
by: Ma, Zhengzhao, et al.
Published: (2026)
by: Ma, Zhengzhao, et al.
Published: (2026)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
by: Stojanovski, Zafir, et al.
Published: (2025)
by: Stojanovski, Zafir, et al.
Published: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
by: Ackermann, Johannes, et al.
Published: (2026)
by: Ackermann, Johannes, et al.
Published: (2026)
Fake Advertisements Detection Using Automated Multimodal Learning: A Case Study for Vietnamese Real Estate Data
by: Nguyen, Duy, et al.
Published: (2025)
by: Nguyen, Duy, et al.
Published: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
by: Wang, Zhen, et al.
Published: (2025)
by: Wang, Zhen, et al.
Published: (2025)
Efficient Bilevel Optimization for Meta Label Correction in Noisy Label Learning
by: Nguyen, Ba Hoang Anh, et al.
Published: (2026)
by: Nguyen, Ba Hoang Anh, et al.
Published: (2026)
Learning Reconfigurable Representations for Multimodal Federated Learning with Missing Data
by: Nguyen, Duong M., et al.
Published: (2025)
by: Nguyen, Duong M., et al.
Published: (2025)
Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards
by: Rad, Ali, et al.
Published: (2026)
by: Rad, Ali, et al.
Published: (2026)
Distributional Surgery for Language Model Activations
by: Nguyen, Bao, et al.
Published: (2025)
by: Nguyen, Bao, et al.
Published: (2025)
Learning to Stop Overthinking at Test Time
by: Bao, Hieu Tran, et al.
Published: (2025)
by: Bao, Hieu Tran, et al.
Published: (2025)
Few-shot Continual Relation Extraction via Open Information Extraction
by: Nguyen, Thiem, et al.
Published: (2025)
by: Nguyen, Thiem, et al.
Published: (2025)
Cost-Adaptive Recourse Recommendation by Adaptive Preference Elicitation
by: Nguyen, Duy, et al.
Published: (2024)
by: Nguyen, Duy, et al.
Published: (2024)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
by: Liu, Bingshuai, et al.
Published: (2025)
by: Liu, Bingshuai, et al.
Published: (2025)
XMainframe: A Large Language Model for Mainframe Modernization
by: Dau, Anh T. V., et al.
Published: (2024)
by: Dau, Anh T. V., et al.
Published: (2024)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
by: Yan, Kai, et al.
Published: (2026)
by: Yan, Kai, et al.
Published: (2026)
Taipan: Efficient and Expressive State Space Language Models with Selective Attention
by: Van Nguyen, Chien, et al.
Published: (2024)
by: Van Nguyen, Chien, et al.
Published: (2024)
TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding
by: Xing, Xiaobo, et al.
Published: (2025)
by: Xing, Xiaobo, et al.
Published: (2025)
A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning
by: Wachi, Akifumi, et al.
Published: (2026)
by: Wachi, Akifumi, et al.
Published: (2026)
Mixture-of-Personas Language Models for Population Simulation
by: Bui, Ngoc, et al.
Published: (2025)
by: Bui, Ngoc, et al.
Published: (2025)
Cold-start Recommendation by Personalized Embedding Region Elicitation
by: Nguyen, Hieu Trung, et al.
Published: (2024)
by: Nguyen, Hieu Trung, et al.
Published: (2024)
Toward Cost-efficient Adaptive Clinical Trials in Knee Osteoarthritis with Reinforcement Learning
by: Nguyen, Khanh, et al.
Published: (2024)
by: Nguyen, Khanh, et al.
Published: (2024)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
by: Pang, Jing-Cheng, et al.
Published: (2024)
by: Pang, Jing-Cheng, et al.
Published: (2024)
Probing the Decision Boundaries of In-context Learning in Large Language Models
by: Zhao, Siyan, et al.
Published: (2024)
by: Zhao, Siyan, et al.
Published: (2024)
Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
by: Sun, Yifan, et al.
Published: (2025)
by: Sun, Yifan, et al.
Published: (2025)
Understanding Transformers via N-gram Statistics
by: Nguyen, Timothy
Published: (2024)
by: Nguyen, Timothy
Published: (2024)
Balancing Knowledge Distillation for Imbalance Learning with Bilevel Optimization
by: Nguyen, Anh B. H., et al.
Published: (2026)
by: Nguyen, Anh B. H., et al.
Published: (2026)
ViCLSR: A Supervised Contrastive Learning Framework with Natural Language Inference for Natural Language Understanding Tasks
by: Van Huynh, Tin, et al.
Published: (2026)
by: Van Huynh, Tin, et al.
Published: (2026)
Similar Items
-
Reasoning Planning for Language Models
by: Nguyen, Bao, et al.
Published: (2025) -
Generative Conditional Distributions by Neural (Entropic) Optimal Transport
by: Nguyen, Bao, et al.
Published: (2024) -
Structured Pruning for Diverse Best-of-N Reasoning Optimization
by: Nguyen, Hieu Trung, et al.
Published: (2025) -
Adaptive Correlation-Weighted Intrinsic Rewards for Reinforcement Learning
by: Nguyen, Viet Bac, et al.
Published: (2026) -
Task-driven Layerwise Additive Activation Intervention
by: Nguyen, Hieu Trung, et al.
Published: (2025)