DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hu, Haoyu, Zhao, Xuandong, Xu, Xuhai "Orson'', Jacoby, Nori |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
von: Nguyen, Hieu Trung, et al.
Veröffentlicht: (2026)
von: Nguyen, Hieu Trung, et al.
Veröffentlicht: (2026)
A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning
von: Wachi, Akifumi, et al.
Veröffentlicht: (2026)
von: Wachi, Akifumi, et al.
Veröffentlicht: (2026)
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
von: Yao, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Yao, Zhiyuan, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025)
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025)
GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets
von: Yao, Zhangyang, et al.
Veröffentlicht: (2026)
von: Yao, Zhangyang, et al.
Veröffentlicht: (2026)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026)
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
von: Zhang, Feng, et al.
Veröffentlicht: (2026)
von: Zhang, Feng, et al.
Veröffentlicht: (2026)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
von: Yoon, Deokgyu, et al.
Veröffentlicht: (2026)
von: Yoon, Deokgyu, et al.
Veröffentlicht: (2026)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
von: Wang, Longwen, et al.
Veröffentlicht: (2026)
von: Wang, Longwen, et al.
Veröffentlicht: (2026)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
von: Gunjal, Anisha, et al.
Veröffentlicht: (2025)
von: Gunjal, Anisha, et al.
Veröffentlicht: (2025)
DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks
von: Chen, Zhiliang, et al.
Veröffentlicht: (2025)
von: Chen, Zhiliang, et al.
Veröffentlicht: (2025)
Subwords as Skills: Tokenization for Sparse-Reward Reinforcement Learning
von: Yunis, David, et al.
Veröffentlicht: (2023)
von: Yunis, David, et al.
Veröffentlicht: (2023)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
von: Stojanovski, Zafir, et al.
Veröffentlicht: (2025)
von: Stojanovski, Zafir, et al.
Veröffentlicht: (2025)
Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards
von: Dave, Rudray, et al.
Veröffentlicht: (2026)
von: Dave, Rudray, et al.
Veröffentlicht: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
von: Zhang, Zijing, et al.
Veröffentlicht: (2025)
von: Zhang, Zijing, et al.
Veröffentlicht: (2025)
DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay
von: Li, Long, et al.
Veröffentlicht: (2026)
von: Li, Long, et al.
Veröffentlicht: (2026)
DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher
von: Zhong, Yisheng, et al.
Veröffentlicht: (2026)
von: Zhong, Yisheng, et al.
Veröffentlicht: (2026)
Reward Shaping to Mitigate Reward Hacking in RLHF
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
von: Cho, Dongkyu Derek, et al.
Veröffentlicht: (2025)
von: Cho, Dongkyu Derek, et al.
Veröffentlicht: (2025)
The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward
von: Li, Long, et al.
Veröffentlicht: (2025)
von: Li, Long, et al.
Veröffentlicht: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
von: Wang, Zhen, et al.
Veröffentlicht: (2025)
von: Wang, Zhen, et al.
Veröffentlicht: (2025)
An Imperfect Verifier is Good Enough: Learning with Noisy Rewards
von: Plesner, Andreas, et al.
Veröffentlicht: (2026)
von: Plesner, Andreas, et al.
Veröffentlicht: (2026)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
von: Ma, Zhengzhao, et al.
Veröffentlicht: (2026)
von: Ma, Zhengzhao, et al.
Veröffentlicht: (2026)
Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards
von: Rad, Ali, et al.
Veröffentlicht: (2026)
von: Rad, Ali, et al.
Veröffentlicht: (2026)
Reward Hacking Mitigation using Verifiable Composite Rewards
von: Tarek, Mirza Farhan Bin, et al.
Veröffentlicht: (2025)
von: Tarek, Mirza Farhan Bin, et al.
Veröffentlicht: (2025)
Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards
von: Bai, Bizhe, et al.
Veröffentlicht: (2026)
von: Bai, Bizhe, et al.
Veröffentlicht: (2026)
T-REG: Preference Optimization with Token-Level Reward Regularization
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens
von: Wen, Hao, et al.
Veröffentlicht: (2025)
von: Wen, Hao, et al.
Veröffentlicht: (2025)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
von: Yan, Kai, et al.
Veröffentlicht: (2026)
von: Yan, Kai, et al.
Veröffentlicht: (2026)
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
von: Ren, Tao, et al.
Veröffentlicht: (2025)
von: Ren, Tao, et al.
Veröffentlicht: (2025)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
von: He, Haoran, et al.
Veröffentlicht: (2025)
von: He, Haoran, et al.
Veröffentlicht: (2025)
The Art of Deception: Robust Backdoor Attack using Dynamic Stacking of Triggers
von: Mengara, Orson
Veröffentlicht: (2024)
von: Mengara, Orson
Veröffentlicht: (2024)
Multi-Agent Reinforcement Learning for Resources Allocation Optimization: A Survey
von: Hady, Mohamad A., et al.
Veröffentlicht: (2025)
von: Hady, Mohamad A., et al.
Veröffentlicht: (2025)
Token-Budget-Aware LLM Reasoning
von: Han, Tingxu, et al.
Veröffentlicht: (2024)
von: Han, Tingxu, et al.
Veröffentlicht: (2024)
Adaptive Budget Allocation for Orthogonal-Subspace Adapter Tuning in LLMs Continual Learning
von: Wan, Zhiyi, et al.
Veröffentlicht: (2025)
von: Wan, Zhiyi, et al.
Veröffentlicht: (2025)
Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models
von: Hu, Yuelin, et al.
Veröffentlicht: (2026)
von: Hu, Yuelin, et al.
Veröffentlicht: (2026)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
von: Jiang, Zhizheng, et al.
Veröffentlicht: (2026)
von: Jiang, Zhizheng, et al.
Veröffentlicht: (2026)
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
von: Li, Ziniu, et al.
Veröffentlicht: (2025)
von: Li, Ziniu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
von: Nguyen, Hieu Trung, et al.
Veröffentlicht: (2026) -
A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning
von: Wachi, Akifumi, et al.
Veröffentlicht: (2026) -
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
von: Yao, Zhiyuan, et al.
Veröffentlicht: (2026) -
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025) -
GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets
von: Yao, Zhangyang, et al.
Veröffentlicht: (2026)