Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Tao, Li, Shuo, Sun, Yan, Ding, Dongsheng, Dobriban, Edgar |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR
por: Kim, Soeun, et al.
Publicado: (2026)
por: Kim, Soeun, et al.
Publicado: (2026)
Improving Sampling Efficiency in RLVR through Adaptive Rollout and Response Reuse
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
Optimal Decision-Making Based on Prediction Sets
por: Wang, Tao, et al.
Publicado: (2026)
por: Wang, Tao, et al.
Publicado: (2026)
Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection
por: Wu, Jianghao, et al.
Publicado: (2026)
por: Wu, Jianghao, et al.
Publicado: (2026)
Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling
por: Wang, Xinglin, et al.
Publicado: (2025)
por: Wang, Xinglin, et al.
Publicado: (2025)
OptPO: Optimal Rollout Allocation for Test-time Policy Optimization
por: Wang, Youkang, et al.
Publicado: (2025)
por: Wang, Youkang, et al.
Publicado: (2025)
Leveraging Error Diversity in Group Rollouts for Reinforcement Learning
por: Liu, Wenpu, et al.
Publicado: (2026)
por: Liu, Wenpu, et al.
Publicado: (2026)
On Rollouts in Model-Based Reinforcement Learning
por: Frauenknecht, Bernd, et al.
Publicado: (2025)
por: Frauenknecht, Bernd, et al.
Publicado: (2025)
Singleton-Optimized Conformal Prediction
por: Wang, Tao, et al.
Publicado: (2025)
por: Wang, Tao, et al.
Publicado: (2025)
Bayes-Optimal Classifiers under Group Fairness
por: Zeng, Xianli, et al.
Publicado: (2022)
por: Zeng, Xianli, et al.
Publicado: (2022)
One-Shot Safety Alignment for Large Language Models via Optimal Dualization
por: Huang, Xinmeng, et al.
Publicado: (2024)
por: Huang, Xinmeng, et al.
Publicado: (2024)
A Rollout-Based Algorithm and Reward Function for Resource Allocation in Business Processes
por: Middelhuis, Jeroen, et al.
Publicado: (2025)
por: Middelhuis, Jeroen, et al.
Publicado: (2025)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
DiffusionRollout: Uncertainty-Aware Rollout Planning in Long-Horizon PDE Solving
por: Yoo, Seungwoo, et al.
Publicado: (2026)
por: Yoo, Seungwoo, et al.
Publicado: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
por: Nguyen, Hieu Trung, et al.
Publicado: (2026)
por: Nguyen, Hieu Trung, et al.
Publicado: (2026)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
por: Xu, Yixuan Even, et al.
Publicado: (2025)
por: Xu, Yixuan Even, et al.
Publicado: (2025)
How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization
por: Fang, Yangyi, et al.
Publicado: (2026)
por: Fang, Yangyi, et al.
Publicado: (2026)
Trust the Model Where It Trusts Itself -- Model-Based Actor-Critic with Uncertainty-Aware Rollout Adaption
por: Frauenknecht, Bernd, et al.
Publicado: (2024)
por: Frauenknecht, Bernd, et al.
Publicado: (2024)
RTMC: Step-Level Credit Assignment via Rollout Trees
por: Wang, Tao, et al.
Publicado: (2026)
por: Wang, Tao, et al.
Publicado: (2026)
Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning
por: Zhang, Zhi, et al.
Publicado: (2026)
por: Zhang, Zhi, et al.
Publicado: (2026)
WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
por: Mundada, Gagan, et al.
Publicado: (2026)
por: Mundada, Gagan, et al.
Publicado: (2026)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
por: Li, Yuhang, et al.
Publicado: (2026)
por: Li, Yuhang, et al.
Publicado: (2026)
Maximum Entropy Exploration Without the Rollouts
por: Adamczyk, Jacob, et al.
Publicado: (2026)
por: Adamczyk, Jacob, et al.
Publicado: (2026)
EchoRL: Reinforcement Learning via Rollout Echoing
por: Bi, Jinhe, et al.
Publicado: (2026)
por: Bi, Jinhe, et al.
Publicado: (2026)
SymmPI: Predictive Inference for Data with Group Symmetries
por: Dobriban, Edgar, et al.
Publicado: (2023)
por: Dobriban, Edgar, et al.
Publicado: (2023)
ARROW: An Adaptive Rollout and Routing Method for Global Weather Forecasting
por: Tian, Jindong, et al.
Publicado: (2025)
por: Tian, Jindong, et al.
Publicado: (2025)
HINT: Helping Ineffective Rollouts Navigate Towards Effectiveness
por: Wang, Xinyi, et al.
Publicado: (2025)
por: Wang, Xinyi, et al.
Publicado: (2025)
Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models
por: Cohen, Lior, et al.
Publicado: (2026)
por: Cohen, Lior, et al.
Publicado: (2026)
Controlling Transient Amplification Improves Long-horizon Rollouts
por: Pervez, Adeel, et al.
Publicado: (2026)
por: Pervez, Adeel, et al.
Publicado: (2026)
Guided Cooperation in Hierarchical Reinforcement Learning via Model-based Rollout
por: Wang, Haoran, et al.
Publicado: (2023)
por: Wang, Haoran, et al.
Publicado: (2023)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
por: Lu, Xiaodong, et al.
Publicado: (2026)
por: Lu, Xiaodong, et al.
Publicado: (2026)
ImagineBench: Evaluating Reinforcement Learning with Large Language Model Rollouts
por: Pang, Jing-Cheng, et al.
Publicado: (2025)
por: Pang, Jing-Cheng, et al.
Publicado: (2025)
Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL
por: Zhai, Zhiyuan, et al.
Publicado: (2026)
por: Zhai, Zhiyuan, et al.
Publicado: (2026)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
por: Ding, Yi, et al.
Publicado: (2026)
por: Ding, Yi, et al.
Publicado: (2026)
SGNO: Spectral Generator Neural Operators for Stable Long Horizon PDE Rollouts
por: Li, Jiayi, et al.
Publicado: (2026)
por: Li, Jiayi, et al.
Publicado: (2026)
Rollout-Training Co-Design for Efficient LLM-Based Multi-Agent Reinforcement Learning
por: Jiang, Zhida, et al.
Publicado: (2026)
por: Jiang, Zhida, et al.
Publicado: (2026)
Statistical Methods in Generative AI
por: Dobriban, Edgar
Publicado: (2025)
por: Dobriban, Edgar
Publicado: (2025)
Heddle: A Distributed Orchestration System for Agentic RL Rollout
por: Zhang, Zili, et al.
Publicado: (2026)
por: Zhang, Zili, et al.
Publicado: (2026)
Memory-Conditioned Flow-Matching for Stable Autoregressive PDE Rollouts
por: Armegioiu, Victor
Publicado: (2026)
por: Armegioiu, Victor
Publicado: (2026)
Using Common Random Numbers for Simulation-based Planning with Rollouts
por: Yadav, Sandarbh, et al.
Publicado: (2026)
por: Yadav, Sandarbh, et al.
Publicado: (2026)
Ejemplares similares
-
Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR
por: Kim, Soeun, et al.
Publicado: (2026) -
Improving Sampling Efficiency in RLVR through Adaptive Rollout and Response Reuse
por: Zhang, Yuheng, et al.
Publicado: (2025) -
Optimal Decision-Making Based on Prediction Sets
por: Wang, Tao, et al.
Publicado: (2026) -
Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection
por: Wu, Jianghao, et al.
Publicado: (2026) -
Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling
por: Wang, Xinglin, et al.
Publicado: (2025)