Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR
Fuente:
arXiv
Guardado en:
| Autores principales: | Min, Zijun, Liu, Bingshuai, Wang, Ante, Zhang, Long, Zeng, Anxiang, Zhang, Haibo, Su, Jinsong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025)
por: Liu, Bingshuai, et al.
Publicado: (2025)
HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment
por: Liu, Zhanyu, et al.
Publicado: (2026)
por: Liu, Zhanyu, et al.
Publicado: (2026)
ESPO: Entropy Importance Sampling Policy Optimization
por: Sheng, Yuepeng, et al.
Publicado: (2025)
por: Sheng, Yuepeng, et al.
Publicado: (2025)
Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization
por: Li, Meng, et al.
Publicado: (2025)
por: Li, Meng, et al.
Publicado: (2025)
Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
por: Lochab, Anamika, et al.
Publicado: (2026)
por: Lochab, Anamika, et al.
Publicado: (2026)
PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR
por: Zhang, Yiqi, et al.
Publicado: (2026)
por: Zhang, Yiqi, et al.
Publicado: (2026)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
por: Cui, Sijia, et al.
Publicado: (2026)
por: Cui, Sijia, et al.
Publicado: (2026)
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
por: Huang, Zhuoxu, et al.
Publicado: (2026)
por: Huang, Zhuoxu, et al.
Publicado: (2026)
Data-Efficient RLVR via Off-Policy Influence Guidance
por: Zhu, Erle, et al.
Publicado: (2025)
por: Zhu, Erle, et al.
Publicado: (2025)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
por: Chen, Kun, et al.
Publicado: (2026)
por: Chen, Kun, et al.
Publicado: (2026)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
por: Xu, Huimin, et al.
Publicado: (2026)
por: Xu, Huimin, et al.
Publicado: (2026)
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
por: Qu, Yun, et al.
Publicado: (2026)
por: Qu, Yun, et al.
Publicado: (2026)
On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR
por: Ye, Hao, et al.
Publicado: (2026)
por: Ye, Hao, et al.
Publicado: (2026)
RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning
por: Mao, Yixiu, et al.
Publicado: (2026)
por: Mao, Yixiu, et al.
Publicado: (2026)
Token-level Proximal Policy Optimization for Query Generation
por: Ouyang, Yichen, et al.
Publicado: (2024)
por: Ouyang, Yichen, et al.
Publicado: (2024)
Not only where, But when: Temporal Scheduling for RLVR
por: Zhang, Jinghao, et al.
Publicado: (2026)
por: Zhang, Jinghao, et al.
Publicado: (2026)
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
por: Miao, Yuchun, et al.
Publicado: (2026)
por: Miao, Yuchun, et al.
Publicado: (2026)
Where Hindsight Credit Can Reside: A Signed-Capacity View of Token Updates in RLVR
por: He, Yuhang, et al.
Publicado: (2026)
por: He, Yuhang, et al.
Publicado: (2026)
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
por: Liu, Bingshuai, et al.
Publicado: (2023)
por: Liu, Bingshuai, et al.
Publicado: (2023)
Linear Dynamics in the RLVR Training of Large Language Models
por: Wang, Tianle, et al.
Publicado: (2026)
por: Wang, Tianle, et al.
Publicado: (2026)
Coverage-Guaranteed Speech Emotion Recognition via Calibrated Uncertainty-Adaptive Prediction Sets
por: Jia, Zijun, et al.
Publicado: (2025)
por: Jia, Zijun, et al.
Publicado: (2025)
CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization
por: Heakl, Ahmed, et al.
Publicado: (2026)
por: Heakl, Ahmed, et al.
Publicado: (2026)
PubSwap: Public-Data Off-Policy Coordination for Federated RLVR
por: Nayak, Anupam, et al.
Publicado: (2026)
por: Nayak, Anupam, et al.
Publicado: (2026)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
por: He, Yinhan, et al.
Publicado: (2026)
por: He, Yinhan, et al.
Publicado: (2026)
Route Experts by Sequence, not by Token
por: Wen, Tiansheng, et al.
Publicado: (2025)
por: Wen, Tiansheng, et al.
Publicado: (2025)
Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
por: Liu, Fanfan, et al.
Publicado: (2026)
por: Liu, Fanfan, et al.
Publicado: (2026)
Feature-Aware One-Shot Federated Learning via Hierarchical Token Sequences
por: Liu, Shudong, et al.
Publicado: (2026)
por: Liu, Shudong, et al.
Publicado: (2026)
The Path Not Taken: RLVR Provably Learns Off the Principals
por: Zhu, Hanqing, et al.
Publicado: (2025)
por: Zhu, Hanqing, et al.
Publicado: (2025)
Self-Distilled RLVR
por: Yang, Chenxu, et al.
Publicado: (2026)
por: Yang, Chenxu, et al.
Publicado: (2026)
Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation
por: Ding, Fei, et al.
Publicado: (2026)
por: Ding, Fei, et al.
Publicado: (2026)
Continuous Optimization for Feature Selection with Permutation-Invariant Embedding and Policy-Guided Search
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
por: Cohen, Taco, et al.
Publicado: (2025)
por: Cohen, Taco, et al.
Publicado: (2025)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
A Hybrid Multi-Factor Network with Dynamic Sequence Modeling for Early Warning of Intraoperative Hypotension
por: Cheng, Mingyue, et al.
Publicado: (2024)
por: Cheng, Mingyue, et al.
Publicado: (2024)
Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection
por: Wu, Jianghao, et al.
Publicado: (2026)
por: Wu, Jianghao, et al.
Publicado: (2026)
Group Sequence Policy Optimization
por: Zheng, Chujie, et al.
Publicado: (2025)
por: Zheng, Chujie, et al.
Publicado: (2025)
LLM-Based Scientific Equation Discovery via Physics-Informed Token-Regularized Policy Optimization
por: Wang, Boxiao, et al.
Publicado: (2026)
por: Wang, Boxiao, et al.
Publicado: (2026)
Soft Sequence Policy Optimization
por: Glazyrina, Svetlana, et al.
Publicado: (2026)
por: Glazyrina, Svetlana, et al.
Publicado: (2026)
RLVR-World: Training World Models with Reinforcement Learning
por: Wu, Jialong, et al.
Publicado: (2025)
por: Wu, Jialong, et al.
Publicado: (2025)
Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models
por: Hu, Yuelin, et al.
Publicado: (2026)
por: Hu, Yuelin, et al.
Publicado: (2026)
Ejemplares similares
-
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025) -
HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment
por: Liu, Zhanyu, et al.
Publicado: (2026) -
ESPO: Entropy Importance Sampling Policy Optimization
por: Sheng, Yuepeng, et al.
Publicado: (2025) -
Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization
por: Li, Meng, et al.
Publicado: (2025) -
Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
por: Lochab, Anamika, et al.
Publicado: (2026)