ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Song, Li, Li, Zhao, Wenwen, Yang, Zhisheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
di: Wen, Muning, et al.
Pubblicazione: (2024)
di: Wen, Muning, et al.
Pubblicazione: (2024)
TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
di: Choo, Jinho, et al.
Pubblicazione: (2026)
di: Choo, Jinho, et al.
Pubblicazione: (2026)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Rethinking Entropy Regularization in Large Reasoning Models
di: Jiang, Yuxian, et al.
Pubblicazione: (2025)
di: Jiang, Yuxian, et al.
Pubblicazione: (2025)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
di: Zhang, Tunyu, et al.
Pubblicazione: (2025)
di: Zhang, Tunyu, et al.
Pubblicazione: (2025)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
di: Xu, Huimin, et al.
Pubblicazione: (2026)
di: Xu, Huimin, et al.
Pubblicazione: (2026)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
di: Li, Xuan, et al.
Pubblicazione: (2026)
di: Li, Xuan, et al.
Pubblicazione: (2026)
Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization
di: Wang, Dayu, et al.
Pubblicazione: (2026)
di: Wang, Dayu, et al.
Pubblicazione: (2026)
Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level
di: Jia, Nan, et al.
Pubblicazione: (2026)
di: Jia, Nan, et al.
Pubblicazione: (2026)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
di: Li, Jiawei, et al.
Pubblicazione: (2024)
di: Li, Jiawei, et al.
Pubblicazione: (2024)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
di: Li, Tenghui, et al.
Pubblicazione: (2024)
di: Li, Tenghui, et al.
Pubblicazione: (2024)
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
di: Yang, Wang, et al.
Pubblicazione: (2026)
di: Yang, Wang, et al.
Pubblicazione: (2026)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
di: Shen, Guobin, et al.
Pubblicazione: (2026)
di: Shen, Guobin, et al.
Pubblicazione: (2026)
DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2025)
di: Wang, Shenzhi, et al.
Pubblicazione: (2025)
Segment-Aligned Policy Optimization for Multi-Modal Reasoning
di: Gao, Lei, et al.
Pubblicazione: (2026)
di: Gao, Lei, et al.
Pubblicazione: (2026)
CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention
di: Li, Qingbin, et al.
Pubblicazione: (2025)
di: Li, Qingbin, et al.
Pubblicazione: (2025)
Diffusion Actor-Critic with Entropy Regulator
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
From Semantics to Hierarchy: A Hybrid Euclidean-Tangent-Hyperbolic Space Model for Temporal Knowledge Graph Reasoning
di: Feng, Siling, et al.
Pubblicazione: (2024)
di: Feng, Siling, et al.
Pubblicazione: (2024)
Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
di: Wu, Yecheng, et al.
Pubblicazione: (2026)
di: Wu, Yecheng, et al.
Pubblicazione: (2026)
Policy Guided Tree Search for Enhanced LLM Reasoning
di: Li, Yang
Pubblicazione: (2025)
di: Li, Yang
Pubblicazione: (2025)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
di: Guo, Zhenyuan, et al.
Pubblicazione: (2026)
di: Guo, Zhenyuan, et al.
Pubblicazione: (2026)
On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models
di: Zhao, Chongyang, et al.
Pubblicazione: (2026)
di: Zhao, Chongyang, et al.
Pubblicazione: (2026)
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
Quantifying and Understanding Uncertainty in Large Reasoning Models
di: Li, Yangyi, et al.
Pubblicazione: (2026)
di: Li, Yangyi, et al.
Pubblicazione: (2026)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
di: Si, Wenwen, et al.
Pubblicazione: (2025)
di: Si, Wenwen, et al.
Pubblicazione: (2025)
When Maximum Entropy Misleads Policy Optimization
di: Zhang, Ruipeng, et al.
Pubblicazione: (2025)
di: Zhang, Ruipeng, et al.
Pubblicazione: (2025)
ESPO: Entropy Importance Sampling Policy Optimization
di: Sheng, Yuepeng, et al.
Pubblicazione: (2025)
di: Sheng, Yuepeng, et al.
Pubblicazione: (2025)
Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models
di: Xie, Zhifei, et al.
Pubblicazione: (2025)
di: Xie, Zhifei, et al.
Pubblicazione: (2025)
Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks
di: Xu, Yifei, et al.
Pubblicazione: (2025)
di: Xu, Yifei, et al.
Pubblicazione: (2025)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
di: Yang, Shidong, et al.
Pubblicazione: (2026)
di: Yang, Shidong, et al.
Pubblicazione: (2026)
ProToken: Token-Level Attribution for Federated Large Language Models
di: Gill, Waris, et al.
Pubblicazione: (2026)
di: Gill, Waris, et al.
Pubblicazione: (2026)
LLM-Based Scientific Equation Discovery via Physics-Informed Token-Regularized Policy Optimization
di: Wang, Boxiao, et al.
Pubblicazione: (2026)
di: Wang, Boxiao, et al.
Pubblicazione: (2026)
T-REG: Preference Optimization with Token-Level Reward Regularization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
di: Yu, Song, et al.
Pubblicazione: (2026) -
Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models
di: Hu, Yuelin, et al.
Pubblicazione: (2026) -
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
di: Wen, Muning, et al.
Pubblicazione: (2024) -
TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
di: Choo, Jinho, et al.
Pubblicazione: (2026) -
LEPO: Latent Reasoning Policy Optimization for Large Language Models
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)