Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Xinzhu, Li, Xuesheng, Sun, Zhongxiang, Yu, Weijie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
par: Choe, Jean Seong Bjorn, et autres
Publié: (2024)
par: Choe, Jean Seong Bjorn, et autres
Publié: (2024)
ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy
par: Li, Hongming, et autres
Publié: (2024)
par: Li, Hongming, et autres
Publié: (2024)
Entropy-Aware Model Initialization for Effective Exploration in Deep Reinforcement Learning
par: Jang, Sooyoung, et autres
Publié: (2021)
par: Jang, Sooyoung, et autres
Publié: (2021)
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
par: Kunde, Vishnu Teja, et autres
Publié: (2026)
par: Kunde, Vishnu Teja, et autres
Publié: (2026)
Maximum Entropy Exploration Without the Rollouts
par: Adamczyk, Jacob, et autres
Publié: (2026)
par: Adamczyk, Jacob, et autres
Publié: (2026)
Entropy-Guided Loop: Achieving Reasoning through Uncertainty-Aware Generation
par: Correa, Andrew G. A., et autres
Publié: (2025)
par: Correa, Andrew G. A., et autres
Publié: (2025)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
par: Gu, Hengrui, et autres
Publié: (2026)
par: Gu, Hengrui, et autres
Publié: (2026)
HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment
par: Liu, Zhanyu, et autres
Publié: (2026)
par: Liu, Zhanyu, et autres
Publié: (2026)
Rethinking Entropy Regularization in Large Reasoning Models
par: Jiang, Yuxian, et autres
Publié: (2025)
par: Jiang, Yuxian, et autres
Publié: (2025)
EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
par: Shi, Jiahe, et autres
Publié: (2025)
par: Shi, Jiahe, et autres
Publié: (2025)
EntroPIC: Towards Stable Long-Term Training of LLMs via Entropy Stabilization with Proportional-Integral Control
par: Yang, Kai, et autres
Publié: (2025)
par: Yang, Kai, et autres
Publié: (2025)
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
par: Wang, Shenzhi, et autres
Publié: (2025)
par: Wang, Shenzhi, et autres
Publié: (2025)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
par: Yu, Song, et autres
Publié: (2026)
par: Yu, Song, et autres
Publié: (2026)
Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective
par: Hao, Zhezheng, et autres
Publié: (2025)
par: Hao, Zhezheng, et autres
Publié: (2025)
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
par: Le, Thanh-Long V., et autres
Publié: (2025)
par: Le, Thanh-Long V., et autres
Publié: (2025)
Accelerating Reinforcement Learning with Value-Conditional State Entropy Exploration
par: Kim, Dongyoung, et autres
Publié: (2023)
par: Kim, Dongyoung, et autres
Publié: (2023)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
par: Zhan, Guojian, et autres
Publié: (2025)
par: Zhan, Guojian, et autres
Publié: (2025)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
par: Yang, Shidong, et autres
Publié: (2026)
par: Yang, Shidong, et autres
Publié: (2026)
HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation
par: Zhang, Wenjing, et autres
Publié: (2026)
par: Zhang, Wenjing, et autres
Publié: (2026)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
par: Agarwal, Shivam, et autres
Publié: (2025)
par: Agarwal, Shivam, et autres
Publié: (2025)
Adaptive Ensembles of Fine-Tuned Transformers for LLM-Generated Text Detection
par: Lai, Zhixin, et autres
Publié: (2024)
par: Lai, Zhixin, et autres
Publié: (2024)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
A Multi-dimensional Semantic Surprise Framework Based on Low-Entropy Semantic Manifolds for Fine-Grained Out-of-Distribution Detection
par: Peng, Ningkang, et autres
Publié: (2025)
par: Peng, Ningkang, et autres
Publié: (2025)
Stable Adaptive Thinking via Advantage Shaping and Length-Aware Gradient Regulation
par: Xu, Zihang, et autres
Publié: (2026)
par: Xu, Zihang, et autres
Publié: (2026)
D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting
par: Wu, Tianyu, et autres
Publié: (2026)
par: Wu, Tianyu, et autres
Publié: (2026)
Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation
par: Yu, Zhiqi, et autres
Publié: (2026)
par: Yu, Zhiqi, et autres
Publié: (2026)
Memory-Based Advantage Shaping for LLM-Guided Reinforcement Learning
par: Nourzad, Narjes, et autres
Publié: (2026)
par: Nourzad, Narjes, et autres
Publié: (2026)
Improving Offline-to-Online Reinforcement Learning with Q Conditioned State Entropy Exploration
par: Zhang, Ziqi, et autres
Publié: (2023)
par: Zhang, Ziqi, et autres
Publié: (2023)
LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy
par: Karimi, Hamed, et autres
Publié: (2026)
par: Karimi, Hamed, et autres
Publié: (2026)
Tracking Drift: Variation-Aware Entropy Scheduling for Non-Stationary Reinforcement Learning
par: Wang, Tongxi, et autres
Publié: (2026)
par: Wang, Tongxi, et autres
Publié: (2026)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
par: Brantley, Kianté, et autres
Publié: (2025)
par: Brantley, Kianté, et autres
Publié: (2025)
From Implicit Exploration to Structured Reasoning: Leveraging Guideline and Refinement for LLMs
par: Chen, Jiaxiang, et autres
Publié: (2025)
par: Chen, Jiaxiang, et autres
Publié: (2025)
Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
par: He, Qianxi, et autres
Publié: (2025)
par: He, Qianxi, et autres
Publié: (2025)
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
par: Lv, Lei, et autres
Publié: (2026)
par: Lv, Lei, et autres
Publié: (2026)
Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning
par: Hu, Jiajun, et autres
Publié: (2026)
par: Hu, Jiajun, et autres
Publié: (2026)
Revisiting Transformers through the Lens of Low Entropy and Dynamic Sparsity
par: Ren, Ruifeng, et autres
Publié: (2025)
par: Ren, Ruifeng, et autres
Publié: (2025)
ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization
par: Ji, Tianying, et autres
Publié: (2024)
par: Ji, Tianying, et autres
Publié: (2024)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
par: Wang, Shumin, et autres
Publié: (2026)
par: Wang, Shumin, et autres
Publié: (2026)
EntropyStop: Unsupervised Deep Outlier Detection with Loss Entropy
par: Huang, Yihong, et autres
Publié: (2024)
par: Huang, Yihong, et autres
Publié: (2024)
Documents similaires
-
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
par: Choe, Jean Seong Bjorn, et autres
Publié: (2024) -
ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy
par: Li, Hongming, et autres
Publié: (2024) -
Entropy-Aware Model Initialization for Effective Exploration in Deep Reinforcement Learning
par: Jang, Sooyoung, et autres
Publié: (2021) -
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
par: Kunde, Vishnu Teja, et autres
Publié: (2026) -
Maximum Entropy Exploration Without the Rollouts
par: Adamczyk, Jacob, et autres
Publié: (2026)