Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Cao, Hongye, Bai, Zhixin, Peng, Ziyue, Wang, Boyan, Yang, Tianpei, Huo, Jing, Zhang, Yuyao, Gao, Yang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Causal Information Prioritization for Efficient Reinforcement Learning
by: Cao, Hongye, et al.
Published: (2025)
by: Cao, Hongye, et al.
Published: (2025)
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
by: Cao, Hongye, et al.
Published: (2025)
by: Cao, Hongye, et al.
Published: (2025)
Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
by: Gan, Siyuan, et al.
Published: (2026)
by: Gan, Siyuan, et al.
Published: (2026)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
by: Cao, Hongye, et al.
Published: (2025)
by: Cao, Hongye, et al.
Published: (2025)
Towards Empowerment Gain through Causal Structure Learning in Model-Based RL
by: Cao, Hongye, et al.
Published: (2025)
by: Cao, Hongye, et al.
Published: (2025)
Multi-Agent Reinforcement Learning with Communication-Constrained Priors
by: Yang, Guang, et al.
Published: (2025)
by: Yang, Guang, et al.
Published: (2025)
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
by: Wang, Shenzhi, et al.
Published: (2025)
by: Wang, Shenzhi, et al.
Published: (2025)
Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning
by: Hong, Jialiang, et al.
Published: (2025)
by: Hong, Jialiang, et al.
Published: (2025)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
by: Lu, Dongchen, et al.
Published: (2025)
by: Lu, Dongchen, et al.
Published: (2025)
MedSentry: Understanding and Mitigating Safety Risks in Medical LLM Multi-Agent Systems
by: Chen, Kai, et al.
Published: (2025)
by: Chen, Kai, et al.
Published: (2025)
MDTeamGPT: A Self-Evolving LLM-based Multi-Agent Framework for Multi-Disciplinary Team Medical Consultation
by: Chen, Kai, et al.
Published: (2025)
by: Chen, Kai, et al.
Published: (2025)
CodeAgents: A Token-Efficient Framework for Codified Multi-Agent Reasoning in LLMs
by: Yang, Bruce, et al.
Published: (2025)
by: Yang, Bruce, et al.
Published: (2025)
TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba
by: Yang, Ziyue, et al.
Published: (2026)
by: Yang, Ziyue, et al.
Published: (2026)
The Evolving Landscape of LLM- and VLM-Integrated Reinforcement Learning
by: Schoepp, Sheila, et al.
Published: (2025)
by: Schoepp, Sheila, et al.
Published: (2025)
Token-Efficient RL for LLM Reasoning
by: Lee, Alan, et al.
Published: (2025)
by: Lee, Alan, et al.
Published: (2025)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
by: Cui, Ganqu, et al.
Published: (2025)
by: Cui, Ganqu, et al.
Published: (2025)
Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
by: Qian, Chen, et al.
Published: (2025)
by: Qian, Chen, et al.
Published: (2025)
ESTAR: Early-Stopping Token-Aware Reasoning For Efficient Inference
by: Wang, Junda, et al.
Published: (2026)
by: Wang, Junda, et al.
Published: (2026)
Reinforced Efficient Reasoning via Semantically Diverse Exploration
by: Zhao, Ziqi, et al.
Published: (2026)
by: Zhao, Ziqi, et al.
Published: (2026)
FPGA Divide-and-Conquer Placement using Deep Reinforcement Learning
by: Wang, Shang, et al.
Published: (2024)
by: Wang, Shang, et al.
Published: (2024)
Utility-Guided Agent Orchestration for Efficient LLM Tool Use
by: Liu, Boyan, et al.
Published: (2026)
by: Liu, Boyan, et al.
Published: (2026)
ssToken: Self-modulated and Semantic-aware Token Selection for LLM Fine-tuning
by: Qin, Xiaohan, et al.
Published: (2025)
by: Qin, Xiaohan, et al.
Published: (2025)
Interactive Learning for LLM Reasoning
by: Lin, Hehai, et al.
Published: (2025)
by: Lin, Hehai, et al.
Published: (2025)
Reinforced Latent Reasoning for LLM-based Recommendation
by: Zhang, Yang, et al.
Published: (2025)
by: Zhang, Yang, et al.
Published: (2025)
The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
by: Agarwal, Shivam, et al.
Published: (2025)
by: Agarwal, Shivam, et al.
Published: (2025)
ENTRA: Entropy-Based Redundancy Avoidance in Large Language Model Reasoning
by: Cai, Ruichu, et al.
Published: (2026)
by: Cai, Ruichu, et al.
Published: (2026)
Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding
by: Jing, Zihao, et al.
Published: (2026)
by: Jing, Zihao, et al.
Published: (2026)
Reasoning with Reinforced Functional Token Tuning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
by: Jin, Renren, et al.
Published: (2025)
by: Jin, Renren, et al.
Published: (2025)
HeartLLM: Discretized ECG Tokenization for LLM-Based Diagnostic Reasoning
by: Yang, Jinning, et al.
Published: (2025)
by: Yang, Jinning, et al.
Published: (2025)
SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning
by: Li, Zheng, et al.
Published: (2025)
by: Li, Zheng, et al.
Published: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
by: Wang, Huaijie, et al.
Published: (2024)
by: Wang, Huaijie, et al.
Published: (2024)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
by: Yu, Song, et al.
Published: (2026)
by: Yu, Song, et al.
Published: (2026)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
by: Jiang, Xitai, et al.
Published: (2026)
by: Jiang, Xitai, et al.
Published: (2026)
Doctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement Learning
by: Lai, Yunghwei, et al.
Published: (2025)
by: Lai, Yunghwei, et al.
Published: (2025)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
by: Shan, Lianlei, et al.
Published: (2026)
by: Shan, Lianlei, et al.
Published: (2026)
Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning
by: Dou, Zhihao, et al.
Published: (2025)
by: Dou, Zhihao, et al.
Published: (2025)
Token-Efficient Prompt Injection Attack: Provoking Cessation in LLM Reasoning via Adaptive Token Compression
by: Cui, Yu, et al.
Published: (2025)
by: Cui, Yu, et al.
Published: (2025)
Beyond Semantic Manipulation: Token-Space Attacks on Reward Models
by: Zhang, Yuheng, et al.
Published: (2026)
by: Zhang, Yuheng, et al.
Published: (2026)
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
by: Zheng, Haizhong, et al.
Published: (2025)
by: Zheng, Haizhong, et al.
Published: (2025)
Similar Items
-
Causal Information Prioritization for Efficient Reinforcement Learning
by: Cao, Hongye, et al.
Published: (2025) -
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
by: Cao, Hongye, et al.
Published: (2025) -
Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
by: Gan, Siyuan, et al.
Published: (2026) -
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
by: Cao, Hongye, et al.
Published: (2025) -
Towards Empowerment Gain through Causal Structure Learning in Model-Based RL
by: Cao, Hongye, et al.
Published: (2025)