Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yixiao, Li, Yang, Cheng, Dongzhou, Fan, Hehe, Cheng, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
par: Zhou, Yixiao, et autres
Publié: (2026)
par: Zhou, Yixiao, et autres
Publié: (2026)
Looking Inward: Language Models Can Learn About Themselves by Introspection
par: Binder, Felix J, et autres
Publié: (2024)
par: Binder, Felix J, et autres
Publié: (2024)
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
par: Zhang, Jinghao, et autres
Publié: (2025)
par: Zhang, Jinghao, et autres
Publié: (2025)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
par: Limozin, Alexis, et autres
Publié: (2026)
par: Limozin, Alexis, et autres
Publié: (2026)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
par: Zhou, Yifei, et autres
Publié: (2024)
par: Zhou, Yifei, et autres
Publié: (2024)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
par: Liu, Bingshuai, et autres
Publié: (2025)
par: Liu, Bingshuai, et autres
Publié: (2025)
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
par: Yang, Ling, et autres
Publié: (2025)
par: Yang, Ling, et autres
Publié: (2025)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
par: Shen, Guobin, et autres
Publié: (2026)
par: Shen, Guobin, et autres
Publié: (2026)
FlowRL: Matching Reward Distributions for LLM Reasoning
par: Zhu, Xuekai, et autres
Publié: (2025)
par: Zhu, Xuekai, et autres
Publié: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
par: Liu, Shih-Yang, et autres
Publié: (2026)
par: Liu, Shih-Yang, et autres
Publié: (2026)
Exploring RL-based LLM Training for Formal Language Tasks with Programmed Rewards
par: Padula, Alexander G., et autres
Publié: (2024)
par: Padula, Alexander G., et autres
Publié: (2024)
HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
par: Li, Haozhan, et autres
Publié: (2025)
par: Li, Haozhan, et autres
Publié: (2025)
UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
par: Luo, Sijia, et autres
Publié: (2026)
par: Luo, Sijia, et autres
Publié: (2026)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
par: Feng, Xiao, et autres
Publié: (2026)
par: Feng, Xiao, et autres
Publié: (2026)
Bridging Internal Probability and Self-Consistency for Effective and Efficient LLM Reasoning
par: Zhou, Zhi, et autres
Publié: (2025)
par: Zhou, Zhi, et autres
Publié: (2025)
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
par: Shi, Zhenning, et autres
Publié: (2026)
par: Shi, Zhenning, et autres
Publié: (2026)
ToolRL: Reward is All Tool Learning Needs
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing
par: Bao, Yilin, et autres
Publié: (2026)
par: Bao, Yilin, et autres
Publié: (2026)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
par: Zhang, Shenao, et autres
Publié: (2025)
par: Zhang, Shenao, et autres
Publié: (2025)
Enhancing Large Language Models through Structured Reasoning
par: Dong, Yubo, et autres
Publié: (2025)
par: Dong, Yubo, et autres
Publié: (2025)
Learning to Reason under Off-Policy Guidance
par: Yan, Jianhao, et autres
Publié: (2025)
par: Yan, Jianhao, et autres
Publié: (2025)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
par: Yu, Hongli, et autres
Publié: (2025)
par: Yu, Hongli, et autres
Publié: (2025)
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
par: Zhou, Jin Peng, et autres
Publié: (2025)
par: Zhou, Jin Peng, et autres
Publié: (2025)
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
par: Liu, Qihao, et autres
Publié: (2025)
par: Liu, Qihao, et autres
Publié: (2025)
Co-Evolution of Policy and Internal Reward for Language Agents
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
par: Lu, Xingyu, et autres
Publié: (2026)
par: Lu, Xingyu, et autres
Publié: (2026)
Translution: Unifying Self-attention and Convolution for Adaptive and Relative Modeling
par: Fan, Hehe, et autres
Publié: (2025)
par: Fan, Hehe, et autres
Publié: (2025)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
par: Cui, Sijia, et autres
Publié: (2026)
par: Cui, Sijia, et autres
Publié: (2026)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
par: Zhao, Anhao, et autres
Publié: (2026)
par: Zhao, Anhao, et autres
Publié: (2026)
Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
par: Bin, Yi, et autres
Publié: (2025)
par: Bin, Yi, et autres
Publié: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024)
par: Hu, Xing, et autres
Publié: (2024)
LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning
par: Huang, Wei, et autres
Publié: (2026)
par: Huang, Wei, et autres
Publié: (2026)
Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning
par: Chen, Zizhe, et autres
Publié: (2026)
par: Chen, Zizhe, et autres
Publié: (2026)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
par: Xu, Ran, et autres
Publié: (2025)
par: Xu, Ran, et autres
Publié: (2025)
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
par: Yang, Zhuolin, et autres
Publié: (2026)
par: Yang, Zhuolin, et autres
Publié: (2026)
MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search
par: Yang, Zonglin, et autres
Publié: (2025)
par: Yang, Zonglin, et autres
Publié: (2025)
Documents similaires
-
One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
par: Zhou, Yixiao, et autres
Publié: (2026) -
Looking Inward: Language Models Can Learn About Themselves by Introspection
par: Binder, Felix J, et autres
Publié: (2024) -
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
par: Zhang, Jinghao, et autres
Publié: (2025) -
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
par: Limozin, Alexis, et autres
Publié: (2026) -
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
par: Zhou, Yifei, et autres
Publié: (2024)