On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zou, Deyu, Chen, Yongqiang, Feng, Fan, Li, Mufei, Li, Pan, Gong, Yu, Cheng, James |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reducing Belief Deviation in Reinforcement Learning for Active Reasoning
par: Zou, Deyu, et autres
Publié: (2025)
par: Zou, Deyu, et autres
Publié: (2025)
Weak-to-Strong GraphRAG: Aligning Weak Retrievers with Large Language Models for Graph-based Retrieval Augmented Generation
par: Zou, Deyu, et autres
Publié: (2025)
par: Zou, Deyu, et autres
Publié: (2025)
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
par: Shen, Xinjie, et autres
Publié: (2025)
par: Shen, Xinjie, et autres
Publié: (2025)
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
par: Zhuang, Ziqing, et autres
Publié: (2026)
par: Zhuang, Ziqing, et autres
Publié: (2026)
SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning
par: Zhao, Wanjia, et autres
Publié: (2025)
par: Zhao, Wanjia, et autres
Publié: (2025)
GraphMaker: Can Diffusion Models Generate Large Attributed Graphs?
par: Li, Mufei, et autres
Publié: (2023)
par: Li, Mufei, et autres
Publié: (2023)
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
par: Liu, Shikun, et autres
Publié: (2025)
par: Liu, Shikun, et autres
Publié: (2025)
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
par: He, Zhongyu, et autres
Publié: (2026)
par: He, Zhongyu, et autres
Publié: (2026)
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning
par: Huang, Xijie, et autres
Publié: (2023)
par: Huang, Xijie, et autres
Publié: (2023)
Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning
par: Chen, Zizhe, et autres
Publié: (2026)
par: Chen, Zizhe, et autres
Publié: (2026)
RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
par: Hao, Qianyue, et autres
Publié: (2025)
par: Hao, Qianyue, et autres
Publié: (2025)
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
par: Wang, Pinzheng, et autres
Publié: (2026)
par: Wang, Pinzheng, et autres
Publié: (2026)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
par: Sun, Yiliu, et autres
Publié: (2025)
par: Sun, Yiliu, et autres
Publié: (2025)
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
par: Liu, Qihao, et autres
Publié: (2025)
par: Liu, Qihao, et autres
Publié: (2025)
HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing
par: Du, Chengyu, et autres
Publié: (2026)
par: Du, Chengyu, et autres
Publié: (2026)
CollabLLM: From Passive Responders to Active Collaborators
par: Wu, Shirley, et autres
Publié: (2025)
par: Wu, Shirley, et autres
Publié: (2025)
Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning
par: Li, Xiaozhe, et autres
Publié: (2026)
par: Li, Xiaozhe, et autres
Publié: (2026)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
par: Shan, Lianlei, et autres
Publié: (2026)
par: Shan, Lianlei, et autres
Publié: (2026)
Kaleidoscope: Learnable Masks for Heterogeneous Multi-agent Reinforcement Learning
par: Li, Xinran, et autres
Publié: (2024)
par: Li, Xinran, et autres
Publié: (2024)
Active Legibility in Multiagent Reinforcement Learning
par: Liu, Yanyu, et autres
Publié: (2024)
par: Liu, Yanyu, et autres
Publié: (2024)
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
par: Wang, Hong, et autres
Publié: (2025)
par: Wang, Hong, et autres
Publié: (2025)
Can LLM Agents Simulate Dynamic Networks? A Case Study on Email Networks with Phishing Synthesis
par: Miao, Siqi, et autres
Publié: (2026)
par: Miao, Siqi, et autres
Publié: (2026)
Discovering and Reasoning of Causality in the Hidden World with Large Language Models
par: Liu, Chenxi, et autres
Publié: (2024)
par: Liu, Chenxi, et autres
Publié: (2024)
GeSS: Benchmarking Geometric Deep Learning under Scientific Applications with Distribution Shifts
par: Zou, Deyu, et autres
Publié: (2023)
par: Zou, Deyu, et autres
Publié: (2023)
Efficient and Generalized end-to-end Autonomous Driving System with Latent Deep Reinforcement Learning and Demonstrations
par: Tang, Zuojin, et autres
Publié: (2024)
par: Tang, Zuojin, et autres
Publié: (2024)
ReasonOps: Operator Segmentation for LLM Reasoning Traces
par: Lee, Daniel, et autres
Publié: (2026)
par: Lee, Daniel, et autres
Publié: (2026)
Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
par: Parashar, Shubham, et autres
Publié: (2025)
par: Parashar, Shubham, et autres
Publié: (2025)
Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective
par: Cheng, Zhoujun, et autres
Publié: (2025)
par: Cheng, Zhoujun, et autres
Publié: (2025)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
par: Chen, Mingyang, et autres
Publié: (2025)
par: Chen, Mingyang, et autres
Publié: (2025)
A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning
par: Zhou, Zhi, et autres
Publié: (2025)
par: Zhou, Zhi, et autres
Publié: (2025)
Demonstration Selection for In-Context Learning via Reinforcement Learning
par: Wang, Xubin, et autres
Publié: (2024)
par: Wang, Xubin, et autres
Publié: (2024)
Reinforced Latent Reasoning for LLM-based Recommendation
par: Zhang, Yang, et autres
Publié: (2025)
par: Zhang, Yang, et autres
Publié: (2025)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
par: Chen, Guanxu, et autres
Publié: (2025)
par: Chen, Guanxu, et autres
Publié: (2025)
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
par: Tan, Zelin, et autres
Publié: (2025)
par: Tan, Zelin, et autres
Publié: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
par: Ye, Zhiling, et autres
Publié: (2025)
par: Ye, Zhiling, et autres
Publié: (2025)
Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling
par: Wan, Guangya, et autres
Publié: (2024)
par: Wan, Guangya, et autres
Publié: (2024)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
par: Ke, Junlong, et autres
Publié: (2026)
par: Ke, Junlong, et autres
Publié: (2026)
Single-agent Reinforcement Learning Model for Regional Adaptive Traffic Signal Control
par: Li, Qiang, et autres
Publié: (2025)
par: Li, Qiang, et autres
Publié: (2025)
Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models
par: Duan, Zenghao, et autres
Publié: (2026)
par: Duan, Zenghao, et autres
Publié: (2026)
Documents similaires
-
Reducing Belief Deviation in Reinforcement Learning for Active Reasoning
par: Zou, Deyu, et autres
Publié: (2025) -
Weak-to-Strong GraphRAG: Aligning Weak Retrievers with Large Language Models for Graph-based Retrieval Augmented Generation
par: Zou, Deyu, et autres
Publié: (2025) -
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
par: Shen, Xinjie, et autres
Publié: (2025) -
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
par: Zhuang, Ziqing, et autres
Publié: (2026) -
SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning
par: Zhao, Wanjia, et autres
Publié: (2025)