Reducing Belief Deviation in Reinforcement Learning for Active Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Zou, Deyu, Chen, Yongqiang, Wang, Jianxiang, Yang, Haochen, Li, Mufei, Cheng, James, Li, Pan, Gong, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agents
by: Zou, Deyu, et al.
Published: (2026)
by: Zou, Deyu, et al.
Published: (2026)
Weak-to-Strong GraphRAG: Aligning Weak Retrievers with Large Language Models for Graph-based Retrieval Augmented Generation
by: Zou, Deyu, et al.
Published: (2025)
by: Zou, Deyu, et al.
Published: (2025)
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
by: Shen, Xinjie, et al.
Published: (2025)
by: Shen, Xinjie, et al.
Published: (2025)
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
by: Liu, Shikun, et al.
Published: (2025)
by: Liu, Shikun, et al.
Published: (2025)
GraphMaker: Can Diffusion Models Generate Large Attributed Graphs?
by: Li, Mufei, et al.
Published: (2023)
by: Li, Mufei, et al.
Published: (2023)
Learning to Cut: Reinforcement Learning for Benders Decomposition
by: Cai, Haochen, et al.
Published: (2026)
by: Cai, Haochen, et al.
Published: (2026)
Reducing Cognitive Overhead in Tool Use via Multi-Small-Agent Reinforcement Learning
by: Wang, Dayu, et al.
Published: (2025)
by: Wang, Dayu, et al.
Published: (2025)
PersRM-R1: Enhance Personalized Reward Modeling with Reinforcement Learning
by: Li, Mengdi, et al.
Published: (2025)
by: Li, Mengdi, et al.
Published: (2025)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
by: Chen, Guanxu, et al.
Published: (2025)
by: Chen, Guanxu, et al.
Published: (2025)
Self-Pro: A Self-Prompt and Tuning Framework for Graph Neural Networks
by: Gong, Chenghua, et al.
Published: (2023)
by: Gong, Chenghua, et al.
Published: (2023)
Demonstration Selection for In-Context Learning via Reinforcement Learning
by: Wang, Xubin, et al.
Published: (2024)
by: Wang, Xubin, et al.
Published: (2024)
Active Legibility in Multiagent Reinforcement Learning
by: Liu, Yanyu, et al.
Published: (2024)
by: Liu, Yanyu, et al.
Published: (2024)
Learning Dynamic Belief Graphs for Theory-of-mind Reasoning
by: Chen, Ruxiao, et al.
Published: (2026)
by: Chen, Ruxiao, et al.
Published: (2026)
Discovering and Reasoning of Causality in the Hidden World with Large Language Models
by: Liu, Chenxi, et al.
Published: (2024)
by: Liu, Chenxi, et al.
Published: (2024)
GeSS: Benchmarking Geometric Deep Learning under Scientific Applications with Distribution Shifts
by: Zou, Deyu, et al.
Published: (2023)
by: Zou, Deyu, et al.
Published: (2023)
Text-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language Supervision
by: Zhang, Shilin, et al.
Published: (2025)
by: Zhang, Shilin, et al.
Published: (2025)
Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies
by: Cheng, Sitao, et al.
Published: (2025)
by: Cheng, Sitao, et al.
Published: (2025)
Efficient and Generalized end-to-end Autonomous Driving System with Latent Deep Reinforcement Learning and Demonstrations
by: Tang, Zuojin, et al.
Published: (2024)
by: Tang, Zuojin, et al.
Published: (2024)
Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring
by: Guan, Weixin, et al.
Published: (2026)
by: Guan, Weixin, et al.
Published: (2026)
Limited Reasoning Space: The cage of long-horizon reasoning in LLMs
by: Li, Zhenyu, et al.
Published: (2026)
by: Li, Zhenyu, et al.
Published: (2026)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
by: Chen, Mingyang, et al.
Published: (2025)
by: Chen, Mingyang, et al.
Published: (2025)
Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning
by: Chen, Zizhe, et al.
Published: (2026)
by: Chen, Zizhe, et al.
Published: (2026)
Collaborative Belief Reasoning with LLMs for Efficient Multi-Agent Collaboration
by: Wang, Zhimin, et al.
Published: (2025)
by: Wang, Zhimin, et al.
Published: (2025)
Can Large Language Models Act as Ensembler for Multi-GNNs?
by: Duan, Hanqi, et al.
Published: (2024)
by: Duan, Hanqi, et al.
Published: (2024)
Conceptual Belief-Informed Reinforcement Learning
by: Gu, Xingrui, et al.
Published: (2024)
by: Gu, Xingrui, et al.
Published: (2024)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
by: Sun, Yiliu, et al.
Published: (2025)
by: Sun, Yiliu, et al.
Published: (2025)
Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning
by: Li, Xiaozhe, et al.
Published: (2026)
by: Li, Xiaozhe, et al.
Published: (2026)
Continuum-Interaction-Driven Intelligence: Human-Aligned Neural Architecture via Crystallized Reasoning and Fluid Generation
by: Zhou, Pengcheng, et al.
Published: (2025)
by: Zhou, Pengcheng, et al.
Published: (2025)
Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning
by: Wu, Wenxun, et al.
Published: (2025)
by: Wu, Wenxun, et al.
Published: (2025)
A Survey on Learning from Graphs with Heterophily: Recent Advances and Future Directions
by: Gong, Chenghua, et al.
Published: (2024)
by: Gong, Chenghua, et al.
Published: (2024)
Differentiable Evolutionary Reinforcement Learning
by: Cheng, Sitao, et al.
Published: (2025)
by: Cheng, Sitao, et al.
Published: (2025)
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
by: Wang, Pinzheng, et al.
Published: (2026)
by: Wang, Pinzheng, et al.
Published: (2026)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
by: Leong, Chak Tou, et al.
Published: (2026)
by: Leong, Chak Tou, et al.
Published: (2026)
ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
by: Zhan, Simon Sinong, et al.
Published: (2025)
by: Zhan, Simon Sinong, et al.
Published: (2025)
Dream to Chat: Model-based Reinforcement Learning on Dialogues with User Belief Modeling
by: Zhao, Yue, et al.
Published: (2025)
by: Zhao, Yue, et al.
Published: (2025)
Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning
by: Zhang, Menglong, et al.
Published: (2025)
by: Zhang, Menglong, et al.
Published: (2025)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
by: Li, Yuan, et al.
Published: (2025)
by: Li, Yuan, et al.
Published: (2025)
LENS: Learning to Segment Anything with Unified Reinforced Reasoning
by: Zhu, Lianghui, et al.
Published: (2025)
by: Zhu, Lianghui, et al.
Published: (2025)
Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning
by: Xu, Ke, et al.
Published: (2026)
by: Xu, Ke, et al.
Published: (2026)
Similar Items
-
On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agents
by: Zou, Deyu, et al.
Published: (2026) -
Weak-to-Strong GraphRAG: Aligning Weak Retrievers with Large Language Models for Graph-based Retrieval Augmented Generation
by: Zou, Deyu, et al.
Published: (2025) -
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
by: Shen, Xinjie, et al.
Published: (2025) -
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
by: Liu, Shikun, et al.
Published: (2025) -
GraphMaker: Can Diffusion Models Generate Large Attributed Graphs?
by: Li, Mufei, et al.
Published: (2023)