Saved in:
| Main Authors: | Zou, Deyu, Chen, Yongqiang, Feng, Fan, Li, Mufei, Li, Pan, Gong, Yu, Cheng, James |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.12109 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reducing Belief Deviation in Reinforcement Learning for Active Reasoning
by: Zou, Deyu, et al.
Published: (2025)
by: Zou, Deyu, et al.
Published: (2025)
Weak-to-Strong GraphRAG: Aligning Weak Retrievers with Large Language Models for Graph-based Retrieval Augmented Generation
by: Zou, Deyu, et al.
Published: (2025)
by: Zou, Deyu, et al.
Published: (2025)
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
by: Shen, Xinjie, et al.
Published: (2025)
by: Shen, Xinjie, et al.
Published: (2025)
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
by: Zhuang, Ziqing, et al.
Published: (2026)
by: Zhuang, Ziqing, et al.
Published: (2026)
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
by: Liu, Shikun, et al.
Published: (2025)
by: Liu, Shikun, et al.
Published: (2025)
SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning
by: Zhao, Wanjia, et al.
Published: (2025)
by: Zhao, Wanjia, et al.
Published: (2025)
GraphMaker: Can Diffusion Models Generate Large Attributed Graphs?
by: Li, Mufei, et al.
Published: (2023)
by: Li, Mufei, et al.
Published: (2023)
Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning
by: Chen, Zizhe, et al.
Published: (2026)
by: Chen, Zizhe, et al.
Published: (2026)
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning
by: Huang, Xijie, et al.
Published: (2023)
by: Huang, Xijie, et al.
Published: (2023)
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
by: He, Zhongyu, et al.
Published: (2026)
by: He, Zhongyu, et al.
Published: (2026)
Can LLM Agents Simulate Dynamic Networks? A Case Study on Email Networks with Phishing Synthesis
by: Miao, Siqi, et al.
Published: (2026)
by: Miao, Siqi, et al.
Published: (2026)
Discovering and Reasoning of Causality in the Hidden World with Large Language Models
by: Liu, Chenxi, et al.
Published: (2024)
by: Liu, Chenxi, et al.
Published: (2024)
GeSS: Benchmarking Geometric Deep Learning under Scientific Applications with Distribution Shifts
by: Zou, Deyu, et al.
Published: (2023)
by: Zou, Deyu, et al.
Published: (2023)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
by: Sun, Yiliu, et al.
Published: (2025)
by: Sun, Yiliu, et al.
Published: (2025)
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
by: Liu, Qihao, et al.
Published: (2025)
by: Liu, Qihao, et al.
Published: (2025)
Kaleidoscope: Learnable Masks for Heterogeneous Multi-agent Reinforcement Learning
by: Li, Xinran, et al.
Published: (2024)
by: Li, Xinran, et al.
Published: (2024)
RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
by: Hao, Qianyue, et al.
Published: (2025)
by: Hao, Qianyue, et al.
Published: (2025)
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
by: Wang, Pinzheng, et al.
Published: (2026)
by: Wang, Pinzheng, et al.
Published: (2026)
HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing
by: Du, Chengyu, et al.
Published: (2026)
by: Du, Chengyu, et al.
Published: (2026)
CollabLLM: From Passive Responders to Active Collaborators
by: Wu, Shirley, et al.
Published: (2025)
by: Wu, Shirley, et al.
Published: (2025)
Efficient and Generalized end-to-end Autonomous Driving System with Latent Deep Reinforcement Learning and Demonstrations
by: Tang, Zuojin, et al.
Published: (2024)
by: Tang, Zuojin, et al.
Published: (2024)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
by: Shan, Lianlei, et al.
Published: (2026)
by: Shan, Lianlei, et al.
Published: (2026)
Demonstration Selection for In-Context Learning via Reinforcement Learning
by: Wang, Xubin, et al.
Published: (2024)
by: Wang, Xubin, et al.
Published: (2024)
Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective
by: Cheng, Zhoujun, et al.
Published: (2025)
by: Cheng, Zhoujun, et al.
Published: (2025)
Active Legibility in Multiagent Reinforcement Learning
by: Liu, Yanyu, et al.
Published: (2024)
by: Liu, Yanyu, et al.
Published: (2024)
Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
by: Parashar, Shubham, et al.
Published: (2025)
by: Parashar, Shubham, et al.
Published: (2025)
ReasonOps: Operator Segmentation for LLM Reasoning Traces
by: Lee, Daniel, et al.
Published: (2026)
by: Lee, Daniel, et al.
Published: (2026)
Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning
by: Li, Xiaozhe, et al.
Published: (2026)
by: Li, Xiaozhe, et al.
Published: (2026)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
by: Chen, Mingyang, et al.
Published: (2025)
by: Chen, Mingyang, et al.
Published: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
by: Ye, Zhiling, et al.
Published: (2025)
by: Ye, Zhiling, et al.
Published: (2025)
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
by: Wang, Hong, et al.
Published: (2025)
by: Wang, Hong, et al.
Published: (2025)
A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning
by: Zhou, Zhi, et al.
Published: (2025)
by: Zhou, Zhi, et al.
Published: (2025)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
by: Chen, Guanxu, et al.
Published: (2025)
by: Chen, Guanxu, et al.
Published: (2025)
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
by: Tan, Zelin, et al.
Published: (2025)
by: Tan, Zelin, et al.
Published: (2025)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
Single-agent Reinforcement Learning Model for Regional Adaptive Traffic Signal Control
by: Li, Qiang, et al.
Published: (2025)
by: Li, Qiang, et al.
Published: (2025)
Multi-agent Reinforcement Learning with Deep Networks for Diverse Q-Vectors
by: Luo, Zhenglong, et al.
Published: (2024)
by: Luo, Zhenglong, et al.
Published: (2024)
Bridging Internal Probability and Self-Consistency for Effective and Efficient LLM Reasoning
by: Zhou, Zhi, et al.
Published: (2025)
by: Zhou, Zhi, et al.
Published: (2025)
Reinforced Latent Reasoning for LLM-based Recommendation
by: Zhang, Yang, et al.
Published: (2025)
by: Zhang, Yang, et al.
Published: (2025)
MindMerger: Efficient Boosting LLM Reasoning in non-English Languages
by: Huang, Zixian, et al.
Published: (2024)
by: Huang, Zixian, et al.
Published: (2024)
Similar Items
-
Reducing Belief Deviation in Reinforcement Learning for Active Reasoning
by: Zou, Deyu, et al.
Published: (2025) -
Weak-to-Strong GraphRAG: Aligning Weak Retrievers with Large Language Models for Graph-based Retrieval Augmented Generation
by: Zou, Deyu, et al.
Published: (2025) -
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
by: Shen, Xinjie, et al.
Published: (2025) -
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
by: Zhuang, Ziqing, et al.
Published: (2026) -
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
by: Liu, Shikun, et al.
Published: (2025)