Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Siwei, Shen, Yifei, Sun, Haoran, Feng, Shi, Teng, Shang-Hua, Dong, Li, Hao, Yaru, Chen, Wei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ALPINE: Unveiling the Planning Capability of Autoregressive Learning in Language Models
by: Wang, Siwei, et al.
Published: (2024)
by: Wang, Siwei, et al.
Published: (2024)
Towards Optimal Learning of Language Models
by: Gu, Yuxian, et al.
Published: (2024)
by: Gu, Yuxian, et al.
Published: (2024)
Theoretical Benefit and Limitation of Diffusion Language Model
by: Feng, Guhao, et al.
Published: (2025)
by: Feng, Guhao, et al.
Published: (2025)
Rethinking Pruning Large Language Models: Benefits and Pitfalls of Reconstruction Error Minimization
by: Shin, Sungbin, et al.
Published: (2024)
by: Shin, Sungbin, et al.
Published: (2024)
The Era of Agentic Organization: Learning to Organize with Language Models
by: Chi, Zewen, et al.
Published: (2025)
by: Chi, Zewen, et al.
Published: (2025)
Promises and Pitfalls of Generative Masked Language Modeling: Theoretical Framework and Practical Guidelines
by: Li, Yuchen, et al.
Published: (2024)
by: Li, Yuchen, et al.
Published: (2024)
Data Selection via Optimal Control for Language Models
by: Gu, Yuxian, et al.
Published: (2024)
by: Gu, Yuxian, et al.
Published: (2024)
Curiosity-Driven Reinforcement Learning from Human Feedback
by: Sun, Haoran, et al.
Published: (2025)
by: Sun, Haoran, et al.
Published: (2025)
Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective
by: Fang, Hao, et al.
Published: (2026)
by: Fang, Hao, et al.
Published: (2026)
MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions
by: Chai, Yekun, et al.
Published: (2024)
by: Chai, Yekun, et al.
Published: (2024)
Test-Time Adaptation via Many-Shot Prompting: Benefits, Limits, and Pitfalls
by: Upasani, Shubhangi, et al.
Published: (2026)
by: Upasani, Shubhangi, et al.
Published: (2026)
Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts
by: Zhang, Di, et al.
Published: (2025)
by: Zhang, Di, et al.
Published: (2025)
Pitfalls of Evaluating Language Models with Open Benchmarks
by: Hasan, Md. Najib, et al.
Published: (2025)
by: Hasan, Md. Najib, et al.
Published: (2025)
Expressive and Generalizable Low-rank Adaptation for Large Models via Slow Cascaded Learning
by: Li, Siwei, et al.
Published: (2024)
by: Li, Siwei, et al.
Published: (2024)
Editing the Mind of Giants: An In-Depth Exploration of Pitfalls of Knowledge Editing in Large Language Models
by: Hsueh, Cheng-Hsun, et al.
Published: (2024)
by: Hsueh, Cheng-Hsun, et al.
Published: (2024)
Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search
by: Liu, Max, et al.
Published: (2024)
by: Liu, Max, et al.
Published: (2024)
Post-Completion Learning for Language Models
by: Fei, Xiang, et al.
Published: (2025)
by: Fei, Xiang, et al.
Published: (2025)
Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls
by: Kang, Feiyang, et al.
Published: (2025)
by: Kang, Feiyang, et al.
Published: (2025)
The Promises and Pitfalls of Using Language Models to Measure Instruction Quality in Education
by: Xu, Paiheng, et al.
Published: (2024)
by: Xu, Paiheng, et al.
Published: (2024)
Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference
by: Cai, Hua, et al.
Published: (2025)
by: Cai, Hua, et al.
Published: (2025)
Federated Learning from Vision-Language Foundation Models: Theoretical Analysis and Method
by: Pan, Bikang, et al.
Published: (2024)
by: Pan, Bikang, et al.
Published: (2024)
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
by: Jiang, Guochao, et al.
Published: (2025)
by: Jiang, Guochao, et al.
Published: (2025)
Optimizing Prompts for Text-to-Image Generation
by: Hao, Yaru, et al.
Published: (2022)
by: Hao, Yaru, et al.
Published: (2022)
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning
by: Wu, Jiaqi, et al.
Published: (2025)
by: Wu, Jiaqi, et al.
Published: (2025)
PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning
by: Kim, Byeongjin, et al.
Published: (2026)
by: Kim, Byeongjin, et al.
Published: (2026)
Large Language Models for Stemming: Promises, Pitfalls and Failures
by: Wang, Shuai, et al.
Published: (2024)
by: Wang, Shuai, et al.
Published: (2024)
When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models
by: Yoon, Youngsik, et al.
Published: (2026)
by: Yoon, Youngsik, et al.
Published: (2026)
Reinforced Lifelong Editing for Language Models
by: Li, Zherui, et al.
Published: (2025)
by: Li, Zherui, et al.
Published: (2025)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
by: Xie, Roy, et al.
Published: (2025)
by: Xie, Roy, et al.
Published: (2025)
Adapters for Altering LLM Vocabularies: What Languages Benefit the Most?
by: Han, HyoJung, et al.
Published: (2024)
by: Han, HyoJung, et al.
Published: (2024)
Unveiling the Pitfalls of Knowledge Editing for Large Language Models
by: Li, Zhoubo, et al.
Published: (2023)
by: Li, Zhoubo, et al.
Published: (2023)
Pitfalls of Scale: Investigating the Inverse Task of Redefinition in Large Language Models
by: Stringli, Elena, et al.
Published: (2025)
by: Stringli, Elena, et al.
Published: (2025)
Persona Setting Pitfall: Persistent Outgroup Biases in Large Language Models Arising from Social Identity Adoption
by: Dong, Wenchao, et al.
Published: (2024)
by: Dong, Wenchao, et al.
Published: (2024)
CRE-LLM: A Domain-Specific Chinese Relation Extraction Framework with Fine-tuned Large Language Model
by: Shi, Zhengpeng, et al.
Published: (2024)
by: Shi, Zhengpeng, et al.
Published: (2024)
PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
by: Lu, Keer, et al.
Published: (2025)
by: Lu, Keer, et al.
Published: (2025)
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
by: Shen, Junhao, et al.
Published: (2026)
by: Shen, Junhao, et al.
Published: (2026)
Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models
by: Xu, Zixiang, et al.
Published: (2025)
by: Xu, Zixiang, et al.
Published: (2025)
Cross-Lingual Word Alignment for ASEAN Languages with Contrastive Learning
by: Zhang, Jingshen, et al.
Published: (2024)
by: Zhang, Jingshen, et al.
Published: (2024)
Can Theoretical Physics Research Benefit from Language Agents?
by: Lu, Sirui, et al.
Published: (2025)
by: Lu, Sirui, et al.
Published: (2025)
LangMARL: Natural Language Multi-Agent Reinforcement Learning
by: Yao, Huaiyuan, et al.
Published: (2026)
by: Yao, Huaiyuan, et al.
Published: (2026)
Similar Items
-
ALPINE: Unveiling the Planning Capability of Autoregressive Learning in Language Models
by: Wang, Siwei, et al.
Published: (2024) -
Towards Optimal Learning of Language Models
by: Gu, Yuxian, et al.
Published: (2024) -
Theoretical Benefit and Limitation of Diffusion Language Model
by: Feng, Guhao, et al.
Published: (2025) -
Rethinking Pruning Large Language Models: Benefits and Pitfalls of Reconstruction Error Minimization
by: Shin, Sungbin, et al.
Published: (2024) -
The Era of Agentic Organization: Learning to Organize with Language Models
by: Chi, Zewen, et al.
Published: (2025)