CPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Tianlong, Chen, Junzhe, Han, Xueting, Bai, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reinforced Reasoning for Embodied Planning
por: Wu, Di, et al.
Publicado: (2025)
por: Wu, Di, et al.
Publicado: (2025)
MathMixup: Boosting LLM Mathematical Reasoning with Difficulty-Controllable Data Synthesis and Curriculum Learning
por: Li, Xuchen, et al.
Publicado: (2026)
por: Li, Xuchen, et al.
Publicado: (2026)
Boosting Deductive Reasoning with Step Signals In RLHF
por: Li, Jialian, et al.
Publicado: (2024)
por: Li, Jialian, et al.
Publicado: (2024)
BSM: Small but Powerful Biological Sequence Model for Genes and Proteins
por: Xiang, Weixi, et al.
Publicado: (2024)
por: Xiang, Weixi, et al.
Publicado: (2024)
TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning
por: Yang, Shenzhi, et al.
Publicado: (2025)
por: Yang, Shenzhi, et al.
Publicado: (2025)
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
por: Yang, Zhicheng, et al.
Publicado: (2026)
por: Yang, Zhicheng, et al.
Publicado: (2026)
Learning to Generate Formally Verifiable Step-by-Step Logic Reasoning via Structured Formal Intermediaries
por: Chen, Luoxin, et al.
Publicado: (2026)
por: Chen, Luoxin, et al.
Publicado: (2026)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
por: Wang, Huaijie, et al.
Publicado: (2024)
por: Wang, Huaijie, et al.
Publicado: (2024)
TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks
por: Kapoor, Vansh, et al.
Publicado: (2026)
por: Kapoor, Vansh, et al.
Publicado: (2026)
One-Step Generative Policies with Q-Learning: A Reformulation of MeanFlow
por: Wang, Zeyuan, et al.
Publicado: (2025)
por: Wang, Zeyuan, et al.
Publicado: (2025)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
por: Rezaei, Mohammad, et al.
Publicado: (2026)
por: Rezaei, Mohammad, et al.
Publicado: (2026)
Boosting Maximum Entropy Reinforcement Learning via One-Step Flow Matching
por: Li, Zeqiao, et al.
Publicado: (2026)
por: Li, Zeqiao, et al.
Publicado: (2026)
Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning
por: Jung, Jaehun, et al.
Publicado: (2025)
por: Jung, Jaehun, et al.
Publicado: (2025)
What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning
por: Ma, Yiran, et al.
Publicado: (2024)
por: Ma, Yiran, et al.
Publicado: (2024)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
por: Shan, Lianlei, et al.
Publicado: (2026)
por: Shan, Lianlei, et al.
Publicado: (2026)
Do Latent-CoT Models Think Step-by-Step? A Mechanistic Study on Sequential Reasoning Tasks
por: Liang, Jia, et al.
Publicado: (2026)
por: Liang, Jia, et al.
Publicado: (2026)
Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning
por: Wang, Changhong, et al.
Publicado: (2024)
por: Wang, Changhong, et al.
Publicado: (2024)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
por: Lin, Wenze, et al.
Publicado: (2026)
por: Lin, Wenze, et al.
Publicado: (2026)
UltraSketchLLM: Saliency-Driven Sketching for Ultra-Low Bit LLM Compression
por: Zou, Sunan, et al.
Publicado: (2025)
por: Zou, Sunan, et al.
Publicado: (2025)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
por: Deng, Yihe, et al.
Publicado: (2025)
por: Deng, Yihe, et al.
Publicado: (2025)
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
por: Shan, Zikang, et al.
Publicado: (2026)
por: Shan, Zikang, et al.
Publicado: (2026)
MPO: Boosting LLM Agents with Meta Plan Optimization
por: Xiong, Weimin, et al.
Publicado: (2025)
por: Xiong, Weimin, et al.
Publicado: (2025)
Planning In Natural Language Improves LLM Search For Code Generation
por: Wang, Evan, et al.
Publicado: (2024)
por: Wang, Evan, et al.
Publicado: (2024)
VERIRL: Boosting the LLM-based Verilog Code Generation via Reinforcement Learning
por: Teng, Fu, et al.
Publicado: (2025)
por: Teng, Fu, et al.
Publicado: (2025)
Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge
por: Wang, Yuhang, et al.
Publicado: (2025)
por: Wang, Yuhang, et al.
Publicado: (2025)
Causally Aligned Curriculum Learning
por: Li, Mingxuan, et al.
Publicado: (2025)
por: Li, Mingxuan, et al.
Publicado: (2025)
Boosting Hierarchical Reinforcement Learning with Meta-Learning for Complex Task Adaptation
por: Khajooeinejad, Arash, et al.
Publicado: (2024)
por: Khajooeinejad, Arash, et al.
Publicado: (2024)
ATLaS: Agent Tuning via Learning Critical Steps
por: Chen, Zhixun, et al.
Publicado: (2025)
por: Chen, Zhixun, et al.
Publicado: (2025)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2026)
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2026)
ExtremeCast: Boosting Extreme Value Prediction for Global Weather Forecast
por: Xu, Wanghan, et al.
Publicado: (2024)
por: Xu, Wanghan, et al.
Publicado: (2024)
Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
por: Chen, Jack, et al.
Publicado: (2025)
por: Chen, Jack, et al.
Publicado: (2025)
LLM-Based Scientific Equation Discovery via Physics-Informed Token-Regularized Policy Optimization
por: Wang, Boxiao, et al.
Publicado: (2026)
por: Wang, Boxiao, et al.
Publicado: (2026)
Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback
por: Lin, Yen-Ting, et al.
Publicado: (2025)
por: Lin, Yen-Ting, et al.
Publicado: (2025)
IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning
por: Qin, Yihao, et al.
Publicado: (2026)
por: Qin, Yihao, et al.
Publicado: (2026)
Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration
por: Bai, Qinxun, et al.
Publicado: (2025)
por: Bai, Qinxun, et al.
Publicado: (2025)
Thought Anchors: Which LLM Reasoning Steps Matter?
por: Bogdan, Paul C., et al.
Publicado: (2025)
por: Bogdan, Paul C., et al.
Publicado: (2025)
The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation
por: Zhang, Ruichen, et al.
Publicado: (2025)
por: Zhang, Ruichen, et al.
Publicado: (2025)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
Cogito, Ergo Ludo: An Agent that Learns to Play by Reasoning and Planning
por: Wang, Sai, et al.
Publicado: (2025)
por: Wang, Sai, et al.
Publicado: (2025)
DOGe: Defensive Output Generation for LLM Protection Against Knowledge Distillation
por: Li, Pingzhi, et al.
Publicado: (2025)
por: Li, Pingzhi, et al.
Publicado: (2025)
Ejemplares similares
-
Reinforced Reasoning for Embodied Planning
por: Wu, Di, et al.
Publicado: (2025) -
MathMixup: Boosting LLM Mathematical Reasoning with Difficulty-Controllable Data Synthesis and Curriculum Learning
por: Li, Xuchen, et al.
Publicado: (2026) -
Boosting Deductive Reasoning with Step Signals In RLHF
por: Li, Jialian, et al.
Publicado: (2024) -
BSM: Small but Powerful Biological Sequence Model for Genes and Proteins
por: Xiang, Weixi, et al.
Publicado: (2024) -
TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning
por: Yang, Shenzhi, et al.
Publicado: (2025)