HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Chengyu, Zhang, Zhengxin, Cardie, Claire |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Better LLM Reasoning via Dual-Play
por: Zhang, Zhengxin, et al.
Publicado: (2025)
por: Zhang, Zhengxin, et al.
Publicado: (2025)
Policy-Gradient Training of Language Models for Ranking
por: Gao, Ge, et al.
Publicado: (2023)
por: Gao, Ge, et al.
Publicado: (2023)
Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text
por: Huang, Chengyu, et al.
Publicado: (2026)
por: Huang, Chengyu, et al.
Publicado: (2026)
Self-Training Elicits Concise Reasoning in Large Language Models
por: Munkhbat, Tergel, et al.
Publicado: (2025)
por: Munkhbat, Tergel, et al.
Publicado: (2025)
Steering Large Reasoning Models towards Concise Reasoning via Flow Matching
por: Li, Yawei, et al.
Publicado: (2026)
por: Li, Yawei, et al.
Publicado: (2026)
How Far Are We From True Auto-Research?
por: Zhang, Zhengxin, et al.
Publicado: (2026)
por: Zhang, Zhengxin, et al.
Publicado: (2026)
Reasoning Court: Combining Reasoning, Action, and Judgment for Multi-Hop Reasoning
por: Wu, Jingtian, et al.
Publicado: (2025)
por: Wu, Jingtian, et al.
Publicado: (2025)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
por: Su, Zhenpeng, et al.
Publicado: (2025)
por: Su, Zhenpeng, et al.
Publicado: (2025)
DCRM: A Heuristic to Measure Response Pair Quality in Preference Optimization
por: Huang, Chengyu, et al.
Publicado: (2025)
por: Huang, Chengyu, et al.
Publicado: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
por: Qi, Penghui, et al.
Publicado: (2025)
por: Qi, Penghui, et al.
Publicado: (2025)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
por: Wu, Feijie, et al.
Publicado: (2025)
por: Wu, Feijie, et al.
Publicado: (2025)
Noise-Aware Training of Layout-Aware Language Models
por: Sarkhel, Ritesh, et al.
Publicado: (2024)
por: Sarkhel, Ritesh, et al.
Publicado: (2024)
Adaptive Social Learning via Mode Policy Optimization for Language Agents
por: Wang, Minzheng, et al.
Publicado: (2025)
por: Wang, Minzheng, et al.
Publicado: (2025)
COPO: Consistency-Aware Policy Optimization
por: Han, Jinghang, et al.
Publicado: (2025)
por: Han, Jinghang, et al.
Publicado: (2025)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
por: Zhao, Shiwan, et al.
Publicado: (2026)
por: Zhao, Shiwan, et al.
Publicado: (2026)
Simple Policy Gradients for Reasoning with Diffusion Language Models
por: Zhan, Anthony
Publicado: (2025)
por: Zhan, Anthony
Publicado: (2025)
On the Optimal Reasoning Length for RL-Trained Language Models
por: Nohara, Daisuke, et al.
Publicado: (2026)
por: Nohara, Daisuke, et al.
Publicado: (2026)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
por: Zhang, Jingyi, et al.
Publicado: (2025)
por: Zhang, Jingyi, et al.
Publicado: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
por: Chen, Mengzhao, et al.
Publicado: (2024)
por: Chen, Mengzhao, et al.
Publicado: (2024)
Adapting Fake News Detection to the Era of Large Language Models
por: Su, Jinyan, et al.
Publicado: (2023)
por: Su, Jinyan, et al.
Publicado: (2023)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
por: Huang, Jiameng, et al.
Publicado: (2025)
por: Huang, Jiameng, et al.
Publicado: (2025)
ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
por: Dumitru, Razvan-Gabriel, et al.
Publicado: (2025)
por: Dumitru, Razvan-Gabriel, et al.
Publicado: (2025)
STEP: Success-Rate-Aware Trajectory-Efficient Policy Optimization
por: Chen, Yuhan, et al.
Publicado: (2025)
por: Chen, Yuhan, et al.
Publicado: (2025)
Stepwise Alignment for Constrained Language Model Policy Optimization
por: Wachi, Akifumi, et al.
Publicado: (2024)
por: Wachi, Akifumi, et al.
Publicado: (2024)
Uncertainty-Aware Gradient Signal-to-Noise Data Selection for Instruction Tuning
por: Yuan, Zhihang, et al.
Publicado: (2026)
por: Yuan, Zhihang, et al.
Publicado: (2026)
PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning
por: Lu, Wenquan, et al.
Publicado: (2026)
por: Lu, Wenquan, et al.
Publicado: (2026)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models
por: Jha, Basab, et al.
Publicado: (2025)
por: Jha, Basab, et al.
Publicado: (2025)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
por: Wang, Ziyan, et al.
Publicado: (2025)
por: Wang, Ziyan, et al.
Publicado: (2025)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
por: Jia, Sheng, et al.
Publicado: (2025)
por: Jia, Sheng, et al.
Publicado: (2025)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
por: Pan, Chengjun, et al.
Publicado: (2026)
por: Pan, Chengjun, et al.
Publicado: (2026)
SiLQ: Simple Large Language Model Quantization-Aware Training
por: Esser, Steven K., et al.
Publicado: (2025)
por: Esser, Steven K., et al.
Publicado: (2025)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
por: Lin, Nianyi, et al.
Publicado: (2025)
por: Lin, Nianyi, et al.
Publicado: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
por: Li, Chengao, et al.
Publicado: (2025)
por: Li, Chengao, et al.
Publicado: (2025)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
por: Zhang, Xichen, et al.
Publicado: (2025)
por: Zhang, Xichen, et al.
Publicado: (2025)
Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning
por: Kim, Minwu, et al.
Publicado: (2026)
por: Kim, Minwu, et al.
Publicado: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
por: Liang, Yu, et al.
Publicado: (2026)
por: Liang, Yu, et al.
Publicado: (2026)
Ejemplares similares
-
Better LLM Reasoning via Dual-Play
por: Zhang, Zhengxin, et al.
Publicado: (2025) -
Policy-Gradient Training of Language Models for Ranking
por: Gao, Ge, et al.
Publicado: (2023) -
Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text
por: Huang, Chengyu, et al.
Publicado: (2026) -
Self-Training Elicits Concise Reasoning in Large Language Models
por: Munkhbat, Tergel, et al.
Publicado: (2025) -
Steering Large Reasoning Models towards Concise Reasoning via Flow Matching
por: Li, Yawei, et al.
Publicado: (2026)