LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Weizhe, Koenig, Sven, Dilkina, Bistra |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Iterative Deepening Sampling as Efficient Test-Time Scaling
von: Chen, Weizhe, et al.
Veröffentlicht: (2025)
von: Chen, Weizhe, et al.
Veröffentlicht: (2025)
RePrompt: Planning by Automatic Prompt Engineering for Large Language Models Agents
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)
MARL-LNS: Cooperative Multi-agent Reinforcement Learning via Large Neighborhoods Search
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)
Why Solving Multi-agent Path Finding with Large Language Model has not Succeeded Yet
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)
No Panacea in Planning: Algorithm Selection for Suboptimal Multi-Agent Path Finding
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
von: Xia, Yinan, et al.
Veröffentlicht: (2026)
von: Xia, Yinan, et al.
Veröffentlicht: (2026)
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
von: Shrivastava, Vaishnavi, et al.
Veröffentlicht: (2025)
von: Shrivastava, Vaishnavi, et al.
Veröffentlicht: (2025)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
von: Liu, Yang, et al.
Veröffentlicht: (2025)
von: Liu, Yang, et al.
Veröffentlicht: (2025)
Learning Backdoors for Mixed Integer Linear Programs with Contrastive Learning
von: Cai, Junyang, et al.
Veröffentlicht: (2024)
von: Cai, Junyang, et al.
Veröffentlicht: (2024)
Balans: Multi-Armed Bandits-based Adaptive Large Neighborhood Search for Mixed-Integer Programming Problem
von: Cai, Junyang, et al.
Veröffentlicht: (2024)
von: Cai, Junyang, et al.
Veröffentlicht: (2024)
Multi-task Representation Learning for Mixed Integer Linear Programming
von: Cai, Junyang, et al.
Veröffentlicht: (2024)
von: Cai, Junyang, et al.
Veröffentlicht: (2024)
Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
von: Li, Yang, et al.
Veröffentlicht: (2025)
von: Li, Yang, et al.
Veröffentlicht: (2025)
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
Sample-efficient LLM Optimization with Reset Replay
von: Liu, Zichuan, et al.
Veröffentlicht: (2025)
von: Liu, Zichuan, et al.
Veröffentlicht: (2025)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
von: Zhang, Xichen, et al.
Veröffentlicht: (2025)
von: Zhang, Xichen, et al.
Veröffentlicht: (2025)
Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning
von: Huang, Yiming, et al.
Veröffentlicht: (2026)
von: Huang, Yiming, et al.
Veröffentlicht: (2026)
Explaining Length Bias in LLM-Based Preference Evaluations
von: Hu, Zhengyu, et al.
Veröffentlicht: (2024)
von: Hu, Zhengyu, et al.
Veröffentlicht: (2024)
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
von: Kim, Junseok, et al.
Veröffentlicht: (2026)
von: Kim, Junseok, et al.
Veröffentlicht: (2026)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
von: Deng, Jingcheng, et al.
Veröffentlicht: (2026)
von: Deng, Jingcheng, et al.
Veröffentlicht: (2026)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
von: He, Yinhan, et al.
Veröffentlicht: (2026)
von: He, Yinhan, et al.
Veröffentlicht: (2026)
Length Desensitization in Direct Preference Optimization
von: Liu, Wei, et al.
Veröffentlicht: (2024)
von: Liu, Wei, et al.
Veröffentlicht: (2024)
Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length
von: Ma, Xuezhe, et al.
Veröffentlicht: (2024)
von: Ma, Xuezhe, et al.
Veröffentlicht: (2024)
ParBalans: Parallel Multi-Armed Bandits-based Adaptive Large Neighborhood Search
von: Yilmaz, Alican, et al.
Veröffentlicht: (2025)
von: Yilmaz, Alican, et al.
Veröffentlicht: (2025)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
von: Chen, Peter, et al.
Veröffentlicht: (2025)
von: Chen, Peter, et al.
Veröffentlicht: (2025)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
von: Xu, Wujiang, et al.
Veröffentlicht: (2025)
von: Xu, Wujiang, et al.
Veröffentlicht: (2025)
SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning
von: Hu, Chenzhi, et al.
Veröffentlicht: (2026)
von: Hu, Chenzhi, et al.
Veröffentlicht: (2026)
MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning
von: Wang, Hongjun, et al.
Veröffentlicht: (2026)
von: Wang, Hongjun, et al.
Veröffentlicht: (2026)
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
von: Wang, Weiqi, et al.
Veröffentlicht: (2026)
von: Wang, Weiqi, et al.
Veröffentlicht: (2026)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
von: Qi, Penghui, et al.
Veröffentlicht: (2025)
von: Qi, Penghui, et al.
Veröffentlicht: (2025)
Disentangling Length from Quality in Direct Preference Optimization
von: Park, Ryan, et al.
Veröffentlicht: (2024)
von: Park, Ryan, et al.
Veröffentlicht: (2024)
SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning
von: Ai, Zhengyang, et al.
Veröffentlicht: (2026)
von: Ai, Zhengyang, et al.
Veröffentlicht: (2026)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
von: Lin, Zihan, et al.
Veröffentlicht: (2026)
von: Lin, Zihan, et al.
Veröffentlicht: (2026)
Adaptive Anytime Multi-Agent Path Finding Using Bandit-Based Large Neighborhood Search
von: Phan, Thomy, et al.
Veröffentlicht: (2023)
von: Phan, Thomy, et al.
Veröffentlicht: (2023)
Preference Optimization with Multi-Sample Comparisons
von: Wang, Chaoqi, et al.
Veröffentlicht: (2024)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2024)
An Explainable Diagnostic Framework for Neurodegenerative Dementias via Reinforcement-Optimized LLM Reasoning
von: Zamai, Andrew, et al.
Veröffentlicht: (2025)
von: Zamai, Andrew, et al.
Veröffentlicht: (2025)
Nudging the Boundaries of LLM Reasoning
von: Chen, Justin Chih-Yao, et al.
Veröffentlicht: (2025)
von: Chen, Justin Chih-Yao, et al.
Veröffentlicht: (2025)
Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum
von: Pouransari, Hadi, et al.
Veröffentlicht: (2024)
von: Pouransari, Hadi, et al.
Veröffentlicht: (2024)
The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
von: Zhu, Xinyu, et al.
Veröffentlicht: (2025)
von: Zhu, Xinyu, et al.
Veröffentlicht: (2025)
On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Iterative Deepening Sampling as Efficient Test-Time Scaling
von: Chen, Weizhe, et al.
Veröffentlicht: (2025) -
RePrompt: Planning by Automatic Prompt Engineering for Large Language Models Agents
von: Chen, Weizhe, et al.
Veröffentlicht: (2024) -
MARL-LNS: Cooperative Multi-agent Reinforcement Learning via Large Neighborhoods Search
von: Chen, Weizhe, et al.
Veröffentlicht: (2024) -
Why Solving Multi-agent Path Finding with Large Language Model has not Succeeded Yet
von: Chen, Weizhe, et al.
Veröffentlicht: (2024) -
No Panacea in Planning: Algorithm Selection for Suboptimal Multi-Agent Path Finding
von: Chen, Weizhe, et al.
Veröffentlicht: (2024)