Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
Fuente:
arXiv
Guardado en:
| Autores principales: | Walder, Christian, Karkhanis, Deep |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
por: Pal, Arka, et al.
Publicado: (2024)
por: Pal, Arka, et al.
Publicado: (2024)
Agentic Reinforced Policy Optimization
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
Causally-Enhanced Reinforcement Policy Optimization
por: Wang, Xiangqi, et al.
Publicado: (2025)
por: Wang, Xiangqi, et al.
Publicado: (2025)
Incorporating Graph Attention Mechanism into Geometric Problem Solving Based on Deep Reinforcement Learning
por: Zhong, Xiuqin, et al.
Publicado: (2024)
por: Zhong, Xiuqin, et al.
Publicado: (2024)
MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning
por: Wang, Hongjun, et al.
Publicado: (2026)
por: Wang, Hongjun, et al.
Publicado: (2026)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
por: Guo, Ruohao, et al.
Publicado: (2025)
por: Guo, Ruohao, et al.
Publicado: (2025)
Can Generative AI Solve Your In-Context Learning Problem? A Martingale Perspective
por: Jesson, Andrew, et al.
Publicado: (2024)
por: Jesson, Andrew, et al.
Publicado: (2024)
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
por: Singhi, Nishad, et al.
Publicado: (2025)
por: Singhi, Nishad, et al.
Publicado: (2025)
Max It or Miss It: Benchmarking LLM On Solving Extremal Problems
por: Gao, Binxin, et al.
Publicado: (2025)
por: Gao, Binxin, et al.
Publicado: (2025)
Enhancing LLM Problem Solving with REAP: Reflection, Explicit Problem Deconstruction, and Advanced Prompting
por: Lingo, Ryan, et al.
Publicado: (2024)
por: Lingo, Ryan, et al.
Publicado: (2024)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025)
por: Liu, Bingshuai, et al.
Publicado: (2025)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
por: Qu, Yuxiao, et al.
Publicado: (2025)
por: Qu, Yuxiao, et al.
Publicado: (2025)
Graph of Thoughts: Solving Elaborate Problems with Large Language Models
por: Besta, Maciej, et al.
Publicado: (2023)
por: Besta, Maciej, et al.
Publicado: (2023)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
por: Qu, Yuxiao, et al.
Publicado: (2026)
por: Qu, Yuxiao, et al.
Publicado: (2026)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
por: Cui, Sijia, et al.
Publicado: (2026)
por: Cui, Sijia, et al.
Publicado: (2026)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
por: Kao, Kuei-Chun, et al.
Publicado: (2024)
por: Kao, Kuei-Chun, et al.
Publicado: (2024)
Decomposing Elements of Problem Solving: What "Math" Does RL Teach?
por: Qin, Tian, et al.
Publicado: (2025)
por: Qin, Tian, et al.
Publicado: (2025)
Boosting of Thoughts: Trial-and-Error Problem Solving with Large Language Models
por: Chen, Sijia, et al.
Publicado: (2024)
por: Chen, Sijia, et al.
Publicado: (2024)
Solving General Natural-Language-Description Optimization Problems with Large Language Models
por: Zhang, Jihai, et al.
Publicado: (2024)
por: Zhang, Jihai, et al.
Publicado: (2024)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
por: Ackermann, Johannes, et al.
Publicado: (2025)
por: Ackermann, Johannes, et al.
Publicado: (2025)
Rethinking the Potential of Multimodality in Collaborative Problem Solving Diagnosis with Large Language Models
por: Wong, K., et al.
Publicado: (2025)
por: Wong, K., et al.
Publicado: (2025)
Fibration Policy Optimization
por: Li, Chang, et al.
Publicado: (2026)
por: Li, Chang, et al.
Publicado: (2026)
Adaptive Social Learning via Mode Policy Optimization for Language Agents
por: Wang, Minzheng, et al.
Publicado: (2025)
por: Wang, Minzheng, et al.
Publicado: (2025)
Investigating Bias: A Multilingual Pipeline for Generating, Solving, and Evaluating Math Problems with LLMs
por: Mahran, Mariam, et al.
Publicado: (2025)
por: Mahran, Mariam, et al.
Publicado: (2025)
Deconfounded Causality-aware Parameter-Efficient Fine-Tuning for Problem-Solving Improvement of LLMs
por: Wang, Ruoyu, et al.
Publicado: (2024)
por: Wang, Ruoyu, et al.
Publicado: (2024)
Do Language Models Exhibit the Same Cognitive Biases in Problem Solving as Human Learners?
por: Opedal, Andreas, et al.
Publicado: (2024)
por: Opedal, Andreas, et al.
Publicado: (2024)
A Survey of Deep Learning for Geometry Problem Solving
por: Ma, Jianzhe, et al.
Publicado: (2025)
por: Ma, Jianzhe, et al.
Publicado: (2025)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
por: Dechtiar, Moriya, et al.
Publicado: (2025)
por: Dechtiar, Moriya, et al.
Publicado: (2025)
Soft Adaptive Policy Optimization
por: Gao, Chang, et al.
Publicado: (2025)
por: Gao, Chang, et al.
Publicado: (2025)
Group Sequence Policy Optimization
por: Zheng, Chujie, et al.
Publicado: (2025)
por: Zheng, Chujie, et al.
Publicado: (2025)
Free Lunch for Pass@$k$? Low Cost Diverse Sampling for Diffusion Language Models
por: Lamont, Sean, et al.
Publicado: (2026)
por: Lamont, Sean, et al.
Publicado: (2026)
Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach
por: Zhang, Xinnan, et al.
Publicado: (2025)
por: Zhang, Xinnan, et al.
Publicado: (2025)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
por: Panaganti, Kishan, et al.
Publicado: (2026)
por: Panaganti, Kishan, et al.
Publicado: (2026)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
por: Zhou, Han, et al.
Publicado: (2025)
por: Zhou, Han, et al.
Publicado: (2025)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
por: Wang, Xiaoxuan, et al.
Publicado: (2023)
por: Wang, Xiaoxuan, et al.
Publicado: (2023)
DCPO: Dynamic Clipping Policy Optimization
por: Yang, Shihui, et al.
Publicado: (2025)
por: Yang, Shihui, et al.
Publicado: (2025)
COPO: Consistency-Aware Policy Optimization
por: Han, Jinghang, et al.
Publicado: (2025)
por: Han, Jinghang, et al.
Publicado: (2025)
Dataset Reset Policy Optimization for RLHF
por: Chang, Jonathan D., et al.
Publicado: (2024)
por: Chang, Jonathan D., et al.
Publicado: (2024)
Understanding the Language Model to Solve the Symbolic Multi-Step Reasoning Problem from the Perspective of Buffer Mechanism
por: Wang, Zhiwei, et al.
Publicado: (2024)
por: Wang, Zhiwei, et al.
Publicado: (2024)
Ejemplares similares
-
Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
por: Pal, Arka, et al.
Publicado: (2024) -
Agentic Reinforced Policy Optimization
por: Dong, Guanting, et al.
Publicado: (2025) -
Causally-Enhanced Reinforcement Policy Optimization
por: Wang, Xiangqi, et al.
Publicado: (2025) -
Incorporating Graph Attention Mechanism into Geometric Problem Solving Based on Deep Reinforcement Learning
por: Zhong, Xiuqin, et al.
Publicado: (2024) -
MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning
por: Wang, Hongjun, et al.
Publicado: (2026)