Calibration-Aware Policy Optimization for Reasoning LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Ziqi, Lou, Xingzhou, Wu, Meiqi, Wen, Zhengqi, Zhang, Junge |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
por: Shi, Jiahe, et al.
Publicado: (2025)
por: Shi, Jiahe, et al.
Publicado: (2025)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
por: Jiang, Bingqing, et al.
Publicado: (2026)
por: Jiang, Bingqing, et al.
Publicado: (2026)
Reward-Robust RLHF in LLMs
por: Yan, Yuzi, et al.
Publicado: (2024)
por: Yan, Yuzi, et al.
Publicado: (2024)
Position: Foundation Agents as the Paradigm Shift for Decision Making
por: Liu, Xiaoqian, et al.
Publicado: (2024)
por: Liu, Xiaoqian, et al.
Publicado: (2024)
RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
por: Fernandez, Nigel, et al.
Publicado: (2025)
por: Fernandez, Nigel, et al.
Publicado: (2025)
LRT-Diffusion: Calibrated Risk-Aware Guidance for Diffusion Policies
por: Sun, Ximan, et al.
Publicado: (2025)
por: Sun, Ximan, et al.
Publicado: (2025)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
por: Wu, Feijie, et al.
Publicado: (2025)
por: Wu, Feijie, et al.
Publicado: (2025)
TAPE: Leveraging Agent Topology for Cooperative Multi-Agent Policy Gradient
por: Lou, Xingzhou, et al.
Publicado: (2023)
por: Lou, Xingzhou, et al.
Publicado: (2023)
UCPO: Uncertainty-Aware Policy Optimization
por: Zeng, Xianzhou, et al.
Publicado: (2026)
por: Zeng, Xianzhou, et al.
Publicado: (2026)
A dynamical clipping approach with task feedback for Proximal Policy Optimization
por: Zhang, Ziqi, et al.
Publicado: (2023)
por: Zhang, Ziqi, et al.
Publicado: (2023)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
Validity-Calibrated Reasoning Distillation
por: Saadi, Khouloud, et al.
Publicado: (2026)
por: Saadi, Khouloud, et al.
Publicado: (2026)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
por: Zhou, Yuyan, et al.
Publicado: (2026)
por: Zhou, Yuyan, et al.
Publicado: (2026)
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation
por: Zhang, Jiaxin, et al.
Publicado: (2026)
por: Zhang, Jiaxin, et al.
Publicado: (2026)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
por: Huang, Chengyu, et al.
Publicado: (2025)
por: Huang, Chengyu, et al.
Publicado: (2025)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
por: Li, Xuan, et al.
Publicado: (2026)
por: Li, Xuan, et al.
Publicado: (2026)
One-Way Policy Optimization for Self-Evolving LLMs
por: Yang, Shuo, et al.
Publicado: (2026)
por: Yang, Shuo, et al.
Publicado: (2026)
PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
por: Feng, Wenfeng, et al.
Publicado: (2025)
por: Feng, Wenfeng, et al.
Publicado: (2025)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
por: Li, Jiawei, et al.
Publicado: (2024)
por: Li, Jiawei, et al.
Publicado: (2024)
Self-supervised Pretraining for Decision Foundation Model: Formulation, Pipeline and Challenges
por: Liu, Xiaoqian, et al.
Publicado: (2023)
por: Liu, Xiaoqian, et al.
Publicado: (2023)
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
por: Zhou, Huilin, et al.
Publicado: (2026)
por: Zhou, Huilin, et al.
Publicado: (2026)
Generalizable Heuristic Generation Through LLMs with Meta-Optimization
por: Shi, Yiding, et al.
Publicado: (2025)
por: Shi, Yiding, et al.
Publicado: (2025)
Bootstrapping LLMs via Preference-Based Policy Optimization
por: Jia, Chen
Publicado: (2025)
por: Jia, Chen
Publicado: (2025)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
por: Wang, Jingyi, et al.
Publicado: (2026)
por: Wang, Jingyi, et al.
Publicado: (2026)
Segment-Aligned Policy Optimization for Multi-Modal Reasoning
por: Gao, Lei, et al.
Publicado: (2026)
por: Gao, Lei, et al.
Publicado: (2026)
Generalized Priority-Aware Shapley Value
por: Lee, Kiljae, et al.
Publicado: (2026)
por: Lee, Kiljae, et al.
Publicado: (2026)
Two-Stage Regularization-Based Structured Pruning for LLMs
por: Feng, Mingkuan, et al.
Publicado: (2025)
por: Feng, Mingkuan, et al.
Publicado: (2025)
Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio
por: Wen, Ziqing, et al.
Publicado: (2026)
por: Wen, Ziqing, et al.
Publicado: (2026)
When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2026)
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2026)
COPO: Consistency-Aware Policy Optimization
por: Han, Jinghang, et al.
Publicado: (2025)
por: Han, Jinghang, et al.
Publicado: (2025)
Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization
por: Wang, Dayu, et al.
Publicado: (2026)
por: Wang, Dayu, et al.
Publicado: (2026)
Prompted Policy Search: Reinforcement Learning through Linguistic and Numerical Reasoning in LLMs
por: Zhou, Yifan, et al.
Publicado: (2025)
por: Zhou, Yifan, et al.
Publicado: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
por: Li, Gang, et al.
Publicado: (2025)
por: Li, Gang, et al.
Publicado: (2025)
HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs
por: Kachroo, Darsh, et al.
Publicado: (2026)
por: Kachroo, Darsh, et al.
Publicado: (2026)
Variational Delayed Policy Optimization
por: Wu, Qingyuan, et al.
Publicado: (2024)
por: Wu, Qingyuan, et al.
Publicado: (2024)
Divergence-Augmented Policy Optimization
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
por: Zixian, Wang
Publicado: (2026)
por: Zixian, Wang
Publicado: (2026)
Hawk: An Efficient NALM System for Accurate Low-Power Appliance Recognition
por: Wang, Zijian, et al.
Publicado: (2024)
por: Wang, Zijian, et al.
Publicado: (2024)
Reflective Policy Optimization
por: Gan, Yaozhong, et al.
Publicado: (2024)
por: Gan, Yaozhong, et al.
Publicado: (2024)
Ejemplares similares
-
EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
por: Shi, Jiahe, et al.
Publicado: (2025) -
Structured Role-Aware Policy Optimization for Multimodal Reasoning
por: Jiang, Bingqing, et al.
Publicado: (2026) -
Reward-Robust RLHF in LLMs
por: Yan, Yuzi, et al.
Publicado: (2024) -
Position: Foundation Agents as the Paradigm Shift for Decision Making
por: Liu, Xiaoqian, et al.
Publicado: (2024) -
RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
por: Fernandez, Nigel, et al.
Publicado: (2025)