FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Ding, Yuyang, Zhang, Chi, Li, Juntao, Lin, Haibin, Zhang, Min |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
por: He, Yinhan, et al.
Publicado: (2026)
por: He, Yinhan, et al.
Publicado: (2026)
SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
por: Ding, Yuyang, et al.
Publicado: (2025)
por: Ding, Yuyang, et al.
Publicado: (2025)
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
por: Kim, Junseok, et al.
Publicado: (2026)
por: Kim, Junseok, et al.
Publicado: (2026)
Calibration-Aware Policy Optimization for Reasoning LLMs
por: Wang, Ziqi, et al.
Publicado: (2026)
por: Wang, Ziqi, et al.
Publicado: (2026)
Large Reasoning Models Learn Better Alignment from Flawed Thinking
por: Peng, ShengYun, et al.
Publicado: (2025)
por: Peng, ShengYun, et al.
Publicado: (2025)
LongFlow: Efficient KV Cache Compression for Reasoning Models
por: Su, Yi, et al.
Publicado: (2026)
por: Su, Yi, et al.
Publicado: (2026)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
por: Li, Gang, et al.
Publicado: (2025)
por: Li, Gang, et al.
Publicado: (2025)
Towards DS-NER: Unveiling and Addressing Latent Noise in Distant Annotations
por: Ding, Yuyang, et al.
Publicado: (2025)
por: Ding, Yuyang, et al.
Publicado: (2025)
Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning
por: Ding, Zihan, et al.
Publicado: (2023)
por: Ding, Zihan, et al.
Publicado: (2023)
Uncertainty-Aware Data-Based Method for Fast and Reliable Shape Optimization
por: Yang, Yunjia, et al.
Publicado: (2026)
por: Yang, Yunjia, et al.
Publicado: (2026)
LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization
por: Zhao, Juntao, et al.
Publicado: (2024)
por: Zhao, Juntao, et al.
Publicado: (2024)
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
por: Qiu, Quantong, et al.
Publicado: (2026)
por: Qiu, Quantong, et al.
Publicado: (2026)
Diversity-Aware Policy Optimization for Large Language Model Reasoning
por: Yao, Jian, et al.
Publicado: (2025)
por: Yao, Jian, et al.
Publicado: (2025)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
por: Yang, Zhicheng, et al.
Publicado: (2026)
por: Yang, Zhicheng, et al.
Publicado: (2026)
WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
por: Mundada, Gagan, et al.
Publicado: (2026)
por: Mundada, Gagan, et al.
Publicado: (2026)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
por: Jiang, Bingqing, et al.
Publicado: (2026)
por: Jiang, Bingqing, et al.
Publicado: (2026)
Provably Efficient Exploration in Policy Optimization
por: Cai, Qi, et al.
Publicado: (2019)
por: Cai, Qi, et al.
Publicado: (2019)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
por: Qi, Penghui, et al.
Publicado: (2025)
por: Qi, Penghui, et al.
Publicado: (2025)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
por: Deng, Hexuan, et al.
Publicado: (2025)
por: Deng, Hexuan, et al.
Publicado: (2025)
STEP: Success-Rate-Aware Trajectory-Efficient Policy Optimization
por: Chen, Yuhan, et al.
Publicado: (2025)
por: Chen, Yuhan, et al.
Publicado: (2025)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
por: Huang, Chengyu, et al.
Publicado: (2025)
por: Huang, Chengyu, et al.
Publicado: (2025)
Textual Gradients are a Flawed Metaphor for Automatic Prompt Optimization
por: Melcer, Daniel, et al.
Publicado: (2025)
por: Melcer, Daniel, et al.
Publicado: (2025)
Constrained Policy Optimization with Explicit Behavior Density for Offline Reinforcement Learning
por: Zhang, Jing, et al.
Publicado: (2023)
por: Zhang, Jing, et al.
Publicado: (2023)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
por: Li, Xuan, et al.
Publicado: (2026)
por: Li, Xuan, et al.
Publicado: (2026)
ACT: Anti-Crosstalk Learning for Cross-Sectional Stock Ranking via Temporal Disentanglement and Structural Purification
por: Li, Juntao, et al.
Publicado: (2026)
por: Li, Juntao, et al.
Publicado: (2026)
Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning
por: Zhang, Yuyang, et al.
Publicado: (2026)
por: Zhang, Yuyang, et al.
Publicado: (2026)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
por: Liu, Xiaogeng, et al.
Publicado: (2026)
por: Liu, Xiaogeng, et al.
Publicado: (2026)
Capacity-Aware Mixture Law Enables Efficient LLM Data Optimization
por: Li, Jingwei, et al.
Publicado: (2026)
por: Li, Jingwei, et al.
Publicado: (2026)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
por: Zhu, Taojie, et al.
Publicado: (2026)
por: Zhu, Taojie, et al.
Publicado: (2026)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
por: Zhou, Yuyan, et al.
Publicado: (2026)
por: Zhou, Yuyan, et al.
Publicado: (2026)
UCPO: Uncertainty-Aware Policy Optimization
por: Zeng, Xianzhou, et al.
Publicado: (2026)
por: Zeng, Xianzhou, et al.
Publicado: (2026)
Biased or Flawed? Mitigating Stereotypes in Generative Language Models by Addressing Task-Specific Flaws
por: Jha, Akshita, et al.
Publicado: (2024)
por: Jha, Akshita, et al.
Publicado: (2024)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
por: Xia, Yinan, et al.
Publicado: (2026)
por: Xia, Yinan, et al.
Publicado: (2026)
Efficient Federated RLHF via Zeroth-Order Policy Optimization
por: Wang, Deyi, et al.
Publicado: (2026)
por: Wang, Deyi, et al.
Publicado: (2026)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
por: Yang, Junxiao, et al.
Publicado: (2025)
por: Yang, Junxiao, et al.
Publicado: (2025)
Can Large Reasoning Models Improve Accuracy on Mathematical Tasks Using Flawed Thinking?
por: Amjith, Saraswathy, et al.
Publicado: (2025)
por: Amjith, Saraswathy, et al.
Publicado: (2025)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
por: Li, Jiawei, et al.
Publicado: (2024)
por: Li, Jiawei, et al.
Publicado: (2024)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
por: Wu, Feijie, et al.
Publicado: (2025)
por: Wu, Feijie, et al.
Publicado: (2025)
Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization
por: Zhu, Haodong, et al.
Publicado: (2026)
por: Zhu, Haodong, et al.
Publicado: (2026)
COPO: Consistency-Aware Policy Optimization
por: Han, Jinghang, et al.
Publicado: (2025)
por: Han, Jinghang, et al.
Publicado: (2025)
Ejemplares similares
-
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
por: He, Yinhan, et al.
Publicado: (2026) -
SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
por: Ding, Yuyang, et al.
Publicado: (2025) -
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
por: Kim, Junseok, et al.
Publicado: (2026) -
Calibration-Aware Policy Optimization for Reasoning LLMs
por: Wang, Ziqi, et al.
Publicado: (2026) -
Large Reasoning Models Learn Better Alignment from Flawed Thinking
por: Peng, ShengYun, et al.
Publicado: (2025)