Salvato in:
| Autori principali: | Li, Chang, Tsu, Tshihao, Zhang, Yaren, Xue, Chao, He, Xiaodong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.08239 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
di: Li, Chengao, et al.
Pubblicazione: (2025)
di: Li, Chengao, et al.
Pubblicazione: (2025)
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
Group Sequence Policy Optimization
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
di: Qi, Penghui, et al.
Pubblicazione: (2025)
di: Qi, Penghui, et al.
Pubblicazione: (2025)
Soft Adaptive Policy Optimization
di: Gao, Chang, et al.
Pubblicazione: (2025)
di: Gao, Chang, et al.
Pubblicazione: (2025)
Dataset Reset Policy Optimization for RLHF
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
COPO: Consistency-Aware Policy Optimization
di: Han, Jinghang, et al.
Pubblicazione: (2025)
di: Han, Jinghang, et al.
Pubblicazione: (2025)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
Agentic Reinforced Policy Optimization
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
Causally-Enhanced Reinforcement Policy Optimization
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
ReDit: Reward Dithering for Improved LLM Policy Optimization
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
di: Han, Kevin, et al.
Pubblicazione: (2026)
di: Han, Kevin, et al.
Pubblicazione: (2026)
CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
di: He, Junhui, et al.
Pubblicazione: (2024)
di: He, Junhui, et al.
Pubblicazione: (2024)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
di: Lin, Nianyi, et al.
Pubblicazione: (2025)
di: Lin, Nianyi, et al.
Pubblicazione: (2025)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
di: Zhou, Han, et al.
Pubblicazione: (2025)
di: Zhou, Han, et al.
Pubblicazione: (2025)
Adaptive Social Learning via Mode Policy Optimization for Language Agents
di: Wang, Minzheng, et al.
Pubblicazione: (2025)
di: Wang, Minzheng, et al.
Pubblicazione: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
di: Zhang, Songming, et al.
Pubblicazione: (2025)
di: Zhang, Songming, et al.
Pubblicazione: (2025)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
di: Chen, Peter, et al.
Pubblicazione: (2025)
di: Chen, Peter, et al.
Pubblicazione: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
di: Cui, Sijia, et al.
Pubblicazione: (2026)
di: Cui, Sijia, et al.
Pubblicazione: (2026)
DCPO: Dynamic Clipping Policy Optimization
di: Yang, Shihui, et al.
Pubblicazione: (2025)
di: Yang, Shihui, et al.
Pubblicazione: (2025)
HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control
di: Yao, Xincheng, et al.
Pubblicazione: (2026)
di: Yao, Xincheng, et al.
Pubblicazione: (2026)
STEP: Success-Rate-Aware Trajectory-Efficient Policy Optimization
di: Chen, Yuhan, et al.
Pubblicazione: (2025)
di: Chen, Yuhan, et al.
Pubblicazione: (2025)
DefSent+: Improving sentence embeddings of language models by projecting definition sentences into a quasi-isotropic or isotropic vector space of unlimited dictionary entries
di: Liu, Xiaodong
Pubblicazione: (2024)
di: Liu, Xiaodong
Pubblicazione: (2024)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
di: Huang, Chengyu, et al.
Pubblicazione: (2025)
di: Huang, Chengyu, et al.
Pubblicazione: (2025)
BinaryPPO: Efficient Policy Optimization for Binary Classification
di: Pandey, Punya Syon, et al.
Pubblicazione: (2026)
di: Pandey, Punya Syon, et al.
Pubblicazione: (2026)
Stepwise Alignment for Constrained Language Model Policy Optimization
di: Wachi, Akifumi, et al.
Pubblicazione: (2024)
di: Wachi, Akifumi, et al.
Pubblicazione: (2024)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
di: Wu, Feijie, et al.
Pubblicazione: (2025)
di: Wu, Feijie, et al.
Pubblicazione: (2025)
Agentic Entropy-Balanced Policy Optimization
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
di: Wang, Jialu, et al.
Pubblicazione: (2026)
di: Wang, Jialu, et al.
Pubblicazione: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
Co-Evolution of Policy and Internal Reward for Language Agents
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
Towards Consistent Natural-Language Explanations via Explanation-Consistency Finetuning
di: Chen, Yanda, et al.
Pubblicazione: (2024)
di: Chen, Yanda, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
di: Li, Chengao, et al.
Pubblicazione: (2025) -
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025) -
Group Sequence Policy Optimization
di: Zheng, Chujie, et al.
Pubblicazione: (2025) -
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
di: Qi, Penghui, et al.
Pubblicazione: (2025) -
Soft Adaptive Policy Optimization
di: Gao, Chang, et al.
Pubblicazione: (2025)