LamPO: A Lambda Style Policy Optimization for Reasoning Language Models
Fuente:
arXiv
Salvato in:
| Autore principale: | arXiv, Redacted by |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models
di: arXiv, Redacted by
Pubblicazione: (2026)
di: arXiv, Redacted by
Pubblicazione: (2026)
The Llama 4 Herd: Architecture, Training, Evaluation, and Deployment Notes
di: arXiv, Redacted by
Pubblicazione: (2026)
di: arXiv, Redacted by
Pubblicazione: (2026)
Removed by arXiv
di: arXiv, Removed by
Pubblicazione: (2023)
di: arXiv, Removed by
Pubblicazione: (2023)
HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs
di: Deng, Ken, et al.
Pubblicazione: (2025)
di: Deng, Ken, et al.
Pubblicazione: (2025)
Authorship Style Transfer with Policy Optimization
di: Liu, Shuai, et al.
Pubblicazione: (2024)
di: Liu, Shuai, et al.
Pubblicazione: (2024)
PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning
di: Lu, Wenquan, et al.
Pubblicazione: (2026)
di: Lu, Wenquan, et al.
Pubblicazione: (2026)
CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization
di: Li, Junyi, et al.
Pubblicazione: (2026)
di: Li, Junyi, et al.
Pubblicazione: (2026)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
di: Wang, Daoyu, et al.
Pubblicazione: (2026)
di: Wang, Daoyu, et al.
Pubblicazione: (2026)
Combining On-Policy Optimization and Distillation for Long-Context Reasoning in Large Language Models
di: Ramos, Miguel Moura, et al.
Pubblicazione: (2026)
di: Ramos, Miguel Moura, et al.
Pubblicazione: (2026)
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment
di: Deng, Ruibo, et al.
Pubblicazione: (2025)
di: Deng, Ruibo, et al.
Pubblicazione: (2025)
SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models
di: Rao, Jun, et al.
Pubblicazione: (2025)
di: Rao, Jun, et al.
Pubblicazione: (2025)
Lambdas at the Far Edge: a Tale of Flying Lambdas and Lambdas on Wheels
di: Audrito, Giorgio, et al.
Pubblicazione: (2026)
di: Audrito, Giorgio, et al.
Pubblicazione: (2026)
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
di: Zong, Zefang, et al.
Pubblicazione: (2026)
di: Zong, Zefang, et al.
Pubblicazione: (2026)
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling
di: Li, Yizhi, et al.
Pubblicazione: (2025)
di: Li, Yizhi, et al.
Pubblicazione: (2025)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
ComPO: Community Preferences for Language Model Personalization
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
Style over Substance: Distilled Language Models Reason Via Stylistic Replication
di: Lippmann, Philip, et al.
Pubblicazione: (2025)
di: Lippmann, Philip, et al.
Pubblicazione: (2025)
StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control
di: Zhao, Haishu, et al.
Pubblicazione: (2026)
di: Zhao, Haishu, et al.
Pubblicazione: (2026)
Perception-Aware Policy Optimization for Multimodal Reasoning
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
BFS-PO: Best-First Search for Large Reasoning Models
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2026)
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2026)
Relative Score Policy Optimization for Diffusion Language Models
di: Yu, Zichao, et al.
Pubblicazione: (2026)
di: Yu, Zichao, et al.
Pubblicazione: (2026)
Scaling Policy Compliance Assessment in Language Models with Policy Reasoning Traces
di: Imperial, Joseph Marvin, et al.
Pubblicazione: (2025)
di: Imperial, Joseph Marvin, et al.
Pubblicazione: (2025)
Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models
di: Yu, Zongji, et al.
Pubblicazione: (2026)
di: Yu, Zongji, et al.
Pubblicazione: (2026)
PrefPO: Pairwise Preference Prompt Optimization
di: Singhal, Rahul, et al.
Pubblicazione: (2026)
di: Singhal, Rahul, et al.
Pubblicazione: (2026)
GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer
di: Cho, Junmo, et al.
Pubblicazione: (2026)
di: Cho, Junmo, et al.
Pubblicazione: (2026)
Foresight Optimization for Strategic Reasoning in Large Language Models
di: Wang, Jiashuo, et al.
Pubblicazione: (2026)
di: Wang, Jiashuo, et al.
Pubblicazione: (2026)
Optimizing Language Model's Reasoning Abilities with Weak Supervision
di: Tong, Yongqi, et al.
Pubblicazione: (2024)
di: Tong, Yongqi, et al.
Pubblicazione: (2024)
MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework
di: Qi, Yupeng, et al.
Pubblicazione: (2025)
di: Qi, Yupeng, et al.
Pubblicazione: (2025)
SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation
di: Xu, Ting, et al.
Pubblicazione: (2025)
di: Xu, Ting, et al.
Pubblicazione: (2025)
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
di: Kang, Minki, et al.
Pubblicazione: (2026)
di: Kang, Minki, et al.
Pubblicazione: (2026)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
di: Huang, Chengyu, et al.
Pubblicazione: (2025)
di: Huang, Chengyu, et al.
Pubblicazione: (2025)
Composing Policy Gradients and Prompt Optimization for Language Model Programs
di: Ziems, Noah, et al.
Pubblicazione: (2025)
di: Ziems, Noah, et al.
Pubblicazione: (2025)
Lax Modal Lambda Calculi
di: Valliappan, Nachiappan
Pubblicazione: (2025)
di: Valliappan, Nachiappan
Pubblicazione: (2025)
Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models
di: Xu, Mufan, et al.
Pubblicazione: (2026)
di: Xu, Mufan, et al.
Pubblicazione: (2026)
KnowPO: Knowledge-aware Preference Optimization for Controllable Knowledge Selection in Retrieval-Augmented Language Models
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024)
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024)
Style Vectors for Steering Generative Large Language Model
di: Konen, Kai, et al.
Pubblicazione: (2024)
di: Konen, Kai, et al.
Pubblicazione: (2024)
Replacing Language Model for Style Transfer
di: Cheng, Pengyu, et al.
Pubblicazione: (2022)
di: Cheng, Pengyu, et al.
Pubblicazione: (2022)
TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning
di: Huang, Xu, et al.
Pubblicazione: (2026)
di: Huang, Xu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models
di: arXiv, Redacted by
Pubblicazione: (2026) -
The Llama 4 Herd: Architecture, Training, Evaluation, and Deployment Notes
di: arXiv, Redacted by
Pubblicazione: (2026) -
Removed by arXiv
di: arXiv, Removed by
Pubblicazione: (2023) -
HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs
di: Deng, Ken, et al.
Pubblicazione: (2025) -
Authorship Style Transfer with Policy Optimization
di: Liu, Shuai, et al.
Pubblicazione: (2024)