Guardado en:
| Autor principal: | Cho, Jaekyung |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.24082 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Weights-Rotated Preference Optimization for Large Language Models
por: Yang, Chenxu, et al.
Publicado: (2025)
por: Yang, Chenxu, et al.
Publicado: (2025)
Iterative Reasoning Preference Optimization
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024)
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024)
ROPO: Robust Preference Optimization for Large Language Models
por: Liang, Xize, et al.
Publicado: (2024)
por: Liang, Xize, et al.
Publicado: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
por: He, Jiafan, et al.
Publicado: (2024)
por: He, Jiafan, et al.
Publicado: (2024)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
por: Zhang, Rongzhi, et al.
Publicado: (2024)
por: Zhang, Rongzhi, et al.
Publicado: (2024)
Aligning Large Language Models with Searcher Preferences
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization
por: Savage, Thomas, et al.
Publicado: (2024)
por: Savage, Thomas, et al.
Publicado: (2024)
Retrieval-Augmented Fine-Tuning With Preference Optimization For Visual Program Generation
por: Kang, Deokhyung, et al.
Publicado: (2025)
por: Kang, Deokhyung, et al.
Publicado: (2025)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2023)
por: Zhao, Siyan, et al.
Publicado: (2023)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
por: Feng, Zhili, et al.
Publicado: (2025)
por: Feng, Zhili, et al.
Publicado: (2025)
VPO: Leveraging the Number of Votes in Preference Optimization
por: Cho, Jae Hyeon, et al.
Publicado: (2024)
por: Cho, Jae Hyeon, et al.
Publicado: (2024)
Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Models
por: Gu, Yanggan, et al.
Publicado: (2025)
por: Gu, Yanggan, et al.
Publicado: (2025)
Active Preference Learning for Large Language Models
por: Muldrew, William, et al.
Publicado: (2024)
por: Muldrew, William, et al.
Publicado: (2024)
Aligning Large Language Model Behavior with Human Citation Preferences
por: Ando, Kenichiro, et al.
Publicado: (2026)
por: Ando, Kenichiro, et al.
Publicado: (2026)
Self-Boosting Large Language Models with Synthetic Preference Data
por: Dong, Qingxiu, et al.
Publicado: (2024)
por: Dong, Qingxiu, et al.
Publicado: (2024)
Creative Preference Optimization
por: Ismayilzada, Mete, et al.
Publicado: (2025)
por: Ismayilzada, Mete, et al.
Publicado: (2025)
On the Role of Preference Variance in Preference Optimization
por: Guo, Jiacheng, et al.
Publicado: (2025)
por: Guo, Jiacheng, et al.
Publicado: (2025)
Mitigating Hallucinated Translations in Large Language Models with Hallucination-focused Preference Optimization
por: Tang, Zilu, et al.
Publicado: (2025)
por: Tang, Zilu, et al.
Publicado: (2025)
CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences
por: Pokharel, Rhitabrat, et al.
Publicado: (2025)
por: Pokharel, Rhitabrat, et al.
Publicado: (2025)
Knowledge Editing in Language Models via Adapted Direct Preference Optimization
por: Rozner, Amit, et al.
Publicado: (2024)
por: Rozner, Amit, et al.
Publicado: (2024)
Self-Play Preference Optimization for Language Model Alignment
por: Wu, Yue, et al.
Publicado: (2024)
por: Wu, Yue, et al.
Publicado: (2024)
IIMedGPT: Promoting Large Language Model Capabilities of Medical Tasks by Efficient Human Preference Alignment
por: Zhang, Yiming, et al.
Publicado: (2025)
por: Zhang, Yiming, et al.
Publicado: (2025)
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
por: Pombal, José, et al.
Publicado: (2026)
por: Pombal, José, et al.
Publicado: (2026)
Language Models Largely Exhibit Human-like Constituent Ordering Preferences
por: Tur, Ada Defne, et al.
Publicado: (2025)
por: Tur, Ada Defne, et al.
Publicado: (2025)
How does Misinformation Affect Large Language Model Behaviors and Preferences?
por: Peng, Miao, et al.
Publicado: (2025)
por: Peng, Miao, et al.
Publicado: (2025)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
por: Liu, Tong, et al.
Publicado: (2025)
por: Liu, Tong, et al.
Publicado: (2025)
Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment
por: Zhang, Jianfei, et al.
Publicado: (2024)
por: Zhang, Jianfei, et al.
Publicado: (2024)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
por: Yu, Huimu, et al.
Publicado: (2024)
por: Yu, Huimu, et al.
Publicado: (2024)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
por: Lee, Gihun, et al.
Publicado: (2024)
por: Lee, Gihun, et al.
Publicado: (2024)
Active Preference Optimization for Sample Efficient RLHF
por: Das, Nirjhar, et al.
Publicado: (2024)
por: Das, Nirjhar, et al.
Publicado: (2024)
Multiplayer Nash Preference Optimization
por: Wu, Fang, et al.
Publicado: (2025)
por: Wu, Fang, et al.
Publicado: (2025)
Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancement
por: Zhou, Xiaofeng, et al.
Publicado: (2025)
por: Zhou, Xiaofeng, et al.
Publicado: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
Preference Learning Algorithms Do Not Learn Preference Rankings
por: Chen, Angelica, et al.
Publicado: (2024)
por: Chen, Angelica, et al.
Publicado: (2024)
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
por: Bao, Qiming, et al.
Publicado: (2026)
por: Bao, Qiming, et al.
Publicado: (2026)
Geometric-Averaged Preference Optimization for Soft Preference Labels
por: Furuta, Hiroki, et al.
Publicado: (2024)
por: Furuta, Hiroki, et al.
Publicado: (2024)
Probing Persona-Dependent Preferences in Language Models
por: Gilg, Oscar, et al.
Publicado: (2026)
por: Gilg, Oscar, et al.
Publicado: (2026)
CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models
por: Nguyen, Son The, et al.
Publicado: (2024)
por: Nguyen, Son The, et al.
Publicado: (2024)
Improving Attributed Text Generation of Large Language Models via Preference Learning
por: Li, Dongfang, et al.
Publicado: (2024)
por: Li, Dongfang, et al.
Publicado: (2024)
Ejemplares similares
-
Weights-Rotated Preference Optimization for Large Language Models
por: Yang, Chenxu, et al.
Publicado: (2025) -
Iterative Reasoning Preference Optimization
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024) -
ROPO: Robust Preference Optimization for Large Language Models
por: Liang, Xize, et al.
Publicado: (2024) -
Accelerated Preference Optimization for Large Language Model Alignment
por: He, Jiafan, et al.
Publicado: (2024) -
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
por: Li, Jian, et al.
Publicado: (2024)