VPO: Leveraging the Number of Votes in Preference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Cho, Jae Hyeon, Park, Minkyung, Lee, Byung-Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
di: Cho, Jay Hyeon, et al.
Pubblicazione: (2025)
di: Cho, Jay Hyeon, et al.
Pubblicazione: (2025)
Geometric-Averaged Preference Optimization for Soft Preference Labels
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
On the Role of Preference Variance in Preference Optimization
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
Assessing LLM Reasoning Steps via Principal Knowledge Grounding
di: Hwang, Hyeon, et al.
Pubblicazione: (2025)
di: Hwang, Hyeon, et al.
Pubblicazione: (2025)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
SEAL: Scaling to Emphasize Attention for Long-Context Retrieval
di: Lee, Changhun, et al.
Pubblicazione: (2025)
di: Lee, Changhun, et al.
Pubblicazione: (2025)
Preference Learning Algorithms Do Not Learn Preference Rankings
di: Chen, Angelica, et al.
Pubblicazione: (2024)
di: Chen, Angelica, et al.
Pubblicazione: (2024)
Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization
di: Won, Yunjae, et al.
Pubblicazione: (2025)
di: Won, Yunjae, et al.
Pubblicazione: (2025)
Filtered Direct Preference Optimization
di: Morimura, Tetsuro, et al.
Pubblicazione: (2024)
di: Morimura, Tetsuro, et al.
Pubblicazione: (2024)
Direct Preference Optimization with an Offset
di: Amini, Afra, et al.
Pubblicazione: (2024)
di: Amini, Afra, et al.
Pubblicazione: (2024)
Self-Consistency Preference Optimization
di: Prasad, Archiki, et al.
Pubblicazione: (2024)
di: Prasad, Archiki, et al.
Pubblicazione: (2024)
Language over Content: Tracing Cultural Understanding in Multilingual Large Language Models
di: Cho, Seungho, et al.
Pubblicazione: (2025)
di: Cho, Seungho, et al.
Pubblicazione: (2025)
Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift
di: Jian, Chengtao, et al.
Pubblicazione: (2025)
di: Jian, Chengtao, et al.
Pubblicazione: (2025)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
di: Gupta, Taneesh, et al.
Pubblicazione: (2025)
di: Gupta, Taneesh, et al.
Pubblicazione: (2025)
Entropy Controllable Direct Preference Optimization
di: Omura, Motoki, et al.
Pubblicazione: (2024)
di: Omura, Motoki, et al.
Pubblicazione: (2024)
Orthogonal Finetuning for Direct Preference Optimization
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
di: Kim, Dongyoung, et al.
Pubblicazione: (2024)
di: Kim, Dongyoung, et al.
Pubblicazione: (2024)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
TSO: Self-Training with Scaled Preference Optimization
di: Chen, Kaihui, et al.
Pubblicazione: (2024)
di: Chen, Kaihui, et al.
Pubblicazione: (2024)
WPO: Enhancing RLHF with Weighted Preference Optimization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
Preference Optimization by Estimating the Ratio of the Data Distribution
di: Kim, Yeongmin, et al.
Pubblicazione: (2025)
di: Kim, Yeongmin, et al.
Pubblicazione: (2025)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
di: Lee, Gihun, et al.
Pubblicazione: (2024)
di: Lee, Gihun, et al.
Pubblicazione: (2024)
ROPO: Robust Preference Optimization for Large Language Models
di: Liang, Xize, et al.
Pubblicazione: (2024)
di: Liang, Xize, et al.
Pubblicazione: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
di: He, Jiafan, et al.
Pubblicazione: (2024)
di: He, Jiafan, et al.
Pubblicazione: (2024)
Self-Play Preference Optimization for Language Model Alignment
di: Wu, Yue, et al.
Pubblicazione: (2024)
di: Wu, Yue, et al.
Pubblicazione: (2024)
T-REG: Preference Optimization with Token-Level Reward Regularization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
di: Razin, Noam, et al.
Pubblicazione: (2024)
di: Razin, Noam, et al.
Pubblicazione: (2024)
Efficient semantic uncertainty quantification in language models via diversity-steered sampling
di: Park, Ji Won, et al.
Pubblicazione: (2025)
di: Park, Ji Won, et al.
Pubblicazione: (2025)
Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization
di: Huang, Audrey, et al.
Pubblicazione: (2024)
di: Huang, Audrey, et al.
Pubblicazione: (2024)
MathBridge: A Large Corpus Dataset for Translating Spoken Mathematical Expressions into $LaTeX$ Formulas for Improved Readability
di: Jung, Kyudan, et al.
Pubblicazione: (2024)
di: Jung, Kyudan, et al.
Pubblicazione: (2024)
Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning
di: Fan, Chongyu, et al.
Pubblicazione: (2024)
di: Fan, Chongyu, et al.
Pubblicazione: (2024)
Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment
di: D'Oosterlinck, Karel, et al.
Pubblicazione: (2024)
di: D'Oosterlinck, Karel, et al.
Pubblicazione: (2024)
Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning
di: Zhang, Ruiqi, et al.
Pubblicazione: (2024)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
di: Wang, Jialu, et al.
Pubblicazione: (2026)
di: Wang, Jialu, et al.
Pubblicazione: (2026)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
di: Zhu, Zining, et al.
Pubblicazione: (2025)
di: Zhu, Zining, et al.
Pubblicazione: (2025)
GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer
di: Cho, Junmo, et al.
Pubblicazione: (2026)
di: Cho, Junmo, et al.
Pubblicazione: (2026)
PSYCHE: A Multi-faceted Patient Simulation Framework for Evaluation of Psychiatric Assessment Conversational Agents
di: Lee, Jingoo, et al.
Pubblicazione: (2025)
di: Lee, Jingoo, et al.
Pubblicazione: (2025)
Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
di: Choi, Yumin, et al.
Pubblicazione: (2025)
di: Choi, Yumin, et al.
Pubblicazione: (2025)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
di: Cho, Jay Hyeon, et al.
Pubblicazione: (2025) -
Geometric-Averaged Preference Optimization for Soft Preference Labels
di: Furuta, Hiroki, et al.
Pubblicazione: (2024) -
On the Role of Preference Variance in Preference Optimization
di: Guo, Jiacheng, et al.
Pubblicazione: (2025) -
Assessing LLM Reasoning Steps via Principal Knowledge Grounding
di: Hwang, Hyeon, et al.
Pubblicazione: (2025) -
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
di: Park, Jungwoo, et al.
Pubblicazione: (2025)