Robust Preference Alignment via Directional Neighborhood Consensus
Fuente:
arXiv
Salvato in:
| Autori principali: | Mao, Ruochen, Shi, Yuling, Gu, Xiaodong, Wei, Jiaheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AttentionRAG: Attention-Guided Context Pruning in Retrieval-Augmented Generation
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
di: Zhao, Mengjie, et al.
Pubblicazione: (2026)
di: Zhao, Mengjie, et al.
Pubblicazione: (2026)
Between Lines of Code: Unraveling the Distinct Patterns of Machine and Human Programmers
di: Shi, Yuling, et al.
Pubblicazione: (2024)
di: Shi, Yuling, et al.
Pubblicazione: (2024)
From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging
di: Shi, Yuling, et al.
Pubblicazione: (2024)
di: Shi, Yuling, et al.
Pubblicazione: (2024)
LastingBench: Defend Benchmarks Against Knowledge Leakage
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
LongCodeZip: Compress Long Context for Code Language Models
di: Shi, Yuling, et al.
Pubblicazione: (2025)
di: Shi, Yuling, et al.
Pubblicazione: (2025)
On-the-fly Preference Alignment via Principle-Guided Decoding
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
Understanding the Logic of Direct Preference Alignment through Logic
di: Richardson, Kyle, et al.
Pubblicazione: (2024)
di: Richardson, Kyle, et al.
Pubblicazione: (2024)
SWE-QA: Can Language Models Answer Repository-level Code Questions?
di: Peng, Weihan, et al.
Pubblicazione: (2025)
di: Peng, Weihan, et al.
Pubblicazione: (2025)
Improving Conversational Abilities of Quantized Large Language Models via Direct Preference Alignment
di: Lee, Janghwan, et al.
Pubblicazione: (2024)
di: Lee, Janghwan, et al.
Pubblicazione: (2024)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
Direct Preference Knowledge Distillation for Large Language Models
di: Li, Yixing, et al.
Pubblicazione: (2024)
di: Li, Yixing, et al.
Pubblicazione: (2024)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
di: Li, Shilong, et al.
Pubblicazione: (2024)
di: Li, Shilong, et al.
Pubblicazione: (2024)
From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language Models via Neurons Alignment
di: Huang, Chongxuan, et al.
Pubblicazione: (2025)
di: Huang, Chongxuan, et al.
Pubblicazione: (2025)
ICDPO: Effectively Borrowing Alignment Capability of Others via In-context Direct Preference Optimization
di: Song, Feifan, et al.
Pubblicazione: (2024)
di: Song, Feifan, et al.
Pubblicazione: (2024)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
di: Kim, Dongyoung, et al.
Pubblicazione: (2024)
di: Kim, Dongyoung, et al.
Pubblicazione: (2024)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?
di: Peng, Weihan, et al.
Pubblicazione: (2026)
di: Peng, Weihan, et al.
Pubblicazione: (2026)
Robust Multi-Objective Preference Alignment with Online DPO
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
Panacea: Pareto Alignment via Preference Adaptation for LLMs
di: Zhong, Yifan, et al.
Pubblicazione: (2024)
di: Zhong, Yifan, et al.
Pubblicazione: (2024)
Refined Direct Preference Optimization with Synthetic Data for Behavioral Alignment of LLMs
di: Gallego, Víctor
Pubblicazione: (2024)
di: Gallego, Víctor
Pubblicazione: (2024)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
di: Chen, Yeheng, et al.
Pubblicazione: (2026)
di: Chen, Yeheng, et al.
Pubblicazione: (2026)
Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering
di: Shi, Yuling, et al.
Pubblicazione: (2026)
di: Shi, Yuling, et al.
Pubblicazione: (2026)
VERI-DPO: Evidence-Aware Alignment for Clinical Summarization via Claim Verification and Direct Preference Optimization
di: Liu, Weixin, et al.
Pubblicazione: (2026)
di: Liu, Weixin, et al.
Pubblicazione: (2026)
Accelerated Preference Optimization for Large Language Model Alignment
di: He, Jiafan, et al.
Pubblicazione: (2024)
di: He, Jiafan, et al.
Pubblicazione: (2024)
EffiSkill: Agent Skill Based Automated Code Efficiency Optimization
di: Wang, Zimu, et al.
Pubblicazione: (2026)
di: Wang, Zimu, et al.
Pubblicazione: (2026)
Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE
di: Huang, Hejin, et al.
Pubblicazione: (2026)
di: Huang, Hejin, et al.
Pubblicazione: (2026)
Course-Correction: Safety Alignment Using Synthetic Preferences
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
Preference Alignment for Diffusion Model via Explicit Denoised Distribution Estimation
di: Shi, Dingyuan, et al.
Pubblicazione: (2024)
di: Shi, Dingyuan, et al.
Pubblicazione: (2024)
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
di: Yang, Zhengbang, et al.
Pubblicazione: (2026)
di: Yang, Zhengbang, et al.
Pubblicazione: (2026)
BPO: Revisiting Preference Modeling in Direct Preference Optimization
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
di: Sun, Zetian, et al.
Pubblicazione: (2025)
di: Sun, Zetian, et al.
Pubblicazione: (2025)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
di: Zhu, Kewen, et al.
Pubblicazione: (2026)
di: Zhu, Kewen, et al.
Pubblicazione: (2026)
The Crucial Role of Samplers in Online Direct Preference Optimization
di: Shi, Ruizhe, et al.
Pubblicazione: (2024)
di: Shi, Ruizhe, et al.
Pubblicazione: (2024)
Leveraging Robust Optimization for LLM Alignment under Distribution Shifts
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization
di: Zhu, Mingye, et al.
Pubblicazione: (2024)
di: Zhu, Mingye, et al.
Pubblicazione: (2024)
Robust Preference Optimization via Dynamic Target Margins
di: Sun, Jie, et al.
Pubblicazione: (2025)
di: Sun, Jie, et al.
Pubblicazione: (2025)
Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization
di: Huang, Audrey, et al.
Pubblicazione: (2024)
di: Huang, Audrey, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AttentionRAG: Attention-Guided Context Pruning in Retrieval-Augmented Generation
di: Fang, Yixiong, et al.
Pubblicazione: (2025) -
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
di: Zhao, Mengjie, et al.
Pubblicazione: (2026) -
Between Lines of Code: Unraveling the Distinct Patterns of Machine and Human Programmers
di: Shi, Yuling, et al.
Pubblicazione: (2024) -
From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging
di: Shi, Yuling, et al.
Pubblicazione: (2024) -
LastingBench: Defend Benchmarks Against Knowledge Leakage
di: Fang, Yixiong, et al.
Pubblicazione: (2025)