Strong Preferences Affect the Robustness of Preference Models and Value Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Ziwei, Kankanhalli, Mohan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hallucination is Inevitable: An Innate Limitation of Large Language Models
por: Xu, Ziwei, et al.
Publicado: (2024)
por: Xu, Ziwei, et al.
Publicado: (2024)
Bullying the Machine: How Personas Increase LLM Vulnerability
por: Xu, Ziwei, et al.
Publicado: (2025)
por: Xu, Ziwei, et al.
Publicado: (2025)
Reasoning LLMs are Wandering Solution Explorers
por: Lu, Jiahao, et al.
Publicado: (2025)
por: Lu, Jiahao, et al.
Publicado: (2025)
Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier
por: Badrinath, Anirudhan, et al.
Publicado: (2024)
por: Badrinath, Anirudhan, et al.
Publicado: (2024)
On Diversified Preferences of Large Language Model Alignment
por: Zeng, Dun, et al.
Publicado: (2023)
por: Zeng, Dun, et al.
Publicado: (2023)
Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
por: Xu, Zaiyan, et al.
Publicado: (2025)
por: Xu, Zaiyan, et al.
Publicado: (2025)
Adversarial Preference Learning for Robust LLM Alignment
por: Wang, Yuanfu, et al.
Publicado: (2025)
por: Wang, Yuanfu, et al.
Publicado: (2025)
HPS: Hard Preference Sampling for Human Preference Alignment
por: Zou, Xiandong, et al.
Publicado: (2025)
por: Zou, Xiandong, et al.
Publicado: (2025)
Beyond Preferences in AI Alignment
por: Zhi-Xuan, Tan, et al.
Publicado: (2024)
por: Zhi-Xuan, Tan, et al.
Publicado: (2024)
In-Context Reward Adaptation for Robust Preference Modeling
por: Sun, Zhenyu, et al.
Publicado: (2026)
por: Sun, Zhenyu, et al.
Publicado: (2026)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
por: Lyu, Yougang, et al.
Publicado: (2024)
por: Lyu, Yougang, et al.
Publicado: (2024)
CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models
por: Nguyen, Son The, et al.
Publicado: (2024)
por: Nguyen, Son The, et al.
Publicado: (2024)
Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models
por: Lu, Shule, et al.
Publicado: (2026)
por: Lu, Shule, et al.
Publicado: (2026)
Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models
por: Lu, Shule, et al.
Publicado: (2026)
por: Lu, Shule, et al.
Publicado: (2026)
Synergistic Weak-Strong Collaboration by Aligning Preferences
por: Jiao, Yizhu, et al.
Publicado: (2025)
por: Jiao, Yizhu, et al.
Publicado: (2025)
Preference-Based Alignment of Discrete Diffusion Models
por: Borso, Umberto, et al.
Publicado: (2025)
por: Borso, Umberto, et al.
Publicado: (2025)
Direct Alignment with Heterogeneous Preferences
por: Shirali, Ali, et al.
Publicado: (2025)
por: Shirali, Ali, et al.
Publicado: (2025)
Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding
por: Song, Feifan, et al.
Publicado: (2025)
por: Song, Feifan, et al.
Publicado: (2025)
Uncovering Factor Level Preferences to Improve Human-Model Alignment
por: Oh, Juhyun, et al.
Publicado: (2024)
por: Oh, Juhyun, et al.
Publicado: (2024)
Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment
por: Zhang, Jianfei, et al.
Publicado: (2024)
por: Zhang, Jianfei, et al.
Publicado: (2024)
Modeling Human Responses to Multimodal AI Content
por: Shen, Zhiqi, et al.
Publicado: (2025)
por: Shen, Zhiqi, et al.
Publicado: (2025)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
por: Rajaram, Sara, et al.
Publicado: (2025)
por: Rajaram, Sara, et al.
Publicado: (2025)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
por: Xu, Danni, et al.
Publicado: (2026)
por: Xu, Danni, et al.
Publicado: (2026)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
Implicit Safety Alignment from Crowd Preferences
por: Lin, Qian, et al.
Publicado: (2026)
por: Lin, Qian, et al.
Publicado: (2026)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
por: Li, Wei, et al.
Publicado: (2024)
por: Li, Wei, et al.
Publicado: (2024)
How does Misinformation Affect Large Language Model Behaviors and Preferences?
por: Peng, Miao, et al.
Publicado: (2025)
por: Peng, Miao, et al.
Publicado: (2025)
Privacy Risks and Preservation Methods in Explainable Artificial Intelligence: A Scoping Review
por: Allana, Sonal, et al.
Publicado: (2025)
por: Allana, Sonal, et al.
Publicado: (2025)
Involuntary Jailbreak: On Self-Prompting Attacks
por: Guo, Yangyang, et al.
Publicado: (2025)
por: Guo, Yangyang, et al.
Publicado: (2025)
Preference Alignment Improves Language Model-Based TTS
por: Tian, Jinchuan, et al.
Publicado: (2024)
por: Tian, Jinchuan, et al.
Publicado: (2024)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
por: Xu, Danni, et al.
Publicado: (2025)
por: Xu, Danni, et al.
Publicado: (2025)
Word Alignment as Preference for Machine Translation
por: Wu, Qiyu, et al.
Publicado: (2024)
por: Wu, Qiyu, et al.
Publicado: (2024)
Preference Ranking Optimization for Human Alignment
por: Song, Feifan, et al.
Publicado: (2023)
por: Song, Feifan, et al.
Publicado: (2023)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
por: Liu, Biao, et al.
Publicado: (2025)
por: Liu, Biao, et al.
Publicado: (2025)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
por: Kim, Dongyoung, et al.
Publicado: (2024)
por: Kim, Dongyoung, et al.
Publicado: (2024)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
por: Zhou, Zhanhui, et al.
Publicado: (2023)
por: Zhou, Zhanhui, et al.
Publicado: (2023)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
por: Cheng, Jie, et al.
Publicado: (2024)
por: Cheng, Jie, et al.
Publicado: (2024)
From "Weak" Signals to Strong Models: Preference Delta Aggregation with LoRA Merging
por: Sun, Qi, et al.
Publicado: (2026)
por: Sun, Qi, et al.
Publicado: (2026)
Course-Correction: Safety Alignment Using Synthetic Preferences
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors
por: Liang, Ren-Wei, et al.
Publicado: (2025)
por: Liang, Ren-Wei, et al.
Publicado: (2025)
Ejemplares similares
-
Hallucination is Inevitable: An Innate Limitation of Large Language Models
por: Xu, Ziwei, et al.
Publicado: (2024) -
Bullying the Machine: How Personas Increase LLM Vulnerability
por: Xu, Ziwei, et al.
Publicado: (2025) -
Reasoning LLMs are Wandering Solution Explorers
por: Lu, Jiahao, et al.
Publicado: (2025) -
Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier
por: Badrinath, Anirudhan, et al.
Publicado: (2024) -
On Diversified Preferences of Large Language Model Alignment
por: Zeng, Dun, et al.
Publicado: (2023)