Uncovering Cross-Objective Interference in Multi-Objective Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Yining, Jiang, Meng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
di: Lu, Yining, et al.
Pubblicazione: (2025)
di: Lu, Yining, et al.
Pubblicazione: (2025)
OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment
di: Lin, Liang, et al.
Pubblicazione: (2025)
di: Lin, Liang, et al.
Pubblicazione: (2025)
Multi-Objective Alignment of Language Models for Personalized Psychotherapy
di: Beikzadeh, Mehrab, et al.
Pubblicazione: (2026)
di: Beikzadeh, Mehrab, et al.
Pubblicazione: (2026)
Robust Multi-Objective Preference Alignment with Online DPO
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
Pareto Multi-Objective Alignment for Language Models
di: He, Qiang, et al.
Pubblicazione: (2025)
di: He, Qiang, et al.
Pubblicazione: (2025)
Discovering Implicit Large Language Model Alignment Objectives
di: Chen, Edward, et al.
Pubblicazione: (2026)
di: Chen, Edward, et al.
Pubblicazione: (2026)
Reward-free Alignment for Conflicting Objectives
di: Chen, Peter, et al.
Pubblicazione: (2026)
di: Chen, Peter, et al.
Pubblicazione: (2026)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
di: Li, Moxin, et al.
Pubblicazione: (2025)
di: Li, Moxin, et al.
Pubblicazione: (2025)
The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives
di: Bou, Matthieu, et al.
Pubblicazione: (2025)
di: Bou, Matthieu, et al.
Pubblicazione: (2025)
Improving LLM Safety Alignment with Dual-Objective Optimization
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
di: Li, Chengao, et al.
Pubblicazione: (2025)
di: Li, Chengao, et al.
Pubblicazione: (2025)
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
One Model for All: Multi-Objective Controllable Language Models
di: He, Qiang, et al.
Pubblicazione: (2026)
di: He, Qiang, et al.
Pubblicazione: (2026)
Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift
di: Vennemeyer, Daniel, et al.
Pubblicazione: (2026)
di: Vennemeyer, Daniel, et al.
Pubblicazione: (2026)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection
di: Joshi, Maithili, et al.
Pubblicazione: (2025)
di: Joshi, Maithili, et al.
Pubblicazione: (2025)
Multi-Objective Large Language Model Unlearning
di: Pan, Zibin, et al.
Pubblicazione: (2024)
di: Pan, Zibin, et al.
Pubblicazione: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization
di: Zhao, Zhengyang, et al.
Pubblicazione: (2026)
di: Zhao, Zhengyang, et al.
Pubblicazione: (2026)
SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement
di: Sahoo, Subramanyam, et al.
Pubblicazione: (2026)
di: Sahoo, Subramanyam, et al.
Pubblicazione: (2026)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026)
di: Bai, Yang, et al.
Pubblicazione: (2026)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
di: Pavlenko, Kirill, et al.
Pubblicazione: (2026)
di: Pavlenko, Kirill, et al.
Pubblicazione: (2026)
Drifting Objectives for Refining Discrete Diffusion Language Models
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
LLMAP: LLM-Assisted Multi-Objective Route Planning with User Preferences
di: Yuan, Liangqi, et al.
Pubblicazione: (2025)
di: Yuan, Liangqi, et al.
Pubblicazione: (2025)
RLP: Reinforcement as a Pretraining Objective
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2025)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2025)
COS-DPO: Conditioned One-Shot Multi-Objective Fine-Tuning Framework
di: Ren, Yinuo, et al.
Pubblicazione: (2024)
di: Ren, Yinuo, et al.
Pubblicazione: (2024)
Conditional Language Policy: A General Framework for Steerable Multi-Objective Finetuning
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
di: Xiong, Wei, et al.
Pubblicazione: (2025)
di: Xiong, Wei, et al.
Pubblicazione: (2025)
Aligning the Objective of LLM-based Program Repair
di: Xu, Junjielong, et al.
Pubblicazione: (2024)
di: Xu, Junjielong, et al.
Pubblicazione: (2024)
A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL
di: Yang, Lei, et al.
Pubblicazione: (2026)
di: Yang, Lei, et al.
Pubblicazione: (2026)
Objective Metrics for Evaluating Large Language Models Using External Data Sources
di: Du, Haoze, et al.
Pubblicazione: (2025)
di: Du, Haoze, et al.
Pubblicazione: (2025)
EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
On the Hidden Objective Biases of Group-based Reinforcement Learning
di: Fontana, Aleksandar, et al.
Pubblicazione: (2026)
di: Fontana, Aleksandar, et al.
Pubblicazione: (2026)
Adversarial Decoding: Generating Readable Documents for Adversarial Objectives
di: Zhang, Collin, et al.
Pubblicazione: (2024)
di: Zhang, Collin, et al.
Pubblicazione: (2024)
Bone Soups: A Seek-and-Soup Model Merging Approach for Controllable Multi-Objective Generation
di: Xie, Guofu, et al.
Pubblicazione: (2025)
di: Xie, Guofu, et al.
Pubblicazione: (2025)
Evolutionary Multi-Objective Optimization of Large Language Model Prompts for Balancing Sentiments
di: Baumann, Jill, et al.
Pubblicazione: (2024)
di: Baumann, Jill, et al.
Pubblicazione: (2024)
Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search
di: Lu, Jialin, et al.
Pubblicazione: (2026)
di: Lu, Jialin, et al.
Pubblicazione: (2026)
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
M3: A Multi-Task Mixed-Objective Learning Framework for Open-Domain Multi-Hop Dense Sentence Retrieval
di: Bai, Yang, et al.
Pubblicazione: (2024)
di: Bai, Yang, et al.
Pubblicazione: (2024)
Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives
di: Wang, Zecheng, et al.
Pubblicazione: (2026)
di: Wang, Zecheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
di: Lu, Yining, et al.
Pubblicazione: (2025) -
OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment
di: Lin, Liang, et al.
Pubblicazione: (2025) -
Multi-Objective Alignment of Language Models for Personalized Psychotherapy
di: Beikzadeh, Mehrab, et al.
Pubblicazione: (2026) -
Robust Multi-Objective Preference Alignment with Online DPO
di: Gupta, Raghav, et al.
Pubblicazione: (2025) -
Pareto Multi-Objective Alignment for Language Models
di: He, Qiang, et al.
Pubblicazione: (2025)