Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Wenzhe, Liu, Biao, Sun, Yiyang, Geng, Xin, Xu, Ning |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization
von: Yang, Junming, et al.
Veröffentlicht: (2025)
von: Yang, Junming, et al.
Veröffentlicht: (2025)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
von: Liu, Biao, et al.
Veröffentlicht: (2025)
von: Liu, Biao, et al.
Veröffentlicht: (2025)
Aligners: Decoupling LLMs and Alignment
von: Ngweta, Lilian, et al.
Veröffentlicht: (2024)
von: Ngweta, Lilian, et al.
Veröffentlicht: (2024)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
von: Hou, Xiaoyang, et al.
Veröffentlicht: (2026)
von: Hou, Xiaoyang, et al.
Veröffentlicht: (2026)
Meta-Learning Objectives for Preference Optimization
von: Alfano, Carlo, et al.
Veröffentlicht: (2024)
von: Alfano, Carlo, et al.
Veröffentlicht: (2024)
GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
von: Zhao, Yiyang, et al.
Veröffentlicht: (2025)
von: Zhao, Yiyang, et al.
Veröffentlicht: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
von: Lin, Baijiong, et al.
Veröffentlicht: (2025)
von: Lin, Baijiong, et al.
Veröffentlicht: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
von: Li, Chengao, et al.
Veröffentlicht: (2025)
von: Li, Chengao, et al.
Veröffentlicht: (2025)
C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs
von: Gao, Rui, et al.
Veröffentlicht: (2026)
von: Gao, Rui, et al.
Veröffentlicht: (2026)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
von: Ambadkar, Tanmay, et al.
Veröffentlicht: (2026)
von: Ambadkar, Tanmay, et al.
Veröffentlicht: (2026)
Preference-Guided Diffusion for Multi-Objective Offline Optimization
von: Annadani, Yashas, et al.
Veröffentlicht: (2025)
von: Annadani, Yashas, et al.
Veröffentlicht: (2025)
Bootstrapping LLMs via Preference-Based Policy Optimization
von: Jia, Chen
Veröffentlicht: (2025)
von: Jia, Chen
Veröffentlicht: (2025)
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)
Aligner: Efficient Alignment by Learning to Correct
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
Interactive Hyperparameter Optimization in Multi-Objective Problems via Preference Learning
von: Giovanelli, Joseph, et al.
Veröffentlicht: (2023)
von: Giovanelli, Joseph, et al.
Veröffentlicht: (2023)
PSMGD: Periodic Stochastic Multi-Gradient Descent for Fast Multi-Objective Optimization
von: Xu, Mingjing, et al.
Veröffentlicht: (2024)
von: Xu, Mingjing, et al.
Veröffentlicht: (2024)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
von: Harland, Hadassah, et al.
Veröffentlicht: (2024)
von: Harland, Hadassah, et al.
Veröffentlicht: (2024)
Uncertain Multi-Objective Recommendation via Orthogonal Meta-Learning Enhanced Bayesian Optimization
von: Wang, Hongxu, et al.
Veröffentlicht: (2025)
von: Wang, Hongxu, et al.
Veröffentlicht: (2025)
Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation
von: Xu, Hefei, et al.
Veröffentlicht: (2025)
von: Xu, Hefei, et al.
Veröffentlicht: (2025)
OntoAligner Meets Knowledge Graph Embedding Aligners
von: Giglou, Hamed Babaei, et al.
Veröffentlicht: (2025)
von: Giglou, Hamed Babaei, et al.
Veröffentlicht: (2025)
MetaAligner: Towards Generalizable Multi-Objective Alignment of Language Models
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
Multi-Objective Neural Architecture Search by Learning Search Space Partitions
von: Zhao, Yiyang, et al.
Veröffentlicht: (2024)
von: Zhao, Yiyang, et al.
Veröffentlicht: (2024)
NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment
von: Shen, Gerald, et al.
Veröffentlicht: (2024)
von: Shen, Gerald, et al.
Veröffentlicht: (2024)
Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
von: Xu, Zaiyan, et al.
Veröffentlicht: (2025)
von: Xu, Zaiyan, et al.
Veröffentlicht: (2025)
Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection
von: Zhao, Zihui, et al.
Veröffentlicht: (2025)
von: Zhao, Zihui, et al.
Veröffentlicht: (2025)
Harmonizing Multi-Objective LLM Unlearning via Unified Domain Representation and Bidirectional Logit Distillation
von: Zhong, Yisheng, et al.
Veröffentlicht: (2026)
von: Zhong, Yisheng, et al.
Veröffentlicht: (2026)
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
von: Wang, Jialu, et al.
Veröffentlicht: (2026)
von: Wang, Jialu, et al.
Veröffentlicht: (2026)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
von: Liu, Ning, et al.
Veröffentlicht: (2026)
von: Liu, Ning, et al.
Veröffentlicht: (2026)
Aligning CodeLLMs with Direct Preference Optimization
von: Miao, Yibo, et al.
Veröffentlicht: (2024)
von: Miao, Yibo, et al.
Veröffentlicht: (2024)
Progressively Label Enhancement for Large Language Model Alignment
von: Liu, Biao, et al.
Veröffentlicht: (2024)
von: Liu, Biao, et al.
Veröffentlicht: (2024)
Collaborative Expert LLMs Guided Multi-Objective Molecular Optimization
von: Yu, Jiajun, et al.
Veröffentlicht: (2025)
von: Yu, Jiajun, et al.
Veröffentlicht: (2025)
PA2D-MORL: Pareto Ascent Directional Decomposition based Multi-Objective Reinforcement Learning
von: Hu, Tianmeng, et al.
Veröffentlicht: (2026)
von: Hu, Tianmeng, et al.
Veröffentlicht: (2026)
OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs
von: Gao, Yuting, et al.
Veröffentlicht: (2025)
von: Gao, Yuting, et al.
Veröffentlicht: (2025)
Sample Efficient Preference Alignment in LLMs via Active Exploration
von: Mehta, Viraj, et al.
Veröffentlicht: (2023)
von: Mehta, Viraj, et al.
Veröffentlicht: (2023)
Training Greedy Policy for Proposal Batch Selection in Expensive Multi-Objective Combinatorial Optimization
von: Lee, Deokjae, et al.
Veröffentlicht: (2024)
von: Lee, Deokjae, et al.
Veröffentlicht: (2024)
In-Context Multi-Objective Optimization
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization
von: Nikzad, Murtaza, et al.
Veröffentlicht: (2026)
von: Nikzad, Murtaza, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization
von: Yang, Junming, et al.
Veröffentlicht: (2025) -
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
von: Liu, Biao, et al.
Veröffentlicht: (2025) -
Aligners: Decoupling LLMs and Alignment
von: Ngweta, Lilian, et al.
Veröffentlicht: (2024) -
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023) -
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
von: Hou, Xiaoyang, et al.
Veröffentlicht: (2026)