Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Rui, Pan, Xiaoman, Luo, Feng, Qiu, Shuang, Zhong, Han, Yu, Dong, Chen, Jianshu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
Skills-in-Context Prompting: Unlocking Compositionality in Large Language Models
von: Chen, Jiaao, et al.
Veröffentlicht: (2023)
von: Chen, Jiaao, et al.
Veröffentlicht: (2023)
Thrust: Adaptively Propels Large Language Models with External Knowledge
von: Zhao, Xinran, et al.
Veröffentlicht: (2023)
von: Zhao, Xinran, et al.
Veröffentlicht: (2023)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
von: Shen, Jingyan, et al.
Veröffentlicht: (2025)
von: Shen, Jingyan, et al.
Veröffentlicht: (2025)
Fact-and-Reflection (FaR) Improves Confidence Calibration of Large Language Models
von: Zhao, Xinran, et al.
Veröffentlicht: (2024)
von: Zhao, Xinran, et al.
Veröffentlicht: (2024)
Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential
von: Wu, Xuansheng, et al.
Veröffentlicht: (2025)
von: Wu, Xuansheng, et al.
Veröffentlicht: (2025)
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
von: Wu, Xuansheng, et al.
Veröffentlicht: (2023)
von: Wu, Xuansheng, et al.
Veröffentlicht: (2023)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
von: Min, Do June, et al.
Veröffentlicht: (2024)
von: Min, Do June, et al.
Veröffentlicht: (2024)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
von: Yang, Wen, et al.
Veröffentlicht: (2025)
von: Yang, Wen, et al.
Veröffentlicht: (2025)
Weighted-Reward Preference Optimization for Implicit Model Fusion
von: Yang, Ziyi, et al.
Veröffentlicht: (2024)
von: Yang, Ziyi, et al.
Veröffentlicht: (2024)
Less is More: Improving LLM Alignment via Preference Data Selection
von: Deng, Xun, et al.
Veröffentlicht: (2025)
von: Deng, Xun, et al.
Veröffentlicht: (2025)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
von: Sun, Shengyang, et al.
Veröffentlicht: (2025)
von: Sun, Shengyang, et al.
Veröffentlicht: (2025)
Learning Ordinal Probabilistic Reward from Preferences
von: Chen, Longze, et al.
Veröffentlicht: (2026)
von: Chen, Longze, et al.
Veröffentlicht: (2026)
Self-supervised Attribute-aware Dynamic Preference Ranking Alignment
von: Yang, Hongyu, et al.
Veröffentlicht: (2025)
von: Yang, Hongyu, et al.
Veröffentlicht: (2025)
Towards Understanding the Influence of Reward Margin on Preference Model Performance
von: Qin, Bowen, et al.
Veröffentlicht: (2024)
von: Qin, Bowen, et al.
Veröffentlicht: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
von: Qiu, Wenjie, et al.
Veröffentlicht: (2025)
von: Qiu, Wenjie, et al.
Veröffentlicht: (2025)
Discriminative Finetuning of Generative Large Language Models without Reward Models and Human Preference Data
von: Guo, Siqi, et al.
Veröffentlicht: (2025)
von: Guo, Siqi, et al.
Veröffentlicht: (2025)
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
von: Deng, Qiyuan, et al.
Veröffentlicht: (2025)
von: Deng, Qiyuan, et al.
Veröffentlicht: (2025)
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
von: Lu, Yining, et al.
Veröffentlicht: (2025)
von: Lu, Yining, et al.
Veröffentlicht: (2025)
Preference Alignment Improves Language Model-Based TTS
von: Tian, Jinchuan, et al.
Veröffentlicht: (2024)
von: Tian, Jinchuan, et al.
Veröffentlicht: (2024)
Panacea: Pareto Alignment via Preference Adaptation for LLMs
von: Zhong, Yifan, et al.
Veröffentlicht: (2024)
von: Zhong, Yifan, et al.
Veröffentlicht: (2024)
Abstraction-of-Thought Makes Language Models Better Reasoners
von: Hong, Ruixin, et al.
Veröffentlicht: (2024)
von: Hong, Ruixin, et al.
Veröffentlicht: (2024)
Boosting Reward Model with Preference-Conditional Multi-Aspect Synthetic Data Generation
von: Shen, Jiaming, et al.
Veröffentlicht: (2024)
von: Shen, Jiaming, et al.
Veröffentlicht: (2024)
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
von: Shen, Yiran, et al.
Veröffentlicht: (2025)
von: Shen, Yiran, et al.
Veröffentlicht: (2025)
Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards
von: Zeng, Xia, et al.
Veröffentlicht: (2025)
von: Zeng, Xia, et al.
Veröffentlicht: (2025)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
von: Wang, Hao, et al.
Veröffentlicht: (2025)
von: Wang, Hao, et al.
Veröffentlicht: (2025)
Generalizing Reward Modeling for Out-of-Distribution Preference Learning
von: Jia, Chen
Veröffentlicht: (2024)
von: Jia, Chen
Veröffentlicht: (2024)
Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
von: Yu, Wenhao, et al.
Veröffentlicht: (2023)
von: Yu, Wenhao, et al.
Veröffentlicht: (2023)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
von: Zhu, Wenhong, et al.
Veröffentlicht: (2024)
von: Zhu, Wenhong, et al.
Veröffentlicht: (2024)
GRAM: A Generative Foundation Reward Model for Reward Generalization
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling
von: Gupta, Taneesh, et al.
Veröffentlicht: (2024)
von: Gupta, Taneesh, et al.
Veröffentlicht: (2024)
Dynamic and Generalizable Process Reward Modeling
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment
von: Wang, Mingzhi, et al.
Veröffentlicht: (2024)
von: Wang, Mingzhi, et al.
Veröffentlicht: (2024)
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
von: Yang, Zhengbang, et al.
Veröffentlicht: (2026)
von: Yang, Zhengbang, et al.
Veröffentlicht: (2026)
WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
von: Wang, Rui, et al.
Veröffentlicht: (2025)
von: Wang, Rui, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024) -
Skills-in-Context Prompting: Unlocking Compositionality in Large Language Models
von: Chen, Jiaao, et al.
Veröffentlicht: (2023) -
Thrust: Adaptively Propels Large Language Models with External Knowledge
von: Zhao, Xinran, et al.
Veröffentlicht: (2023) -
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
von: Shen, Jingyan, et al.
Veröffentlicht: (2025) -
Fact-and-Reflection (FaR) Improves Confidence Calibration of Large Language Models
von: Zhao, Xinran, et al.
Veröffentlicht: (2024)