PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Baijiong, Jiang, Weisen, Xu, Yuancheng, Chen, Hao, Chen, Ying-Cong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MTMamba++: Enhancing Multi-Task Dense Scene Understanding via Mamba-Based Decoders
por: Lin, Baijiong, et al.
Publicado: (2024)
por: Lin, Baijiong, et al.
Publicado: (2024)
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
por: Chen, Shuhao, et al.
Publicado: (2024)
por: Chen, Shuhao, et al.
Publicado: (2024)
Dual-Balancing for Multi-Task Learning
por: Lin, Baijiong, et al.
Publicado: (2023)
por: Lin, Baijiong, et al.
Publicado: (2023)
MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based Decoders
por: Lin, Baijiong, et al.
Publicado: (2024)
por: Lin, Baijiong, et al.
Publicado: (2024)
Reward-free Alignment for Conflicting Objectives
por: Chen, Peter, et al.
Publicado: (2026)
por: Chen, Peter, et al.
Publicado: (2026)
PARM: Pipeline-Adapted Reward Model
por: Fan, Xingyu, et al.
Publicado: (2026)
por: Fan, Xingyu, et al.
Publicado: (2026)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
por: Wang, Haozhe, et al.
Publicado: (2026)
por: Wang, Haozhe, et al.
Publicado: (2026)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
por: Xu, Wenzhe, et al.
Publicado: (2026)
por: Xu, Wenzhe, et al.
Publicado: (2026)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
por: Wang, Chaoqi, et al.
Publicado: (2025)
por: Wang, Chaoqi, et al.
Publicado: (2025)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
por: Yang, Rui, et al.
Publicado: (2024)
por: Yang, Rui, et al.
Publicado: (2024)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
por: Zhou, Zhanhui, et al.
Publicado: (2023)
por: Zhou, Zhanhui, et al.
Publicado: (2023)
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
por: Hou, Xiaoyang, et al.
Publicado: (2026)
por: Hou, Xiaoyang, et al.
Publicado: (2026)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
por: Harland, Hadassah, et al.
Publicado: (2024)
por: Harland, Hadassah, et al.
Publicado: (2024)
Multi-Metric Preference Alignment for Generative Speech Restoration
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models
por: Liu, Qi, et al.
Publicado: (2025)
por: Liu, Qi, et al.
Publicado: (2025)
MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification
por: Jiang, Weisen, et al.
Publicado: (2026)
por: Jiang, Weisen, et al.
Publicado: (2026)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
por: Yuan, Yifu, et al.
Publicado: (2024)
por: Yuan, Yifu, et al.
Publicado: (2024)
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
por: Zhang, Shenao, et al.
Publicado: (2024)
por: Zhang, Shenao, et al.
Publicado: (2024)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
por: Liu, Biao, et al.
Publicado: (2025)
por: Liu, Biao, et al.
Publicado: (2025)
ComPO: Preference Alignment via Comparison Oracles
por: Chen, Peter, et al.
Publicado: (2025)
por: Chen, Peter, et al.
Publicado: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
por: Huang, Jiameng, et al.
Publicado: (2025)
por: Huang, Jiameng, et al.
Publicado: (2025)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
por: Huang, Kexin, et al.
Publicado: (2025)
por: Huang, Kexin, et al.
Publicado: (2025)
Automatic Reward Shaping from Multi-Objective Human Heuristics
por: Xie, Yuqing, et al.
Publicado: (2025)
por: Xie, Yuqing, et al.
Publicado: (2025)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
por: Wang, Haichuan, et al.
Publicado: (2026)
por: Wang, Haichuan, et al.
Publicado: (2026)
The Reward Model Selection Crisis in Personalized Alignment
por: Rezk, Fady, et al.
Publicado: (2025)
por: Rezk, Fady, et al.
Publicado: (2025)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
por: Karlekar, Sweta, et al.
Publicado: (2026)
por: Karlekar, Sweta, et al.
Publicado: (2026)
Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation
por: Xu, Hefei, et al.
Publicado: (2025)
por: Xu, Hefei, et al.
Publicado: (2025)
From Demonstrations to Rewards: Alignment Without Explicit Human Preferences
por: Zeng, Siliang, et al.
Publicado: (2025)
por: Zeng, Siliang, et al.
Publicado: (2025)
Interactive Multi-Objective Probabilistic Preference Learning with Soft and Hard Bounds
por: Chen, Edward, et al.
Publicado: (2025)
por: Chen, Edward, et al.
Publicado: (2025)
In-Context Reward Adaptation for Robust Preference Modeling
por: Sun, Zhenyu, et al.
Publicado: (2026)
por: Sun, Zhenyu, et al.
Publicado: (2026)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
por: Jiang, Zaifan, et al.
Publicado: (2023)
por: Jiang, Zaifan, et al.
Publicado: (2023)
Interactive Hyperparameter Optimization in Multi-Objective Problems via Preference Learning
por: Giovanelli, Joseph, et al.
Publicado: (2023)
por: Giovanelli, Joseph, et al.
Publicado: (2023)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
por: Fan, Zhengyuan, et al.
Publicado: (2026)
por: Fan, Zhengyuan, et al.
Publicado: (2026)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
por: Rajaram, Sara, et al.
Publicado: (2025)
por: Rajaram, Sara, et al.
Publicado: (2025)
How Hard Can It Be? Hardness-Aware Multi-Objective Unlearning
por: Chen, Jiangwei, et al.
Publicado: (2026)
por: Chen, Jiangwei, et al.
Publicado: (2026)
Policy and World Modeling Co-Training for Language Agents
por: Lu, Ning, et al.
Publicado: (2026)
por: Lu, Ning, et al.
Publicado: (2026)
Pareto Multi-Objective Alignment for Language Models
por: He, Qiang, et al.
Publicado: (2025)
por: He, Qiang, et al.
Publicado: (2025)
PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling
por: Jian, Ai, et al.
Publicado: (2025)
por: Jian, Ai, et al.
Publicado: (2025)
Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
por: Kim, Bryan Sangwoo, et al.
Publicado: (2025)
por: Kim, Bryan Sangwoo, et al.
Publicado: (2025)
Ejemplares similares
-
MTMamba++: Enhancing Multi-Task Dense Scene Understanding via Mamba-Based Decoders
por: Lin, Baijiong, et al.
Publicado: (2024) -
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
por: Chen, Shuhao, et al.
Publicado: (2024) -
Dual-Balancing for Multi-Task Learning
por: Lin, Baijiong, et al.
Publicado: (2023) -
MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based Decoders
por: Lin, Baijiong, et al.
Publicado: (2024) -
Reward-free Alignment for Conflicting Objectives
por: Chen, Peter, et al.
Publicado: (2026)