SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences
Fuente:
arXiv
Guardado en:
| Autores principales: | Mukherjee, Arpan, Bullo, Marcello, Gündüz, Deniz |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Shared Low-Rank Adaptation Approach to Personalized RLHF
por: Liu, Renpu, et al.
Publicado: (2025)
por: Liu, Renpu, et al.
Publicado: (2025)
MaxMin-RLHF: Alignment with Diverse Human Preferences
por: Chakraborty, Souradip, et al.
Publicado: (2024)
por: Chakraborty, Souradip, et al.
Publicado: (2024)
Sustainable Edge Intelligence Through Energy-Aware Early Exiting
por: Bullo, Marcello, et al.
Publicado: (2023)
por: Bullo, Marcello, et al.
Publicado: (2023)
Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality
por: Mukherjee, Arpan, et al.
Publicado: (2025)
por: Mukherjee, Arpan, et al.
Publicado: (2025)
Offline Constrained RLHF with Multiple Preference Oracles
por: Latham, Brenden, et al.
Publicado: (2026)
por: Latham, Brenden, et al.
Publicado: (2026)
Energy-Aware Dynamic Neural Inference
por: Bullo, Marcello, et al.
Publicado: (2024)
por: Bullo, Marcello, et al.
Publicado: (2024)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
por: Cho, Taehyun, et al.
Publicado: (2025)
por: Cho, Taehyun, et al.
Publicado: (2025)
Adaptive Margin RLHF via Preference over Preferences
por: Chittepu, Yaswanth, et al.
Publicado: (2025)
por: Chittepu, Yaswanth, et al.
Publicado: (2025)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
por: Cen, Shicong, et al.
Publicado: (2024)
por: Cen, Shicong, et al.
Publicado: (2024)
Active Preference Optimization for Sample Efficient RLHF
por: Das, Nirjhar, et al.
Publicado: (2024)
por: Das, Nirjhar, et al.
Publicado: (2024)
Regularized Online RLHF with Generalized Bilinear Preferences
por: Lee, Junghyun, et al.
Publicado: (2026)
por: Lee, Junghyun, et al.
Publicado: (2026)
WPO: Enhancing RLHF with Weighted Preference Optimization
por: Zhou, Wenxuan, et al.
Publicado: (2024)
por: Zhou, Wenxuan, et al.
Publicado: (2024)
Group Robust Preference Optimization in Reward-free RLHF
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2024)
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2024)
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024)
por: Agnihotri, Akhil, et al.
Publicado: (2024)
Influencing Humans to Conform to Preference Models for RLHF
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
por: Dong, Hanze, et al.
Publicado: (2024)
por: Dong, Hanze, et al.
Publicado: (2024)
Understanding the Effects of RLHF on LLM Generalisation and Diversity
por: Kirk, Robert, et al.
Publicado: (2023)
por: Kirk, Robert, et al.
Publicado: (2023)
Sharpe Ratio-Guided Active Learning for Preference Optimization in RLHF
por: Belakaria, Syrine, et al.
Publicado: (2025)
por: Belakaria, Syrine, et al.
Publicado: (2025)
RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation
por: Park, Chanwoo, et al.
Publicado: (2024)
por: Park, Chanwoo, et al.
Publicado: (2024)
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
por: Siththaranjan, Anand, et al.
Publicado: (2023)
por: Siththaranjan, Anand, et al.
Publicado: (2023)
Democratic Preference Alignment via Sortition-Weighted RLHF
por: Sana, Suvadip, et al.
Publicado: (2026)
por: Sana, Suvadip, et al.
Publicado: (2026)
Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO
por: Shi, Ruizhe, et al.
Publicado: (2025)
por: Shi, Ruizhe, et al.
Publicado: (2025)
Factored Causal Representation Learning for Robust Reward Modeling in RLHF
por: Yang, Yupei, et al.
Publicado: (2026)
por: Yang, Yupei, et al.
Publicado: (2026)
Mitigating the Alignment Tax of RLHF
por: Lin, Yong, et al.
Publicado: (2023)
por: Lin, Yong, et al.
Publicado: (2023)
OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework
por: Hu, Jian, et al.
Publicado: (2024)
por: Hu, Jian, et al.
Publicado: (2024)
Towards Federated RLHF with Aggregated Client Preference for LLMs
por: Wu, Feijie, et al.
Publicado: (2024)
por: Wu, Feijie, et al.
Publicado: (2024)
APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
por: Srewa, Mahmoud, et al.
Publicado: (2026)
por: Srewa, Mahmoud, et al.
Publicado: (2026)
ROCM: RLHF on consistency models
por: Shekhar, Shivanshu, et al.
Publicado: (2025)
por: Shekhar, Shivanshu, et al.
Publicado: (2025)
Enhancing RLHF with Human Gaze Modeling
por: Galliamov, Karim, et al.
Publicado: (2025)
por: Galliamov, Karim, et al.
Publicado: (2025)
Optimal Design for Reward Modeling in RLHF
por: Scheid, Antoine, et al.
Publicado: (2024)
por: Scheid, Antoine, et al.
Publicado: (2024)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
por: Baumgärtner, Tim, et al.
Publicado: (2024)
por: Baumgärtner, Tim, et al.
Publicado: (2024)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
por: Shen, Judy Hanwen, et al.
Publicado: (2024)
por: Shen, Judy Hanwen, et al.
Publicado: (2024)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
por: Xu, Nuo, et al.
Publicado: (2024)
por: Xu, Nuo, et al.
Publicado: (2024)
On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization
por: Xiao, Jiancong, et al.
Publicado: (2024)
por: Xiao, Jiancong, et al.
Publicado: (2024)
Investigating on RLHF methodology
por: Kutalev, Alexey, et al.
Publicado: (2024)
por: Kutalev, Alexey, et al.
Publicado: (2024)
RLHF and IIA: Perverse Incentives
por: Xu, Wanqiao, et al.
Publicado: (2023)
por: Xu, Wanqiao, et al.
Publicado: (2023)
Reward-Robust RLHF in LLMs
por: Yan, Yuzi, et al.
Publicado: (2024)
por: Yan, Yuzi, et al.
Publicado: (2024)
FedRLHF: A Convergence-Guaranteed Federated Framework for Privacy-Preserving and Personalized RLHF
por: Fan, Flint Xiaofeng, et al.
Publicado: (2024)
por: Fan, Flint Xiaofeng, et al.
Publicado: (2024)
Learning a Pessimistic Reward Model in RLHF
por: Xu, Yinglun, et al.
Publicado: (2025)
por: Xu, Yinglun, et al.
Publicado: (2025)
On a Connection Between Imitation Learning and RLHF
por: Xiao, Teng, et al.
Publicado: (2025)
por: Xiao, Teng, et al.
Publicado: (2025)
Ejemplares similares
-
A Shared Low-Rank Adaptation Approach to Personalized RLHF
por: Liu, Renpu, et al.
Publicado: (2025) -
MaxMin-RLHF: Alignment with Diverse Human Preferences
por: Chakraborty, Souradip, et al.
Publicado: (2024) -
Sustainable Edge Intelligence Through Energy-Aware Early Exiting
por: Bullo, Marcello, et al.
Publicado: (2023) -
Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality
por: Mukherjee, Arpan, et al.
Publicado: (2025) -
Offline Constrained RLHF with Multiple Preference Oracles
por: Latham, Brenden, et al.
Publicado: (2026)