Guardado en:
| Autores principales: | Latham, Brenden, Moharrami, Mehrdad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.00200 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Tail Distribution of Regret in Optimistic Reinforcement Learning
por: Khodadadian, Sajad, et al.
Publicado: (2025)
por: Khodadadian, Sajad, et al.
Publicado: (2025)
Learning to Admit Optimally in an $M/M/k/k+N$ Queueing System with Unknown Service Rate
por: Adler, Saghar, et al.
Publicado: (2022)
por: Adler, Saghar, et al.
Publicado: (2022)
On the Convergence of Modified Policy Iteration in Risk Sensitive Exponential Cost Markov Decision Processes
por: Murthy, Yashaswini, et al.
Publicado: (2023)
por: Murthy, Yashaswini, et al.
Publicado: (2023)
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024)
por: Agnihotri, Akhil, et al.
Publicado: (2024)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
por: Cen, Shicong, et al.
Publicado: (2024)
por: Cen, Shicong, et al.
Publicado: (2024)
An explainable transformer circuit for compositional generalization
por: Tang, Cheng, et al.
Publicado: (2025)
por: Tang, Cheng, et al.
Publicado: (2025)
SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences
por: Mukherjee, Arpan, et al.
Publicado: (2025)
por: Mukherjee, Arpan, et al.
Publicado: (2025)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
por: Cho, Taehyun, et al.
Publicado: (2025)
por: Cho, Taehyun, et al.
Publicado: (2025)
On the Exponential Convergence for Offline RLHF with Pairwise Comparisons
por: Chen, Zhirui, et al.
Publicado: (2024)
por: Chen, Zhirui, et al.
Publicado: (2024)
Adaptive Margin RLHF via Preference over Preferences
por: Chittepu, Yaswanth, et al.
Publicado: (2025)
por: Chittepu, Yaswanth, et al.
Publicado: (2025)
Offline and Online KL-Regularized RLHF under Differential Privacy
por: Wu, Yulian, et al.
Publicado: (2025)
por: Wu, Yulian, et al.
Publicado: (2025)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
por: Xu, Yinglun, et al.
Publicado: (2023)
por: Xu, Yinglun, et al.
Publicado: (2023)
SALSA: Soup-based Alignment Learning for Stronger Adaptation in RLHF
por: Chegini, Atoosa, et al.
Publicado: (2024)
por: Chegini, Atoosa, et al.
Publicado: (2024)
Regularized Online RLHF with Generalized Bilinear Preferences
por: Lee, Junghyun, et al.
Publicado: (2026)
por: Lee, Junghyun, et al.
Publicado: (2026)
Active Preference Optimization for Sample Efficient RLHF
por: Das, Nirjhar, et al.
Publicado: (2024)
por: Das, Nirjhar, et al.
Publicado: (2024)
WPO: Enhancing RLHF with Weighted Preference Optimization
por: Zhou, Wenxuan, et al.
Publicado: (2024)
por: Zhou, Wenxuan, et al.
Publicado: (2024)
Group Robust Preference Optimization in Reward-free RLHF
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2024)
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2024)
Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning
por: Moghimi, Mehrdad, et al.
Publicado: (2025)
por: Moghimi, Mehrdad, et al.
Publicado: (2025)
Oracle-efficient Hybrid Learning with Constrained Adversaries
por: Okoroafor, Princewill, et al.
Publicado: (2026)
por: Okoroafor, Princewill, et al.
Publicado: (2026)
Influencing Humans to Conform to Preference Models for RLHF
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)
RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation
por: Park, Chanwoo, et al.
Publicado: (2024)
por: Park, Chanwoo, et al.
Publicado: (2024)
Sharpe Ratio-Guided Active Learning for Preference Optimization in RLHF
por: Belakaria, Syrine, et al.
Publicado: (2025)
por: Belakaria, Syrine, et al.
Publicado: (2025)
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
por: Siththaranjan, Anand, et al.
Publicado: (2023)
por: Siththaranjan, Anand, et al.
Publicado: (2023)
A Unified Theoretical Analysis of Private and Robust Offline Alignment: from RLHF to DPO
por: Zhou, Xingyu, et al.
Publicado: (2025)
por: Zhou, Xingyu, et al.
Publicado: (2025)
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
por: Chen, Ziyi, et al.
Publicado: (2025)
por: Chen, Ziyi, et al.
Publicado: (2025)
Democratic Preference Alignment via Sortition-Weighted RLHF
por: Sana, Suvadip, et al.
Publicado: (2026)
por: Sana, Suvadip, et al.
Publicado: (2026)
MaxMin-RLHF: Alignment with Diverse Human Preferences
por: Chakraborty, Souradip, et al.
Publicado: (2024)
por: Chakraborty, Souradip, et al.
Publicado: (2024)
APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
por: Srewa, Mahmoud, et al.
Publicado: (2026)
por: Srewa, Mahmoud, et al.
Publicado: (2026)
Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO
por: Shi, Ruizhe, et al.
Publicado: (2025)
por: Shi, Ruizhe, et al.
Publicado: (2025)
Towards Federated RLHF with Aggregated Client Preference for LLMs
por: Wu, Feijie, et al.
Publicado: (2024)
por: Wu, Feijie, et al.
Publicado: (2024)
Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation
por: Hu, Haichen, et al.
Publicado: (2026)
por: Hu, Haichen, et al.
Publicado: (2026)
Offline Oracle-Efficient Learning for Contextual MDPs via Layerwise Exploration-Exploitation Tradeoff
por: Qian, Jian, et al.
Publicado: (2024)
por: Qian, Jian, et al.
Publicado: (2024)
Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL
por: Ghosh, Udita, et al.
Publicado: (2026)
por: Ghosh, Udita, et al.
Publicado: (2026)
Online Policy Learning from Offline Preferences
por: Zhang, Guoxi, et al.
Publicado: (2024)
por: Zhang, Guoxi, et al.
Publicado: (2024)
On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization
por: Xiao, Jiancong, et al.
Publicado: (2024)
por: Xiao, Jiancong, et al.
Publicado: (2024)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
por: Shen, Judy Hanwen, et al.
Publicado: (2024)
por: Shen, Judy Hanwen, et al.
Publicado: (2024)
KL-Regularized RLHF with Multiple Reference Models: Exact Solutions and Sample Complexity
por: Aminian, Gholamali, et al.
Publicado: (2025)
por: Aminian, Gholamali, et al.
Publicado: (2025)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
por: Baumgärtner, Tim, et al.
Publicado: (2024)
por: Baumgärtner, Tim, et al.
Publicado: (2024)
Preference Elicitation for Offline Reinforcement Learning
por: Pace, Alizée, et al.
Publicado: (2024)
por: Pace, Alizée, et al.
Publicado: (2024)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
Ejemplares similares
-
Tail Distribution of Regret in Optimistic Reinforcement Learning
por: Khodadadian, Sajad, et al.
Publicado: (2025) -
Learning to Admit Optimally in an $M/M/k/k+N$ Queueing System with Unknown Service Rate
por: Adler, Saghar, et al.
Publicado: (2022) -
On the Convergence of Modified Policy Iteration in Risk Sensitive Exponential Cost Markov Decision Processes
por: Murthy, Yashaswini, et al.
Publicado: (2023) -
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024) -
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
por: Cen, Shicong, et al.
Publicado: (2024)