Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Seong Jin, Sun, Will Wei, Liu, Yufeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Low-Rank Online Dynamic Assortment with Dual Contextual Information
por: Lee, Seong Jin, et al.
Publicado: (2024)
por: Lee, Seong Jin, et al.
Publicado: (2024)
Dual Active Learning for Reinforcement Learning from Human Feedback
por: Liu, Pangpang, et al.
Publicado: (2024)
por: Liu, Pangpang, et al.
Publicado: (2024)
Reinforcement Learning from Human Feedback: A Statistical Perspective
por: Liu, Pangpang, et al.
Publicado: (2026)
por: Liu, Pangpang, et al.
Publicado: (2026)
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
por: Liu, Pangpang, et al.
Publicado: (2025)
por: Liu, Pangpang, et al.
Publicado: (2025)
Contextual Online Uncertainty-Aware Preference Learning for Human Feedback
por: Lu, Nan, et al.
Publicado: (2025)
por: Lu, Nan, et al.
Publicado: (2025)
Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
por: Cho, Young Hyun, et al.
Publicado: (2026)
por: Cho, Young Hyun, et al.
Publicado: (2026)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
Reinforcement Learning from Human Feedback
por: Lambert, Nathan
Publicado: (2025)
por: Lambert, Nathan
Publicado: (2025)
Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback
por: Liu, Qiang, et al.
Publicado: (2026)
por: Liu, Qiang, et al.
Publicado: (2026)
Dense Reward for Free in Reinforcement Learning from Human Feedback
por: Chan, Alex J., et al.
Publicado: (2024)
por: Chan, Alex J., et al.
Publicado: (2024)
TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback
por: Pang, Lei, et al.
Publicado: (2025)
por: Pang, Lei, et al.
Publicado: (2025)
Efficient Generalized Low-Rank Tensor Contextual Bandits
por: Yi, Qianxin, et al.
Publicado: (2023)
por: Yi, Qianxin, et al.
Publicado: (2023)
Contextually Guided Transformers via Low-Rank Adaptation
por: Zhmoginov, Andrey, et al.
Publicado: (2025)
por: Zhmoginov, Andrey, et al.
Publicado: (2025)
Strategyproof Reinforcement Learning from Human Feedback
por: Buening, Thomas Kleine, et al.
Publicado: (2025)
por: Buening, Thomas Kleine, et al.
Publicado: (2025)
Beating Adversarial Low-Rank MDPs with Unknown Transition and Bandit Feedback
por: Liu, Haolin, et al.
Publicado: (2024)
por: Liu, Haolin, et al.
Publicado: (2024)
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
por: Shen, Wei, et al.
Publicado: (2025)
por: Shen, Wei, et al.
Publicado: (2025)
Robust Reinforcement Learning from Corrupted Human Feedback
por: Bukharin, Alexander, et al.
Publicado: (2024)
por: Bukharin, Alexander, et al.
Publicado: (2024)
ILoRA: Federated Learning with Low-Rank Adaptation for Heterogeneous Client Aggregation
por: Zhou, Junchao, et al.
Publicado: (2025)
por: Zhou, Junchao, et al.
Publicado: (2025)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
por: Ye, Chenlu, et al.
Publicado: (2024)
por: Ye, Chenlu, et al.
Publicado: (2024)
Towards Federated Low-Rank Adaptation of Language Models with Rank Heterogeneity
por: Byun, Yuji, et al.
Publicado: (2024)
por: Byun, Yuji, et al.
Publicado: (2024)
Parameter Efficient Reinforcement Learning from Human Feedback
por: Sidahmed, Hakim, et al.
Publicado: (2024)
por: Sidahmed, Hakim, et al.
Publicado: (2024)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
por: Swamy, Gokul, et al.
Publicado: (2024)
por: Swamy, Gokul, et al.
Publicado: (2024)
Multi-turn Reinforcement Learning from Preference Human Feedback
por: Shani, Lior, et al.
Publicado: (2024)
por: Shani, Lior, et al.
Publicado: (2024)
Reinforcement Learning from Multi-level and Episodic Human Feedback
por: Elahi, Muhammad Qasim, et al.
Publicado: (2025)
por: Elahi, Muhammad Qasim, et al.
Publicado: (2025)
Combinatorial Reinforcement Learning with Preference Feedback
por: Lee, Joongkyu, et al.
Publicado: (2025)
por: Lee, Joongkyu, et al.
Publicado: (2025)
Generalized Low-Rank Matrix Contextual Bandits with Graph Information
por: Wang, Yao, et al.
Publicado: (2025)
por: Wang, Yao, et al.
Publicado: (2025)
Federated Reinforcement Learning with Constraint Heterogeneity
por: Jin, Hao, et al.
Publicado: (2024)
por: Jin, Hao, et al.
Publicado: (2024)
The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback
por: Chen, Ruitao, et al.
Publicado: (2024)
por: Chen, Ruitao, et al.
Publicado: (2024)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
por: Ye, Kai, et al.
Publicado: (2025)
por: Ye, Kai, et al.
Publicado: (2025)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
por: Zhang, Zhen-Yu, et al.
Publicado: (2026)
por: Zhang, Zhen-Yu, et al.
Publicado: (2026)
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback
por: Lambert, Nathan, et al.
Publicado: (2023)
por: Lambert, Nathan, et al.
Publicado: (2023)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
por: Zhang, Qining, et al.
Publicado: (2025)
por: Zhang, Qining, et al.
Publicado: (2025)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
por: Lee, Harrison, et al.
Publicado: (2023)
por: Lee, Harrison, et al.
Publicado: (2023)
Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis
por: Zhang, Qining, et al.
Publicado: (2024)
por: Zhang, Qining, et al.
Publicado: (2024)
A Survey of Reinforcement Learning from Human Feedback
por: Kaufmann, Timo, et al.
Publicado: (2023)
por: Kaufmann, Timo, et al.
Publicado: (2023)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
por: Verma, Arun, et al.
Publicado: (2025)
por: Verma, Arun, et al.
Publicado: (2025)
Shift Before You Learn: Enabling Low-Rank Representations in Reinforcement Learning
por: Dubail, Bastien, et al.
Publicado: (2025)
por: Dubail, Bastien, et al.
Publicado: (2025)
Reinforcing Human Behavior Simulation via Verbal Feedback
por: Sun, Weiwei, et al.
Publicado: (2026)
por: Sun, Weiwei, et al.
Publicado: (2026)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
por: Hong, Ilgee, et al.
Publicado: (2024)
por: Hong, Ilgee, et al.
Publicado: (2024)
Corruption Robust Offline Reinforcement Learning with Human Feedback
por: Mandal, Debmalya, et al.
Publicado: (2024)
por: Mandal, Debmalya, et al.
Publicado: (2024)
Ejemplares similares
-
Low-Rank Online Dynamic Assortment with Dual Contextual Information
por: Lee, Seong Jin, et al.
Publicado: (2024) -
Dual Active Learning for Reinforcement Learning from Human Feedback
por: Liu, Pangpang, et al.
Publicado: (2024) -
Reinforcement Learning from Human Feedback: A Statistical Perspective
por: Liu, Pangpang, et al.
Publicado: (2026) -
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
por: Liu, Pangpang, et al.
Publicado: (2025) -
Contextual Online Uncertainty-Aware Preference Learning for Human Feedback
por: Lu, Nan, et al.
Publicado: (2025)