Deep Reinforcement Learning from Hierarchical Preference Design
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bukharin, Alexander, Li, Yixiao, He, Pengcheng, Zhao, Tuo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
HelpSteer2-Preference: Complementing Ratings with Preferences
von: Wang, Zhilin, et al.
Veröffentlicht: (2024)
von: Wang, Zhilin, et al.
Veröffentlicht: (2024)
Fairness Begins with State: Purifying Latent Preferences for Hierarchical Reinforcement Learning in Interactive Recommendation
von: Lu, Yun, et al.
Veröffentlicht: (2026)
von: Lu, Yun, et al.
Veröffentlicht: (2026)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)
Molecular De Novo Design through Transformer-based Reinforcement Learning
von: Xu, Pengcheng, et al.
Veröffentlicht: (2023)
von: Xu, Pengcheng, et al.
Veröffentlicht: (2023)
Rethinking Plasticity in Deep Reinforcement Learning
von: He, Zhiqiang
Veröffentlicht: (2026)
von: He, Zhiqiang
Veröffentlicht: (2026)
NoWag: A Unified Framework for Shape Preserving Compression of Large Language Models
von: Liu, Lawrence, et al.
Veröffentlicht: (2025)
von: Liu, Lawrence, et al.
Veröffentlicht: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
von: Nguyen, Thanh Thi, et al.
Veröffentlicht: (2025)
von: Nguyen, Thanh Thi, et al.
Veröffentlicht: (2025)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
Robust Reinforcement Learning from Corrupted Human Feedback
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
Evaluating Feature Dependent Noise in Preference-based Reinforcement Learning
von: Li, Yuxuan, et al.
Veröffentlicht: (2026)
von: Li, Yuxuan, et al.
Veröffentlicht: (2026)
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
von: Schlaginhaufen, Andreas, et al.
Veröffentlicht: (2025)
von: Schlaginhaufen, Andreas, et al.
Veröffentlicht: (2025)
Behavior Preference Regression for Offline Reinforcement Learning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning
von: Chen, Ziyuan, et al.
Veröffentlicht: (2025)
von: Chen, Ziyuan, et al.
Veröffentlicht: (2025)
Generalization Capability for Imitation Learning
von: Wang, Yixiao
Veröffentlicht: (2025)
von: Wang, Yixiao
Veröffentlicht: (2025)
Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
von: Shianifar, Jonaid, et al.
Veröffentlicht: (2026)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
Deep Networks Learn Deep Hierarchical Models
von: Daniely, Amit
Veröffentlicht: (2026)
von: Daniely, Amit
Veröffentlicht: (2026)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
von: Cheng, Jie, et al.
Veröffentlicht: (2024)
von: Cheng, Jie, et al.
Veröffentlicht: (2024)
HDT: Hierarchical Discrete Transformer for Multivariate Time Series Forecasting
von: Feng, Shibo, et al.
Veröffentlicht: (2025)
von: Feng, Shibo, et al.
Veröffentlicht: (2025)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
von: Gao, Xiancheng, et al.
Veröffentlicht: (2025)
von: Gao, Xiancheng, et al.
Veröffentlicht: (2025)
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
von: Kim, Gihoon, et al.
Veröffentlicht: (2026)
von: Kim, Gihoon, et al.
Veröffentlicht: (2026)
Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL
von: Zhou, Yixiao, et al.
Veröffentlicht: (2026)
von: Zhou, Yixiao, et al.
Veröffentlicht: (2026)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
Understanding and Improving Hyperbolic Deep Reinforcement Learning
von: Klein, Timo, et al.
Veröffentlicht: (2025)
von: Klein, Timo, et al.
Veröffentlicht: (2025)
Efficient Diversity-based Experience Replay for Deep Reinforcement Learning
von: Zhao, Kaiyan, et al.
Veröffentlicht: (2024)
von: Zhao, Kaiyan, et al.
Veröffentlicht: (2024)
A Domain-Knowledge-Aided Deep Reinforcement Learning Approach for Flight Control Design
von: Shin, Hyo-Sang, et al.
Veröffentlicht: (2019)
von: Shin, Hyo-Sang, et al.
Veröffentlicht: (2019)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
von: Carr, Jonathan Colaço, et al.
Veröffentlicht: (2026)
von: Carr, Jonathan Colaço, et al.
Veröffentlicht: (2026)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
von: Li, Yixiao, et al.
Veröffentlicht: (2025)
von: Li, Yixiao, et al.
Veröffentlicht: (2025)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
von: Cercola, Matteo, et al.
Veröffentlicht: (2025)
von: Cercola, Matteo, et al.
Veröffentlicht: (2025)
Skill-Critic: Refining Learned Skills for Hierarchical Reinforcement Learning
von: Hao, Ce, et al.
Veröffentlicht: (2023)
von: Hao, Ce, et al.
Veröffentlicht: (2023)
CAE: Repurposing the Critic as an Explorer in Deep Reinforcement Learning
von: Li, Yexin
Veröffentlicht: (2025)
von: Li, Yexin
Veröffentlicht: (2025)
OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing
von: Bao, Yilin, et al.
Veröffentlicht: (2026)
von: Bao, Yilin, et al.
Veröffentlicht: (2026)
PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
von: Driss, Brahim, et al.
Veröffentlicht: (2025)
von: Driss, Brahim, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
von: Hong, Ilgee, et al.
Veröffentlicht: (2024) -
HelpSteer2-Preference: Complementing Ratings with Preferences
von: Wang, Zhilin, et al.
Veröffentlicht: (2024) -
Fairness Begins with State: Purifying Latent Preferences for Hierarchical Reinforcement Learning in Interactive Recommendation
von: Lu, Yun, et al.
Veröffentlicht: (2026) -
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024) -
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)