RA-PbRL: Provably Efficient Risk-Aware Preference-Based Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Yujie, Escamill, Jose Efraim Aguilar, Lu, Weyl, Wang, Huazheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Provably Efficient Algorithm for Best Scoring Rule Identification in Online Principal-Agent Information Acquisition
par: Wang, Zichen, et autres
Publié: (2025)
par: Wang, Zichen, et autres
Publié: (2025)
When Can You Poison Rewards? A Tight Characterization of Reward Poisoning in Linear MDPs
par: Escamilla, Jose Efraim Aguilar, et autres
Publié: (2026)
par: Escamilla, Jose Efraim Aguilar, et autres
Publié: (2026)
Provable Reward-Agnostic Preference-Based Reinforcement Learning
par: Zhan, Wenhao, et autres
Publié: (2023)
par: Zhan, Wenhao, et autres
Publié: (2023)
Neural Motion Simulator: Pushing the Limit of World Models in Reinforcement Learning
par: Hao, Chenjie, et autres
Publié: (2025)
par: Hao, Chenjie, et autres
Publié: (2025)
Provably Efficient Partially Observable Risk-Sensitive Reinforcement Learning with Hindsight Observation
par: Zhang, Tonghe, et autres
Publié: (2024)
par: Zhang, Tonghe, et autres
Publié: (2024)
Provably Efficient Reinforcement Learning with Multinomial Logit Function Approximation
par: Li, Long-Fei, et autres
Publié: (2024)
par: Li, Long-Fei, et autres
Publié: (2024)
Provable Risk-Sensitive Distributional Reinforcement Learning with General Function Approximation
par: Chen, Yu, et autres
Publié: (2024)
par: Chen, Yu, et autres
Publié: (2024)
Provably Sample-Efficient Robust Reinforcement Learning with Average Reward
par: Roch, Zachary, et autres
Publié: (2025)
par: Roch, Zachary, et autres
Publié: (2025)
FLoRA: Sample-Efficient Preference-based RL via Low-Rank Style Adaptation of Reward Functions
par: Marta, Daniel, et autres
Publié: (2025)
par: Marta, Daniel, et autres
Publié: (2025)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
par: Deng, Hexuan, et autres
Publié: (2025)
par: Deng, Hexuan, et autres
Publié: (2025)
Contrastive UCB: Provably Efficient Contrastive Self-Supervised Learning in Online Reinforcement Learning
par: Qiu, Shuang, et autres
Publié: (2022)
par: Qiu, Shuang, et autres
Publié: (2022)
Offline Inverse RL: New Solution Concepts and Provably Efficient Algorithms
par: Lazzati, Filippo, et autres
Publié: (2024)
par: Lazzati, Filippo, et autres
Publié: (2024)
Efficient Preference-Based Reinforcement Learning Using Learned Dynamics Models
par: Liu, Yi, et autres
Publié: (2023)
par: Liu, Yi, et autres
Publié: (2023)
Preference-Guided Reinforcement Learning for Efficient Exploration
par: Wang, Guojian, et autres
Publié: (2024)
par: Wang, Guojian, et autres
Publié: (2024)
Provably Efficient Exploration in Inverse Constrained Reinforcement Learning
par: Yue, Bo, et autres
Publié: (2024)
par: Yue, Bo, et autres
Publié: (2024)
CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts
par: Zhang, Rui, et autres
Publié: (2026)
par: Zhang, Rui, et autres
Publié: (2026)
Sample-Efficient Preference-based Reinforcement Learning with Dynamics Aware Rewards
par: Metcalf, Katherine, et autres
Publié: (2024)
par: Metcalf, Katherine, et autres
Publié: (2024)
Towards Provable Emergence of In-Context Reinforcement Learning
par: Wang, Jiuqi, et autres
Publié: (2025)
par: Wang, Jiuqi, et autres
Publié: (2025)
Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning
par: Luo, Zhi, et autres
Publié: (2024)
par: Luo, Zhi, et autres
Publié: (2024)
One-Step Bellman Alignment Enables Provably Efficient Transfer in Online RL
par: Chen, Elynn, et autres
Publié: (2026)
par: Chen, Elynn, et autres
Publié: (2026)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
par: Li, Yuhang, et autres
Publié: (2026)
par: Li, Yuhang, et autres
Publié: (2026)
Bridging Distributional and Risk-sensitive Reinforcement Learning with Provable Regret Bounds
par: Liang, Hao, et autres
Publié: (2022)
par: Liang, Hao, et autres
Publié: (2022)
Deep Networks Favor Simple Data
par: Lu, Weyl, et autres
Publié: (2026)
par: Lu, Weyl, et autres
Publié: (2026)
Provable Representation with Efficient Planning for Partial Observable Reinforcement Learning
par: Zhang, Hongming, et autres
Publié: (2023)
par: Zhang, Hongming, et autres
Publié: (2023)
TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback
par: Pang, Lei, et autres
Publié: (2025)
par: Pang, Lei, et autres
Publié: (2025)
Provable and Practical: Efficient Exploration in Reinforcement Learning via Langevin Monte Carlo
par: Ishfaq, Haque, et autres
Publié: (2023)
par: Ishfaq, Haque, et autres
Publié: (2023)
Provable Memory Efficient Self-Play Algorithm for Model-free Reinforcement Learning
par: Li, Na, et autres
Publié: (2025)
par: Li, Na, et autres
Publié: (2025)
Optimistically Optimistic Exploration for Provably Efficient Infinite-Horizon Reinforcement and Imitation Learning
par: Moulin, Antoine, et autres
Publié: (2025)
par: Moulin, Antoine, et autres
Publié: (2025)
Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences
par: Liu, Ziang, et autres
Publié: (2024)
par: Liu, Ziang, et autres
Publié: (2024)
Multi-objective Reinforcement Learning with Nonlinear Preferences: Provable Approximation for Maximizing Expected Scalarized Return
par: Peng, Nianli, et autres
Publié: (2023)
par: Peng, Nianli, et autres
Publié: (2023)
Provably Efficient and Agile Randomized Q-Learning
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
RAIE: Region-Aware Incremental Preference Editing with LoRA for LLM-based Recommendation
par: Zeng, Jin, et autres
Publié: (2026)
par: Zeng, Jin, et autres
Publié: (2026)
Provably Efficient Multi-Objective Bandit Algorithms under Preference-Centric Customization
par: Cao, Linfeng, et autres
Publié: (2025)
par: Cao, Linfeng, et autres
Publié: (2025)
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
par: Zeng, Yifan, et autres
Publié: (2026)
par: Zeng, Yifan, et autres
Publié: (2026)
How does Inverse RL Scale to Large State Spaces? A Provably Efficient Approach
par: Lazzati, Filippo, et autres
Publié: (2024)
par: Lazzati, Filippo, et autres
Publié: (2024)
Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function Approximation
par: Kitamura, Toshinori, et autres
Publié: (2025)
par: Kitamura, Toshinori, et autres
Publié: (2025)
FineFT: Efficient and Risk-Aware Ensemble Reinforcement Learning for Futures Trading
par: Qin, Molei, et autres
Publié: (2025)
par: Qin, Molei, et autres
Publié: (2025)
Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes
par: Lu, Miao, et autres
Publié: (2022)
par: Lu, Miao, et autres
Publié: (2022)
Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning
par: Ghosh, Udita, et autres
Publié: (2025)
par: Ghosh, Udita, et autres
Publié: (2025)
LoRA-drop: Efficient LoRA Parameter Pruning based on Output Evaluation
par: Zhou, Hongyun, et autres
Publié: (2024)
par: Zhou, Hongyun, et autres
Publié: (2024)
Documents similaires
-
Provably Efficient Algorithm for Best Scoring Rule Identification in Online Principal-Agent Information Acquisition
par: Wang, Zichen, et autres
Publié: (2025) -
When Can You Poison Rewards? A Tight Characterization of Reward Poisoning in Linear MDPs
par: Escamilla, Jose Efraim Aguilar, et autres
Publié: (2026) -
Provable Reward-Agnostic Preference-Based Reinforcement Learning
par: Zhan, Wenhao, et autres
Publié: (2023) -
Neural Motion Simulator: Pushing the Limit of World Models in Reinforcement Learning
par: Hao, Chenjie, et autres
Publié: (2025) -
Provably Efficient Partially Observable Risk-Sensitive Reinforcement Learning with Hindsight Observation
par: Zhang, Tonghe, et autres
Publié: (2024)