DIPPER: Direct Preference Optimization to Accelerate Primitive-Enabled Hierarchical Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Singh, Utsav, Chakraborty, Souradip, Suttle, Wesley A., Sadler, Brian M., Namboodiri, Vinay P, Bedi, Amrit Singh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PIPER: Primitive-Informed Preference-based Hierarchical Reinforcement Learning via Hindsight Relabeling
di: Singh, Utsav, et al.
Pubblicazione: (2024)
di: Singh, Utsav, et al.
Pubblicazione: (2024)
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2024)
di: Singh, Utsav, et al.
Pubblicazione: (2024)
PEAR: Primitive Enabled Adaptive Relabeling for Boosting Hierarchical Reinforcement Learning
di: Singh, Utsav, et al.
Pubblicazione: (2023)
di: Singh, Utsav, et al.
Pubblicazione: (2023)
CRISP: Curriculum Inducing Primitive Informed Subgoal Prediction for Hierarchical Reinforcement Learning
di: Singh, Utsav, et al.
Pubblicazione: (2023)
di: Singh, Utsav, et al.
Pubblicazione: (2023)
RL with Learnable Textual Feedback: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2026)
di: Singh, Utsav, et al.
Pubblicazione: (2026)
LGR2: Language Guided Reward Relabeling for Accelerating Hierarchical Reinforcement Learning
di: Singh, Utsav, et al.
Pubblicazione: (2024)
di: Singh, Utsav, et al.
Pubblicazione: (2024)
Towards Global Optimality for Practical Average Reward Reinforcement Learning without Mixing Time Oracles
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
di: Barakat, Anas, et al.
Pubblicazione: (2026)
di: Barakat, Anas, et al.
Pubblicazione: (2026)
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
di: Barakat, Anas, et al.
Pubblicazione: (2024)
di: Barakat, Anas, et al.
Pubblicazione: (2024)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
On The Sample Complexity Bounds In Bilevel Reinforcement Learning
di: Gaur, Mudit, et al.
Pubblicazione: (2025)
di: Gaur, Mudit, et al.
Pubblicazione: (2025)
Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation
di: Patel, Bhrij, et al.
Pubblicazione: (2023)
di: Patel, Bhrij, et al.
Pubblicazione: (2023)
MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models
di: Zhai, Kevin, et al.
Pubblicazione: (2025)
di: Zhai, Kevin, et al.
Pubblicazione: (2025)
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
Deceptive Path Planning via Reinforcement Learning with Graph Neural Networks
di: Fatemi, Michael Y., et al.
Pubblicazione: (2024)
di: Fatemi, Michael Y., et al.
Pubblicazione: (2024)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
Align-Pro: A Principled Approach to Prompt Optimization for LLM Alignment
di: Trivedi, Prashant, et al.
Pubblicazione: (2025)
di: Trivedi, Prashant, et al.
Pubblicazione: (2025)
Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
DHP: Discrete Hierarchical Planning for Hierarchical Reinforcement Learning Agents
di: Sharma, Shashank, et al.
Pubblicazione: (2025)
di: Sharma, Shashank, et al.
Pubblicazione: (2025)
Signal attenuation enables scalable decentralized multi-agent reinforcement learning over networks
di: Suttle, Wesley A, et al.
Pubblicazione: (2025)
di: Suttle, Wesley A, et al.
Pubblicazione: (2025)
PROPS: Progressively Private Self-alignment of Large Language Models
di: Teku, Noel, et al.
Pubblicazione: (2025)
di: Teku, Noel, et al.
Pubblicazione: (2025)
Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Conservative Natural Policy Gradient Primal-Dual Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2022)
di: Bai, Qinbo, et al.
Pubblicazione: (2022)
Transfer Q Star: Principled Decoding for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Sampling-based Safe Reinforcement Learning for Nonlinear Dynamical Systems
di: Suttle, Wesley A., et al.
Pubblicazione: (2024)
di: Suttle, Wesley A., et al.
Pubblicazione: (2024)
Behavioral Entropy-Guided Dataset Generation for Offline Reinforcement Learning
di: Suttle, Wesley A., et al.
Pubblicazione: (2025)
di: Suttle, Wesley A., et al.
Pubblicazione: (2025)
On The Global Convergence Of Online RLHF With Neural Parametrization
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
di: Lee, Jihoon, et al.
Pubblicazione: (2025)
di: Lee, Jihoon, et al.
Pubblicazione: (2025)
Value of Information-based Deceptive Path Planning Under Adversarial Interventions
di: Suttle, Wesley A., et al.
Pubblicazione: (2025)
di: Suttle, Wesley A., et al.
Pubblicazione: (2025)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
Direct Preference Optimization With Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences
di: Chidambaram, Keertana, et al.
Pubblicazione: (2024)
di: Chidambaram, Keertana, et al.
Pubblicazione: (2024)
Closing the Gap: Achieving Global Convergence (Last Iterate) of Actor-Critic under Markovian Sampling with Neural Network Parametrization
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Draft-Conditioned Constrained Decoding for Structured Generation in LLMs
di: Reddy, Avinash, et al.
Pubblicazione: (2026)
di: Reddy, Avinash, et al.
Pubblicazione: (2026)
TRAM: Test-Time Risk Adaptation with Mixture of Agents
di: Chehade, Mohamad Fares El Hajj, et al.
Pubblicazione: (2024)
di: Chehade, Mohamad Fares El Hajj, et al.
Pubblicazione: (2024)
Multi-LLM QA with Embodied Exploration
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
Improved Sample Complexity For Diffusion Model Training Without Empirical Risk Minimizer Access
di: Gaur, Mudit, et al.
Pubblicazione: (2025)
di: Gaur, Mudit, et al.
Pubblicazione: (2025)
Beyond Text: Utilizing Vocal Cues to Improve Decision Making in LLMs for Robot Navigation Tasks
di: Sun, Xingpeng, et al.
Pubblicazione: (2024)
di: Sun, Xingpeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PIPER: Primitive-Informed Preference-based Hierarchical Reinforcement Learning via Hindsight Relabeling
di: Singh, Utsav, et al.
Pubblicazione: (2024) -
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2024) -
PEAR: Primitive Enabled Adaptive Relabeling for Boosting Hierarchical Reinforcement Learning
di: Singh, Utsav, et al.
Pubblicazione: (2023) -
CRISP: Curriculum Inducing Primitive Informed Subgoal Prediction for Hierarchical Reinforcement Learning
di: Singh, Utsav, et al.
Pubblicazione: (2023) -
RL with Learnable Textual Feedback: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2026)