Saved in:
| Main Authors: | Zhao, Qi, Fu, Haotian, Sun, Chen, Konidaris, George |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2408.16090 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Knowledge Retention for Continual Model-Based Reinforcement Learning
by: Sun, Yixiang, et al.
Published: (2025)
by: Sun, Yixiang, et al.
Published: (2025)
Model-based Reinforcement Learning for Parameterized Action Spaces
by: Zhang, Renhao, et al.
Published: (2024)
by: Zhang, Renhao, et al.
Published: (2024)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
by: Xu, Wujiang, et al.
Published: (2025)
by: Xu, Wujiang, et al.
Published: (2025)
EPO: Diverse and Realistic Protein Ensemble Generation via Energy Preference Optimization
by: Sun, Yuancheng, et al.
Published: (2025)
by: Sun, Yuancheng, et al.
Published: (2025)
Learning Parameterized Skills from Demonstrations
by: Gupta, Vedant, et al.
Published: (2025)
by: Gupta, Vedant, et al.
Published: (2025)
From Noise to Control: Parameterized Diffusion Policies
by: Zhang, Renhao, et al.
Published: (2026)
by: Zhang, Renhao, et al.
Published: (2026)
Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion
by: Haramati, Dan, et al.
Published: (2026)
by: Haramati, Dan, et al.
Published: (2026)
Learning Abstract World Model for Value-preserving Planning with Options
by: Rodriguez-Sanchez, Rafael, et al.
Published: (2024)
by: Rodriguez-Sanchez, Rafael, et al.
Published: (2024)
Geometry of Neural Reinforcement Learning in Continuous State and Action Spaces
by: Tiwari, Saket, et al.
Published: (2025)
by: Tiwari, Saket, et al.
Published: (2025)
On the Geometry of Reinforcement Learning in Continuous State and Action Spaces
by: Tiwari, Saket, et al.
Published: (2022)
by: Tiwari, Saket, et al.
Published: (2022)
Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents
by: Gao, Heyang, et al.
Published: (2025)
by: Gao, Heyang, et al.
Published: (2025)
Latent-Predictive Empowerment: Measuring Empowerment without a Simulator
by: Levy, Andrew, et al.
Published: (2024)
by: Levy, Andrew, et al.
Published: (2024)
Exploiting Contextual Structure to Generate Useful Auxiliary Tasks
by: Quartey, Benedict, et al.
Published: (2023)
by: Quartey, Benedict, et al.
Published: (2023)
From Pixels to Factors: Learning Independently Controllable State Variables for Reinforcement Learning
by: Rodriguez-Sanchez, Rafael, et al.
Published: (2025)
by: Rodriguez-Sanchez, Rafael, et al.
Published: (2025)
Language-guided Skill Learning with Temporal Variational Inference
by: Fu, Haotian, et al.
Published: (2024)
by: Fu, Haotian, et al.
Published: (2024)
Learning Markov State Abstractions for Deep Reinforcement Learning
by: Allen, Cameron, et al.
Published: (2021)
by: Allen, Cameron, et al.
Published: (2021)
Environment-Adaptive Preference Optimization for Wildfire Prediction
by: Jiang, Enyi, et al.
Published: (2026)
by: Jiang, Enyi, et al.
Published: (2026)
Benchmarking Partial Observability in Reinforcement Learning with a Suite of Memory-Improvable Domains
by: Tao, Ruo Yu, et al.
Published: (2025)
by: Tao, Ruo Yu, et al.
Published: (2025)
InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization
by: Li, Yu, et al.
Published: (2025)
by: Li, Yu, et al.
Published: (2025)
Enhancing LLM Safety via Constrained Direct Preference Optimization
by: Liu, Zixuan, et al.
Published: (2024)
by: Liu, Zixuan, et al.
Published: (2024)
Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning
by: Qin, Kai, et al.
Published: (2025)
by: Qin, Kai, et al.
Published: (2025)
Automating Curriculum Learning for Reinforcement Learning using a Skill-Based Bayesian Network
by: Hsiao, Vincent, et al.
Published: (2025)
by: Hsiao, Vincent, et al.
Published: (2025)
Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization
by: Long, Da, et al.
Published: (2026)
by: Long, Da, et al.
Published: (2026)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
by: Huang, Haojian, et al.
Published: (2025)
by: Huang, Haojian, et al.
Published: (2025)
HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs
by: Kachroo, Darsh, et al.
Published: (2026)
by: Kachroo, Darsh, et al.
Published: (2026)
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
by: Singh, Utsav, et al.
Published: (2024)
by: Singh, Utsav, et al.
Published: (2024)
DIPPER: Direct Preference Optimization to Accelerate Primitive-Enabled Hierarchical Reinforcement Learning
by: Singh, Utsav, et al.
Published: (2024)
by: Singh, Utsav, et al.
Published: (2024)
TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning
by: Chen, Ziyuan, et al.
Published: (2025)
by: Chen, Ziyuan, et al.
Published: (2025)
Preference Optimization for Combinatorial Optimization Problems
by: Pan, Mingjun, et al.
Published: (2025)
by: Pan, Mingjun, et al.
Published: (2025)
Test-Time Adaptation for LLM Agents via Environment Interaction
by: Chen, Arthur, et al.
Published: (2025)
by: Chen, Arthur, et al.
Published: (2025)
Learning Equivariant Neural-Augmented Object Dynamics From Few Interactions
by: Orozco, Sergio, et al.
Published: (2026)
by: Orozco, Sergio, et al.
Published: (2026)
Alignment with Preference Optimization Is All You Need for LLM Safety
by: Alami, Reda, et al.
Published: (2024)
by: Alami, Reda, et al.
Published: (2024)
Deep Reinforcement Learning from Hierarchical Preference Design
by: Bukharin, Alexander, et al.
Published: (2023)
by: Bukharin, Alexander, et al.
Published: (2023)
HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents
by: Carta, Thomas, et al.
Published: (2025)
by: Carta, Thomas, et al.
Published: (2025)
Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving
by: Zhao, Zihan, et al.
Published: (2026)
by: Zhao, Zihan, et al.
Published: (2026)
Direct Multi-Turn Preference Optimization for Language Agents
by: Shi, Wentao, et al.
Published: (2024)
by: Shi, Wentao, et al.
Published: (2024)
Delay-Empowered Causal Hierarchical Reinforcement Learning
by: Zhao, Chenran, et al.
Published: (2026)
by: Zhao, Chenran, et al.
Published: (2026)
Preference Optimization with Multi-Sample Comparisons
by: Wang, Chaoqi, et al.
Published: (2024)
by: Wang, Chaoqi, et al.
Published: (2024)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
by: Sun, Shengjie, et al.
Published: (2025)
by: Sun, Shengjie, et al.
Published: (2025)
IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization
by: Chen, Zixuan, et al.
Published: (2026)
by: Chen, Zixuan, et al.
Published: (2026)
Similar Items
-
Knowledge Retention for Continual Model-Based Reinforcement Learning
by: Sun, Yixiang, et al.
Published: (2025) -
Model-based Reinforcement Learning for Parameterized Action Spaces
by: Zhang, Renhao, et al.
Published: (2024) -
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
by: Xu, Wujiang, et al.
Published: (2025) -
EPO: Diverse and Realistic Protein Ensemble Generation via Energy Preference Optimization
by: Sun, Yuancheng, et al.
Published: (2025) -
Learning Parameterized Skills from Demonstrations
by: Gupta, Vedant, et al.
Published: (2025)