EXPO: Stable Reinforcement Learning with Expressive Policies
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Perry, Li, Qiyang, Sadigh, Dorsa, Finn, Chelsea |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
par: Dong, Perry, et autres
Publié: (2026)
par: Dong, Perry, et autres
Publié: (2026)
FASTER: Value-Guided Sampling for Fast RL
par: Dong, Perry, et autres
Publié: (2026)
par: Dong, Perry, et autres
Publié: (2026)
Value Flows
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
TQL: Scaling Q-Functions with Transformers by Preventing Attention Collapse
par: Dong, Perry, et autres
Publié: (2026)
par: Dong, Perry, et autres
Publié: (2026)
What Matters for Batch Online Reinforcement Learning in Robotics?
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
Polychromic Objectives for Reinforcement Learning
par: Hamid, Jubayer Ibn, et autres
Publié: (2025)
par: Hamid, Jubayer Ibn, et autres
Publié: (2025)
Efficient Data Collection for Robotic Manipulation via Compositional Generalization
par: Gao, Jensen, et autres
Publié: (2024)
par: Gao, Jensen, et autres
Publié: (2024)
Imitation Bootstrapped Reinforcement Learning
par: Hu, Hengyuan, et autres
Publié: (2023)
par: Hu, Hengyuan, et autres
Publié: (2023)
Reinforcement Learning via Implicit Imitation Guidance
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
Contrastive Preference Learning: Learning from Human Feedback without RL
par: Hejna, Joey, et autres
Publié: (2023)
par: Hejna, Joey, et autres
Publié: (2023)
Policy Learning with a Language Bottleneck
par: Srivastava, Megha, et autres
Publié: (2024)
par: Srivastava, Megha, et autres
Publié: (2024)
Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
par: Wagenmaker, Andrew, et autres
Publié: (2025)
par: Wagenmaker, Andrew, et autres
Publié: (2025)
Batch Active Learning of Reward Functions from Human Preferences
par: Bıyık, Erdem, et autres
Publié: (2024)
par: Bıyık, Erdem, et autres
Publié: (2024)
Latent Diffusion Planning for Imitation Learning
par: Xie, Amber, et autres
Publié: (2025)
par: Xie, Amber, et autres
Publié: (2025)
Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy
par: Doo, JaeHyeok, et autres
Publié: (2026)
par: Doo, JaeHyeok, et autres
Publié: (2026)
Invariance Co-training for Robot Visual Generalization
par: Yang, Jonathan, et autres
Publié: (2025)
par: Yang, Jonathan, et autres
Publié: (2025)
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
par: Sarkar, Bidipta, et autres
Publié: (2025)
par: Sarkar, Bidipta, et autres
Publié: (2025)
Grounding by Trying: LLMs with Reinforcement Learning-Enhanced Retrieval
par: Hsu, Sheryl, et autres
Publié: (2024)
par: Hsu, Sheryl, et autres
Publié: (2024)
Diffusion Models are Secretly Exchangeable: Parallelizing DDPMs via Autospeculation
par: Hu, Hengyuan, et autres
Publié: (2025)
par: Hu, Hengyuan, et autres
Publié: (2025)
RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning
par: Xu, Charles, et autres
Publié: (2024)
par: Xu, Charles, et autres
Publié: (2024)
A Taxonomy for Evaluating Generalist Robot Manipulation Policies
par: Gao, Jensen, et autres
Publié: (2025)
par: Gao, Jensen, et autres
Publié: (2025)
Learning Long-Context Diffusion Policies via Past-Token Prediction
par: Torne, Marcel, et autres
Publié: (2025)
par: Torne, Marcel, et autres
Publié: (2025)
Motion Tracks: A Unified Representation for Human-Robot Transfer in Few-Shot Imitation Learning
par: Ren, Juntao, et autres
Publié: (2025)
par: Ren, Juntao, et autres
Publié: (2025)
Reinforcement Learning with Action Chunking
par: Li, Qiyang, et autres
Publié: (2025)
par: Li, Qiyang, et autres
Publié: (2025)
Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning
par: Clark, Jaden, et autres
Publié: (2025)
par: Clark, Jaden, et autres
Publié: (2025)
Affordance-Guided Reinforcement Learning via Visual Prompting
par: Lee, Olivia Y., et autres
Publié: (2024)
par: Lee, Olivia Y., et autres
Publié: (2024)
Towards Interpretable Reinforcement Learning with Constrained Normalizing Flow Policies
par: Rietz, Finn, et autres
Publié: (2024)
par: Rietz, Finn, et autres
Publié: (2024)
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
par: Xiang, Violet, et autres
Publié: (2025)
par: Xiang, Violet, et autres
Publié: (2025)
Self-Guided Masked Autoencoders for Domain-Agnostic Self-Supervised Learning
par: Xie, Johnathan, et autres
Publié: (2024)
par: Xie, Johnathan, et autres
Publié: (2024)
Universal Neural Functionals
par: Zhou, Allan, et autres
Publié: (2024)
par: Zhou, Allan, et autres
Publié: (2024)
What's the Move? Hybrid Imitation Learning via Salient Points
par: Sundaresan, Priya, et autres
Publié: (2024)
par: Sundaresan, Priya, et autres
Publié: (2024)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
par: Zhang, Han, et autres
Publié: (2025)
par: Zhang, Han, et autres
Publié: (2025)
Learning More Expressive General Policies for Classical Planning Domains
par: Ståhlberg, Simon, et autres
Publié: (2024)
par: Ståhlberg, Simon, et autres
Publié: (2024)
Flow Q-Learning
par: Park, Seohong, et autres
Publié: (2025)
par: Park, Seohong, et autres
Publié: (2025)
Vocal Sandbox: Continual Learning and Adaptation for Situated Human-Robot Collaboration
par: Grannen, Jennifer, et autres
Publié: (2024)
par: Grannen, Jennifer, et autres
Publié: (2024)
ProVox: Personalization and Proactive Planning for Situated Human-Robot Collaboration
par: Grannen, Jennifer, et autres
Publié: (2025)
par: Grannen, Jennifer, et autres
Publié: (2025)
Maximum Entropy Reinforcement Learning with Diffusion Policy
par: Dong, Xiaoyi, et autres
Publié: (2025)
par: Dong, Xiaoyi, et autres
Publié: (2025)
ML-Driven Approaches to Combat Medicare Fraud: Advances in Class Imbalance Solutions, Feature Engineering, Adaptive Learning, and Business Impact
par: Farahmandazad, Dorsa, et autres
Publié: (2025)
par: Farahmandazad, Dorsa, et autres
Publié: (2025)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
par: Mark, Max Sobol, et autres
Publié: (2024)
par: Mark, Max Sobol, et autres
Publié: (2024)
Understanding Expressivity of GNN in Rule Learning
par: Qiu, Haiquan, et autres
Publié: (2023)
par: Qiu, Haiquan, et autres
Publié: (2023)
Documents similaires
-
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
par: Dong, Perry, et autres
Publié: (2026) -
FASTER: Value-Guided Sampling for Fast RL
par: Dong, Perry, et autres
Publié: (2026) -
Value Flows
par: Dong, Perry, et autres
Publié: (2025) -
TQL: Scaling Q-Functions with Transformers by Preventing Attention Collapse
par: Dong, Perry, et autres
Publié: (2026) -
What Matters for Batch Online Reinforcement Learning in Robotics?
par: Dong, Perry, et autres
Publié: (2025)