Fill in the Blanks: Accelerating Q-Learning with a Handful of Demonstrations in Sparse Reward Settings
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Azad, Seyed Mahdi Basiri, Boedecker, Joschka |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SR-Reward: Taking The Path More Traveled
par: Azad, Seyed Mahdi B., et autres
Publié: (2025)
par: Azad, Seyed Mahdi B., et autres
Publié: (2025)
Safe Imitation Learning of Nonlinear Model Predictive Control for Flexible Robots
par: Mamedov, Shamil, et autres
Publié: (2022)
par: Mamedov, Shamil, et autres
Publié: (2022)
Spectral Alignment in Forward-Backward Representations via Temporal Abstraction
par: Azad, Seyed Mahdi B., et autres
Publié: (2026)
par: Azad, Seyed Mahdi B., et autres
Publié: (2026)
The Art of Imitation: Learning Long-Horizon Manipulation Tasks from Few Demonstrations
par: von Hartz, Jan Ole, et autres
Publié: (2024)
par: von Hartz, Jan Ole, et autres
Publié: (2024)
UDUC: An Uncertainty-driven Approach for Learning-based Robust Control
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
Solving Inverse Problem for Multi-armed Bandits via Convex Optimization
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
Probabilistic Recurrent Intention Switching Model
par: Sheng, Wenyuan, et autres
Publié: (2026)
par: Sheng, Wenyuan, et autres
Publié: (2026)
Inverse Reinforcement Learning via Convex Optimization
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
Disciplined Biconvex Programming
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
Context-Conditional Navigation with a Learning-Based Terrain- and Robot-Aware Dynamics Model
par: Guttikonda, Suresh, et autres
Publié: (2023)
par: Guttikonda, Suresh, et autres
Publié: (2023)
Filling in the Blanks: Applying Data Imputation in incomplete Water Metering Data
par: Amaxilatis, Dimitrios, et autres
Publié: (2025)
par: Amaxilatis, Dimitrios, et autres
Publié: (2025)
The Unreasonable Effectiveness of Discrete-Time Gaussian Process Mixtures for Robot Policy Learning
par: von Hartz, Jan Ole, et autres
Publié: (2025)
par: von Hartz, Jan Ole, et autres
Publié: (2025)
Multi-intention Inverse Q-learning for Interpretable Behavior Representation
par: Zhu, Hao, et autres
Publié: (2023)
par: Zhu, Hao, et autres
Publié: (2023)
CBGBench: Fill in the Blank of Protein-Molecule Complex Binding Graph
par: Lin, Haitao, et autres
Publié: (2024)
par: Lin, Haitao, et autres
Publié: (2024)
Latent Linear Quadratic Regulator for Robotic Control Tasks
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
The Surprising Ineffectiveness of Pre-Trained Visual Representations for Model-Based Reinforcement Learning
par: Schneider, Moritz, et autres
Publié: (2024)
par: Schneider, Moritz, et autres
Publié: (2024)
MSG: Multi-Stream Generative Policies for Sample-Efficient Robotic Manipulation
par: von Hartz, Jan Ole, et autres
Publié: (2025)
par: von Hartz, Jan Ole, et autres
Publié: (2025)
Does TabPFN Understand Causal Structures?
par: Swelam, Omar, et autres
Publié: (2025)
par: Swelam, Omar, et autres
Publié: (2025)
Fitting Reinforcement Learning Model to Behavioral Data under Bandits
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
BetterBodies: Reinforcement Learning guided Diffusion for Antibody Sequence Design
par: Vogt, Yannick, et autres
Publié: (2024)
par: Vogt, Yannick, et autres
Publié: (2024)
"Filling the Blanks'': Identifying Micro-activities that Compose Complex Human Activities of Daily Living
par: Chatterjee, Soumyajit, et autres
Publié: (2023)
par: Chatterjee, Soumyajit, et autres
Publié: (2023)
KnowledgeVIS: Interpreting Language Models by Comparing Fill-in-the-Blank Prompts
par: Coscia, Adam, et autres
Publié: (2024)
par: Coscia, Adam, et autres
Publié: (2024)
Multi-convex Programming for Discrete Latent Factor Models Prototyping
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
Stable Online and Offline Reinforcement Learning for Antibody CDRH3 Design
par: Vogt, Yannick, et autres
Publié: (2023)
par: Vogt, Yannick, et autres
Publié: (2023)
Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach
par: Kim, Kihyun, et autres
Publié: (2026)
par: Kim, Kihyun, et autres
Publié: (2026)
Information-Theoretic Policy Pre-Training with Empowerment
par: Schneider, Moritz, et autres
Publié: (2025)
par: Schneider, Moritz, et autres
Publié: (2025)
Fill in the Blank: Exploring and Enhancing LLM Capabilities for Backward Reasoning in Math Word Problems
par: Deb, Aniruddha, et autres
Publié: (2023)
par: Deb, Aniruddha, et autres
Publié: (2023)
Logit Reweighting for Topic-Focused Summarization
par: Braun, Joschka, et autres
Publié: (2025)
par: Braun, Joschka, et autres
Publié: (2025)
Beyond Multiple Choice: Evaluating Steering Vectors for Summarization
par: Braun, Joschka, et autres
Publié: (2025)
par: Braun, Joschka, et autres
Publié: (2025)
SINDyG: Sparse Identification of Nonlinear Dynamical Systems from Graph-Structured Data, with Applications to Stuart-Landau Oscillator Networks
par: Basiri, Mohammad Amin, et autres
Publié: (2024)
par: Basiri, Mohammad Amin, et autres
Publié: (2024)
Expert Proximity as Surrogate Rewards for Single Demonstration Imitation Learning
par: Chiang, Chia-Cheng, et autres
Publié: (2024)
par: Chiang, Chia-Cheng, et autres
Publié: (2024)
Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification
par: Reiter, Rudolf, et autres
Publié: (2025)
par: Reiter, Rudolf, et autres
Publié: (2025)
Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards
par: Heckel, Reinhard, et autres
Publié: (2026)
par: Heckel, Reinhard, et autres
Publié: (2026)
Learning Safety Constraints from Demonstrations with Unknown Rewards
par: Lindner, David, et autres
Publié: (2023)
par: Lindner, David, et autres
Publié: (2023)
From Set Convergence to Pointwise Convergence: Finite-Time Guarantees for Average-Reward Q-Learning with Adaptive Stepsizes
par: Chen, Zaiwei, et autres
Publié: (2025)
par: Chen, Zaiwei, et autres
Publié: (2025)
Learning Fill-in Reduction Ordering via Graph Policy Optimization for Sparse Matrices
par: Li, Ziwei, et autres
Publié: (2026)
par: Li, Ziwei, et autres
Publié: (2026)
Learning a Sparse Neural Network using IHT
par: Damadi, Saeed, et autres
Publié: (2024)
par: Damadi, Saeed, et autres
Publié: (2024)
SparseTransX: Efficient Training of Translation-Based Knowledge Graph Embeddings Using Sparse Matrix Operations
par: Anik, Md Saidul Hoque, et autres
Publié: (2025)
par: Anik, Md Saidul Hoque, et autres
Publié: (2025)
Understanding (Un)Reliability of Steering Vectors in Language Models
par: Braun, Joschka, et autres
Publié: (2025)
par: Braun, Joschka, et autres
Publié: (2025)
Hierarchical Apprenticeship Learning from Imperfect Demonstrations with Evolving Rewards
par: Islam, Md Mirajul, et autres
Publié: (2026)
par: Islam, Md Mirajul, et autres
Publié: (2026)
Documents similaires
-
SR-Reward: Taking The Path More Traveled
par: Azad, Seyed Mahdi B., et autres
Publié: (2025) -
Safe Imitation Learning of Nonlinear Model Predictive Control for Flexible Robots
par: Mamedov, Shamil, et autres
Publié: (2022) -
Spectral Alignment in Forward-Backward Representations via Temporal Abstraction
par: Azad, Seyed Mahdi B., et autres
Publié: (2026) -
The Art of Imitation: Learning Long-Horizon Manipulation Tasks from Few Demonstrations
par: von Hartz, Jan Ole, et autres
Publié: (2024) -
UDUC: An Uncertainty-driven Approach for Learning-based Robust Control
par: Zhang, Yuan, et autres
Publié: (2024)