Convergence of a model-free entropy-regularized inverse reinforcement learning algorithm
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Renard, Titouan, Schlaginhaufen, Andreas, Ni, Tingting, Kamgarpour, Maryam |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
par: Schlaginhaufen, Andreas, et autres
Publié: (2024)
par: Schlaginhaufen, Andreas, et autres
Publié: (2024)
Fast Rates for Inverse Reinforcement Learning
par: Schlaginhaufen, Andreas, et autres
Publié: (2026)
par: Schlaginhaufen, Andreas, et autres
Publié: (2026)
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
par: Schlaginhaufen, Andreas, et autres
Publié: (2025)
par: Schlaginhaufen, Andreas, et autres
Publié: (2025)
A learning-based approach to stochastic optimal control under reach-avoid constraint
par: Ni, Tingting, et autres
Publié: (2024)
par: Ni, Tingting, et autres
Publié: (2024)
Constrained Meta Reinforcement Learning with Provable Test-Time Safety
par: Ni, Tingting, et autres
Publié: (2026)
par: Ni, Tingting, et autres
Publié: (2026)
A safe exploration approach to constrained Markov decision processes
par: Ni, Tingting, et autres
Publié: (2023)
par: Ni, Tingting, et autres
Publié: (2023)
Bellman operator convergence enhancements in reinforcement learning algorithms
par: Kadurha, David Krame, et autres
Publié: (2025)
par: Kadurha, David Krame, et autres
Publié: (2025)
An advantage based policy transfer algorithm for reinforcement learning with measures of transferability
par: Alam, Md Ferdous, et autres
Publié: (2023)
par: Alam, Md Ferdous, et autres
Publié: (2023)
Autonomous navigation of catheters and guidewires in mechanical thrombectomy using inverse reinforcement learning
par: Robertshaw, Harry, et autres
Publié: (2024)
par: Robertshaw, Harry, et autres
Publié: (2024)
Causal prompting model-based offline reinforcement learning
par: Yu, Xuehui, et autres
Publié: (2024)
par: Yu, Xuehui, et autres
Publié: (2024)
Trust Region Preference Approximation: A simple and stable reinforcement learning algorithm for LLM reasoning
par: Su, Xuerui, et autres
Publié: (2025)
par: Su, Xuerui, et autres
Publié: (2025)
Soft $Q(λ)$: A multi-step off-policy method for entropy regularised reinforcement learning using eligibility traces
par: Mahajan, Pranav, et autres
Publié: (2026)
par: Mahajan, Pranav, et autres
Publié: (2026)
Normalization and effective learning rates in reinforcement learning
par: Lyle, Clare, et autres
Publié: (2024)
par: Lyle, Clare, et autres
Publié: (2024)
Policy-shaped prediction: avoiding distractions in model-based reinforcement learning
par: Hutson, Miles, et autres
Publié: (2024)
par: Hutson, Miles, et autres
Publié: (2024)
Found-RL: foundation model-enhanced reinforcement learning for autonomous driving
par: Qu, Yansong, et autres
Publié: (2026)
par: Qu, Yansong, et autres
Publié: (2026)
Emergent temporal abstractions in autoregressive models enable hierarchical reinforcement learning
par: Kobayashi, Seijin, et autres
Publié: (2025)
par: Kobayashi, Seijin, et autres
Publié: (2025)
Curriculum reinforcement learning with measurable task representation learning
par: Wen, Yongyan, et autres
Publié: (2026)
par: Wen, Yongyan, et autres
Publié: (2026)
Scores as Actions: a framework of fine-tuning diffusion models by continuous-time reinforcement learning
par: Zhao, Hanyang, et autres
Publié: (2024)
par: Zhao, Hanyang, et autres
Publié: (2024)
Acting upon Imagination: when to trust imagined trajectories in model based reinforcement learning
par: Remonda, Adrian, et autres
Publié: (2021)
par: Remonda, Adrian, et autres
Publié: (2021)
BenchRL-QAS: Benchmarking reinforcement learning algorithms for quantum architecture search
par: Ikhtiarudin, Azhar, et autres
Publié: (2025)
par: Ikhtiarudin, Azhar, et autres
Publié: (2025)
Human-compatible driving partners through data-regularized self-play reinforcement learning
par: Cornelisse, Daphne, et autres
Publié: (2024)
par: Cornelisse, Daphne, et autres
Publié: (2024)
Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
From model-based learning to model-free behaviour with Meta-Interpretive Learning
par: Patsantzis, Stassa
Publié: (2025)
par: Patsantzis, Stassa
Publié: (2025)
MaxInfoRL: Boosting exploration in reinforcement learning through information gain maximization
par: Sukhija, Bhavya, et autres
Publié: (2024)
par: Sukhija, Bhavya, et autres
Publié: (2024)
Deep reinforcement learning with time-scale invariant memory
par: Kabir, Md Rysul, et autres
Publié: (2024)
par: Kabir, Md Rysul, et autres
Publié: (2024)
Offline reinforcement learning for job-shop scheduling problems
par: Echeverria, Imanol, et autres
Publié: (2024)
par: Echeverria, Imanol, et autres
Publié: (2024)
Counterfactual experience augmented off-policy reinforcement learning
par: Lee, Sunbowen, et autres
Publié: (2025)
par: Lee, Sunbowen, et autres
Publié: (2025)
Delayed homomorphic reinforcement learning for environments with delayed feedback
par: Lee, Jongsoo, et autres
Publié: (2026)
par: Lee, Jongsoo, et autres
Publié: (2026)
Zero-shot protein stability prediction by inverse folding models: a free energy interpretation
par: Frellsen, Jes, et autres
Publié: (2025)
par: Frellsen, Jes, et autres
Publié: (2025)
Deep reinforcement learning for machine scheduling: Methodology, the state-of-the-art, and future directions
par: Khadivi, Maziyar, et autres
Publié: (2023)
par: Khadivi, Maziyar, et autres
Publié: (2023)
Scilab-RL: A software framework for efficient reinforcement learning and cognitive modeling research
par: Dohmen, Jan, et autres
Publié: (2024)
par: Dohmen, Jan, et autres
Publié: (2024)
Dynamic feature selection in medical predictive monitoring by reinforcement learning
par: Chen, Yutong, et autres
Publié: (2024)
par: Chen, Yutong, et autres
Publié: (2024)
Economic span selection of bridge based on deep reinforcement learning
par: Zhang, Leye, et autres
Publié: (2024)
par: Zhang, Leye, et autres
Publié: (2024)
Leveraging weights signals -- Predicting and improving generalizability in reinforcement learning
par: Moulin, Olivier, et autres
Publié: (2025)
par: Moulin, Olivier, et autres
Publié: (2025)
Not all tokens are needed(NAT): token efficient reinforcement learning
par: Sang, Hejian, et autres
Publié: (2026)
par: Sang, Hejian, et autres
Publié: (2026)
A quantum-classical reinforcement learning model to play Atari games
par: Freinberger, Dominik, et autres
Publié: (2024)
par: Freinberger, Dominik, et autres
Publié: (2024)
Guided Safe Shooting: model based reinforcement learning with safety constraints
par: Paolo, Giuseppe, et autres
Publié: (2022)
par: Paolo, Giuseppe, et autres
Publié: (2022)
Pilot selection in the era of Virtual reality: algorithms for accurate and interpretable machine learning models
par: Ke, Luoma, et autres
Publié: (2025)
par: Ke, Luoma, et autres
Publié: (2025)
Understanding Prediction Discrepancies in Machine Learning Classifiers
par: Renard, Xavier, et autres
Publié: (2021)
par: Renard, Xavier, et autres
Publié: (2021)
In value-based deep reinforcement learning, a pruned network is a good network
par: Obando-Ceron, Johan, et autres
Publié: (2024)
par: Obando-Ceron, Johan, et autres
Publié: (2024)
Documents similaires
-
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
par: Schlaginhaufen, Andreas, et autres
Publié: (2024) -
Fast Rates for Inverse Reinforcement Learning
par: Schlaginhaufen, Andreas, et autres
Publié: (2026) -
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
par: Schlaginhaufen, Andreas, et autres
Publié: (2025) -
A learning-based approach to stochastic optimal control under reach-avoid constraint
par: Ni, Tingting, et autres
Publié: (2024) -
Constrained Meta Reinforcement Learning with Provable Test-Time Safety
par: Ni, Tingting, et autres
Publié: (2026)