Salvato in:
| Autori principali: | Malato, Federico, Hautamaki, Ville |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.01558 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Online Adaptation for Enhancing Imitation Learning Policies
di: Malato, Federico, et al.
Pubblicazione: (2024)
di: Malato, Federico, et al.
Pubblicazione: (2024)
Zero-shot World Models via Search in Memory
di: Malato, Federico, et al.
Pubblicazione: (2025)
di: Malato, Federico, et al.
Pubblicazione: (2025)
Zero-shot Imitation Policy via Search in Demonstration Dataset
di: Malato, Federco, et al.
Pubblicazione: (2024)
di: Malato, Federco, et al.
Pubblicazione: (2024)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
di: Goodall, Alexander W., et al.
Pubblicazione: (2025)
di: Goodall, Alexander W., et al.
Pubblicazione: (2025)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
di: Palenicek, Daniel, et al.
Pubblicazione: (2025)
di: Palenicek, Daniel, et al.
Pubblicazione: (2025)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
Automated Off-Policy Estimator Selection via Supervised Learning
di: Felicioni, Nicolò, et al.
Pubblicazione: (2024)
di: Felicioni, Nicolò, et al.
Pubblicazione: (2024)
Sample Complexity Reduction via Policy Difference Estimation in Tabular Reinforcement Learning
di: Narang, Adhyyan, et al.
Pubblicazione: (2024)
di: Narang, Adhyyan, et al.
Pubblicazione: (2024)
On the Sample Efficiency of Abstractions and Potential-Based Reward Shaping in Reinforcement Learning
di: Canonaco, Giuseppe, et al.
Pubblicazione: (2024)
di: Canonaco, Giuseppe, et al.
Pubblicazione: (2024)
COSBO: Conservative Offline Simulation-Based Policy Optimization
di: Kargar, Eshagh, et al.
Pubblicazione: (2024)
di: Kargar, Eshagh, et al.
Pubblicazione: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
di: Kang, Hyungkyu, et al.
Pubblicazione: (2025)
di: Kang, Hyungkyu, et al.
Pubblicazione: (2025)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
Frugal Actor-Critic: Sample Efficient Off-Policy Deep Reinforcement Learning Using Unique Experiences
di: Singh, Nikhil Kumar, et al.
Pubblicazione: (2024)
di: Singh, Nikhil Kumar, et al.
Pubblicazione: (2024)
Zero-Shot Off-Policy Learning
di: Asadulaev, Arip, et al.
Pubblicazione: (2026)
di: Asadulaev, Arip, et al.
Pubblicazione: (2026)
Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective
di: Duan, Tianyang, et al.
Pubblicazione: (2025)
di: Duan, Tianyang, et al.
Pubblicazione: (2025)
Sample Complexity of Distributionally Robust Off-Dynamics Reinforcement Learning with Online Interaction
di: He, Yiting, et al.
Pubblicazione: (2025)
di: He, Yiting, et al.
Pubblicazione: (2025)
Off-Policy Correction For Multi-Agent Reinforcement Learning
di: Zawalski, Michał, et al.
Pubblicazione: (2021)
di: Zawalski, Michał, et al.
Pubblicazione: (2021)
Regret-Based Defense in Adversarial Reinforcement Learning
di: Belaire, Roman, et al.
Pubblicazione: (2023)
di: Belaire, Roman, et al.
Pubblicazione: (2023)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
di: Zhang, Wenhao, et al.
Pubblicazione: (2025)
di: Zhang, Wenhao, et al.
Pubblicazione: (2025)
CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms
di: Yenicesu, Arda Sarp, et al.
Pubblicazione: (2024)
di: Yenicesu, Arda Sarp, et al.
Pubblicazione: (2024)
Subgoal-based Reward Shaping to Improve Efficiency in Reinforcement Learning
di: Okudo, Takato, et al.
Pubblicazione: (2021)
di: Okudo, Takato, et al.
Pubblicazione: (2021)
A Generalized Projected Bellman Error for Off-policy Value Estimation in Reinforcement Learning
di: Patterson, Andrew, et al.
Pubblicazione: (2021)
di: Patterson, Andrew, et al.
Pubblicazione: (2021)
MGAS: Multi-Granularity Architecture Search for Trade-Off Between Model Effectiveness and Efficiency
di: Liu, Xiaoyun, et al.
Pubblicazione: (2023)
di: Liu, Xiaoyun, et al.
Pubblicazione: (2023)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
di: Liu, Xiao-Yin, et al.
Pubblicazione: (2024)
di: Liu, Xiao-Yin, et al.
Pubblicazione: (2024)
When is Offline Policy Selection Sample Efficient for Reinforcement Learning?
di: Liu, Vincent, et al.
Pubblicazione: (2023)
di: Liu, Vincent, et al.
Pubblicazione: (2023)
Learning Action Embeddings for Off-Policy Evaluation
di: Cief, Matej, et al.
Pubblicazione: (2023)
di: Cief, Matej, et al.
Pubblicazione: (2023)
Shortcut Learning in Binary Classifier Black Boxes: Applications to Voice Anti-Spoofing and Biometrics
di: Sahidullah, Md, et al.
Pubblicazione: (2026)
di: Sahidullah, Md, et al.
Pubblicazione: (2026)
MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning
di: Guo, Yihong, et al.
Pubblicazione: (2025)
di: Guo, Yihong, et al.
Pubblicazione: (2025)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
di: Ackermann, Johannes, et al.
Pubblicazione: (2025)
di: Ackermann, Johannes, et al.
Pubblicazione: (2025)
Improving Numerical Stability of Normalized Mutual Information Estimator on High Dimensions
di: Tuononen, Marko, et al.
Pubblicazione: (2024)
di: Tuononen, Marko, et al.
Pubblicazione: (2024)
How Ensembles of Distilled Policies Improve Generalisation in Reinforcement Learning
di: Weltevrede, Max, et al.
Pubblicazione: (2025)
di: Weltevrede, Max, et al.
Pubblicazione: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Boosting Sample Efficiency and Generalization in Multi-agent Reinforcement Learning via Equivariance
di: McClellan, Joshua, et al.
Pubblicazione: (2024)
di: McClellan, Joshua, et al.
Pubblicazione: (2024)
Sample-Efficiency in Multi-Batch Reinforcement Learning: The Need for Dimension-Dependent Adaptivity
di: Johnson, Emmeran, et al.
Pubblicazione: (2023)
di: Johnson, Emmeran, et al.
Pubblicazione: (2023)
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
di: Melo, Luckeciano C., et al.
Pubblicazione: (2025)
di: Melo, Luckeciano C., et al.
Pubblicazione: (2025)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
di: Moradipari, Ahmadreza, et al.
Pubblicazione: (2023)
di: Moradipari, Ahmadreza, et al.
Pubblicazione: (2023)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
di: Nakanishi, Kosuke, et al.
Pubblicazione: (2025)
di: Nakanishi, Kosuke, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Online Adaptation for Enhancing Imitation Learning Policies
di: Malato, Federico, et al.
Pubblicazione: (2024) -
Zero-shot World Models via Search in Memory
di: Malato, Federico, et al.
Pubblicazione: (2025) -
Zero-shot Imitation Policy via Search in Demonstration Dataset
di: Malato, Federco, et al.
Pubblicazione: (2024) -
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
di: Goodall, Alexander W., et al.
Pubblicazione: (2025) -
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)