Guardado en:
| Autores principales: | Malato, Federico, Hautamaki, Ville |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.01558 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Online Adaptation for Enhancing Imitation Learning Policies
por: Malato, Federico, et al.
Publicado: (2024)
por: Malato, Federico, et al.
Publicado: (2024)
Zero-shot World Models via Search in Memory
por: Malato, Federico, et al.
Publicado: (2025)
por: Malato, Federico, et al.
Publicado: (2025)
Zero-shot Imitation Policy via Search in Demonstration Dataset
por: Malato, Federco, et al.
Publicado: (2024)
por: Malato, Federco, et al.
Publicado: (2024)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
por: Goodall, Alexander W., et al.
Publicado: (2025)
por: Goodall, Alexander W., et al.
Publicado: (2025)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
por: Zhou, Hongyi, et al.
Publicado: (2025)
por: Zhou, Hongyi, et al.
Publicado: (2025)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
por: Lee, Haanvid, et al.
Publicado: (2024)
por: Lee, Haanvid, et al.
Publicado: (2024)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
por: Palenicek, Daniel, et al.
Publicado: (2025)
por: Palenicek, Daniel, et al.
Publicado: (2025)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
por: Zhuang, Yuan, et al.
Publicado: (2026)
por: Zhuang, Yuan, et al.
Publicado: (2026)
Automated Off-Policy Estimator Selection via Supervised Learning
por: Felicioni, Nicolò, et al.
Publicado: (2024)
por: Felicioni, Nicolò, et al.
Publicado: (2024)
Sample Complexity Reduction via Policy Difference Estimation in Tabular Reinforcement Learning
por: Narang, Adhyyan, et al.
Publicado: (2024)
por: Narang, Adhyyan, et al.
Publicado: (2024)
On the Sample Efficiency of Abstractions and Potential-Based Reward Shaping in Reinforcement Learning
por: Canonaco, Giuseppe, et al.
Publicado: (2024)
por: Canonaco, Giuseppe, et al.
Publicado: (2024)
COSBO: Conservative Offline Simulation-Based Policy Optimization
por: Kargar, Eshagh, et al.
Publicado: (2024)
por: Kargar, Eshagh, et al.
Publicado: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
por: Kang, Hyungkyu, et al.
Publicado: (2025)
por: Kang, Hyungkyu, et al.
Publicado: (2025)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
por: Kiyohara, Haruka, et al.
Publicado: (2023)
por: Kiyohara, Haruka, et al.
Publicado: (2023)
Frugal Actor-Critic: Sample Efficient Off-Policy Deep Reinforcement Learning Using Unique Experiences
por: Singh, Nikhil Kumar, et al.
Publicado: (2024)
por: Singh, Nikhil Kumar, et al.
Publicado: (2024)
Zero-Shot Off-Policy Learning
por: Asadulaev, Arip, et al.
Publicado: (2026)
por: Asadulaev, Arip, et al.
Publicado: (2026)
Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective
por: Duan, Tianyang, et al.
Publicado: (2025)
por: Duan, Tianyang, et al.
Publicado: (2025)
Sample Complexity of Distributionally Robust Off-Dynamics Reinforcement Learning with Online Interaction
por: He, Yiting, et al.
Publicado: (2025)
por: He, Yiting, et al.
Publicado: (2025)
Off-Policy Correction For Multi-Agent Reinforcement Learning
por: Zawalski, Michał, et al.
Publicado: (2021)
por: Zawalski, Michał, et al.
Publicado: (2021)
Regret-Based Defense in Adversarial Reinforcement Learning
por: Belaire, Roman, et al.
Publicado: (2023)
por: Belaire, Roman, et al.
Publicado: (2023)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
por: Zhang, Wenhao, et al.
Publicado: (2025)
por: Zhang, Wenhao, et al.
Publicado: (2025)
CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms
por: Yenicesu, Arda Sarp, et al.
Publicado: (2024)
por: Yenicesu, Arda Sarp, et al.
Publicado: (2024)
Subgoal-based Reward Shaping to Improve Efficiency in Reinforcement Learning
por: Okudo, Takato, et al.
Publicado: (2021)
por: Okudo, Takato, et al.
Publicado: (2021)
A Generalized Projected Bellman Error for Off-policy Value Estimation in Reinforcement Learning
por: Patterson, Andrew, et al.
Publicado: (2021)
por: Patterson, Andrew, et al.
Publicado: (2021)
MGAS: Multi-Granularity Architecture Search for Trade-Off Between Model Effectiveness and Efficiency
por: Liu, Xiaoyun, et al.
Publicado: (2023)
por: Liu, Xiaoyun, et al.
Publicado: (2023)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
por: Liu, Xiao-Yin, et al.
Publicado: (2024)
por: Liu, Xiao-Yin, et al.
Publicado: (2024)
When is Offline Policy Selection Sample Efficient for Reinforcement Learning?
por: Liu, Vincent, et al.
Publicado: (2023)
por: Liu, Vincent, et al.
Publicado: (2023)
Learning Action Embeddings for Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2023)
por: Cief, Matej, et al.
Publicado: (2023)
Shortcut Learning in Binary Classifier Black Boxes: Applications to Voice Anti-Spoofing and Biometrics
por: Sahidullah, Md, et al.
Publicado: (2026)
por: Sahidullah, Md, et al.
Publicado: (2026)
MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning
por: Guo, Yihong, et al.
Publicado: (2025)
por: Guo, Yihong, et al.
Publicado: (2025)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
por: Ackermann, Johannes, et al.
Publicado: (2025)
por: Ackermann, Johannes, et al.
Publicado: (2025)
Improving Numerical Stability of Normalized Mutual Information Estimator on High Dimensions
por: Tuononen, Marko, et al.
Publicado: (2024)
por: Tuononen, Marko, et al.
Publicado: (2024)
How Ensembles of Distilled Policies Improve Generalisation in Reinforcement Learning
por: Weltevrede, Max, et al.
Publicado: (2025)
por: Weltevrede, Max, et al.
Publicado: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Boosting Sample Efficiency and Generalization in Multi-agent Reinforcement Learning via Equivariance
por: McClellan, Joshua, et al.
Publicado: (2024)
por: McClellan, Joshua, et al.
Publicado: (2024)
Sample-Efficiency in Multi-Batch Reinforcement Learning: The Need for Dimension-Dependent Adaptivity
por: Johnson, Emmeran, et al.
Publicado: (2023)
por: Johnson, Emmeran, et al.
Publicado: (2023)
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
por: Melo, Luckeciano C., et al.
Publicado: (2025)
por: Melo, Luckeciano C., et al.
Publicado: (2025)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
por: Moradipari, Ahmadreza, et al.
Publicado: (2023)
por: Moradipari, Ahmadreza, et al.
Publicado: (2023)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
por: Nakanishi, Kosuke, et al.
Publicado: (2025)
por: Nakanishi, Kosuke, et al.
Publicado: (2025)
Ejemplares similares
-
Online Adaptation for Enhancing Imitation Learning Policies
por: Malato, Federico, et al.
Publicado: (2024) -
Zero-shot World Models via Search in Memory
por: Malato, Federico, et al.
Publicado: (2025) -
Zero-shot Imitation Policy via Search in Demonstration Dataset
por: Malato, Federco, et al.
Publicado: (2024) -
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
por: Goodall, Alexander W., et al.
Publicado: (2025) -
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
por: Xiao, Teng, et al.
Publicado: (2024)