Turning Sand to Gold: Recycling Data to Bridge On-Policy and Off-Policy Learning via Causal Bound
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fiskus, Tal, Shaham, Uri |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Unsupervised Ensemble Learning Through Deep Energy-based Models
von: Maymon, Ariel, et al.
Veröffentlicht: (2026)
von: Maymon, Ariel, et al.
Veröffentlicht: (2026)
A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs
von: Shtossel, Erel, et al.
Veröffentlicht: (2026)
von: Shtossel, Erel, et al.
Veröffentlicht: (2026)
Zero-Shot Off-Policy Learning
von: Asadulaev, Arip, et al.
Veröffentlicht: (2026)
von: Asadulaev, Arip, et al.
Veröffentlicht: (2026)
Automated Off-Policy Estimator Selection via Supervised Learning
von: Felicioni, Nicolò, et al.
Veröffentlicht: (2024)
von: Felicioni, Nicolò, et al.
Veröffentlicht: (2024)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
Learning Action Embeddings for Off-Policy Evaluation
von: Cief, Matej, et al.
Veröffentlicht: (2023)
von: Cief, Matej, et al.
Veröffentlicht: (2023)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
von: Lee, Haanvid, et al.
Veröffentlicht: (2024)
von: Lee, Haanvid, et al.
Veröffentlicht: (2024)
The Impact of Off-Policy Training Data on Probe Generalisation
von: Kirch, Nathalie, et al.
Veröffentlicht: (2025)
von: Kirch, Nathalie, et al.
Veröffentlicht: (2025)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
von: Meng, Wenjia, et al.
Veröffentlicht: (2024)
von: Meng, Wenjia, et al.
Veröffentlicht: (2024)
Policy Learning for Off-Dynamics RL with Deficient Support
von: Van, Linh Le Pham, et al.
Veröffentlicht: (2024)
von: Van, Linh Le Pham, et al.
Veröffentlicht: (2024)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
von: Zhang, Wenhao, et al.
Veröffentlicht: (2025)
von: Zhang, Wenhao, et al.
Veröffentlicht: (2025)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
von: Goodall, Alexander W., et al.
Veröffentlicht: (2025)
von: Goodall, Alexander W., et al.
Veröffentlicht: (2025)
ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization
von: Ji, Tianying, et al.
Veröffentlicht: (2024)
von: Ji, Tianying, et al.
Veröffentlicht: (2024)
Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead
von: Koren, Uri, et al.
Veröffentlicht: (2025)
von: Koren, Uri, et al.
Veröffentlicht: (2025)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
von: Cohen, Taco, et al.
Veröffentlicht: (2025)
von: Cohen, Taco, et al.
Veröffentlicht: (2025)
CausalGDP: Causality-Guided Diffusion Policies for Reinforcement Learning
von: Xiao, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Xiao, Xiaofeng, et al.
Veröffentlicht: (2026)
Clustering Context in Off-Policy Evaluation
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025)
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025)
Concept-driven Off Policy Evaluation
von: Majumdar, Ritam, et al.
Veröffentlicht: (2024)
von: Majumdar, Ritam, et al.
Veröffentlicht: (2024)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025)
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
von: Palenicek, Daniel, et al.
Veröffentlicht: (2025)
von: Palenicek, Daniel, et al.
Veröffentlicht: (2025)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
von: Aouali, Imad, et al.
Veröffentlicht: (2024)
von: Aouali, Imad, et al.
Veröffentlicht: (2024)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
von: Zhuang, Yuan, et al.
Veröffentlicht: (2026)
von: Zhuang, Yuan, et al.
Veröffentlicht: (2026)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
von: Romeo, Carlo, et al.
Veröffentlicht: (2026)
von: Romeo, Carlo, et al.
Veröffentlicht: (2026)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
Learning by Doing: An Online Causal Reinforcement Learning Framework with Causal-Aware Policy
von: Cai, Ruichu, et al.
Veröffentlicht: (2024)
von: Cai, Ruichu, et al.
Veröffentlicht: (2024)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
von: Fakoor, Rasool, et al.
Veröffentlicht: (2026)
von: Fakoor, Rasool, et al.
Veröffentlicht: (2026)
Learning to Reason under Off-Policy Guidance
von: Yan, Jianhao, et al.
Veröffentlicht: (2025)
von: Yan, Jianhao, et al.
Veröffentlicht: (2025)
Pessimistic Off-Policy Optimization for Learning to Rank
von: Cief, Matej, et al.
Veröffentlicht: (2022)
von: Cief, Matej, et al.
Veröffentlicht: (2022)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
von: Sen, Sayambhu, et al.
Veröffentlicht: (2025)
von: Sen, Sayambhu, et al.
Veröffentlicht: (2025)
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
von: Li, Chenliang, et al.
Veröffentlicht: (2025)
von: Li, Chenliang, et al.
Veröffentlicht: (2025)
Deep Causal Behavioral Policy Learning: Applications to Healthcare
von: Knecht, Jonas, et al.
Veröffentlicht: (2025)
von: Knecht, Jonas, et al.
Veröffentlicht: (2025)
Learning Nonlinear Causal Reductions to Explain Reinforcement Learning Policies
von: Kekić, Armin, et al.
Veröffentlicht: (2025)
von: Kekić, Armin, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation and Learning for Survival Outcomes under Censoring
von: Kubota, Kohsuke, et al.
Veröffentlicht: (2026)
von: Kubota, Kohsuke, et al.
Veröffentlicht: (2026)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
von: Liu, Zeyuan, et al.
Veröffentlicht: (2026)
von: Liu, Zeyuan, et al.
Veröffentlicht: (2026)
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
von: Li, Xiang, et al.
Veröffentlicht: (2026)
von: Li, Xiang, et al.
Veröffentlicht: (2026)
Analysis of Off-Policy $n$-Step TD-Learning with Linear Function Approximation
von: Lim, Han-Dong, et al.
Veröffentlicht: (2025)
von: Lim, Han-Dong, et al.
Veröffentlicht: (2025)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
von: Zhou, Hongyi, et al.
Veröffentlicht: (2025)
von: Zhou, Hongyi, et al.
Veröffentlicht: (2025)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
von: Shen, Guobin, et al.
Veröffentlicht: (2026)
von: Shen, Guobin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Unsupervised Ensemble Learning Through Deep Energy-based Models
von: Maymon, Ariel, et al.
Veröffentlicht: (2026) -
A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs
von: Shtossel, Erel, et al.
Veröffentlicht: (2026) -
Zero-Shot Off-Policy Learning
von: Asadulaev, Arip, et al.
Veröffentlicht: (2026) -
Automated Off-Policy Estimator Selection via Supervised Learning
von: Felicioni, Nicolò, et al.
Veröffentlicht: (2024) -
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
von: Xiao, Teng, et al.
Veröffentlicht: (2024)