SALE-Based Offline Reinforcement Learning with Ensemble Q-Networks
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Chun, Zheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation
par: Osman, Asim, et autres
Publié: (2026)
par: Osman, Asim, et autres
Publié: (2026)
Autonomous AI Agents for Real-Time Affordable Housing Site Selection: Multi-Objective Reinforcement Learning Under Regulatory Constraints
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning
par: Hu, Yuelin, et autres
Publié: (2026)
par: Hu, Yuelin, et autres
Publié: (2026)
SafeRL-Lite: A Lightweight, Explainable, and Constrained Reinforcement Learning Library
par: Mishra, Satyam, et autres
Publié: (2025)
par: Mishra, Satyam, et autres
Publié: (2025)
GoldenStart: Q-Guided Priors and Entropy Control for Distilling Flow Policies
par: Zhang, He, et autres
Publié: (2026)
par: Zhang, He, et autres
Publié: (2026)
Multi-level meta-reinforcement learning with skill-based curriculum
par: Yang, Sichen, et autres
Publié: (2026)
par: Yang, Sichen, et autres
Publié: (2026)
Foundation Models as World Models: A Foundational Study in Text-Based GridWorlds
par: Sasso, Remo, et autres
Publié: (2025)
par: Sasso, Remo, et autres
Publié: (2025)
A New Modeling to Feature Selection Based on the Fuzzy Rough Set Theory in Normal and Optimistic States on Hybrid Information Systems
par: Safarpour, Mohammad Hossein, et autres
Publié: (2026)
par: Safarpour, Mohammad Hossein, et autres
Publié: (2026)
Exploration with Foundation Models: Capabilities, Limitations, and Hybrid Approaches
par: Sasso, Remo, et autres
Publié: (2025)
par: Sasso, Remo, et autres
Publié: (2025)
RoboMoRe: LLM-based Robot Co-design via Joint Optimization of Morphology and Reward
par: Fang, Jiawei, et autres
Publié: (2025)
par: Fang, Jiawei, et autres
Publié: (2025)
Active perception and disentangled representations allow continual, episodic zero and few-shot learning
par: Rawlinson, David, et autres
Publié: (2026)
par: Rawlinson, David, et autres
Publié: (2026)
SMOSE: Sparse Mixture of Shallow Experts for Interpretable Reinforcement Learning in Continuous Control Tasks
par: Vincze, Mátyás, et autres
Publié: (2024)
par: Vincze, Mátyás, et autres
Publié: (2024)
A Comparison Between Decision Transformers and Traditional Offline Reinforcement Learning Algorithms
par: Caunhye, Ali Murtaza, et autres
Publié: (2025)
par: Caunhye, Ali Murtaza, et autres
Publié: (2025)
Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training
par: Gu, Zhengyao, et autres
Publié: (2026)
par: Gu, Zhengyao, et autres
Publié: (2026)
Strategizing Equitable Transit Evacuations: A Data-Driven Reinforcement Learning Approach
par: Tang, Fang, et autres
Publié: (2024)
par: Tang, Fang, et autres
Publié: (2024)
Evolving machine learning workflows through interactive AutoML
par: Barbudo, Rafael, et autres
Publié: (2024)
par: Barbudo, Rafael, et autres
Publié: (2024)
Active Causal Experimentalist (ACE): Learning Intervention Strategies via Direct Preference Optimization
par: Cooper, Patrick, et autres
Publié: (2026)
par: Cooper, Patrick, et autres
Publié: (2026)
An Improved Adaptive PID Optimizer with Enhanced Convergence and Stability for Deep Learning
par: Saini, Saurabh, et autres
Publié: (2026)
par: Saini, Saurabh, et autres
Publié: (2026)
Bayesian Conservative Policy Optimization (BCPO): A Novel Uncertainty-Calibrated Offline Reinforcement Learning with Credible Lower Bounds
par: Chatterjee, Debashis
Publié: (2026)
par: Chatterjee, Debashis
Publié: (2026)
From Imitation to Interaction: Mastering Game of Schnapsen with Shallow Reinforcement Learning
par: Klačan, Ján, et autres
Publié: (2026)
par: Klačan, Ján, et autres
Publié: (2026)
Communicating Plans, Not Percepts: Scalable Multi-Agent Coordination with Embodied World Models
par: Hill, Brennen A., et autres
Publié: (2025)
par: Hill, Brennen A., et autres
Publié: (2025)
The Mirror Loop: Recursive Non-Convergence in Generative Reasoning Systems
par: DeVilling, Bentley
Publié: (2025)
par: DeVilling, Bentley
Publié: (2025)
Robustness of Reinforcement Learning-Based Traffic Signal Control under Incidents: A Comparative Study
par: Nguyen, Dang Viet Anh, et autres
Publié: (2025)
par: Nguyen, Dang Viet Anh, et autres
Publié: (2025)
Streaming Continual Learning for Unified Adaptive Intelligence in Dynamic Environments
par: Giannini, Federico, et autres
Publié: (2026)
par: Giannini, Federico, et autres
Publié: (2026)
Prediction-Based Markov Violation Scores for Detecting Non-Markovian Observations in Reinforcement Learning
par: Mysore, Naveen
Publié: (2026)
par: Mysore, Naveen
Publié: (2026)
Statistical Guarantees for Lifelong Reinforcement Learning using PAC-Bayes Theory
par: Zhang, Zhi, et autres
Publié: (2024)
par: Zhang, Zhi, et autres
Publié: (2024)
Amazon Locker Capacity Management
par: Sethuraman, Samyukta, et autres
Publié: (2023)
par: Sethuraman, Samyukta, et autres
Publié: (2023)
Maximum Entropy Relaxation of Multi-Way Cardinality Constraints for Synthetic Population Generation
par: Pachet, François, et autres
Publié: (2026)
par: Pachet, François, et autres
Publié: (2026)
A Survey of Reinforcement Learning for Optimization in Automation
par: Farooq, Ahmad, et autres
Publié: (2025)
par: Farooq, Ahmad, et autres
Publié: (2025)
AI Agents: Evolution, Architecture, and Real-World Applications
par: Krishnan, Naveen
Publié: (2025)
par: Krishnan, Naveen
Publié: (2025)
Adaptive Minds: Empowering Agents with LoRA-as-Tools
par: Shekar, Pavan C, et autres
Publié: (2025)
par: Shekar, Pavan C, et autres
Publié: (2025)
Necessary and Sufficient Conditions for Optimal Decision Trees using Dynamic Programming
par: van der Linden, Jacobus G. M., et autres
Publié: (2023)
par: van der Linden, Jacobus G. M., et autres
Publié: (2023)
Efficient Contextual Preferential Bayesian Optimization with Historical Examples
par: Khan, Farha A., et autres
Publié: (2022)
par: Khan, Farha A., et autres
Publié: (2022)
A Structural Threshold in Decision Capacity Governs Collapse in Self-Play Reinforcement Learning
par: Kujur, Arahan
Publié: (2026)
par: Kujur, Arahan
Publié: (2026)
Can a Bayesian Oracle Prevent Harm from an Agent?
par: Bengio, Yoshua, et autres
Publié: (2024)
par: Bengio, Yoshua, et autres
Publié: (2024)
Learning coordinated badminton skills for legged manipulators
par: Ma, Yuntao, et autres
Publié: (2025)
par: Ma, Yuntao, et autres
Publié: (2025)
Connectivity-Aware Representations for Constrained Motion Planning via Multi-Scale Contrastive Learning
par: Jeon, Suhyun, et autres
Publié: (2026)
par: Jeon, Suhyun, et autres
Publié: (2026)
Machine Learning Algorithms for Improving Black Box Optimization Solvers
par: Kimiaei, Morteza, et autres
Publié: (2025)
par: Kimiaei, Morteza, et autres
Publié: (2025)
Safe Reinforcement Learning with Preference-based Constraint Inference
par: Li, Chenglin, et autres
Publié: (2026)
par: Li, Chenglin, et autres
Publié: (2026)
Diffusion-MPC in Discrete Domains: Feasibility Constraints, Horizon Effects, and Critic Alignment: Case study with Tetris
par: Wang, Haochuan Kevin
Publié: (2026)
par: Wang, Haochuan Kevin
Publié: (2026)
Documents similaires
-
Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation
par: Osman, Asim, et autres
Publié: (2026) -
Autonomous AI Agents for Real-Time Affordable Housing Site Selection: Multi-Objective Reinforcement Learning Under Regulatory Constraints
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026) -
Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning
par: Hu, Yuelin, et autres
Publié: (2026) -
SafeRL-Lite: A Lightweight, Explainable, and Constrained Reinforcement Learning Library
par: Mishra, Satyam, et autres
Publié: (2025) -
GoldenStart: Q-Guided Priors and Entropy Control for Distilling Flow Policies
par: Zhang, He, et autres
Publié: (2026)