Soft $Q(λ)$: A multi-step off-policy method for entropy regularised reinforcement learning using eligibility traces
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mahajan, Pranav, Seymour, Ben |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Counterfactual experience augmented off-policy reinforcement learning
von: Lee, Sunbowen, et al.
Veröffentlicht: (2025)
von: Lee, Sunbowen, et al.
Veröffentlicht: (2025)
Ensemble Elastic DQN: A novel multi-step ensemble approach to address overestimation in deep value-based reinforcement learning
von: Ly, Adrian, et al.
Veröffentlicht: (2025)
von: Ly, Adrian, et al.
Veröffentlicht: (2025)
A step toward a reinforcement learning de novo genome assembler
von: Padovani, Kleber, et al.
Veröffentlicht: (2021)
von: Padovani, Kleber, et al.
Veröffentlicht: (2021)
Convergence of a model-free entropy-regularized inverse reinforcement learning algorithm
von: Renard, Titouan, et al.
Veröffentlicht: (2024)
von: Renard, Titouan, et al.
Veröffentlicht: (2024)
Robust off-policy Reinforcement Learning via Soft Constrained Adversary
von: Nakanishi, Kosuke, et al.
Veröffentlicht: (2024)
von: Nakanishi, Kosuke, et al.
Veröffentlicht: (2024)
An advantage based policy transfer algorithm for reinforcement learning with measures of transferability
von: Alam, Md Ferdous, et al.
Veröffentlicht: (2023)
von: Alam, Md Ferdous, et al.
Veröffentlicht: (2023)
Affect and Effect: Limitations of regularisation-based continual learning in EEG-based emotion classification
von: Peire, Nina, et al.
Veröffentlicht: (2026)
von: Peire, Nina, et al.
Veröffentlicht: (2026)
The impact of behavioral diversity in multi-agent reinforcement learning
von: Bettini, Matteo, et al.
Veröffentlicht: (2024)
von: Bettini, Matteo, et al.
Veröffentlicht: (2024)
The challenge of hidden gifts in multi-agent reinforcement learning
von: Malenfant, Dane, et al.
Veröffentlicht: (2025)
von: Malenfant, Dane, et al.
Veröffentlicht: (2025)
Bridging the phenotype-target gap for molecular generation via multi-objective reinforcement learning
von: Guo, Haotian, et al.
Veröffentlicht: (2025)
von: Guo, Haotian, et al.
Veröffentlicht: (2025)
SACn: Soft Actor-Critic with n-step Returns
von: Łyskawa, Jakub, et al.
Veröffentlicht: (2025)
von: Łyskawa, Jakub, et al.
Veröffentlicht: (2025)
Boosting Soft Q-Learning by Bounding
von: Adamczyk, Jacob, et al.
Veröffentlicht: (2024)
von: Adamczyk, Jacob, et al.
Veröffentlicht: (2024)
Adaptive traffic signal safety and efficiency improvement by multi objective deep reinforcement learning approach
von: Mirbakhsh, Shahin, et al.
Veröffentlicht: (2024)
von: Mirbakhsh, Shahin, et al.
Veröffentlicht: (2024)
Estimating unknown parameters in differential equations with a reinforcement learning based PSO method
von: Sun, Wenkui, et al.
Veröffentlicht: (2024)
von: Sun, Wenkui, et al.
Veröffentlicht: (2024)
Normalization and effective learning rates in reinforcement learning
von: Lyle, Clare, et al.
Veröffentlicht: (2024)
von: Lyle, Clare, et al.
Veröffentlicht: (2024)
Data-driven simulator of multi-animal behavior with unknown dynamics via offline and online reinforcement learning
von: Fujii, Keisuke, et al.
Veröffentlicht: (2025)
von: Fujii, Keisuke, et al.
Veröffentlicht: (2025)
Application of linear regression and quasi-Newton methods to the deep reinforcement learning in continuous action cases
von: Komatsu, Hisato
Veröffentlicht: (2025)
von: Komatsu, Hisato
Veröffentlicht: (2025)
Finite time analysis of temporal difference learning with linear function approximation: Tail averaging and regularisation
von: Patil, Gandharv, et al.
Veröffentlicht: (2022)
von: Patil, Gandharv, et al.
Veröffentlicht: (2022)
Curriculum reinforcement learning with measurable task representation learning
von: Wen, Yongyan, et al.
Veröffentlicht: (2026)
von: Wen, Yongyan, et al.
Veröffentlicht: (2026)
Automating proton PBS treatment planning for head and neck cancers using policy gradient-based deep reinforcement learning
von: Wang, Qingqing, et al.
Veröffentlicht: (2024)
von: Wang, Qingqing, et al.
Veröffentlicht: (2024)
Deep reinforcement learning for irrigation scheduling using high-dimensional sensor feedback
von: Saikai, Yuji, et al.
Veröffentlicht: (2023)
von: Saikai, Yuji, et al.
Veröffentlicht: (2023)
Improving the classification of extreme classes by means of loss regularisation and generalised beta distributions
von: Vargas, Víctor Manuel, et al.
Veröffentlicht: (2024)
von: Vargas, Víctor Manuel, et al.
Veröffentlicht: (2024)
Reinforcement Learning in hyperbolic space for multi-step reasoning
von: Xu, Tao, et al.
Veröffentlicht: (2025)
von: Xu, Tao, et al.
Veröffentlicht: (2025)
Towards efficient representation identification in supervised learning
von: Ahuja, Kartik, et al.
Veröffentlicht: (2022)
von: Ahuja, Kartik, et al.
Veröffentlicht: (2022)
Deep reinforcement learning-based spacecraft attitude control with pointing keep-out constraint
von: Yang, Juntang, et al.
Veröffentlicht: (2025)
von: Yang, Juntang, et al.
Veröffentlicht: (2025)
Deep Double Q-learning
von: Nagarajan, Prabhat, et al.
Veröffentlicht: (2025)
von: Nagarajan, Prabhat, et al.
Veröffentlicht: (2025)
APF+: Boosting adaptive-potential function reinforcement learning methods with a W-shaped network for high-dimensional games
von: Chen, Yifei, et al.
Veröffentlicht: (2025)
von: Chen, Yifei, et al.
Veröffentlicht: (2025)
Quantile deep learning models for multi-step ahead time series prediction
von: Cheung, Jimmy, et al.
Veröffentlicht: (2024)
von: Cheung, Jimmy, et al.
Veröffentlicht: (2024)
Delayed homomorphic reinforcement learning for environments with delayed feedback
von: Lee, Jongsoo, et al.
Veröffentlicht: (2026)
von: Lee, Jongsoo, et al.
Veröffentlicht: (2026)
Autonomous navigation of catheters and guidewires in mechanical thrombectomy using inverse reinforcement learning
von: Robertshaw, Harry, et al.
Veröffentlicht: (2024)
von: Robertshaw, Harry, et al.
Veröffentlicht: (2024)
Causal prompting model-based offline reinforcement learning
von: Yu, Xuehui, et al.
Veröffentlicht: (2024)
von: Yu, Xuehui, et al.
Veröffentlicht: (2024)
Deep reinforcement learning with time-scale invariant memory
von: Kabir, Md Rysul, et al.
Veröffentlicht: (2024)
von: Kabir, Md Rysul, et al.
Veröffentlicht: (2024)
Offline reinforcement learning for job-shop scheduling problems
von: Echeverria, Imanol, et al.
Veröffentlicht: (2024)
von: Echeverria, Imanol, et al.
Veröffentlicht: (2024)
Bellman operator convergence enhancements in reinforcement learning algorithms
von: Kadurha, David Krame, et al.
Veröffentlicht: (2025)
von: Kadurha, David Krame, et al.
Veröffentlicht: (2025)
Multi-Objective Constraint Inference using Inverse reinforcement learning
von: Shah, Syed Ihtesham Hussain, et al.
Veröffentlicht: (2026)
von: Shah, Syed Ihtesham Hussain, et al.
Veröffentlicht: (2026)
MinMaxMin $Q$-learning
von: Soffair, Nitsan, et al.
Veröffentlicht: (2024)
von: Soffair, Nitsan, et al.
Veröffentlicht: (2024)
Is Q-learning an Ill-posed Problem?
von: Wissmann, Philipp, et al.
Veröffentlicht: (2025)
von: Wissmann, Philipp, et al.
Veröffentlicht: (2025)
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
von: Putta, Pranav, et al.
Veröffentlicht: (2024)
von: Putta, Pranav, et al.
Veröffentlicht: (2024)
Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
von: Kang, Hyeongyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyeongyu, et al.
Veröffentlicht: (2025)
Not all tokens are needed(NAT): token efficient reinforcement learning
von: Sang, Hejian, et al.
Veröffentlicht: (2026)
von: Sang, Hejian, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Counterfactual experience augmented off-policy reinforcement learning
von: Lee, Sunbowen, et al.
Veröffentlicht: (2025) -
Ensemble Elastic DQN: A novel multi-step ensemble approach to address overestimation in deep value-based reinforcement learning
von: Ly, Adrian, et al.
Veröffentlicht: (2025) -
A step toward a reinforcement learning de novo genome assembler
von: Padovani, Kleber, et al.
Veröffentlicht: (2021) -
Convergence of a model-free entropy-regularized inverse reinforcement learning algorithm
von: Renard, Titouan, et al.
Veröffentlicht: (2024) -
Robust off-policy Reinforcement Learning via Soft Constrained Adversary
von: Nakanishi, Kosuke, et al.
Veröffentlicht: (2024)