Pseudo-Quantized Actor-Critic Algorithm for Robustness to Noisy Temporal Difference Error
Fuente:
arXiv
Salvato in:
| Autore principale: | Kobayashi, Taisuke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Intentionally-underestimated Value Function at Terminal State for Temporal-difference Learning with Mis-designed Reward
di: Kobayashi, Taisuke
Pubblicazione: (2023)
di: Kobayashi, Taisuke
Pubblicazione: (2023)
Towards Autonomous Driving of Personal Mobility with Small and Noisy Dataset using Tsallis-statistics-based Behavioral Cloning
di: Kobayashi, Taisuke, et al.
Pubblicazione: (2021)
di: Kobayashi, Taisuke, et al.
Pubblicazione: (2021)
Weber-Fechner Law in Temporal Difference learning derived from Control as Inference
di: Takahashi, Keiichiro, et al.
Pubblicazione: (2024)
di: Takahashi, Keiichiro, et al.
Pubblicazione: (2024)
Flexible Empowerment at Reasoning with Extended Best-of-N Sampling
di: Kobayashi, Taisuke
Pubblicazione: (2026)
di: Kobayashi, Taisuke
Pubblicazione: (2026)
Revisiting Experience Replayable Conditions
di: Kobayashi, Taisuke
Pubblicazione: (2024)
di: Kobayashi, Taisuke
Pubblicazione: (2024)
Improvements of Dark Experience Replay and Reservoir Sampling towards Better Balance between Consolidation and Plasticity
di: Kobayashi, Taisuke
Pubblicazione: (2025)
di: Kobayashi, Taisuke
Pubblicazione: (2025)
DROP: Distributional and Regular Optimism and Pessimism for Reinforcement Learning
di: Kobayashi, Taisuke
Pubblicazione: (2024)
di: Kobayashi, Taisuke
Pubblicazione: (2024)
Consolidated Adaptive T-soft Update for Deep Reinforcement Learning
di: Kobayashi, Taisuke
Pubblicazione: (2022)
di: Kobayashi, Taisuke
Pubblicazione: (2022)
CubeDAgger: Interactive Imitation Learning for Dynamic Systems with Efficient yet Low-risk Interaction
di: Kobayashi, Taisuke
Pubblicazione: (2025)
di: Kobayashi, Taisuke
Pubblicazione: (2025)
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Compatible Gradient Approximations for Actor-Critic Algorithms
di: Saglam, Baturay, et al.
Pubblicazione: (2024)
di: Saglam, Baturay, et al.
Pubblicazione: (2024)
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
di: Panda, Prashansa, et al.
Pubblicazione: (2023)
di: Panda, Prashansa, et al.
Pubblicazione: (2023)
Value Improved Actor Critic Algorithms
di: Oren, Yaniv, et al.
Pubblicazione: (2024)
di: Oren, Yaniv, et al.
Pubblicazione: (2024)
Actor-Critic without Actor
di: Ki, Donghyeon, et al.
Pubblicazione: (2025)
di: Ki, Donghyeon, et al.
Pubblicazione: (2025)
Actor-Critic Algorithm for Dynamic Expectile and CVaR
di: Luo, Yudong, et al.
Pubblicazione: (2026)
di: Luo, Yudong, et al.
Pubblicazione: (2026)
A Theoretical Justification for Asymmetric Actor-Critic Algorithms
di: Lambrechts, Gaspard, et al.
Pubblicazione: (2025)
di: Lambrechts, Gaspard, et al.
Pubblicazione: (2025)
Improving Actor-Critic Training with Steerable Action-Value Approximation Errors
di: Tasdighi, Bahareh, et al.
Pubblicazione: (2024)
di: Tasdighi, Bahareh, et al.
Pubblicazione: (2024)
Variational Adaptive Noise and Dropout towards Stable Recurrent Neural Networks
di: Kobayashi, Taisuke, et al.
Pubblicazione: (2025)
di: Kobayashi, Taisuke, et al.
Pubblicazione: (2025)
Design of Restricted Normalizing Flow towards Arbitrary Stochastic Policy with Computational Efficiency
di: Kobayashi, Taisuke, et al.
Pubblicazione: (2024)
di: Kobayashi, Taisuke, et al.
Pubblicazione: (2024)
An Investigation of Batch Normalization in Off-Policy Actor-Critic Algorithms
di: Wang, Li, et al.
Pubblicazione: (2025)
di: Wang, Li, et al.
Pubblicazione: (2025)
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
D2 Actor Critic: Diffusion Actor Meets Distributional Critic
di: Zhang, Lunjun, et al.
Pubblicazione: (2025)
di: Zhang, Lunjun, et al.
Pubblicazione: (2025)
Actor-Critic Reinforcement Learning with Phased Actor
di: Wu, Ruofan, et al.
Pubblicazione: (2024)
di: Wu, Ruofan, et al.
Pubblicazione: (2024)
A Communication-Efficient Decentralized Actor-Critic Algorithm
di: Ren, Xiaoxing, et al.
Pubblicazione: (2025)
di: Ren, Xiaoxing, et al.
Pubblicazione: (2025)
Double Actor-Critic with TD Error-Driven Regularization in Reinforcement Learning
di: Chen, Haohui, et al.
Pubblicazione: (2024)
di: Chen, Haohui, et al.
Pubblicazione: (2024)
Generative Actor Critic
di: Qin, Aoyang, et al.
Pubblicazione: (2025)
di: Qin, Aoyang, et al.
Pubblicazione: (2025)
Noisy Spiking Actor Network for Exploration
di: Chen, Ding, et al.
Pubblicazione: (2024)
di: Chen, Ding, et al.
Pubblicazione: (2024)
Adviser-Actor-Critic: Eliminating Steady-State Error in Reinforcement Learning Control
di: Chen, Donghe, et al.
Pubblicazione: (2025)
di: Chen, Donghe, et al.
Pubblicazione: (2025)
DSAC-C: Constrained Maximum Entropy for Robust Discrete Soft-Actor Critic
di: Neo, Dexter, et al.
Pubblicazione: (2023)
di: Neo, Dexter, et al.
Pubblicazione: (2023)
Weak Convergence Analysis of Online Neural Actor-Critic Algorithms
di: Lam, Samuel Chun-Hei, et al.
Pubblicazione: (2024)
di: Lam, Samuel Chun-Hei, et al.
Pubblicazione: (2024)
A New Error Temporal Difference Algorithm for Deep Reinforcement Learning in Microgrid Optimization
di: Yao, Fulong, et al.
Pubblicazione: (2025)
di: Yao, Fulong, et al.
Pubblicazione: (2025)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
di: Kohler, Hector, et al.
Pubblicazione: (2023)
di: Kohler, Hector, et al.
Pubblicazione: (2023)
XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies
di: Palenicek, Daniel, et al.
Pubblicazione: (2026)
di: Palenicek, Daniel, et al.
Pubblicazione: (2026)
An Actor-Critic Algorithm with Function Approximation for Risk Sensitive Cost Markov Decision Processes
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
Efficient Exploration in Deep Reinforcement Learning: A Novel Bayesian Actor-Critic Algorithm
di: Rozanov, Nikolai
Pubblicazione: (2024)
di: Rozanov, Nikolai
Pubblicazione: (2024)
Novel Actor-Critic Algorithm for Robust Decision Making of CAV under Delays and Loss of V2X Data
di: Kherroubi, Zine el abidine
Pubblicazione: (2024)
di: Kherroubi, Zine el abidine
Pubblicazione: (2024)
Scaling Effects and Uncertainty Quantification in Neural Actor Critic Algorithms
di: Georgoudios, Nikos, et al.
Pubblicazione: (2026)
di: Georgoudios, Nikos, et al.
Pubblicazione: (2026)
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
di: de Lara, Nathan Samuel, et al.
Pubblicazione: (2026)
di: de Lara, Nathan Samuel, et al.
Pubblicazione: (2026)
Can Error Mitigation Improve Trainability of Noisy Variational Quantum Algorithms?
di: Wang, Samson, et al.
Pubblicazione: (2021)
di: Wang, Samson, et al.
Pubblicazione: (2021)
Risk-Sensitive Exponential Actor Critic
di: Granados, Alonso, et al.
Pubblicazione: (2026)
di: Granados, Alonso, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Intentionally-underestimated Value Function at Terminal State for Temporal-difference Learning with Mis-designed Reward
di: Kobayashi, Taisuke
Pubblicazione: (2023) -
Towards Autonomous Driving of Personal Mobility with Small and Noisy Dataset using Tsallis-statistics-based Behavioral Cloning
di: Kobayashi, Taisuke, et al.
Pubblicazione: (2021) -
Weber-Fechner Law in Temporal Difference learning derived from Control as Inference
di: Takahashi, Keiichiro, et al.
Pubblicazione: (2024) -
Flexible Empowerment at Reasoning with Extended Best-of-N Sampling
di: Kobayashi, Taisuke
Pubblicazione: (2026) -
Revisiting Experience Replayable Conditions
di: Kobayashi, Taisuke
Pubblicazione: (2024)