Enregistré dans:
| Auteur principal: | Kobayashi, Taisuke |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.01613 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Intentionally-underestimated Value Function at Terminal State for Temporal-difference Learning with Mis-designed Reward
par: Kobayashi, Taisuke
Publié: (2023)
par: Kobayashi, Taisuke
Publié: (2023)
Towards Autonomous Driving of Personal Mobility with Small and Noisy Dataset using Tsallis-statistics-based Behavioral Cloning
par: Kobayashi, Taisuke, et autres
Publié: (2021)
par: Kobayashi, Taisuke, et autres
Publié: (2021)
Weber-Fechner Law in Temporal Difference learning derived from Control as Inference
par: Takahashi, Keiichiro, et autres
Publié: (2024)
par: Takahashi, Keiichiro, et autres
Publié: (2024)
Flexible Empowerment at Reasoning with Extended Best-of-N Sampling
par: Kobayashi, Taisuke
Publié: (2026)
par: Kobayashi, Taisuke
Publié: (2026)
Revisiting Experience Replayable Conditions
par: Kobayashi, Taisuke
Publié: (2024)
par: Kobayashi, Taisuke
Publié: (2024)
Improvements of Dark Experience Replay and Reservoir Sampling towards Better Balance between Consolidation and Plasticity
par: Kobayashi, Taisuke
Publié: (2025)
par: Kobayashi, Taisuke
Publié: (2025)
DROP: Distributional and Regular Optimism and Pessimism for Reinforcement Learning
par: Kobayashi, Taisuke
Publié: (2024)
par: Kobayashi, Taisuke
Publié: (2024)
Consolidated Adaptive T-soft Update for Deep Reinforcement Learning
par: Kobayashi, Taisuke
Publié: (2022)
par: Kobayashi, Taisuke
Publié: (2022)
CubeDAgger: Interactive Imitation Learning for Dynamic Systems with Efficient yet Low-risk Interaction
par: Kobayashi, Taisuke
Publié: (2025)
par: Kobayashi, Taisuke
Publié: (2025)
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
par: Satheesh, Anirudh, et autres
Publié: (2025)
par: Satheesh, Anirudh, et autres
Publié: (2025)
Value Improved Actor Critic Algorithms
par: Oren, Yaniv, et autres
Publié: (2024)
par: Oren, Yaniv, et autres
Publié: (2024)
Compatible Gradient Approximations for Actor-Critic Algorithms
par: Saglam, Baturay, et autres
Publié: (2024)
par: Saglam, Baturay, et autres
Publié: (2024)
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
par: Panda, Prashansa, et autres
Publié: (2023)
par: Panda, Prashansa, et autres
Publié: (2023)
Variational Adaptive Noise and Dropout towards Stable Recurrent Neural Networks
par: Kobayashi, Taisuke, et autres
Publié: (2025)
par: Kobayashi, Taisuke, et autres
Publié: (2025)
Design of Restricted Normalizing Flow towards Arbitrary Stochastic Policy with Computational Efficiency
par: Kobayashi, Taisuke, et autres
Publié: (2024)
par: Kobayashi, Taisuke, et autres
Publié: (2024)
Actor-Critic without Actor
par: Ki, Donghyeon, et autres
Publié: (2025)
par: Ki, Donghyeon, et autres
Publié: (2025)
Actor-Critic Algorithm for Dynamic Expectile and CVaR
par: Luo, Yudong, et autres
Publié: (2026)
par: Luo, Yudong, et autres
Publié: (2026)
A Theoretical Justification for Asymmetric Actor-Critic Algorithms
par: Lambrechts, Gaspard, et autres
Publié: (2025)
par: Lambrechts, Gaspard, et autres
Publié: (2025)
Improving Actor-Critic Training with Steerable Action-Value Approximation Errors
par: Tasdighi, Bahareh, et autres
Publié: (2024)
par: Tasdighi, Bahareh, et autres
Publié: (2024)
An Investigation of Batch Normalization in Off-Policy Actor-Critic Algorithms
par: Wang, Li, et autres
Publié: (2025)
par: Wang, Li, et autres
Publié: (2025)
A Communication-Efficient Decentralized Actor-Critic Algorithm
par: Ren, Xiaoxing, et autres
Publié: (2025)
par: Ren, Xiaoxing, et autres
Publié: (2025)
Actor-Critic Reinforcement Learning with Phased Actor
par: Wu, Ruofan, et autres
Publié: (2024)
par: Wu, Ruofan, et autres
Publié: (2024)
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
par: Bhatnagar, Shalabh, et autres
Publié: (2022)
par: Bhatnagar, Shalabh, et autres
Publié: (2022)
D2 Actor Critic: Diffusion Actor Meets Distributional Critic
par: Zhang, Lunjun, et autres
Publié: (2025)
par: Zhang, Lunjun, et autres
Publié: (2025)
Double Actor-Critic with TD Error-Driven Regularization in Reinforcement Learning
par: Chen, Haohui, et autres
Publié: (2024)
par: Chen, Haohui, et autres
Publié: (2024)
Generative Actor Critic
par: Qin, Aoyang, et autres
Publié: (2025)
par: Qin, Aoyang, et autres
Publié: (2025)
Noisy Spiking Actor Network for Exploration
par: Chen, Ding, et autres
Publié: (2024)
par: Chen, Ding, et autres
Publié: (2024)
Adviser-Actor-Critic: Eliminating Steady-State Error in Reinforcement Learning Control
par: Chen, Donghe, et autres
Publié: (2025)
par: Chen, Donghe, et autres
Publié: (2025)
Weak Convergence Analysis of Online Neural Actor-Critic Algorithms
par: Lam, Samuel Chun-Hei, et autres
Publié: (2024)
par: Lam, Samuel Chun-Hei, et autres
Publié: (2024)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
Scaling Effects and Uncertainty Quantification in Neural Actor Critic Algorithms
par: Georgoudios, Nikos, et autres
Publié: (2026)
par: Georgoudios, Nikos, et autres
Publié: (2026)
DSAC-C: Constrained Maximum Entropy for Robust Discrete Soft-Actor Critic
par: Neo, Dexter, et autres
Publié: (2023)
par: Neo, Dexter, et autres
Publié: (2023)
A New Error Temporal Difference Algorithm for Deep Reinforcement Learning in Microgrid Optimization
par: Yao, Fulong, et autres
Publié: (2025)
par: Yao, Fulong, et autres
Publié: (2025)
Stochastic Actor-Critic: Mitigating Overestimation via Temporal Aleatoric Uncertainty
par: Özalp, Uğurcan
Publié: (2026)
par: Özalp, Uğurcan
Publié: (2026)
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
par: de Lara, Nathan Samuel, et autres
Publié: (2026)
par: de Lara, Nathan Samuel, et autres
Publié: (2026)
XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies
par: Palenicek, Daniel, et autres
Publié: (2026)
par: Palenicek, Daniel, et autres
Publié: (2026)
An Actor-Critic Algorithm with Function Approximation for Risk Sensitive Cost Markov Decision Processes
par: Guin, Soumyajit, et autres
Publié: (2025)
par: Guin, Soumyajit, et autres
Publié: (2025)
Efficient Exploration in Deep Reinforcement Learning: A Novel Bayesian Actor-Critic Algorithm
par: Rozanov, Nikolai
Publié: (2024)
par: Rozanov, Nikolai
Publié: (2024)
Novel Actor-Critic Algorithm for Robust Decision Making of CAV under Delays and Loss of V2X Data
par: Kherroubi, Zine el abidine
Publié: (2024)
par: Kherroubi, Zine el abidine
Publié: (2024)
Risk-Sensitive Exponential Actor Critic
par: Granados, Alonso, et autres
Publié: (2026)
par: Granados, Alonso, et autres
Publié: (2026)
Documents similaires
-
Intentionally-underestimated Value Function at Terminal State for Temporal-difference Learning with Mis-designed Reward
par: Kobayashi, Taisuke
Publié: (2023) -
Towards Autonomous Driving of Personal Mobility with Small and Noisy Dataset using Tsallis-statistics-based Behavioral Cloning
par: Kobayashi, Taisuke, et autres
Publié: (2021) -
Weber-Fechner Law in Temporal Difference learning derived from Control as Inference
par: Takahashi, Keiichiro, et autres
Publié: (2024) -
Flexible Empowerment at Reasoning with Extended Best-of-N Sampling
par: Kobayashi, Taisuke
Publié: (2026) -
Revisiting Experience Replayable Conditions
par: Kobayashi, Taisuke
Publié: (2024)