Compatible Gradient Approximations for Actor-Critic Algorithms
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Saglam, Baturay, Kalogerias, Dionysis |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Test-Time Detoxification without Training or Learning Anything
par: Saglam, Baturay, et autres
Publié: (2026)
par: Saglam, Baturay, et autres
Publié: (2026)
Test-Time Safety Alignment
par: Saglam, Baturay, et autres
Publié: (2026)
par: Saglam, Baturay, et autres
Publié: (2026)
Learning Task Representations from In-Context Learning
par: Saglam, Baturay, et autres
Publié: (2025)
par: Saglam, Baturay, et autres
Publié: (2025)
Risk-Averse Constrained Reinforcement Learning with Optimized Certainty Equivalents
par: Lee, Jane H., et autres
Publié: (2025)
par: Lee, Jane H., et autres
Publié: (2025)
FedAVOT: Exact Distribution Alignment in Federated Learning via Masked Optimal Transport
par: Herlock, et autres
Publié: (2025)
par: Herlock, et autres
Publié: (2025)
Convergence of Agnostic Federated Averaging
par: Herlock, et autres
Publié: (2025)
par: Herlock, et autres
Publié: (2025)
Ultra-Reliable Risk-Aggregated Sum Rate Maximization via Model-Aided Deep Learning
par: Hashmi, Hassaan, et autres
Publié: (2025)
par: Hashmi, Hassaan, et autres
Publié: (2025)
FEDSTR: Money-In AI-Out | A Decentralized Marketplace for Federated Learning and LLM Training on the NOSTR Protocol
par: Nikolakakis, Konstantinos E., et autres
Publié: (2024)
par: Nikolakakis, Konstantinos E., et autres
Publié: (2024)
Non-Asymptotic Analysis for Single-Loop (Natural) Actor-Critic with Compatible Function Approximation
par: Wang, Yudan, et autres
Publié: (2024)
par: Wang, Yudan, et autres
Publié: (2024)
Quasi-Newton Compatible Actor-Critic for Deterministic Policies
par: Kordabad, Arash Bahari, et autres
Publié: (2025)
par: Kordabad, Arash Bahari, et autres
Publié: (2025)
An Actor-Critic Algorithm with Function Approximation for Risk Sensitive Cost Markov Decision Processes
par: Guin, Soumyajit, et autres
Publié: (2025)
par: Guin, Soumyajit, et autres
Publié: (2025)
Large Language Models Encode Semantics and Alignment in Linearly Separable Representations
par: Saglam, Baturay, et autres
Publié: (2025)
par: Saglam, Baturay, et autres
Publié: (2025)
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
par: Panda, Prashansa, et autres
Publié: (2023)
par: Panda, Prashansa, et autres
Publié: (2023)
Value Improved Actor Critic Algorithms
par: Oren, Yaniv, et autres
Publié: (2024)
par: Oren, Yaniv, et autres
Publié: (2024)
Actor-Critic without Actor
par: Ki, Donghyeon, et autres
Publié: (2025)
par: Ki, Donghyeon, et autres
Publié: (2025)
Actor-Critic Algorithm for Dynamic Expectile and CVaR
par: Luo, Yudong, et autres
Publié: (2026)
par: Luo, Yudong, et autres
Publié: (2026)
A Theoretical Justification for Asymmetric Actor-Critic Algorithms
par: Lambrechts, Gaspard, et autres
Publié: (2025)
par: Lambrechts, Gaspard, et autres
Publié: (2025)
Improving Actor-Critic Training with Steerable Action-Value Approximation Errors
par: Tasdighi, Bahareh, et autres
Publié: (2024)
par: Tasdighi, Bahareh, et autres
Publié: (2024)
Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation
par: Panda, Prashansa, et autres
Publié: (2024)
par: Panda, Prashansa, et autres
Publié: (2024)
Cryptocurrency Portfolio Management with Reinforcement Learning: Soft Actor--Critic and Deep Deterministic Policy Gradient Algorithms
par: Paykan, Kamal
Publié: (2025)
par: Paykan, Kamal
Publié: (2025)
An Investigation of Batch Normalization in Off-Policy Actor-Critic Algorithms
par: Wang, Li, et autres
Publié: (2025)
par: Wang, Li, et autres
Publié: (2025)
Heavy-Ball Momentum Accelerated Actor-Critic With Function Approximation
par: Dong, Yanjie, et autres
Publié: (2024)
par: Dong, Yanjie, et autres
Publié: (2024)
Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic
par: Lee, Jeong Woon, et autres
Publié: (2026)
par: Lee, Jeong Woon, et autres
Publié: (2026)
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
par: Bhatnagar, Shalabh, et autres
Publié: (2022)
par: Bhatnagar, Shalabh, et autres
Publié: (2022)
D2 Actor Critic: Diffusion Actor Meets Distributional Critic
par: Zhang, Lunjun, et autres
Publié: (2025)
par: Zhang, Lunjun, et autres
Publié: (2025)
Actor-Critic Reinforcement Learning with Phased Actor
par: Wu, Ruofan, et autres
Publié: (2024)
par: Wu, Ruofan, et autres
Publié: (2024)
A Communication-Efficient Decentralized Actor-Critic Algorithm
par: Ren, Xiaoxing, et autres
Publié: (2025)
par: Ren, Xiaoxing, et autres
Publié: (2025)
Generative Actor Critic
par: Qin, Aoyang, et autres
Publié: (2025)
par: Qin, Aoyang, et autres
Publié: (2025)
A Distributionally Robust Estimator that Dominates the Empirical Average
par: Koumpis, Nikolas, et autres
Publié: (2024)
par: Koumpis, Nikolas, et autres
Publié: (2024)
Inexact Zeroth-Order Nonsmooth and Nonconvex Stochastic Composite Optimization and Applications
par: Pougkakiotis, Spyridon, et autres
Publié: (2025)
par: Pougkakiotis, Spyridon, et autres
Publié: (2025)
Strong Duality in Risk-Constrained Nonconvex Functional Programming
par: Kalogerias, Dionysis, et autres
Publié: (2022)
par: Kalogerias, Dionysis, et autres
Publié: (2022)
Pseudo-Quantized Actor-Critic Algorithm for Robustness to Noisy Temporal Difference Error
par: Kobayashi, Taisuke
Publié: (2026)
par: Kobayashi, Taisuke
Publié: (2026)
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
par: Satheesh, Anirudh, et autres
Publié: (2025)
par: Satheesh, Anirudh, et autres
Publié: (2025)
Weak Convergence Analysis of Online Neural Actor-Critic Algorithms
par: Lam, Samuel Chun-Hei, et autres
Publié: (2024)
par: Lam, Samuel Chun-Hei, et autres
Publié: (2024)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
Efficient Exploration in Deep Reinforcement Learning: A Novel Bayesian Actor-Critic Algorithm
par: Rozanov, Nikolai
Publié: (2024)
par: Rozanov, Nikolai
Publié: (2024)
XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies
par: Palenicek, Daniel, et autres
Publié: (2026)
par: Palenicek, Daniel, et autres
Publié: (2026)
Scaling Effects and Uncertainty Quantification in Neural Actor Critic Algorithms
par: Georgoudios, Nikos, et autres
Publié: (2026)
par: Georgoudios, Nikos, et autres
Publié: (2026)
Natural Policy Gradient and Actor Critic Methods for Constrained Multi-Task Reinforcement Learning
par: Zeng, Sihan, et autres
Publié: (2024)
par: Zeng, Sihan, et autres
Publié: (2024)
Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2023)
par: Yang, Tong, et autres
Publié: (2023)
Documents similaires
-
Test-Time Detoxification without Training or Learning Anything
par: Saglam, Baturay, et autres
Publié: (2026) -
Test-Time Safety Alignment
par: Saglam, Baturay, et autres
Publié: (2026) -
Learning Task Representations from In-Context Learning
par: Saglam, Baturay, et autres
Publié: (2025) -
Risk-Averse Constrained Reinforcement Learning with Optimized Certainty Equivalents
par: Lee, Jane H., et autres
Publié: (2025) -
FedAVOT: Exact Distribution Alignment in Federated Learning via Masked Optimal Transport
par: Herlock, et autres
Publié: (2025)