Reinforcement Learning with Quasi-Hyperbolic Discounting
Fuente:
arXiv
Salvato in:
| Autori principali: | Eshwar, S. R., Motwani, Mayank, Roy, Nibedita, Thoppe, Gugan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Teaching Precommitted Agents: Model-Free Policy Evaluation and Control in Quasi-Hyperbolic Discounted MDPs
di: Eshwar, S. R.
Pubblicazione: (2025)
di: Eshwar, S. R.
Pubblicazione: (2025)
Reliable Policy Iteration: Performance Robustness Across Architecture and Environment Perturbations
di: Eshwar, S. R., et al.
Pubblicazione: (2025)
di: Eshwar, S. R., et al.
Pubblicazione: (2025)
Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
di: Thoppe, Gugan, et al.
Pubblicazione: (2026)
di: Thoppe, Gugan, et al.
Pubblicazione: (2026)
Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
Policy Gradient with Tree Expansion
di: Dalal, Gal, et al.
Pubblicazione: (2023)
di: Dalal, Gal, et al.
Pubblicazione: (2023)
Monotone and Conservative Policy Iteration Beyond the Tabular Case
di: Eshwar, S. R., et al.
Pubblicazione: (2025)
di: Eshwar, S. R., et al.
Pubblicazione: (2025)
Adversary-Robust Learning from Fully Asynchronous Directional Derivative Estimates
di: Paul, Anik Kumar, et al.
Pubblicazione: (2026)
di: Paul, Anik Kumar, et al.
Pubblicazione: (2026)
Does DQN Learn?
di: Gopalan, Aditya, et al.
Pubblicazione: (2022)
di: Gopalan, Aditya, et al.
Pubblicazione: (2022)
Tight Convergence Rates for Online Distributed Linear Estimation with Adversarial Measurements
di: Roy, Nibedita, et al.
Pubblicazione: (2026)
di: Roy, Nibedita, et al.
Pubblicazione: (2026)
Parameter-free Optimal Rates for Nonlinear Semi-Norm Contractions with Applications to $Q$-Learning
di: Naskar, Ankur, et al.
Pubblicazione: (2025)
di: Naskar, Ankur, et al.
Pubblicazione: (2025)
Online Learning of Weakly Coupled MDP Policies for Load Balancing and Auto Scaling
di: Eshwar, S. R., et al.
Pubblicazione: (2024)
di: Eshwar, S. R., et al.
Pubblicazione: (2024)
Partial Identifiability in Inverse Reinforcement Learning For Agents With Non-Exponential Discounting
di: Skalse, Joar, et al.
Pubblicazione: (2024)
di: Skalse, Joar, et al.
Pubblicazione: (2024)
AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning
di: Wang, Yaomin, et al.
Pubblicazione: (2026)
di: Wang, Yaomin, et al.
Pubblicazione: (2026)
Understanding and Improving Hyperbolic Deep Reinforcement Learning
di: Klein, Timo, et al.
Pubblicazione: (2025)
di: Klein, Timo, et al.
Pubblicazione: (2025)
Parameter-Free Federated TD Learning with Markov Noise in Heterogeneous Environments
di: Naskar, Ankur, et al.
Pubblicazione: (2025)
di: Naskar, Ankur, et al.
Pubblicazione: (2025)
Risk Estimation in a Markov Cost Process: Lower and Upper Bounds
di: Thoppe, Gugan, et al.
Pubblicazione: (2023)
di: Thoppe, Gugan, et al.
Pubblicazione: (2023)
h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2025)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2025)
Surrogate-Assisted Evolutionary Reinforcement Learning Based on Autoencoder and Hyperbolic Neural Network
di: Li, Bingdong, et al.
Pubblicazione: (2025)
di: Li, Bingdong, et al.
Pubblicazione: (2025)
Imitation Learning from Observation with Automatic Discount Scheduling
di: Liu, Yuyang, et al.
Pubblicazione: (2023)
di: Liu, Yuyang, et al.
Pubblicazione: (2023)
ConvoLearn: A Learning Sciences Grounded Dataset for Fine-Tuning Dialogic AI Tutors
di: Sharma, Mayank, et al.
Pubblicazione: (2026)
di: Sharma, Mayank, et al.
Pubblicazione: (2026)
CAPSULE: Control-Theoretic Action Perturbations for Safe Uncertainty-Aware Reinforcement Learning
di: Narava, Rahul, et al.
Pubblicazione: (2026)
di: Narava, Rahul, et al.
Pubblicazione: (2026)
Action-Inspired Generative Models
di: A., Eshwar R., et al.
Pubblicazione: (2026)
di: A., Eshwar R., et al.
Pubblicazione: (2026)
DISCO: An End-to-End Bandit Framework for Personalised Discount Allocation
di: Zhang, Jason Shuo, et al.
Pubblicazione: (2024)
di: Zhang, Jason Shuo, et al.
Pubblicazione: (2024)
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
di: Putta, Pranav, et al.
Pubblicazione: (2024)
di: Putta, Pranav, et al.
Pubblicazione: (2024)
ALIGN-FL: Architecture-independent Learning through Invariant Generative component sharing in Federated Learning
di: Gulati, Mayank, et al.
Pubblicazione: (2025)
di: Gulati, Mayank, et al.
Pubblicazione: (2025)
Sample Efficient Active Algorithms for Offline Reinforcement Learning
di: Roy, Soumyadeep, et al.
Pubblicazione: (2026)
di: Roy, Soumyadeep, et al.
Pubblicazione: (2026)
Satisficing Exploration for Deep Reinforcement Learning
di: Arumugam, Dilip, et al.
Pubblicazione: (2024)
di: Arumugam, Dilip, et al.
Pubblicazione: (2024)
Hyperbolic Learning with Multimodal Large Language Models
di: Mandica, Paolo, et al.
Pubblicazione: (2024)
di: Mandica, Paolo, et al.
Pubblicazione: (2024)
Adaptive Discounting of Training Time Attacks
di: Bector, Ridhima, et al.
Pubblicazione: (2024)
di: Bector, Ridhima, et al.
Pubblicazione: (2024)
Sequential Attention-based Sampling for Histopathological Analysis
di: G, Tarun, et al.
Pubblicazione: (2025)
di: G, Tarun, et al.
Pubblicazione: (2025)
Hyperbolic Deep Learning for Foundation Models: A Survey
di: He, Neil, et al.
Pubblicazione: (2025)
di: He, Neil, et al.
Pubblicazione: (2025)
Continual Learning as Computationally Constrained Reinforcement Learning
di: Kumar, Saurabh, et al.
Pubblicazione: (2023)
di: Kumar, Saurabh, et al.
Pubblicazione: (2023)
Reinforcement Learning from Delayed Observations via World Models
di: Karamzade, Armin, et al.
Pubblicazione: (2024)
di: Karamzade, Armin, et al.
Pubblicazione: (2024)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
di: Jha, Mayank
Pubblicazione: (2026)
di: Jha, Mayank
Pubblicazione: (2026)
Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition
di: Manivannan, Sanjeev, et al.
Pubblicazione: (2026)
di: Manivannan, Sanjeev, et al.
Pubblicazione: (2026)
Enhance Hyperbolic Representation Learning via Second-order Pooling
di: Song, Kun, et al.
Pubblicazione: (2024)
di: Song, Kun, et al.
Pubblicazione: (2024)
Understanding and Mitigating Hyperbolic Dimensional Collapse in Graph Contrastive Learning
di: Zhang, Yifei, et al.
Pubblicazione: (2023)
di: Zhang, Yifei, et al.
Pubblicazione: (2023)
Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2026)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2026)
Model-Based Reinforcement Learning under Random Observation Delays
di: Karamzade, Armin, et al.
Pubblicazione: (2025)
di: Karamzade, Armin, et al.
Pubblicazione: (2025)
Hyperbolic Random Forests
di: Doorenbos, Lars, et al.
Pubblicazione: (2023)
di: Doorenbos, Lars, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Teaching Precommitted Agents: Model-Free Policy Evaluation and Control in Quasi-Hyperbolic Discounted MDPs
di: Eshwar, S. R.
Pubblicazione: (2025) -
Reliable Policy Iteration: Performance Robustness Across Architecture and Environment Perturbations
di: Eshwar, S. R., et al.
Pubblicazione: (2025) -
Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
di: Thoppe, Gugan, et al.
Pubblicazione: (2026) -
Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries
di: Ganesh, Swetha, et al.
Pubblicazione: (2024) -
Policy Gradient with Tree Expansion
di: Dalal, Gal, et al.
Pubblicazione: (2023)