Optimistic Q-learning for average reward and episodic reinforcement learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Agrawal, Priyank, Agrawal, Shipra |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Q-learning with Posterior Sampling
di: Agrawal, Priyank, et al.
Pubblicazione: (2025)
di: Agrawal, Priyank, et al.
Pubblicazione: (2025)
Dynamic Pricing and Learning with Long-term Reference Effects
di: Agrawal, Shipra, et al.
Pubblicazione: (2024)
di: Agrawal, Shipra, et al.
Pubblicazione: (2024)
A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit
di: Agrawal, Priyank, et al.
Pubblicazione: (2020)
di: Agrawal, Priyank, et al.
Pubblicazione: (2020)
Dynamic Pricing and Advertising with Demand Learning
di: Agrawal, Shipra, et al.
Pubblicazione: (2023)
di: Agrawal, Shipra, et al.
Pubblicazione: (2023)
Spectral Thompson sampling
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
Leveraging LLMs for reward function design in reinforcement learning control tasks
di: Cardenoso, Franklin, et al.
Pubblicazione: (2025)
di: Cardenoso, Franklin, et al.
Pubblicazione: (2025)
Asymptotic Analysis of Sample-averaged Q-learning
di: Panda, Saunak Kumar, et al.
Pubblicazione: (2024)
di: Panda, Saunak Kumar, et al.
Pubblicazione: (2024)
Spectral bandits for smooth graph functions with applications in recommender systems
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Q-Distribution guided Q-learning for offline reinforcement learning: Uncertainty penalized Q-value via consistency model
di: Zhang, Jing, et al.
Pubblicazione: (2024)
di: Zhang, Jing, et al.
Pubblicazione: (2024)
Spectral bandits
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Active teacher selection for reward learning
di: Freedman, Rachel, et al.
Pubblicazione: (2023)
di: Freedman, Rachel, et al.
Pubblicazione: (2023)
Noise-based reward-modulated learning
di: Fernández, Jesús García, et al.
Pubblicazione: (2025)
di: Fernández, Jesús García, et al.
Pubblicazione: (2025)
On the Convergence of Single-Timescale Actor-Critic
di: Kumar, Navdeep, et al.
Pubblicazione: (2024)
di: Kumar, Navdeep, et al.
Pubblicazione: (2024)
Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs
di: Gan, Xingwei, et al.
Pubblicazione: (2026)
di: Gan, Xingwei, et al.
Pubblicazione: (2026)
Ergodicity in reinforcement learning
di: Baumann, Dominik, et al.
Pubblicazione: (2026)
di: Baumann, Dominik, et al.
Pubblicazione: (2026)
Deep Q-Network (DQN) multi-agent reinforcement learning (MARL) for Stock Trading
di: Tidwell, John Christopher, et al.
Pubblicazione: (2025)
di: Tidwell, John Christopher, et al.
Pubblicazione: (2025)
Online reinforcement learning via sparse Gaussian mixture model Q-functions
di: Vu, Minh, et al.
Pubblicazione: (2025)
di: Vu, Minh, et al.
Pubblicazione: (2025)
Latent learning: episodic memory complements parametric learning by enabling flexible reuse of experiences
di: Lampinen, Andrew Kyle, et al.
Pubblicazione: (2025)
di: Lampinen, Andrew Kyle, et al.
Pubblicazione: (2025)
Reinforcement learning with non-ergodic reward increments: robustness via ergodicity transformations
di: Baumann, Dominik, et al.
Pubblicazione: (2023)
di: Baumann, Dominik, et al.
Pubblicazione: (2023)
Regularized Q-learning
di: Lim, Han-Dong, et al.
Pubblicazione: (2022)
di: Lim, Han-Dong, et al.
Pubblicazione: (2022)
Normalization and effective learning rates in reinforcement learning
di: Lyle, Clare, et al.
Pubblicazione: (2024)
di: Lyle, Clare, et al.
Pubblicazione: (2024)
Average-reward reinforcement learning in semi-Markov decision processes via relative value iteration
di: Yu, Huizhen, et al.
Pubblicazione: (2025)
di: Yu, Huizhen, et al.
Pubblicazione: (2025)
Adaptive Few-Shot Learning (AFSL): Tackling Data Scarcity with Stability, Robustness, and Versatility
di: Agrawal, Rishabh
Pubblicazione: (2025)
di: Agrawal, Rishabh
Pubblicazione: (2025)
Transfer Q-learning
di: Chen, Elynn, et al.
Pubblicazione: (2022)
di: Chen, Elynn, et al.
Pubblicazione: (2022)
Phase-Aware Deep Learning with Complex-Valued CNNs for Audio Signal Applications
di: Agrawal, Naman
Pubblicazione: (2025)
di: Agrawal, Naman
Pubblicazione: (2025)
Curriculum reinforcement learning with measurable task representation learning
di: Wen, Yongyan, et al.
Pubblicazione: (2026)
di: Wen, Yongyan, et al.
Pubblicazione: (2026)
Beyond Next Word Prediction: Developing Comprehensive Evaluation Frameworks for measuring LLM performance on real world applications
di: Agrawal, Vishakha, et al.
Pubblicazione: (2025)
di: Agrawal, Vishakha, et al.
Pubblicazione: (2025)
An introduction to reinforcement learning for neuroscience
di: Jensen, Kristopher T.
Pubblicazione: (2023)
di: Jensen, Kristopher T.
Pubblicazione: (2023)
Stochastic first-order methods for average-reward Markov decision processes
di: Li, Tianjiao, et al.
Pubblicazione: (2022)
di: Li, Tianjiao, et al.
Pubblicazione: (2022)
Finding good policies in average-reward Markov Decision Processes without prior knowledge
di: Tuynman, Adrienne, et al.
Pubblicazione: (2024)
di: Tuynman, Adrienne, et al.
Pubblicazione: (2024)
VA-learning as a more efficient alternative to Q-learning
di: Tang, Yunhao, et al.
Pubblicazione: (2023)
di: Tang, Yunhao, et al.
Pubblicazione: (2023)
Generalized Bayesian deep reinforcement learning
di: Roy, Shreya Sinha, et al.
Pubblicazione: (2024)
di: Roy, Shreya Sinha, et al.
Pubblicazione: (2024)
Safe reinforcement learning in uncertain contexts
di: Baumann, Dominik, et al.
Pubblicazione: (2024)
di: Baumann, Dominik, et al.
Pubblicazione: (2024)
HyperQ-Opt: Q-learning for Hyperparameter Optimization
di: Hasan, Md. Tarek
Pubblicazione: (2024)
di: Hasan, Md. Tarek
Pubblicazione: (2024)
Illuminate: A novel approach for depression detection with explainable analysis and proactive therapy using prompt engineering
di: Agrawal, Aryan
Pubblicazione: (2024)
di: Agrawal, Aryan
Pubblicazione: (2024)
Disentangling impact of capacity, objective, batchsize, estimators, and step-size on flow VI
di: Agrawal, Abhinav, et al.
Pubblicazione: (2024)
di: Agrawal, Abhinav, et al.
Pubblicazione: (2024)
Understanding and mitigating difficulties in posterior predictive evaluation
di: Agrawal, Abhinav, et al.
Pubblicazione: (2024)
di: Agrawal, Abhinav, et al.
Pubblicazione: (2024)
Reinforcement Learning in MDPs with Information-Ordered Policies
di: Zhang, Zhongjun, et al.
Pubblicazione: (2025)
di: Zhang, Zhongjun, et al.
Pubblicazione: (2025)
FAST-Q: Fast-track Exploration with Adversarially Balanced State Representations for Counterfactual Action Estimation in Offline Reinforcement Learning
di: Agrawal, Pulkit, et al.
Pubblicazione: (2025)
di: Agrawal, Pulkit, et al.
Pubblicazione: (2025)
Logarithmic regret bounds for continuous-time average-reward Markov decision processes
di: Gao, Xuefeng, et al.
Pubblicazione: (2022)
di: Gao, Xuefeng, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Q-learning with Posterior Sampling
di: Agrawal, Priyank, et al.
Pubblicazione: (2025) -
Dynamic Pricing and Learning with Long-term Reference Effects
di: Agrawal, Shipra, et al.
Pubblicazione: (2024) -
A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit
di: Agrawal, Priyank, et al.
Pubblicazione: (2020) -
Dynamic Pricing and Advertising with Demand Learning
di: Agrawal, Shipra, et al.
Pubblicazione: (2023) -
Spectral Thompson sampling
di: Kocak, Tomas, et al.
Pubblicazione: (2026)