Q-learning with Posterior Sampling
Fuente:
arXiv
Guardado en:
| Autores principales: | Agrawal, Priyank, Agrawal, Shipra, Azati, Azmat |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Optimistic Q-learning for average reward and episodic reinforcement learning
por: Agrawal, Priyank, et al.
Publicado: (2024)
por: Agrawal, Priyank, et al.
Publicado: (2024)
Dynamic Pricing and Learning with Long-term Reference Effects
por: Agrawal, Shipra, et al.
Publicado: (2024)
por: Agrawal, Shipra, et al.
Publicado: (2024)
A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit
por: Agrawal, Priyank, et al.
Publicado: (2020)
por: Agrawal, Priyank, et al.
Publicado: (2020)
Dynamic Pricing and Advertising with Demand Learning
por: Agrawal, Shipra, et al.
Publicado: (2023)
por: Agrawal, Shipra, et al.
Publicado: (2023)
Spectral Thompson sampling
por: Kocak, Tomas, et al.
Publicado: (2026)
por: Kocak, Tomas, et al.
Publicado: (2026)
Spectral bandits for smooth graph functions with applications in recommender systems
por: Kocák, Tomáš, et al.
Publicado: (2026)
por: Kocák, Tomáš, et al.
Publicado: (2026)
Spectral bandits
por: Kocák, Tomáš, et al.
Publicado: (2026)
por: Kocák, Tomáš, et al.
Publicado: (2026)
On the Convergence of Single-Timescale Actor-Critic
por: Kumar, Navdeep, et al.
Publicado: (2024)
por: Kumar, Navdeep, et al.
Publicado: (2024)
Adaptive Few-Shot Learning (AFSL): Tackling Data Scarcity with Stability, Robustness, and Versatility
por: Agrawal, Rishabh
Publicado: (2025)
por: Agrawal, Rishabh
Publicado: (2025)
Amortized In-Context Bayesian Posterior Estimation
por: Mittal, Sarthak, et al.
Publicado: (2025)
por: Mittal, Sarthak, et al.
Publicado: (2025)
Phase-Aware Deep Learning with Complex-Valued CNNs for Audio Signal Applications
por: Agrawal, Naman
Publicado: (2025)
por: Agrawal, Naman
Publicado: (2025)
Beyond Next Word Prediction: Developing Comprehensive Evaluation Frameworks for measuring LLM performance on real world applications
por: Agrawal, Vishakha, et al.
Publicado: (2025)
por: Agrawal, Vishakha, et al.
Publicado: (2025)
Illuminate: A novel approach for depression detection with explainable analysis and proactive therapy using prompt engineering
por: Agrawal, Aryan
Publicado: (2024)
por: Agrawal, Aryan
Publicado: (2024)
A New Rejection Sampling Approach to $k$-$\mathtt{means}$++ With Improved Trade-Offs
por: Shah, Poojan, et al.
Publicado: (2025)
por: Shah, Poojan, et al.
Publicado: (2025)
Reinforcement Learning in MDPs with Information-Ordered Policies
por: Zhang, Zhongjun, et al.
Publicado: (2025)
por: Zhang, Zhongjun, et al.
Publicado: (2025)
Disentangling impact of capacity, objective, batchsize, estimators, and step-size on flow VI
por: Agrawal, Abhinav, et al.
Publicado: (2024)
por: Agrawal, Abhinav, et al.
Publicado: (2024)
Understanding and mitigating difficulties in posterior predictive evaluation
por: Agrawal, Abhinav, et al.
Publicado: (2024)
por: Agrawal, Abhinav, et al.
Publicado: (2024)
FAST-Q: Fast-track Exploration with Adversarially Balanced State Representations for Counterfactual Action Estimation in Offline Reinforcement Learning
por: Agrawal, Pulkit, et al.
Publicado: (2025)
por: Agrawal, Pulkit, et al.
Publicado: (2025)
FGM optimization in complex domains using Gaussian process regression based profile generation algorithm
por: Konda, Chaitanya Kumar, et al.
Publicado: (2025)
por: Konda, Chaitanya Kumar, et al.
Publicado: (2025)
Posterior Sampling for Continuing Environments
por: Xu, Wanqiao, et al.
Publicado: (2022)
por: Xu, Wanqiao, et al.
Publicado: (2022)
Eventually LIL Regret: Almost Sure $\ln\ln T$ Regret for a sub-Gaussian Mixture on Unbounded Data
por: Agrawal, Shubhada, et al.
Publicado: (2025)
por: Agrawal, Shubhada, et al.
Publicado: (2025)
On Stopping Times of Power-one Sequential Tests: Tight Lower and Upper Bounds
por: Agrawal, Shubhada, et al.
Publicado: (2025)
por: Agrawal, Shubhada, et al.
Publicado: (2025)
Improving Few-Shot Cross-Domain Named Entity Recognition by Instruction Tuning a Word-Embedding based Retrieval Augmented Large Language Model
por: Nandi, Subhadip, et al.
Publicado: (2024)
por: Nandi, Subhadip, et al.
Publicado: (2024)
Cover meets Robbins while Betting on Bounded Data: $\ln n$ Regret and Almost Sure $\ln\ln n$ Regret
por: Agrawal, Shubhada, et al.
Publicado: (2026)
por: Agrawal, Shubhada, et al.
Publicado: (2026)
Regret Tail Characterization of Optimal Bandit Algorithms with Generic Rewards
por: Panda, Subhodip, et al.
Publicado: (2026)
por: Panda, Subhodip, et al.
Publicado: (2026)
Q-Star Meets Scalable Posterior Sampling: Bridging Theory and Practice via HyperAgent
por: Li, Yingru, et al.
Publicado: (2024)
por: Li, Yingru, et al.
Publicado: (2024)
Investigating Fouling Efficiency in Football Using Expected Booking (xB) Model
por: Azmat, Adnan, et al.
Publicado: (2024)
por: Azmat, Adnan, et al.
Publicado: (2024)
Asymptotic Analysis of Sample-averaged Q-learning
por: Panda, Saunak Kumar, et al.
Publicado: (2024)
por: Panda, Saunak Kumar, et al.
Publicado: (2024)
Pareto Set Identification With Posterior Sampling
por: Kone, Cyrille, et al.
Publicado: (2024)
por: Kone, Cyrille, et al.
Publicado: (2024)
Gibbs Sampling the Posterior of Neural Networks
por: Piccioli, Giovanni, et al.
Publicado: (2023)
por: Piccioli, Giovanni, et al.
Publicado: (2023)
Bayesian Optimization for Dynamic Pricing and Learning
por: Anand, Anush, et al.
Publicado: (2025)
por: Anand, Anush, et al.
Publicado: (2025)
RL's Razor: Why Online Reinforcement Learning Forgets Less
por: Shenfeld, Idan, et al.
Publicado: (2025)
por: Shenfeld, Idan, et al.
Publicado: (2025)
Position: Federated Foundation Language Model Post-Training Should Focus on Open-Source Models
por: Agrawal, Nikita, et al.
Publicado: (2025)
por: Agrawal, Nikita, et al.
Publicado: (2025)
Two-level Solar Irradiance Clustering with Season Identification: A Comparative Analysis
por: Agrawal, Roshni, et al.
Publicado: (2025)
por: Agrawal, Roshni, et al.
Publicado: (2025)
Collective Model Intelligence Requires Compatible Specialization
por: Pari, Jyothish, et al.
Publicado: (2024)
por: Pari, Jyothish, et al.
Publicado: (2024)
VeriGate: Verifier-Gated Step-Level Supervision for GRPO
por: Agrawal, Aakriti, et al.
Publicado: (2026)
por: Agrawal, Aakriti, et al.
Publicado: (2026)
AGGRNet: Selective Feature Extraction and Aggregation for Enhanced Medical Image Classification
por: Makwe, Ansh, et al.
Publicado: (2025)
por: Makwe, Ansh, et al.
Publicado: (2025)
Adaptive Multi-Fidelity Reinforcement Learning for Variance Reduction in Engineering Design Optimization
por: Agrawal, Akash, et al.
Publicado: (2025)
por: Agrawal, Akash, et al.
Publicado: (2025)
Adaptive Learning of Design Strategies over Non-Hierarchical Multi-Fidelity Models via Policy Alignment
por: Agrawal, Akash, et al.
Publicado: (2024)
por: Agrawal, Akash, et al.
Publicado: (2024)
Addressing LLM Diversity by Infusing Random Concepts
por: Agrawal, Pulin, et al.
Publicado: (2026)
por: Agrawal, Pulin, et al.
Publicado: (2026)
Ejemplares similares
-
Optimistic Q-learning for average reward and episodic reinforcement learning
por: Agrawal, Priyank, et al.
Publicado: (2024) -
Dynamic Pricing and Learning with Long-term Reference Effects
por: Agrawal, Shipra, et al.
Publicado: (2024) -
A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit
por: Agrawal, Priyank, et al.
Publicado: (2020) -
Dynamic Pricing and Advertising with Demand Learning
por: Agrawal, Shipra, et al.
Publicado: (2023) -
Spectral Thompson sampling
por: Kocak, Tomas, et al.
Publicado: (2026)