A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit
Fuente:
arXiv
Salvato in:
| Autori principali: | Agrawal, Priyank, Tulabandhula, Theja, Avadhanula, Vashist |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2020
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Tractable Multinomial Logit Contextual Bandits with Non-Linear Utilities
di: Hwang, Taehyun, et al.
Pubblicazione: (2026)
di: Hwang, Taehyun, et al.
Pubblicazione: (2026)
Contextual Multinomial Logit Bandits with General Value Functions
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
Learning in Position-Aware Multinomial Logit Bandits: From Multiplicative to General Position Effects
di: Chen, Xi, et al.
Pubblicazione: (2026)
di: Chen, Xi, et al.
Pubblicazione: (2026)
Variance-Adaptive Optimal Algorithm for Reinforcement Learning with Multinomial Logit Function Approximation
di: Kim, Wonyoung, et al.
Pubblicazione: (2026)
di: Kim, Wonyoung, et al.
Pubblicazione: (2026)
Echoes of Socratic Doubt: Embracing Uncertainty in Calibrated Evidential Reinforcement Learning
di: Stutts, Alex Christopher, et al.
Pubblicazione: (2024)
di: Stutts, Alex Christopher, et al.
Pubblicazione: (2024)
Improved Online Confidence Bounds for Multinomial Logistic Bandits
di: Lee, Joongkyu, et al.
Pubblicazione: (2025)
di: Lee, Joongkyu, et al.
Pubblicazione: (2025)
Provably Efficient Reinforcement Learning with Multinomial Logit Function Approximation
di: Li, Long-Fei, et al.
Pubblicazione: (2024)
di: Li, Long-Fei, et al.
Pubblicazione: (2024)
Optimistic Q-learning for average reward and episodic reinforcement learning
di: Agrawal, Priyank, et al.
Pubblicazione: (2024)
di: Agrawal, Priyank, et al.
Pubblicazione: (2024)
Prediction of Lung Metastasis from Hepatocellular Carcinoma using the SEER Database
di: Kim, Jeff J. H., et al.
Pubblicazione: (2025)
di: Kim, Jeff J. H., et al.
Pubblicazione: (2025)
Learning Multinomial Logits in $O(n \log n)$ time
di: Chierichetti, Flavio, et al.
Pubblicazione: (2026)
di: Chierichetti, Flavio, et al.
Pubblicazione: (2026)
Hierarchical Contextual Uplift Bandits for Catalog Personalization
di: Agrawal, Anupam, et al.
Pubblicazione: (2026)
di: Agrawal, Anupam, et al.
Pubblicazione: (2026)
Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification
di: Lee, Joongkyu, et al.
Pubblicazione: (2026)
di: Lee, Joongkyu, et al.
Pubblicazione: (2026)
Achieving Limited Adaptivity for Multinomial Logistic Bandits
di: Midigeshi, Sukruta Prakash, et al.
Pubblicazione: (2025)
di: Midigeshi, Sukruta Prakash, et al.
Pubblicazione: (2025)
Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits
di: Han, Zean, et al.
Pubblicazione: (2026)
di: Han, Zean, et al.
Pubblicazione: (2026)
Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback
di: Goyal, Tanmay, et al.
Pubblicazione: (2025)
di: Goyal, Tanmay, et al.
Pubblicazione: (2025)
Q-learning with Posterior Sampling
di: Agrawal, Priyank, et al.
Pubblicazione: (2025)
di: Agrawal, Priyank, et al.
Pubblicazione: (2025)
Enjoying Non-linearity in Multinomial Logistic Bandits: A Minimax-Optimal Algorithm
di: Boudart, Pierre, et al.
Pubblicazione: (2025)
di: Boudart, Pierre, et al.
Pubblicazione: (2025)
Nearly Minimax Optimal Regret for Multinomial Logistic Bandit
di: Lee, Joongkyu, et al.
Pubblicazione: (2024)
di: Lee, Joongkyu, et al.
Pubblicazione: (2024)
A Reduction Algorithm for Markovian Contextual Linear Bandits
di: Buyukkalayci, Kaan, et al.
Pubblicazione: (2026)
di: Buyukkalayci, Kaan, et al.
Pubblicazione: (2026)
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits
di: Kuroki, Yuko, et al.
Pubblicazione: (2023)
di: Kuroki, Yuko, et al.
Pubblicazione: (2023)
Online Continuous Hyperparameter Optimization for Generalized Linear Contextual Bandits
di: Kang, Yue, et al.
Pubblicazione: (2023)
di: Kang, Yue, et al.
Pubblicazione: (2023)
Batched Online Contextual Sparse Bandits with Sequential Inclusion of Features
di: Swiers, Rowan, et al.
Pubblicazione: (2024)
di: Swiers, Rowan, et al.
Pubblicazione: (2024)
MEMETRON: Metaheuristic Mechanisms for Test-time Response Optimization of Large Language Models
di: Nguyen, Son The, et al.
Pubblicazione: (2025)
di: Nguyen, Son The, et al.
Pubblicazione: (2025)
Non-Asymptotic Convergence of Stochastic Iterative Algorithms: A Lyapunov Framework
di: Chen, Zaiwei, et al.
Pubblicazione: (2026)
di: Chen, Zaiwei, et al.
Pubblicazione: (2026)
An Improved Algorithm for Adversarial Linear Contextual Bandits via Reduction
di: van Erven, Tim, et al.
Pubblicazione: (2025)
di: van Erven, Tim, et al.
Pubblicazione: (2025)
Regret Tail Characterization of Optimal Bandit Algorithms with Generic Rewards
di: Panda, Subhodip, et al.
Pubblicazione: (2026)
di: Panda, Subhodip, et al.
Pubblicazione: (2026)
Online Statistical Inference for Contextual Bandits via Stochastic Gradient Descent
di: Chang, Xiangyu, et al.
Pubblicazione: (2022)
di: Chang, Xiangyu, et al.
Pubblicazione: (2022)
Adaptive Bandit Algorithms for Contextual Matching Markets
di: Lin, Shiyun, et al.
Pubblicazione: (2026)
di: Lin, Shiyun, et al.
Pubblicazione: (2026)
Quantum-Enhanced Neural Contextual Bandit Algorithms
di: Huang, Yuqi, et al.
Pubblicazione: (2026)
di: Huang, Yuqi, et al.
Pubblicazione: (2026)
Active Learning for Stochastic Contextual Linear Bandits
di: Brunskill, Emma, et al.
Pubblicazione: (2026)
di: Brunskill, Emma, et al.
Pubblicazione: (2026)
Online Continual Learning via Logit Adjusted Softmax
di: Huang, Zhehao, et al.
Pubblicazione: (2023)
di: Huang, Zhehao, et al.
Pubblicazione: (2023)
Calibration-Gated LLM Pseudo-Observations for Online Contextual Bandits
di: Pershin, Maksim, et al.
Pubblicazione: (2026)
di: Pershin, Maksim, et al.
Pubblicazione: (2026)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
di: Di, Qiwei, et al.
Pubblicazione: (2024)
di: Di, Qiwei, et al.
Pubblicazione: (2024)
Practical and Optimal Algorithm for Linear Contextual Bandits with Rare Parameter Updates
di: Yu, Sanghoon, et al.
Pubblicazione: (2026)
di: Yu, Sanghoon, et al.
Pubblicazione: (2026)
Efficient Best-of-Both-Worlds Algorithms for Contextual Combinatorial Semi-Bandits
di: Li, Mengmeng, et al.
Pubblicazione: (2025)
di: Li, Mengmeng, et al.
Pubblicazione: (2025)
Improved Regret Bounds of (Multinomial) Logistic Bandits via Regret-to-Confidence-Set Conversion
di: Lee, Junghyun, et al.
Pubblicazione: (2023)
di: Lee, Junghyun, et al.
Pubblicazione: (2023)
Concentration of General Stochastic Approximation Under Heavy-Tailed Markovian Noise
di: Agrawal, Shubhada, et al.
Pubblicazione: (2026)
di: Agrawal, Shubhada, et al.
Pubblicazione: (2026)
Learning When to Trust in Contextual Bandits
di: Ghasemi, Majid, et al.
Pubblicazione: (2026)
di: Ghasemi, Majid, et al.
Pubblicazione: (2026)
PAK-UCB Contextual Bandit: An Online Learning Approach to Prompt-Aware Selection of Generative Models and LLMs
di: Hu, Xiaoyan, et al.
Pubblicazione: (2024)
di: Hu, Xiaoyan, et al.
Pubblicazione: (2024)
Markov Chain Variance Estimation: A Stochastic Approximation Approach
di: Agrawal, Shubhada, et al.
Pubblicazione: (2024)
di: Agrawal, Shubhada, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Tractable Multinomial Logit Contextual Bandits with Non-Linear Utilities
di: Hwang, Taehyun, et al.
Pubblicazione: (2026) -
Contextual Multinomial Logit Bandits with General Value Functions
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024) -
Learning in Position-Aware Multinomial Logit Bandits: From Multiplicative to General Position Effects
di: Chen, Xi, et al.
Pubblicazione: (2026) -
Variance-Adaptive Optimal Algorithm for Reinforcement Learning with Multinomial Logit Function Approximation
di: Kim, Wonyoung, et al.
Pubblicazione: (2026) -
Echoes of Socratic Doubt: Embracing Uncertainty in Calibrated Evidential Reinforcement Learning
di: Stutts, Alex Christopher, et al.
Pubblicazione: (2024)