Contextual Multinomial Logit Bandits with General Value Functions
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Mengxiao, Luo, Haipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Contextual Linear Bandits with Delay as Payoff
por: Zhang, Mengxiao, et al.
Publicado: (2025)
por: Zhang, Mengxiao, et al.
Publicado: (2025)
Efficient Contextual Bandits with Uninformed Feedback Graphs
por: Zhang, Mengxiao, et al.
Publicado: (2024)
por: Zhang, Mengxiao, et al.
Publicado: (2024)
Tractable Multinomial Logit Contextual Bandits with Non-Linear Utilities
por: Hwang, Taehyun, et al.
Publicado: (2026)
por: Hwang, Taehyun, et al.
Publicado: (2026)
A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit
por: Agrawal, Priyank, et al.
Publicado: (2020)
por: Agrawal, Priyank, et al.
Publicado: (2020)
Learning in Position-Aware Multinomial Logit Bandits: From Multiplicative to General Position Effects
por: Chen, Xi, et al.
Publicado: (2026)
por: Chen, Xi, et al.
Publicado: (2026)
Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback
por: Zhang, Mengxiao, et al.
Publicado: (2026)
por: Zhang, Mengxiao, et al.
Publicado: (2026)
Near-Optimal Last-Iterate Convergence for Zero-Sum Games with Bandit Feedback and Opponent Actions
por: Hait, Soumita, et al.
Publicado: (2026)
por: Hait, Soumita, et al.
Publicado: (2026)
Provably Efficient Reinforcement Learning with Multinomial Logit Function Approximation
por: Li, Long-Fei, et al.
Publicado: (2024)
por: Li, Long-Fei, et al.
Publicado: (2024)
Variance-Adaptive Optimal Algorithm for Reinforcement Learning with Multinomial Logit Function Approximation
por: Kim, Wonyoung, et al.
Publicado: (2026)
por: Kim, Wonyoung, et al.
Publicado: (2026)
Provably Efficient Interactive-Grounded Learning with Personalized Reward
por: Zhang, Mengxiao, et al.
Publicado: (2024)
por: Zhang, Mengxiao, et al.
Publicado: (2024)
Single Index Bandits: Generalized Linear Contextual Bandits with Unknown Reward Functions
por: Kang, Yue, et al.
Publicado: (2025)
por: Kang, Yue, et al.
Publicado: (2025)
Alternating Regret for Online Convex Optimization
por: Hait, Soumita, et al.
Publicado: (2025)
por: Hait, Soumita, et al.
Publicado: (2025)
Comparator-Adaptive $Φ$-Regret: Improved Bounds, Simpler Algorithms, and Applications to Games
por: Hait, Soumita, et al.
Publicado: (2025)
por: Hait, Soumita, et al.
Publicado: (2025)
Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification
por: Lee, Joongkyu, et al.
Publicado: (2026)
por: Lee, Joongkyu, et al.
Publicado: (2026)
Achieving Limited Adaptivity for Multinomial Logistic Bandits
por: Midigeshi, Sukruta Prakash, et al.
Publicado: (2025)
por: Midigeshi, Sukruta Prakash, et al.
Publicado: (2025)
Nearly Minimax Optimal Regret for Multinomial Logistic Bandit
por: Lee, Joongkyu, et al.
Publicado: (2024)
por: Lee, Joongkyu, et al.
Publicado: (2024)
Improved Online Confidence Bounds for Multinomial Logistic Bandits
por: Lee, Joongkyu, et al.
Publicado: (2025)
por: Lee, Joongkyu, et al.
Publicado: (2025)
Learning Multinomial Logits in $O(n \log n)$ time
por: Chierichetti, Flavio, et al.
Publicado: (2026)
por: Chierichetti, Flavio, et al.
Publicado: (2026)
Near-Optimal Regret for Distributed Adversarial Bandits: A Black-Box Approach
por: Qiu, Hao, et al.
Publicado: (2026)
por: Qiu, Hao, et al.
Publicado: (2026)
No-Regret Learning for Fair Multi-Agent Social Welfare Optimization
por: Zhang, Mengxiao, et al.
Publicado: (2024)
por: Zhang, Mengxiao, et al.
Publicado: (2024)
Group-Sensitive Offline Contextual Bandits
por: Guo, Yihong, et al.
Publicado: (2025)
por: Guo, Yihong, et al.
Publicado: (2025)
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
por: Levy, Orin, et al.
Publicado: (2025)
por: Levy, Orin, et al.
Publicado: (2025)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
por: Cassel, Asaf, et al.
Publicado: (2024)
por: Cassel, Asaf, et al.
Publicado: (2024)
One Good Source is All You Need: Near-Optimal Regret for Bandits under Heterogeneous Noise
por: Bhat, Amith, et al.
Publicado: (2026)
por: Bhat, Amith, et al.
Publicado: (2026)
Improved Regret Bounds of (Multinomial) Logistic Bandits via Regret-to-Confidence-Set Conversion
por: Lee, Junghyun, et al.
Publicado: (2023)
por: Lee, Junghyun, et al.
Publicado: (2023)
Efficient Generalized Low-Rank Tensor Contextual Bandits
por: Yi, Qianxin, et al.
Publicado: (2023)
por: Yi, Qianxin, et al.
Publicado: (2023)
Second Order Bounds for Contextual Bandits with Function Approximation
por: Pacchiano, Aldo
Publicado: (2024)
por: Pacchiano, Aldo
Publicado: (2024)
Contextual Bandits for Unbounded Context Distributions
por: Zhao, Puning, et al.
Publicado: (2024)
por: Zhao, Puning, et al.
Publicado: (2024)
Sparse Nonparametric Contextual Bandits
por: Flynn, Hamish, et al.
Publicado: (2025)
por: Flynn, Hamish, et al.
Publicado: (2025)
Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback
por: Goyal, Tanmay, et al.
Publicado: (2025)
por: Goyal, Tanmay, et al.
Publicado: (2025)
Online Continuous Hyperparameter Optimization for Generalized Linear Contextual Bandits
por: Kang, Yue, et al.
Publicado: (2023)
por: Kang, Yue, et al.
Publicado: (2023)
Generalized Low-Rank Matrix Contextual Bandits with Graph Information
por: Wang, Yao, et al.
Publicado: (2025)
por: Wang, Yao, et al.
Publicado: (2025)
Shuffle and Joint Differential Privacy for Generalized Linear Contextual Bandits
por: Sarmasarkar, Sahasrajit
Publicado: (2026)
por: Sarmasarkar, Sahasrajit
Publicado: (2026)
Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback
por: Ito, Shinji, et al.
Publicado: (2025)
por: Ito, Shinji, et al.
Publicado: (2025)
Linear Contextual Bandits with Interference
por: Xu, Yang, et al.
Publicado: (2024)
por: Xu, Yang, et al.
Publicado: (2024)
Uncertainty of Joint Neural Contextual Bandit
por: Guo, Hongbo, et al.
Publicado: (2024)
por: Guo, Hongbo, et al.
Publicado: (2024)
Contextual Bandits with Stage-wise Constraints
por: Pacchiano, Aldo, et al.
Publicado: (2024)
por: Pacchiano, Aldo, et al.
Publicado: (2024)
Designing an Interpretable Interface for Contextual Bandits
por: Maher, Andrew, et al.
Publicado: (2024)
por: Maher, Andrew, et al.
Publicado: (2024)
Neural Exploitation and Exploration of Contextual Bandits
por: Ban, Yikun, et al.
Publicado: (2023)
por: Ban, Yikun, et al.
Publicado: (2023)
Multiplayer Information Asymmetric Contextual Bandits
por: Chang, William, et al.
Publicado: (2025)
por: Chang, William, et al.
Publicado: (2025)
Ejemplares similares
-
Contextual Linear Bandits with Delay as Payoff
por: Zhang, Mengxiao, et al.
Publicado: (2025) -
Efficient Contextual Bandits with Uninformed Feedback Graphs
por: Zhang, Mengxiao, et al.
Publicado: (2024) -
Tractable Multinomial Logit Contextual Bandits with Non-Linear Utilities
por: Hwang, Taehyun, et al.
Publicado: (2026) -
A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit
por: Agrawal, Priyank, et al.
Publicado: (2020) -
Learning in Position-Aware Multinomial Logit Bandits: From Multiplicative to General Position Effects
por: Chen, Xi, et al.
Publicado: (2026)