Randomized Exploration for Reinforcement Learning with Multinomial Logistic Function Approximation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cho, Wooseong, Hwang, Taehyun, Lee, Joongkyu, Oh, Min-hwan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Model-Based Reinforcement Learning with Multinomial Logistic Function Approximation
par: Hwang, Taehyun, et autres
Publié: (2022)
par: Hwang, Taehyun, et autres
Publié: (2022)
Nearly Minimax Optimal Regret for Multinomial Logistic Bandit
par: Lee, Joongkyu, et autres
Publié: (2024)
par: Lee, Joongkyu, et autres
Publié: (2024)
Improved Online Confidence Bounds for Multinomial Logistic Bandits
par: Lee, Joongkyu, et autres
Publié: (2025)
par: Lee, Joongkyu, et autres
Publié: (2025)
Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification
par: Lee, Joongkyu, et autres
Publié: (2026)
par: Lee, Joongkyu, et autres
Publié: (2026)
Combinatorial Reinforcement Learning with Preference Feedback
par: Lee, Joongkyu, et autres
Publié: (2025)
par: Lee, Joongkyu, et autres
Publié: (2025)
Tractable Multinomial Logit Contextual Bandits with Non-Linear Utilities
par: Hwang, Taehyun, et autres
Publié: (2026)
par: Hwang, Taehyun, et autres
Publié: (2026)
Demystifying Linear MDPs and Novel Dynamics Aggregation Framework
par: Lee, Joongkyu, et autres
Publié: (2024)
par: Lee, Joongkyu, et autres
Publié: (2024)
Nonstationary Generalized Linear Bandits with Discounted Online Mirror Descent
par: Lee, Joongkyu, et autres
Publié: (2026)
par: Lee, Joongkyu, et autres
Publié: (2026)
Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options
par: Lee, Joongkyu, et autres
Publié: (2025)
par: Lee, Joongkyu, et autres
Publié: (2025)
Lasso Bandit with Compatibility Condition on Optimal Arm
par: Lee, Harin, et autres
Publié: (2024)
par: Lee, Harin, et autres
Publié: (2024)
Infinite-Horizon Reinforcement Learning with Multinomial Logistic Function Approximation
par: Park, Jaehyun, et autres
Publié: (2024)
par: Park, Jaehyun, et autres
Publié: (2024)
Learning Uncertainty-Aware Temporally-Extended Actions
par: Lee, Joongkyu, et autres
Publié: (2024)
par: Lee, Joongkyu, et autres
Publié: (2024)
Infrequent Exploration in Linear Bandits
par: Lee, Harin, et autres
Publié: (2025)
par: Lee, Harin, et autres
Publié: (2025)
Minimax Optimal Reinforcement Learning with Quasi-Optimism
par: Lee, Harin, et autres
Publié: (2025)
par: Lee, Harin, et autres
Publié: (2025)
Variance-Adaptive Optimal Algorithm for Reinforcement Learning with Multinomial Logit Function Approximation
par: Kim, Wonyoung, et autres
Publié: (2026)
par: Kim, Wonyoung, et autres
Publié: (2026)
Unified Framework of Distributional Regret in Multi-Armed Bandits and Reinforcement Learning
par: Lee, Harin, et autres
Publié: (2026)
par: Lee, Harin, et autres
Publié: (2026)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
par: Yoon, Deokgyu, et autres
Publié: (2026)
par: Yoon, Deokgyu, et autres
Publié: (2026)
Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning
par: Kim, Byeongchan, et autres
Publié: (2026)
par: Kim, Byeongchan, et autres
Publié: (2026)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2025)
par: Kang, Hyungkyu, et autres
Publié: (2025)
Exploration via Feature Perturbation in Contextual Bandits
par: Yi, Seouh-won, et autres
Publié: (2025)
par: Yi, Seouh-won, et autres
Publié: (2025)
Provably Efficient Reinforcement Learning with Multinomial Logit Function Approximation
par: Li, Long-Fei, et autres
Publié: (2024)
par: Li, Long-Fei, et autres
Publié: (2024)
Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2026)
par: Kang, Hyungkyu, et autres
Publié: (2026)
SPQR: Controlling Q-ensemble Independence with Spiked Random Model for Reinforcement Learning
par: Lee, Dohyeok, et autres
Publié: (2024)
par: Lee, Dohyeok, et autres
Publié: (2024)
Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function Approximation
par: Cho, Taehyun, et autres
Publié: (2024)
par: Cho, Taehyun, et autres
Publié: (2024)
Improved Regret of Linear Ensemble Sampling
par: Lee, Harin, et autres
Publié: (2024)
par: Lee, Harin, et autres
Publié: (2024)
Rethinking Multinomial Logistic Mixture of Experts with Sigmoid Gating Function
par: Pham, Tuan Minh, et autres
Publié: (2026)
par: Pham, Tuan Minh, et autres
Publié: (2026)
Spectral-Risk Safe Reinforcement Learning with Convergence Guarantees
par: Kim, Dohyeong, et autres
Publié: (2024)
par: Kim, Dohyeong, et autres
Publié: (2024)
Blessings of Multiple Good Arms in Multi-Objective Linear Bandits
par: Ann, Heesang, et autres
Publié: (2026)
par: Ann, Heesang, et autres
Publié: (2026)
Optimal and Practical Batched Linear Bandit Algorithm
par: Yu, Sanghoon, et autres
Publié: (2025)
par: Yu, Sanghoon, et autres
Publié: (2025)
Practical and Optimal Algorithm for Linear Contextual Bandits with Rare Parameter Updates
par: Yu, Sanghoon, et autres
Publié: (2026)
par: Yu, Sanghoon, et autres
Publié: (2026)
Follow-the-Perturbed-Leader for Decoupled Bandits: Best-of-Both-Worlds and Practicality
par: Kim, Chaiwon, et autres
Publié: (2025)
par: Kim, Chaiwon, et autres
Publié: (2025)
Symmetry-Aware GFlowNets
par: Kim, Hohyun, et autres
Publié: (2025)
par: Kim, Hohyun, et autres
Publié: (2025)
Achieving Limited Adaptivity for Multinomial Logistic Bandits
par: Midigeshi, Sukruta Prakash, et autres
Publié: (2025)
par: Midigeshi, Sukruta Prakash, et autres
Publié: (2025)
FIRAL: An Active Learning Algorithm for Multinomial Logistic Regression
par: Chen, Youguang, et autres
Publié: (2024)
par: Chen, Youguang, et autres
Publié: (2024)
Riemannian Multinomial Logistics Regression for SPD Neural Networks
par: Chen, Ziheng, et autres
Publié: (2023)
par: Chen, Ziheng, et autres
Publié: (2023)
Queueing Matching Bandits with Preference Feedback
par: Kim, Jung-hun, et autres
Publié: (2024)
par: Kim, Jung-hun, et autres
Publié: (2024)
Local Anti-Concentration Class: Logarithmic Regret for Greedy Linear Contextual Bandit
par: Kim, Seok-Jin, et autres
Publié: (2024)
par: Kim, Seok-Jin, et autres
Publié: (2024)
ADAM Optimization with Adaptive Batch Selection
par: Kim, Gyu Yeol, et autres
Publié: (2025)
par: Kim, Gyu Yeol, et autres
Publié: (2025)
Stochastic Matching Bandits with Rare Optimization Updates
par: Kim, Jung-hun, et autres
Publié: (2025)
par: Kim, Jung-hun, et autres
Publié: (2025)
Dynamic Assortment Selection and Pricing with Censored Preference Feedback
par: Kim, Jung-hun, et autres
Publié: (2025)
par: Kim, Jung-hun, et autres
Publié: (2025)
Documents similaires
-
Model-Based Reinforcement Learning with Multinomial Logistic Function Approximation
par: Hwang, Taehyun, et autres
Publié: (2022) -
Nearly Minimax Optimal Regret for Multinomial Logistic Bandit
par: Lee, Joongkyu, et autres
Publié: (2024) -
Improved Online Confidence Bounds for Multinomial Logistic Bandits
par: Lee, Joongkyu, et autres
Publié: (2025) -
Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification
par: Lee, Joongkyu, et autres
Publié: (2026) -
Combinatorial Reinforcement Learning with Preference Feedback
par: Lee, Joongkyu, et autres
Publié: (2025)