Almost Free: Self-concordance in Natural Exponential Families and an Application to Bandits
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shuai, Ayoub, Alex, Sentenac, Flore, Tan, Xiaoqi, Szepesvári, Csaba |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Balancing optimism and pessimism in offline-to-online learning
di: Sentenac, Flore, et al.
Pubblicazione: (2025)
di: Sentenac, Flore, et al.
Pubblicazione: (2025)
Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits
di: Liu, Shuai, et al.
Pubblicazione: (2026)
di: Liu, Shuai, et al.
Pubblicazione: (2026)
Exploration via linearly perturbed loss minimisation
di: Janz, David, et al.
Pubblicazione: (2023)
di: Janz, David, et al.
Pubblicazione: (2023)
Rectifying Regression in Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
di: Maran, Davide, et al.
Pubblicazione: (2026)
di: Maran, Davide, et al.
Pubblicazione: (2026)
Learning to Reason Efficiently with Discounted Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Eluder dimension: localise it!
di: Bakhtiari, Alireza, et al.
Pubblicazione: (2026)
di: Bakhtiari, Alireza, et al.
Pubblicazione: (2026)
Stochastic Gradient Succeeds for Bandits
di: Mei, Jincheng, et al.
Pubblicazione: (2024)
di: Mei, Jincheng, et al.
Pubblicazione: (2024)
Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs
di: Tian, Tian, et al.
Pubblicazione: (2024)
di: Tian, Tian, et al.
Pubblicazione: (2024)
Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear $q^π$-Realizability and Concentrability
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)
Sharp analysis of linear ensemble sampling
di: Akhavan, Arya, et al.
Pubblicazione: (2026)
di: Akhavan, Arya, et al.
Pubblicazione: (2026)
Switching the Loss Reduces the Cost in Batch (Offline) Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2024)
di: Ayoub, Alex, et al.
Pubblicazione: (2024)
Ensemble sampling for linear bandits: small ensembles suffice
di: Janz, David, et al.
Pubblicazione: (2023)
di: Janz, David, et al.
Pubblicazione: (2023)
The Challenger: When Do New Data Sources Justify Switching Machine Learning Models?
di: Digalakis Jr, Vassilis, et al.
Pubblicazione: (2025)
di: Digalakis Jr, Vassilis, et al.
Pubblicazione: (2025)
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
di: György, András, et al.
Pubblicazione: (2025)
di: György, András, et al.
Pubblicazione: (2025)
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
di: Zhong, Han, et al.
Pubblicazione: (2021)
di: Zhong, Han, et al.
Pubblicazione: (2021)
LACONIC: Length-Aware Constrained Reinforcement Learning for LLM
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
Regret Minimization via Saddle Point Optimization
di: Kirschner, Johannes, et al.
Pubblicazione: (2024)
di: Kirschner, Johannes, et al.
Pubblicazione: (2024)
To Believe or Not to Believe Your LLM
di: Yadkori, Yasin Abbasi, et al.
Pubblicazione: (2024)
di: Yadkori, Yasin Abbasi, et al.
Pubblicazione: (2024)
Guiding Time-Varying Generative Models with Natural Gradients on Exponential Family Manifold
di: Liu, Song, et al.
Pubblicazione: (2025)
di: Liu, Song, et al.
Pubblicazione: (2025)
Ordering-based Conditions for Global Convergence of Policy Gradient Methods
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
Exponential Family Attention
di: Wibisono, Kevin Christian, et al.
Pubblicazione: (2025)
di: Wibisono, Kevin Christian, et al.
Pubblicazione: (2025)
Almost Minimax Optimal Best Arm Identification in Piecewise Stationary Linear Bandits
di: Hou, Yunlong, et al.
Pubblicazione: (2024)
di: Hou, Yunlong, et al.
Pubblicazione: (2024)
Small steps no more: Global convergence of stochastic gradient bandits for arbitrary learning rates
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
Non-stationary Bandit Convex Optimization: A Comprehensive Study
di: Liu, Xiaoqi, et al.
Pubblicazione: (2025)
di: Liu, Xiaoqi, et al.
Pubblicazione: (2025)
Generalized Linear Bandits: Almost Optimal Regret with One-Pass Update
di: Zhang, Yu-Jie, et al.
Pubblicazione: (2025)
di: Zhang, Yu-Jie, et al.
Pubblicazione: (2025)
Frontier LLMs Still Struggle with Simple Reasoning Tasks
di: Malek, Alan, et al.
Pubblicazione: (2025)
di: Malek, Alan, et al.
Pubblicazione: (2025)
Model Predictive Control is Almost Optimal for Restless Bandit
di: Gast, Nicolas, et al.
Pubblicazione: (2024)
di: Gast, Nicolas, et al.
Pubblicazione: (2024)
Diffusion Models for Inverse Problems in the Exponential Family
di: Micheli, Alessandro, et al.
Pubblicazione: (2025)
di: Micheli, Alessandro, et al.
Pubblicazione: (2025)
Combinatorial Multivariant Multi-Armed Bandits with Applications to Episodic Reinforcement Learning and Beyond
di: Liu, Xutong, et al.
Pubblicazione: (2024)
di: Liu, Xutong, et al.
Pubblicazione: (2024)
Stein's Lemma for the Reparameterization Trick with Exponential Family Mixtures
di: Lin, Wu, et al.
Pubblicazione: (2019)
di: Lin, Wu, et al.
Pubblicazione: (2019)
Tighter Regret Lower Bound for Gaussian Process Bandits with Squared Exponential Kernel in Hypersphere
di: Iwazaki, Shogo
Pubblicazione: (2026)
di: Iwazaki, Shogo
Pubblicazione: (2026)
Stochastic Gradient Descent for Gaussian Processes Done Right
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2023)
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2023)
Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation
di: Lin, Max Qiushi, et al.
Pubblicazione: (2025)
di: Lin, Max Qiushi, et al.
Pubblicazione: (2025)
Optimal Analysis for Bandit Learning in Matching Markets with Serial Dictatorship
di: Wang, Zilong, et al.
Pubblicazione: (2025)
di: Wang, Zilong, et al.
Pubblicazione: (2025)
Scalable Frank-Wolfe on Generalized Self-concordant Functions via Simple Steps
di: Carderera, Alejandro, et al.
Pubblicazione: (2021)
di: Carderera, Alejandro, et al.
Pubblicazione: (2021)
Cascading Bandits Robust to Adversarial Corruptions
di: Xie, Jize, et al.
Pubblicazione: (2025)
di: Xie, Jize, et al.
Pubblicazione: (2025)
Decentralized Asynchronous Multi-player Bandits
di: Fan, Jingqi, et al.
Pubblicazione: (2025)
di: Fan, Jingqi, et al.
Pubblicazione: (2025)
On the Benefits of Free Exploration for Regret Minimization in Multi-Armed Bandits
di: Hou, Yunlong, et al.
Pubblicazione: (2026)
di: Hou, Yunlong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Balancing optimism and pessimism in offline-to-online learning
di: Sentenac, Flore, et al.
Pubblicazione: (2025) -
Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits
di: Liu, Shuai, et al.
Pubblicazione: (2026) -
Exploration via linearly perturbed loss minimisation
di: Janz, David, et al.
Pubblicazione: (2023) -
Rectifying Regression in Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025) -
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
di: Maran, Davide, et al.
Pubblicazione: (2026)