Replicability is Asymptotically Free in Multi-armed Bandits
Fuente:
arXiv
Guardado en:
| Autores principales: | Komiyama, Junpei, Ito, Shinji, Yoshida, Yuichi, Koshino, Souta |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Data-dependent Bounds with $T$-Optimal Best-of-Both-Worlds Guarantees in Multi-Armed Bandits using Stability-Penalty Matching
por: Nguyen, Quan, et al.
Publicado: (2025)
por: Nguyen, Quan, et al.
Publicado: (2025)
High-dimensional Contextual Bandit Problem without Sparsity
por: Komiyama, Junpei, et al.
Publicado: (2023)
por: Komiyama, Junpei, et al.
Publicado: (2023)
High-dimensional Nonparametric Contextual Bandit Problem
por: Iwazaki, Shogo, et al.
Publicado: (2025)
por: Iwazaki, Shogo, et al.
Publicado: (2025)
A Tight Lower Bound for Non-stochastic Multi-armed Bandits with Expert Advice
por: Chase, Zachary, et al.
Publicado: (2025)
por: Chase, Zachary, et al.
Publicado: (2025)
Suboptimal Performance of the Bayes Optimal Algorithm in Frequentist Best Arm Identification
por: Komiyama, Junpei
Publicado: (2022)
por: Komiyama, Junpei
Publicado: (2022)
Finite-Time Regret Analysis of Retry-Aware Bandits
por: Tong, Bingkui, et al.
Publicado: (2026)
por: Tong, Bingkui, et al.
Publicado: (2026)
Best-of-$\infty$ -- Asymptotic Performance of Test-Time LLM Ensembling
por: Komiyama, Junpei, et al.
Publicado: (2025)
por: Komiyama, Junpei, et al.
Publicado: (2025)
Fixed Confidence Best Arm Identification in the Bayesian Setting
por: Jang, Kyoungseok, et al.
Publicado: (2024)
por: Jang, Kyoungseok, et al.
Publicado: (2024)
Rate-optimal Design for Anytime Best Arm Identification
por: Komiyama, Junpei, et al.
Publicado: (2025)
por: Komiyama, Junpei, et al.
Publicado: (2025)
LC-Tsallis-INF: Generalized Best-of-Both-Worlds Linear Contextual Bandits
por: Kato, Masahiro, et al.
Publicado: (2024)
por: Kato, Masahiro, et al.
Publicado: (2024)
GINO-Q: Learning an Asymptotically Optimal Index Policy for Restless Multi-armed Bandits
por: Chen, Gongpu, et al.
Publicado: (2024)
por: Chen, Gongpu, et al.
Publicado: (2024)
Influential Bandits: Pulling an Arm May Change the Environment
por: Sato, Ryoma, et al.
Publicado: (2025)
por: Sato, Ryoma, et al.
Publicado: (2025)
Bandit Max-Min Fair Allocation
por: Harada, Tsubasa, et al.
Publicado: (2025)
por: Harada, Tsubasa, et al.
Publicado: (2025)
Multi-armed Bandits with Missing Outcome
por: Mahrooghi, Ilia, et al.
Publicado: (2024)
por: Mahrooghi, Ilia, et al.
Publicado: (2024)
An Efficient Algorithm for Thresholding Monte Carlo Tree Search
por: Nameki, Shoma, et al.
Publicado: (2026)
por: Nameki, Shoma, et al.
Publicado: (2026)
Heavy-tailed Linear Bandits: Adversarial Robustness, Best-of-both-worlds, and Beyond
por: Zhao, Canzhe, et al.
Publicado: (2025)
por: Zhao, Canzhe, et al.
Publicado: (2025)
Maximal Objectives in the Multi-armed Bandit with Applications
por: Ozbay, Eren, et al.
Publicado: (2020)
por: Ozbay, Eren, et al.
Publicado: (2020)
Offline Learning for Combinatorial Multi-armed Bandits
por: Liu, Xutong, et al.
Publicado: (2025)
por: Liu, Xutong, et al.
Publicado: (2025)
From Generative to Episodic: Sample-Efficient Replicable Reinforcement Learning
por: Hopkins, Max, et al.
Publicado: (2025)
por: Hopkins, Max, et al.
Publicado: (2025)
Combinatorial Allocation Bandits with Nonlinear Arm Utility
por: Shibukawa, Yuki, et al.
Publicado: (2026)
por: Shibukawa, Yuki, et al.
Publicado: (2026)
Causally Abstracted Multi-armed Bandits
por: Zennaro, Fabio Massimo, et al.
Publicado: (2024)
por: Zennaro, Fabio Massimo, et al.
Publicado: (2024)
Deceptive Exploration in Multi-armed Bandits
por: Vurankaya, I. Arda, et al.
Publicado: (2025)
por: Vurankaya, I. Arda, et al.
Publicado: (2025)
No-regret incentive-compatible online learning under exact truthfulness with non-myopic experts
por: Komiyama, Junpei, et al.
Publicado: (2025)
por: Komiyama, Junpei, et al.
Publicado: (2025)
A Perturbation Approach to Unconstrained Linear Bandits
por: Jacobsen, Andrew, et al.
Publicado: (2026)
por: Jacobsen, Andrew, et al.
Publicado: (2026)
Fairness of Exposure in Online Restless Multi-armed Bandits
por: Sood, Archit, et al.
Publicado: (2024)
por: Sood, Archit, et al.
Publicado: (2024)
Replicable Constrained Bandits
por: Bollini, Matteo, et al.
Publicado: (2026)
por: Bollini, Matteo, et al.
Publicado: (2026)
Transfer Learning for Contextual Multi-armed Bandits
por: Cai, Changxiao, et al.
Publicado: (2022)
por: Cai, Changxiao, et al.
Publicado: (2022)
Revisiting Follow-the-Perturbed-Leader with Unbounded Perturbations in Bandit Problems
por: Lee, Jongyeong, et al.
Publicado: (2025)
por: Lee, Jongyeong, et al.
Publicado: (2025)
Locally Private Nonparametric Contextual Multi-armed Bandits
por: Ma, Yuheng, et al.
Publicado: (2025)
por: Ma, Yuheng, et al.
Publicado: (2025)
Learning with Limited Shared Information in Multi-agent Multi-armed Bandit
por: Shao, Junning, et al.
Publicado: (2025)
por: Shao, Junning, et al.
Publicado: (2025)
Multi-agent Multi-armed Bandit with Fully Heavy-tailed Dynamics
por: Wang, Xingyu, et al.
Publicado: (2025)
por: Wang, Xingyu, et al.
Publicado: (2025)
Heterogeneous Multi-agent Multi-armed Bandits on Stochastic Block Models
por: Xu, Mengfan, et al.
Publicado: (2025)
por: Xu, Mengfan, et al.
Publicado: (2025)
Transfer in Sequential Multi-armed Bandits via Reward Samples
por: R, Rahul N, et al.
Publicado: (2024)
por: R, Rahul N, et al.
Publicado: (2024)
Falcon: Fair Active Learning using Multi-armed Bandits
por: Tae, Ki Hyun, et al.
Publicado: (2024)
por: Tae, Ki Hyun, et al.
Publicado: (2024)
Hybrid Combinatorial Multi-armed Bandits with Probabilistically Triggered Arms
por: Zhou, Kongchang, et al.
Publicado: (2025)
por: Zhou, Kongchang, et al.
Publicado: (2025)
Reliable Chain-of-Thought via Prefix Consistency
por: Iwase, Naoto, et al.
Publicado: (2026)
por: Iwase, Naoto, et al.
Publicado: (2026)
Design Experiments to Compare Multi-armed Bandit Algorithms
por: Meng, Huiling, et al.
Publicado: (2026)
por: Meng, Huiling, et al.
Publicado: (2026)
Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback
por: Ito, Shinji, et al.
Publicado: (2025)
por: Ito, Shinji, et al.
Publicado: (2025)
Kullback-Leibler Maillard Sampling for Multi-armed Bandits with Bounded Rewards
por: Qin, Hao, et al.
Publicado: (2023)
por: Qin, Hao, et al.
Publicado: (2023)
Efficient and Optimal Policy Gradient Algorithm for Corrupted Multi-armed Bandits
por: Liu, Jiayuan, et al.
Publicado: (2025)
por: Liu, Jiayuan, et al.
Publicado: (2025)
Ejemplares similares
-
Data-dependent Bounds with $T$-Optimal Best-of-Both-Worlds Guarantees in Multi-Armed Bandits using Stability-Penalty Matching
por: Nguyen, Quan, et al.
Publicado: (2025) -
High-dimensional Contextual Bandit Problem without Sparsity
por: Komiyama, Junpei, et al.
Publicado: (2023) -
High-dimensional Nonparametric Contextual Bandit Problem
por: Iwazaki, Shogo, et al.
Publicado: (2025) -
A Tight Lower Bound for Non-stochastic Multi-armed Bandits with Expert Advice
por: Chase, Zachary, et al.
Publicado: (2025) -
Suboptimal Performance of the Bayes Optimal Algorithm in Frequentist Best Arm Identification
por: Komiyama, Junpei
Publicado: (2022)