Asymptotically-Optimal Gaussian Bandits with Side Observations
Fuente:
arXiv
Salvato in:
| Autori principali: | Atsidakou, Alexia, Papadigenopoulos, Orestis, Caramanis, Constantine, Sanghavi, Sujay, Shakkottai, Sanjay |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Contextual Pandora's Box
di: Atsidakou, Alexia, et al.
Pubblicazione: (2022)
di: Atsidakou, Alexia, et al.
Pubblicazione: (2022)
Finite-Time Logarithmic Bayes Regret Upper Bounds
di: Atsidakou, Alexia, et al.
Pubblicazione: (2023)
di: Atsidakou, Alexia, et al.
Pubblicazione: (2023)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
di: Tejaswi, Atula, et al.
Pubblicazione: (2026)
di: Tejaswi, Atula, et al.
Pubblicazione: (2026)
Blocking Bandits
di: Basu, Soumya, et al.
Pubblicazione: (2019)
di: Basu, Soumya, et al.
Pubblicazione: (2019)
Anchored Diffusion Language Model
di: Rout, Litu, et al.
Pubblicazione: (2025)
di: Rout, Litu, et al.
Pubblicazione: (2025)
AnCoder: Anchored Code Generation via Discrete Diffusion Models
di: Xue, Anton, et al.
Pubblicazione: (2026)
di: Xue, Anton, et al.
Pubblicazione: (2026)
On Mitigating Affinity Bias through Bandits with Evolving Biased Feedback
di: Faw, Matthew, et al.
Pubblicazione: (2025)
di: Faw, Matthew, et al.
Pubblicazione: (2025)
In-Context Learning with Transformers: Softmax Attention Adapts to Function Lipschitzness
di: Collins, Liam, et al.
Pubblicazione: (2024)
di: Collins, Liam, et al.
Pubblicazione: (2024)
RB-Modulation: Training-Free Personalization of Diffusion Models using Stochastic Optimal Control
di: Rout, Litu, et al.
Pubblicazione: (2024)
di: Rout, Litu, et al.
Pubblicazione: (2024)
Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations
di: Rout, Litu, et al.
Pubblicazione: (2024)
di: Rout, Litu, et al.
Pubblicazione: (2024)
Test-Time Anchoring for Discrete Diffusion Posterior Sampling
di: Rout, Litu, et al.
Pubblicazione: (2025)
di: Rout, Litu, et al.
Pubblicazione: (2025)
Bandits with Mean Bounds
di: Sharma, Nihal, et al.
Pubblicazione: (2020)
di: Sharma, Nihal, et al.
Pubblicazione: (2020)
Understanding Self-Supervised Learning via Gaussian Mixture Models
di: Bansal, Parikshit, et al.
Pubblicazione: (2024)
di: Bansal, Parikshit, et al.
Pubblicazione: (2024)
Context-Free Synthetic Data Mitigates Forgetting
di: Bansal, Parikshit, et al.
Pubblicazione: (2025)
di: Bansal, Parikshit, et al.
Pubblicazione: (2025)
Optimization Can Learn Johnson Lindenstrauss Embeddings
di: Tsikouras, Nikos, et al.
Pubblicazione: (2024)
di: Tsikouras, Nikos, et al.
Pubblicazione: (2024)
MaxSketch: Robust Distinct Counting in Streams via Random Projections
di: Tsikouras, Nikos, et al.
Pubblicazione: (2026)
di: Tsikouras, Nikos, et al.
Pubblicazione: (2026)
Linear Regression with Unknown Truncation Beyond Gaussian Features
di: Kouridakis, Alexandros, et al.
Pubblicazione: (2026)
di: Kouridakis, Alexandros, et al.
Pubblicazione: (2026)
Enabling Approximate Joint Sampling in Diffusion LMs
di: Bansal, Parikshit, et al.
Pubblicazione: (2025)
di: Bansal, Parikshit, et al.
Pubblicazione: (2025)
Bandits with Stochastic Experts: Constant Regret, Empirical Experts and Episodes
di: Sharma, Nihal, et al.
Pubblicazione: (2021)
di: Sharma, Nihal, et al.
Pubblicazione: (2021)
Learning Mixtures of Experts with EM: A Mirror Descent Perspective
di: Fruytier, Quentin, et al.
Pubblicazione: (2024)
di: Fruytier, Quentin, et al.
Pubblicazione: (2024)
Collaborative Multi-Agent Heterogeneous Multi-Armed Bandits
di: Chawla, Ronshee, et al.
Pubblicazione: (2023)
di: Chawla, Ronshee, et al.
Pubblicazione: (2023)
Geometric Median (GM) Matching for Robust Data Pruning
di: Acharya, Anish, et al.
Pubblicazione: (2024)
di: Acharya, Anish, et al.
Pubblicazione: (2024)
Test-Time Speculation
di: Kumar, Avinash, et al.
Pubblicazione: (2026)
di: Kumar, Avinash, et al.
Pubblicazione: (2026)
Adaptive and Optimal Second-order Optimistic Methods for Minimax Optimization
di: Jiang, Ruichen, et al.
Pubblicazione: (2024)
di: Jiang, Ruichen, et al.
Pubblicazione: (2024)
The Gossiping Insert-Eliminate Algorithm for Multi-Agent Bandits
di: Chawla, Ronshee, et al.
Pubblicazione: (2020)
di: Chawla, Ronshee, et al.
Pubblicazione: (2020)
Stochastic Graph Bandit Learning with Side-Observations
di: Gong, Xueping, et al.
Pubblicazione: (2023)
di: Gong, Xueping, et al.
Pubblicazione: (2023)
RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation
di: Kwon, Jeongyeol, et al.
Pubblicazione: (2024)
di: Kwon, Jeongyeol, et al.
Pubblicazione: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
Geometric Median Matching for Robust k-Subset Selection from Noisy Data
di: Acharya, Anish, et al.
Pubblicazione: (2025)
di: Acharya, Anish, et al.
Pubblicazione: (2025)
Succeeding at Scale: Automated Dataset Construction and Query-Side Adaptation for Multi-Tenant Search
di: Jain, Prateek, et al.
Pubblicazione: (2026)
di: Jain, Prateek, et al.
Pubblicazione: (2026)
Understanding the Training Speedup from Sampling with Approximate Losses
di: Das, Rudrajit, et al.
Pubblicazione: (2024)
di: Das, Rudrajit, et al.
Pubblicazione: (2024)
Towards Quantifying the Preconditioning Effect of Adam
di: Das, Rudrajit, et al.
Pubblicazione: (2024)
di: Das, Rudrajit, et al.
Pubblicazione: (2024)
Machine Unlearning under Overparameterization
di: Block, Jacob L., et al.
Pubblicazione: (2025)
di: Block, Jacob L., et al.
Pubblicazione: (2025)
Partially Observable Contextual Bandits with Linear Payoffs
di: Zeng, Sihan, et al.
Pubblicazione: (2024)
di: Zeng, Sihan, et al.
Pubblicazione: (2024)
Single-Sample Prophet Inequalities via Greedy-Ordered Selection
di: Caramanis, Constantine, et al.
Pubblicazione: (2021)
di: Caramanis, Constantine, et al.
Pubblicazione: (2021)
Upweighting Easy Samples in Fine-Tuning Mitigates Forgetting
di: Sanyal, Sunny, et al.
Pubblicazione: (2025)
di: Sanyal, Sunny, et al.
Pubblicazione: (2025)
Temper-Then-Tilt: Principled Unlearning for Generative Models through Tempering and Classifier Guidance
di: Block, Jacob L., et al.
Pubblicazione: (2026)
di: Block, Jacob L., et al.
Pubblicazione: (2026)
DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback
di: Xiong, Guojun, et al.
Pubblicazione: (2024)
di: Xiong, Guojun, et al.
Pubblicazione: (2024)
Efficient Approximate Posterior Sampling with Annealed Langevin Monte Carlo
di: Parulekar, Advait, et al.
Pubblicazione: (2025)
di: Parulekar, Advait, et al.
Pubblicazione: (2025)
Asymptotically Optimal Problem-Dependent Bandit Policies for Transfer Learning
di: Prevost, Adrien, et al.
Pubblicazione: (2025)
di: Prevost, Adrien, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Contextual Pandora's Box
di: Atsidakou, Alexia, et al.
Pubblicazione: (2022) -
Finite-Time Logarithmic Bayes Regret Upper Bounds
di: Atsidakou, Alexia, et al.
Pubblicazione: (2023) -
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
di: Tejaswi, Atula, et al.
Pubblicazione: (2026) -
Blocking Bandits
di: Basu, Soumya, et al.
Pubblicazione: (2019) -
Anchored Diffusion Language Model
di: Rout, Litu, et al.
Pubblicazione: (2025)