Provably Efficient Multi-Objective Bandit Algorithms under Preference-Centric Customization
Fuente:
arXiv
Saved in:
| Main Authors: | Cao, Linfeng, Shi, Ming, Shroff, Ness B. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
by: Li, Yining, et al.
Published: (2026)
by: Li, Yining, et al.
Published: (2026)
Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences
by: Shi, Ming, et al.
Published: (2026)
by: Shi, Ming, et al.
Published: (2026)
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
by: Roknilamouki, Amirhossein, et al.
Published: (2025)
by: Roknilamouki, Amirhossein, et al.
Published: (2025)
How to Find the Exact Pareto Front for Multi-Objective MDPs?
by: Li, Yining, et al.
Published: (2024)
by: Li, Yining, et al.
Published: (2024)
An LP-based Sampling Policy for Multi-Armed Bandits with Side-Observations and Stochastic Availability
by: Soni, Ashutosh, et al.
Published: (2026)
by: Soni, Ashutosh, et al.
Published: (2026)
Near-Optimal Partially Observable Reinforcement Learning with Partial Online State Information
by: Shi, Ming, et al.
Published: (2023)
by: Shi, Ming, et al.
Published: (2023)
Communication-Corruption Coupling and Verification in Cooperative Multi-Objective Bandits
by: Shi, Ming
Published: (2026)
by: Shi, Ming
Published: (2026)
Probe-then-Commit Multi-Objective Bandits: Theoretical Benefits of Limited Multi-Arm Feedback
by: Shi, Ming
Published: (2026)
by: Shi, Ming
Published: (2026)
Online Learning for Optimizing AoI-Energy Tradeoff under Unknown Channel Statistics
by: Abd-Elmagid, Mohamed A., et al.
Published: (2025)
by: Abd-Elmagid, Mohamed A., et al.
Published: (2025)
Absorb and Converge: Provable Convergence Guarantee for Absorbing Discrete Diffusion Models
by: Liang, Yuchen, et al.
Published: (2025)
by: Liang, Yuchen, et al.
Published: (2025)
Constraint-Rectified Training for Efficient Chain-of-Thought
by: Wu, Qinhang, et al.
Published: (2026)
by: Wu, Qinhang, et al.
Published: (2026)
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives
by: Akash, S, et al.
Published: (2026)
by: Akash, S, et al.
Published: (2026)
From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models
by: Liang, Yuchen, et al.
Published: (2026)
by: Liang, Yuchen, et al.
Published: (2026)
Monitoring State Transitions in Markovian Systems with Sampling Cost
by: Saurav, Kumar, et al.
Published: (2025)
by: Saurav, Kumar, et al.
Published: (2025)
BeST -- A Novel Source Selection Metric for Transfer Learning
by: Soni, Ashutosh, et al.
Published: (2025)
by: Soni, Ashutosh, et al.
Published: (2025)
Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration
by: Roknilamouki, Amirhossein, et al.
Published: (2026)
by: Roknilamouki, Amirhossein, et al.
Published: (2026)
FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
by: Nourzad, Fatemeh, et al.
Published: (2025)
by: Nourzad, Fatemeh, et al.
Published: (2025)
Multi-Objective Reward and Preference Optimization: Theory and Algorithms
by: Agnihotri, Akhil
Published: (2025)
by: Agnihotri, Akhil
Published: (2025)
Theory on Score-Mismatched Diffusion Models and Zero-Shot Conditional Samplers
by: Liang, Yuchen, et al.
Published: (2024)
by: Liang, Yuchen, et al.
Published: (2024)
Sharp Convergence Rates for Masked Diffusion Models
by: Liang, Yuchen, et al.
Published: (2026)
by: Liang, Yuchen, et al.
Published: (2026)
Split the Differences, Pool the Rest: Provably Efficient Multi-Objective Imitation
by: Sheebaelhamd, Ziyad, et al.
Published: (2026)
by: Sheebaelhamd, Ziyad, et al.
Published: (2026)
Stochastic Multi-Objective Multi-Armed Bandits: Regret Definition and Algorithm
by: Davoodi, Mansoor, et al.
Published: (2025)
by: Davoodi, Mansoor, et al.
Published: (2025)
Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback
by: Xiong, Guojun, et al.
Published: (2024)
by: Xiong, Guojun, et al.
Published: (2024)
Discrete Diffusion Models: Novel Analysis and New Sampler Guarantees
by: Liang, Yuchen, et al.
Published: (2025)
by: Liang, Yuchen, et al.
Published: (2025)
Broadening Target Distributions for Accelerated Diffusion Models via a Novel Analysis Approach
by: Liang, Yuchen, et al.
Published: (2024)
by: Liang, Yuchen, et al.
Published: (2024)
Provable Anytime Ensemble Sampling Algorithms in Nonlinear Contextual Bandits
by: Sun, Jiazheng, et al.
Published: (2025)
by: Sun, Jiazheng, et al.
Published: (2025)
Mixture-of-Transformers Learn Faster: A Theoretical Study on Classification Problems
by: Li, Hongbo, et al.
Published: (2025)
by: Li, Hongbo, et al.
Published: (2025)
Non-Stationary Restless Multi-Armed Bandits with Provable Guarantee
by: Hung, Yu-Heng, et al.
Published: (2025)
by: Hung, Yu-Heng, et al.
Published: (2025)
Prediction-Assisted Online Distributed Deep Learning Workload Scheduling in GPU Clusters
by: Luo, Ziyue, et al.
Published: (2025)
by: Luo, Ziyue, et al.
Published: (2025)
Best Group Identification in Multi-Objective Bandits
by: Shahverdikondori, Mohammad, et al.
Published: (2025)
by: Shahverdikondori, Mohammad, et al.
Published: (2025)
Maximal Objectives in the Multi-armed Bandit with Applications
by: Ozbay, Eren, et al.
Published: (2020)
by: Ozbay, Eren, et al.
Published: (2020)
Can We Theoretically Quantify the Impacts of Local Updates on the Generalization Performance of Federated Learning?
by: Ju, Peizhong, et al.
Published: (2024)
by: Ju, Peizhong, et al.
Published: (2024)
Traversing Pareto Optimal Policies: Provably Efficient Multi-Objective Reinforcement Learning
by: Qiu, Shuang, et al.
Published: (2024)
by: Qiu, Shuang, et al.
Published: (2024)
Efficient and Interpretable Bandit Algorithms
by: Mukherjee, Subhojyoti, et al.
Published: (2023)
by: Mukherjee, Subhojyoti, et al.
Published: (2023)
Theory on Mixture-of-Experts in Continual Learning
by: Li, Hongbo, et al.
Published: (2024)
by: Li, Hongbo, et al.
Published: (2024)
Efficient First-Order Optimization on the Pareto Set for Multi-Objective Learning under Preference Guidance
by: Chen, Lisha, et al.
Published: (2025)
by: Chen, Lisha, et al.
Published: (2025)
Thompson Sampling for Multi-Objective Linear Contextual Bandit
by: Park, Somangchan, et al.
Published: (2025)
by: Park, Somangchan, et al.
Published: (2025)
MultiScale Contextual Bandits for Long Term Objectives
by: Rastogi, Richa, et al.
Published: (2025)
by: Rastogi, Richa, et al.
Published: (2025)
Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains
by: Viano, Luca, et al.
Published: (2026)
by: Viano, Luca, et al.
Published: (2026)
Preference-centric Bandits: Optimality of Mixtures and Regret-efficient Algorithms
by: Tatlı, Meltem, et al.
Published: (2025)
by: Tatlı, Meltem, et al.
Published: (2025)
Similar Items
-
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
by: Li, Yining, et al.
Published: (2026) -
Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences
by: Shi, Ming, et al.
Published: (2026) -
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
by: Roknilamouki, Amirhossein, et al.
Published: (2025) -
How to Find the Exact Pareto Front for Multi-Objective MDPs?
by: Li, Yining, et al.
Published: (2024) -
An LP-based Sampling Policy for Multi-Armed Bandits with Side-Observations and Stochastic Availability
by: Soni, Ashutosh, et al.
Published: (2026)