A Regret Perspective on Online Multiple Testing
Fuente:
arXiv
Guardado en:
| Autores principales: | Hao, Qingyang, Zhou, Kongchang, Kong, Fang, Wei, Hongxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Data-Driven Online Model Selection With Regret Guarantees
por: Pacchiano, Aldo, et al.
Publicado: (2023)
por: Pacchiano, Aldo, et al.
Publicado: (2023)
Hybrid Combinatorial Multi-armed Bandits with Probabilistically Triggered Arms
por: Zhou, Kongchang, et al.
Publicado: (2025)
por: Zhou, Kongchang, et al.
Publicado: (2025)
Provable Training Data Identification for Large Language Models
por: Liu, Zhenlong, et al.
Publicado: (2025)
por: Liu, Zhenlong, et al.
Publicado: (2025)
Optimistic Regret Bounds for Online Learning in Adversarial Markov Decision Processes
por: Moon, Sang Bin, et al.
Publicado: (2024)
por: Moon, Sang Bin, et al.
Publicado: (2024)
How does Bayesian Sampling help Membership Inference Attacks?
por: Liu, Zhenlong, et al.
Publicado: (2025)
por: Liu, Zhenlong, et al.
Publicado: (2025)
RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models
por: Hao, Sai, et al.
Publicado: (2026)
por: Hao, Sai, et al.
Publicado: (2026)
Analytic Continual Test-Time Adaptation for Multi-Modality Corruption
por: Zhang, Yufei, et al.
Publicado: (2024)
por: Zhang, Yufei, et al.
Publicado: (2024)
Defending Membership Inference Attacks via Privacy-aware Sparsity Tuning
por: Hu, Qiang, et al.
Publicado: (2024)
por: Hu, Qiang, et al.
Publicado: (2024)
T-POP: Test-Time Personalization with Online Preference Feedback
por: Qu, Zikun, et al.
Publicado: (2025)
por: Qu, Zikun, et al.
Publicado: (2025)
RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs
por: Geuter, Jonathan, et al.
Publicado: (2025)
por: Geuter, Jonathan, et al.
Publicado: (2025)
Bridging Distributional and Risk-sensitive Reinforcement Learning with Provable Regret Bounds
por: Liang, Hao, et al.
Publicado: (2022)
por: Liang, Hao, et al.
Publicado: (2022)
Online Learning with Multiple Fairness Regularizers via Graph-Structured Feedback
por: Zhou, Quan, et al.
Publicado: (2025)
por: Zhou, Quan, et al.
Publicado: (2025)
Reasoning without Regret
por: Chitra, Tarun
Publicado: (2025)
por: Chitra, Tarun
Publicado: (2025)
Efficient Skill Discovery via Regret-Aware Optimization
por: Zhang, He, et al.
Publicado: (2025)
por: Zhang, He, et al.
Publicado: (2025)
Towards Reward Fairness in RLHF: From a Resource Allocation Perspective
por: Ouyang, Sheng, et al.
Publicado: (2025)
por: Ouyang, Sheng, et al.
Publicado: (2025)
HyPAC: Cost-Efficient LLMs-Human Hybrid Annotation with PAC Error Guarantees
por: Zeng, Hao, et al.
Publicado: (2026)
por: Zeng, Hao, et al.
Publicado: (2026)
Model-agnostic Selective Labeling with Provable Statistical Guarantees
por: Huang, Huipeng, et al.
Publicado: (2025)
por: Huang, Huipeng, et al.
Publicado: (2025)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
por: Baharav, Tavor Z., et al.
Publicado: (2025)
por: Baharav, Tavor Z., et al.
Publicado: (2025)
No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery
por: Rutherford, Alexander, et al.
Publicado: (2024)
por: Rutherford, Alexander, et al.
Publicado: (2024)
On the Learnability of Test-Time Adaptation: A Recovery Complexity Perspective
por: Zhou, Zhi, et al.
Publicado: (2026)
por: Zhou, Zhi, et al.
Publicado: (2026)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
por: Wang, Zhiyong, et al.
Publicado: (2024)
por: Wang, Zhiyong, et al.
Publicado: (2024)
Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator
por: Luo, Beier, et al.
Publicado: (2025)
por: Luo, Beier, et al.
Publicado: (2025)
On the Provable Performance Guarantee of Efficient Reasoning Models
por: Zeng, Hao, et al.
Publicado: (2025)
por: Zeng, Hao, et al.
Publicado: (2025)
Regret-Guided Search Control for Efficient Learning in AlphaZero
por: Tsai, Yun-Jui, et al.
Publicado: (2026)
por: Tsai, Yun-Jui, et al.
Publicado: (2026)
Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective
por: He, Shenghua, et al.
Publicado: (2025)
por: He, Shenghua, et al.
Publicado: (2025)
Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions
por: Gan, Guo, et al.
Publicado: (2026)
por: Gan, Guo, et al.
Publicado: (2026)
No-Regret Reinforcement Learning in Smooth MDPs
por: Maran, Davide, et al.
Publicado: (2024)
por: Maran, Davide, et al.
Publicado: (2024)
Regret-Free Reinforcement Learning for LTL Specifications
por: Majumdar, Rupak, et al.
Publicado: (2024)
por: Majumdar, Rupak, et al.
Publicado: (2024)
Regret-Based Defense in Adversarial Reinforcement Learning
por: Belaire, Roman, et al.
Publicado: (2023)
por: Belaire, Roman, et al.
Publicado: (2023)
Refining Minimax Regret for Unsupervised Environment Design
por: Beukman, Michael, et al.
Publicado: (2024)
por: Beukman, Michael, et al.
Publicado: (2024)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
por: Kong, Deyang, et al.
Publicado: (2025)
por: Kong, Deyang, et al.
Publicado: (2025)
Minimizing Weighted Counterfactual Regret with Optimistic Online Mirror Descent
por: Xu, Hang, et al.
Publicado: (2024)
por: Xu, Hang, et al.
Publicado: (2024)
Unveiling Statistical Significance of Online Regression over Multiple Datasets
por: Abu-Shaira, Mohammad, et al.
Publicado: (2025)
por: Abu-Shaira, Mohammad, et al.
Publicado: (2025)
Super-Exponential Regret for UCT, AlphaGo and Variants
por: Orseau, Laurent, et al.
Publicado: (2024)
por: Orseau, Laurent, et al.
Publicado: (2024)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
por: He, Jiafan, et al.
Publicado: (2025)
por: He, Jiafan, et al.
Publicado: (2025)
Regret-Based Federated Causal Discovery with Unknown Interventions
por: Baldo, Federico, et al.
Publicado: (2025)
por: Baldo, Federico, et al.
Publicado: (2025)
Kernelized Reinforcement Learning with Order Optimal Regret Bounds
por: Vakili, Sattar, et al.
Publicado: (2023)
por: Vakili, Sattar, et al.
Publicado: (2023)
Provably Efficient Exploration in Reward Machines with Low Regret
por: Bourel, Hippolyte, et al.
Publicado: (2024)
por: Bourel, Hippolyte, et al.
Publicado: (2024)
Online Mixture of Experts: No-Regret Learning for Optimal Collective Decision-Making
por: Liu, Larkin, et al.
Publicado: (2025)
por: Liu, Larkin, et al.
Publicado: (2025)
Missing Data Multiple Imputation for Tabular Q-Learning in Online RL
por: Chasalow, Kyla, et al.
Publicado: (2025)
por: Chasalow, Kyla, et al.
Publicado: (2025)
Ejemplares similares
-
Data-Driven Online Model Selection With Regret Guarantees
por: Pacchiano, Aldo, et al.
Publicado: (2023) -
Hybrid Combinatorial Multi-armed Bandits with Probabilistically Triggered Arms
por: Zhou, Kongchang, et al.
Publicado: (2025) -
Provable Training Data Identification for Large Language Models
por: Liu, Zhenlong, et al.
Publicado: (2025) -
Optimistic Regret Bounds for Online Learning in Adversarial Markov Decision Processes
por: Moon, Sang Bin, et al.
Publicado: (2024) -
How does Bayesian Sampling help Membership Inference Attacks?
por: Liu, Zhenlong, et al.
Publicado: (2025)