Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aminian, Gholamali, Shenfeld, Idan, Asadi, Amir R., Beirami, Ahmad, Mroueh, Youssef |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KL-Regularized RLHF with Multiple Reference Models: Exact Solutions and Sample Complexity
par: Aminian, Gholamali, et autres
Publié: (2025)
par: Aminian, Gholamali, et autres
Publié: (2025)
Generalization and Robustness of the Tilted Empirical Risk
par: Aminian, Gholamali, et autres
Publié: (2024)
par: Aminian, Gholamali, et autres
Publié: (2024)
Generalization Error of $f$-Divergence Stabilized Algorithms via Duality
par: Daunas, Francisco, et autres
Publié: (2025)
par: Daunas, Francisco, et autres
Publié: (2025)
Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification
par: Mroueh, Youssef
Publié: (2025)
par: Mroueh, Youssef
Publié: (2025)
Information Theoretic Guarantees For Policy Alignment In Large Language Models
par: Mroueh, Youssef
Publié: (2024)
par: Mroueh, Youssef
Publié: (2024)
Robust Semi-supervised Learning via $f$-Divergence and $α$-Rényi Divergence
par: Aminian, Gholamali, et autres
Publié: (2024)
par: Aminian, Gholamali, et autres
Publié: (2024)
Understanding Transfer Learning via Mean-field Analysis
par: Aminian, Gholamali, et autres
Publié: (2024)
par: Aminian, Gholamali, et autres
Publié: (2024)
UPL: Uncertainty-aware Pseudo-labeling for Imbalance Transductive Node Classification
par: Teimuri, Mohammad T., et autres
Publié: (2025)
par: Teimuri, Mohammad T., et autres
Publié: (2025)
Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences
par: Pipano, Idan, et autres
Publié: (2026)
par: Pipano, Idan, et autres
Publié: (2026)
Private Synthetic Graph Generation and Fused Gromov-Wasserstein Distance
par: Wirth, Leoni Carla, et autres
Publié: (2025)
par: Wirth, Leoni Carla, et autres
Publié: (2025)
RL's Razor: Why Online Reinforcement Learning Forgets Less
par: Shenfeld, Idan, et autres
Publié: (2025)
par: Shenfeld, Idan, et autres
Publié: (2025)
Learning Algorithm Generalization Error Bounds via Auxiliary Distributions
par: Aminian, Gholamali, et autres
Publié: (2022)
par: Aminian, Gholamali, et autres
Publié: (2022)
On the Generalization and Robustness in Conditional Value-at-Risk
par: Mulumudi, Dinesh Karthik, et autres
Publié: (2026)
par: Mulumudi, Dinesh Karthik, et autres
Publié: (2026)
$f$-FUM: Federated Unlearning via min--max and $f$-divergence
par: Karimian, Radmehr, et autres
Publié: (2026)
par: Karimian, Radmehr, et autres
Publié: (2026)
Language Model Personalization via Reward Factorization
par: Shenfeld, Idan, et autres
Publié: (2025)
par: Shenfeld, Idan, et autres
Publié: (2025)
Self-Distillation Enables Continual Learning
par: Shenfeld, Idan, et autres
Publié: (2026)
par: Shenfeld, Idan, et autres
Publié: (2026)
JUICER: Data-Efficient Imitation Learning for Robotic Assembly
par: Ankile, Lars, et autres
Publié: (2024)
par: Ankile, Lars, et autres
Publié: (2024)
ReDiF: Reinforced Distillation for Few Step Diffusion
par: Tighkhorshid, Amirhossein, et autres
Publié: (2025)
par: Tighkhorshid, Amirhossein, et autres
Publié: (2025)
Generalization Error of Graph Neural Networks in the Mean-field Regime
par: Aminian, Gholamali, et autres
Publié: (2024)
par: Aminian, Gholamali, et autres
Publié: (2024)
TGRL: An Algorithm for Teacher Guided Reinforcement Learning
par: Shenfeld, Idan, et autres
Publié: (2023)
par: Shenfeld, Idan, et autres
Publié: (2023)
An Algorithm for Computing the Capacity of Symmetrized KL Information for Discrete Channels
par: Chen, Haobo, et autres
Publié: (2024)
par: Chen, Haobo, et autres
Publié: (2024)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
par: Geuter, Jonathan, et autres
Publié: (2025)
par: Geuter, Jonathan, et autres
Publié: (2025)
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
par: Behnamnia, Armin, et autres
Publié: (2025)
par: Behnamnia, Armin, et autres
Publié: (2025)
Regret-Oracle Complexity Tradeoffs in Agnostic Online Learning
par: Attias, Idan, et autres
Publié: (2026)
par: Attias, Idan, et autres
Publié: (2026)
Individual Regret in Cooperative Stochastic Multi-Armed Bandits
par: Barnea, Idan, et autres
Publié: (2024)
par: Barnea, Idan, et autres
Publié: (2024)
CliffSearch: Structured Agentic Co-Evolution over Theory and Code for Scientific Algorithm Discovery
par: Mroueh, Youssef, et autres
Publié: (2026)
par: Mroueh, Youssef, et autres
Publié: (2026)
Adaptive Symmetrization of the KL Divergence
par: Ben-Dov, Omri, et autres
Publié: (2025)
par: Ben-Dov, Omri, et autres
Publié: (2025)
From Imitation to Refinement -- Residual RL for Precise Assembly
par: Ankile, Lars, et autres
Publié: (2024)
par: Ankile, Lars, et autres
Publié: (2024)
Hierarchical Maximum Entropy via the Renormalization Group
par: Asadi, Amir R.
Publié: (2025)
par: Asadi, Amir R.
Publié: (2025)
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
par: Zhao, Heyang, et autres
Publié: (2025)
par: Zhao, Heyang, et autres
Publié: (2025)
Fast Best-in-Class Regret for Contextual Bandits
par: Girard, Samuel, et autres
Publié: (2025)
par: Girard, Samuel, et autres
Publié: (2025)
Capacity-Constrained Online Learning with Delays: Scheduling Frameworks and Regret Trade-offs
par: Ryabchenko, Alexander, et autres
Publié: (2025)
par: Ryabchenko, Alexander, et autres
Publié: (2025)
Best Arm Identification with Minimal Regret
par: Yang, Junwen, et autres
Publié: (2024)
par: Yang, Junwen, et autres
Publié: (2024)
LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users
par: Hilel, Almog, et autres
Publié: (2025)
par: Hilel, Almog, et autres
Publié: (2025)
On the KL-Divergence-based Robust Satisficing Model
par: Yan, Haojie, et autres
Publié: (2024)
par: Yan, Haojie, et autres
Publié: (2024)
Value Augmented Sampling for Language Model Alignment and Personalization
par: Han, Seungwook, et autres
Publié: (2024)
par: Han, Seungwook, et autres
Publié: (2024)
Learning How Hard to Think: Input-Adaptive Allocation of LM Computation
par: Damani, Mehul, et autres
Publié: (2024)
par: Damani, Mehul, et autres
Publié: (2024)
Multivariate Stochastic Dominance via Optimal Transport and Applications to Models Benchmarking
par: Rioux, Gabriel, et autres
Publié: (2024)
par: Rioux, Gabriel, et autres
Publié: (2024)
The Effect of Stochasticity in Score-Based Diffusion Sampling: a KL Divergence Analysis
par: Schaeffer, Bernardo P., et autres
Publié: (2025)
par: Schaeffer, Bernardo P., et autres
Publié: (2025)
Majority of the Bests: Improving Best-of-N via Bootstrapping
par: Rakhsha, Amin, et autres
Publié: (2025)
par: Rakhsha, Amin, et autres
Publié: (2025)
Documents similaires
-
KL-Regularized RLHF with Multiple Reference Models: Exact Solutions and Sample Complexity
par: Aminian, Gholamali, et autres
Publié: (2025) -
Generalization and Robustness of the Tilted Empirical Risk
par: Aminian, Gholamali, et autres
Publié: (2024) -
Generalization Error of $f$-Divergence Stabilized Algorithms via Duality
par: Daunas, Francisco, et autres
Publié: (2025) -
Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification
par: Mroueh, Youssef
Publié: (2025) -
Information Theoretic Guarantees For Policy Alignment In Large Language Models
par: Mroueh, Youssef
Publié: (2024)