Learnable Chernoff Baselines for Inference-Time Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Madhow, Sunil, Liang, Yuchen, Shroff, Ness, Liang, Yingbin, Wang, Yu-Xiang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Near-Optimal Partially Observable Reinforcement Learning with Partial Online State Information
par: Shi, Ming, et autres
Publié: (2023)
par: Shi, Ming, et autres
Publié: (2023)
From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models
par: Liang, Yuchen, et autres
Publié: (2026)
par: Liang, Yuchen, et autres
Publié: (2026)
Theory on Mixture-of-Experts in Continual Learning
par: Li, Hongbo, et autres
Publié: (2024)
par: Li, Hongbo, et autres
Publié: (2024)
Sharp Convergence Rates for Masked Diffusion Models
par: Liang, Yuchen, et autres
Publié: (2026)
par: Liang, Yuchen, et autres
Publié: (2026)
Theory on Score-Mismatched Diffusion Models and Zero-Shot Conditional Samplers
par: Liang, Yuchen, et autres
Publié: (2024)
par: Liang, Yuchen, et autres
Publié: (2024)
Discrete Diffusion Models: Novel Analysis and New Sampler Guarantees
par: Liang, Yuchen, et autres
Publié: (2025)
par: Liang, Yuchen, et autres
Publié: (2025)
Broadening Target Distributions for Accelerated Diffusion Models via a Novel Analysis Approach
par: Liang, Yuchen, et autres
Publié: (2024)
par: Liang, Yuchen, et autres
Publié: (2024)
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
par: Li, Yining, et autres
Publié: (2026)
par: Li, Yining, et autres
Publié: (2026)
Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data
par: Madhow, Sunil, et autres
Publié: (2023)
par: Madhow, Sunil, et autres
Publié: (2023)
Absorb and Converge: Provable Convergence Guarantee for Absorbing Discrete Diffusion Models
par: Liang, Yuchen, et autres
Publié: (2025)
par: Liang, Yuchen, et autres
Publié: (2025)
Monitoring State Transitions in Markovian Systems with Sampling Cost
par: Saurav, Kumar, et autres
Publié: (2025)
par: Saurav, Kumar, et autres
Publié: (2025)
Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences
par: Shi, Ming, et autres
Publié: (2026)
par: Shi, Ming, et autres
Publié: (2026)
Can We Theoretically Quantify the Impacts of Local Updates on the Generalization Performance of Federated Learning?
par: Ju, Peizhong, et autres
Publié: (2024)
par: Ju, Peizhong, et autres
Publié: (2024)
Why Adam Can Beat SGD: Second-Moment Normalization Yields Sharper Tails
par: Jin, Ruinan, et autres
Publié: (2026)
par: Jin, Ruinan, et autres
Publié: (2026)
Mixture-of-Transformers Learn Faster: A Theoretical Study on Classification Problems
par: Li, Hongbo, et autres
Publié: (2025)
par: Li, Hongbo, et autres
Publié: (2025)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2026)
par: Yang, Tong, et autres
Publié: (2026)
Harnesses for Inference-Time Alignment over Execution Trajectories
par: Wang, Boyuan, et autres
Publié: (2026)
par: Wang, Boyuan, et autres
Publié: (2026)
Improving Sample Efficiency of Model-Free Algorithms for Zero-Sum Markov Games
par: Feng, Songtao, et autres
Publié: (2023)
par: Feng, Songtao, et autres
Publié: (2023)
Constraint-Rectified Training for Efficient Chain-of-Thought
par: Wu, Qinhang, et autres
Publié: (2026)
par: Wu, Qinhang, et autres
Publié: (2026)
Integrated Influence: Data Attribution with Baseline
par: Yang, Linxiao, et autres
Publié: (2025)
par: Yang, Linxiao, et autres
Publié: (2025)
Unlocking the Power of Rehearsal in Continual Learning: A Theoretical Perspective
par: Deng, Junze, et autres
Publié: (2025)
par: Deng, Junze, et autres
Publié: (2025)
On the Learnability of Test-Time Adaptation: A Recovery Complexity Perspective
par: Zhou, Zhi, et autres
Publié: (2026)
par: Zhou, Zhi, et autres
Publié: (2026)
Inference-Time Alignment of Diffusion Models with Direct Noise Optimization
par: Tang, Zhiwei, et autres
Publié: (2024)
par: Tang, Zhiwei, et autres
Publié: (2024)
Contrastive and Variational Approaches in Self-Supervised Learning for Complex Data Mining
par: Liang, Yingbin, et autres
Publié: (2025)
par: Liang, Yingbin, et autres
Publié: (2025)
Echo: Decoupling Inference and Training for Large-Scale RL Alignment on Heterogeneous Swarms
par: Xiao, Jie, et autres
Publié: (2025)
par: Xiao, Jie, et autres
Publié: (2025)
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
par: Yang, Tong, et autres
Publié: (2025)
par: Yang, Tong, et autres
Publié: (2025)
Dynamic Search for Inference-Time Alignment in Diffusion Models
par: Li, Xiner, et autres
Publié: (2025)
par: Li, Xiner, et autres
Publié: (2025)
NeuralOGCM: Differentiable Ocean Modeling with Learnable Physics
par: Wu, Hao, et autres
Publié: (2025)
par: Wu, Hao, et autres
Publié: (2025)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
par: Wang, Haichuan, et autres
Publié: (2026)
par: Wang, Haichuan, et autres
Publié: (2026)
On the Regularization of Learnable Embeddings for Time Series Forecasting
par: Butera, Luca, et autres
Publié: (2024)
par: Butera, Luca, et autres
Publié: (2024)
Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining
par: Sow, Daouda, et autres
Publié: (2025)
par: Sow, Daouda, et autres
Publié: (2025)
Revisiting the (Sub)Optimality of Best-of-N for Inference-Time Alignment
par: Sriraman, Ved, et autres
Publié: (2026)
par: Sriraman, Ved, et autres
Publié: (2026)
Best-of-Tails: Bridging Optimism and Pessimism in Inference-Time Alignment
par: Hsu, Hsiang, et autres
Publié: (2026)
par: Hsu, Hsiang, et autres
Publié: (2026)
Learning to Learn-at-Test-Time: Language Agents with Learnable Adaptation Policies
par: Lou, Zhanzhi, et autres
Publié: (2026)
par: Lou, Zhanzhi, et autres
Publié: (2026)
Rethinking Time Encoding via Learnable Transformation Functions
par: Chen, Xi, et autres
Publié: (2025)
par: Chen, Xi, et autres
Publié: (2025)
A Simplifying and Learnable Graph Convolutional Attention Network for Unsupervised Knowledge Graphs Alignment
par: Cai, Weishan, et autres
Publié: (2024)
par: Cai, Weishan, et autres
Publié: (2024)
SEDformer: Event-Synchronous Spiking Transformers for Irregular Telemetry Time Series Forecasting
par: Zhou, Ziyu, et autres
Publié: (2026)
par: Zhou, Ziyu, et autres
Publié: (2026)
HELIX: Hybrid Encoding with Learnable Identity and Cross-dimensional Synthesis for Time Series Imputation
par: Zhang, Fengming, et autres
Publié: (2026)
par: Zhang, Fengming, et autres
Publié: (2026)
Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
par: Jin, Luozhijie, et autres
Publié: (2025)
par: Jin, Luozhijie, et autres
Publié: (2025)
Combating the Bucket Effect:Multi-Knowledge Alignment for Medication Recommendation
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
Documents similaires
-
Near-Optimal Partially Observable Reinforcement Learning with Partial Online State Information
par: Shi, Ming, et autres
Publié: (2023) -
From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models
par: Liang, Yuchen, et autres
Publié: (2026) -
Theory on Mixture-of-Experts in Continual Learning
par: Li, Hongbo, et autres
Publié: (2024) -
Sharp Convergence Rates for Masked Diffusion Models
par: Liang, Yuchen, et autres
Publié: (2026) -
Theory on Score-Mismatched Diffusion Models and Zero-Shot Conditional Samplers
par: Liang, Yuchen, et autres
Publié: (2024)