Understanding the performance gap between online and offline alignment algorithms
Fuente:
arXiv
Salvato in:
| Autori principali: | Tang, Yunhao, Guo, Daniel Zhaohan, Zheng, Zeyu, Calandriello, Daniele, Cao, Yuan, Tarassov, Eugene, Munos, Rémi, Pires, Bernardo Ávila, Valko, Michal, Cheng, Yong, Dabney, Will |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalized Preference Optimization: A Unified Approach to Offline Alignment
di: Tang, Yunhao, et al.
Pubblicazione: (2024)
di: Tang, Yunhao, et al.
Pubblicazione: (2024)
Off-policy Distributional Q($λ$): Distributional RL without Importance Sampling
di: Tang, Yunhao, et al.
Pubblicazione: (2024)
di: Tang, Yunhao, et al.
Pubblicazione: (2024)
Large-scale semi-supervised learning with online spectral graph sparsification
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
VA-learning as a more efficient alternative to Q-learning
di: Tang, Yunhao, et al.
Pubblicazione: (2023)
di: Tang, Yunhao, et al.
Pubblicazione: (2023)
RL-finetuning LLMs from on- and off-policy data with a single algorithm
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
Analysis of Nystrom method with sequential ridge leverage scores
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
Pack only the essentials: Adaptive dictionary learning for kernel ridge regression
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
Human Alignment of Large Language Models through Online Preference Optimisation
di: Calandriello, Daniele, et al.
Pubblicazione: (2024)
di: Calandriello, Daniele, et al.
Pubblicazione: (2024)
Bandits attack function optimization
di: Preux, Philippe, et al.
Pubblicazione: (2026)
di: Preux, Philippe, et al.
Pubblicazione: (2026)
Stochastic simultaneous optimistic optimization
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Optimizing Return Distributions with Distributional Dynamic Programming
di: Pires, Bernardo Ávila, et al.
Pubblicazione: (2025)
di: Pires, Bernardo Ávila, et al.
Pubblicazione: (2025)
Black-box optimization of noisy functions with unknown smoothness
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
Blazing the trails before beating the path: Sample-efficient Monte-Carlo planning
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
Improved large-scale graph learning through ridge spectral sparsification
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
di: Calandriello, Daniele, et al.
Pubblicazione: (2026)
Model-free Posterior Sampling via Learning Rate Randomization
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
Spectral Thompson sampling
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
Spectral bandits for smooth graph functions
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Efficient learning by implicit exploration in bandit problems with side observations
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
On a few pitfalls in KL divergence gradient estimation for RL
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
Near-Minimax-Optimal Distributional Reinforcement Learning with a Generative Model
di: Rowland, Mark, et al.
Pubblicazione: (2024)
di: Rowland, Mark, et al.
Pubblicazione: (2024)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
di: Richemond, Pierre Harvey, et al.
Pubblicazione: (2024)
di: Richemond, Pierre Harvey, et al.
Pubblicazione: (2024)
Spectral bandits for smooth graph functions with applications in recommender systems
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Spectral bandits
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Adaptive graph-based algorithms for conditional anomaly detection and semi-supervised learning
di: Valko, Michal
Pubblicazione: (2026)
di: Valko, Michal
Pubblicazione: (2026)
Planning in entropy-regularized Markov decision processes and games
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
Nash Learning from Human Feedback
di: Munos, Rémi, et al.
Pubblicazione: (2023)
di: Munos, Rémi, et al.
Pubblicazione: (2023)
A Unifying Framework for Action-Conditional Self-Predictive Reinforcement Learning
di: Khetarpal, Khimya, et al.
Pubblicazione: (2024)
di: Khetarpal, Khimya, et al.
Pubblicazione: (2024)
Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
Optimizing Language Models for Inference Time Objectives using Reinforcement Learning
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
On two ways to use determinantal point processes for Monte Carlo integration
di: Gautier, Guillaume, et al.
Pubblicazione: (2026)
di: Gautier, Guillaume, et al.
Pubblicazione: (2026)
An Analysis of Quantile Temporal-Difference Learning
di: Rowland, Mark, et al.
Pubblicazione: (2023)
di: Rowland, Mark, et al.
Pubblicazione: (2023)
Proximal Point Nash Learning from Human Feedback
di: Tiapkin, Daniil, et al.
Pubblicazione: (2025)
di: Tiapkin, Daniil, et al.
Pubblicazione: (2025)
Demonstration-Regularized RL
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
GPU performance in Run3 ALICE online/offline reconstruction
di: Cimador, Gabriele
Pubblicazione: (2024)
di: Cimador, Gabriele
Pubblicazione: (2024)
Nonlinear identification algorithm for online and offline study of pulmonary mechanical ventilation
di: Riva, Diego A., et al.
Pubblicazione: (2024)
di: Riva, Diego A., et al.
Pubblicazione: (2024)
Bayesian policy gradient and actor-critic algorithms
di: Ghavamzadeh, Mohammad, et al.
Pubblicazione: (2026)
di: Ghavamzadeh, Mohammad, et al.
Pubblicazione: (2026)
Super-Exponential Regret for UCT, AlphaGo and Variants
di: Orseau, Laurent, et al.
Pubblicazione: (2024)
di: Orseau, Laurent, et al.
Pubblicazione: (2024)
Bandits on graphs and structures
di: Valko, Michal
Pubblicazione: (2026)
di: Valko, Michal
Pubblicazione: (2026)
Covariance-adapting algorithm for semi-bandits with application to sparse rewards
di: Perrault, Pierre, et al.
Pubblicazione: (2026)
di: Perrault, Pierre, et al.
Pubblicazione: (2026)
The relationship between offline partisan geographical segregation and online partisan segregation
di: Brown, Megan A., et al.
Pubblicazione: (2025)
di: Brown, Megan A., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Generalized Preference Optimization: A Unified Approach to Offline Alignment
di: Tang, Yunhao, et al.
Pubblicazione: (2024) -
Off-policy Distributional Q($λ$): Distributional RL without Importance Sampling
di: Tang, Yunhao, et al.
Pubblicazione: (2024) -
Large-scale semi-supervised learning with online spectral graph sparsification
di: Calandriello, Daniele, et al.
Pubblicazione: (2026) -
VA-learning as a more efficient alternative to Q-learning
di: Tang, Yunhao, et al.
Pubblicazione: (2023) -
RL-finetuning LLMs from on- and off-policy data with a single algorithm
di: Tang, Yunhao, et al.
Pubblicazione: (2025)