Efficient RL Training for LLMs with Experience Replay
Fuente:
arXiv
Salvato in:
| Autori principali: | Arnal, Charles, Cabannes, Vivien, Cohen, Taco, Kempe, Julia, Munos, Remi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards
di: Arnal, Charles, et al.
Pubblicazione: (2025)
di: Arnal, Charles, et al.
Pubblicazione: (2025)
Touring sampling with pushforward maps
di: Cabannes, Vivien, et al.
Pubblicazione: (2023)
di: Cabannes, Vivien, et al.
Pubblicazione: (2023)
RL-finetuning LLMs from on- and off-policy data with a single algorithm
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
Iteration Head: A Mechanistic Study of Chain-of-Thought
di: Cabannes, Vivien, et al.
Pubblicazione: (2024)
di: Cabannes, Vivien, et al.
Pubblicazione: (2024)
Outcome-based Exploration for LLM Reasoning
di: Song, Yuda, et al.
Pubblicazione: (2025)
di: Song, Yuda, et al.
Pubblicazione: (2025)
Provable Benefits of In-Tool Learning for Large Language Models
di: Houliston, Sam, et al.
Pubblicazione: (2025)
di: Houliston, Sam, et al.
Pubblicazione: (2025)
Learning with Hidden Factorial Structure
di: Arnal, Charles, et al.
Pubblicazione: (2024)
di: Arnal, Charles, et al.
Pubblicazione: (2024)
Mode Estimation with Partial Feedback
di: Arnal, Charles, et al.
Pubblicazione: (2024)
di: Arnal, Charles, et al.
Pubblicazione: (2024)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
di: Cohen, Taco, et al.
Pubblicazione: (2025)
di: Cohen, Taco, et al.
Pubblicazione: (2025)
Formalizing Mathematics at Scale
di: Rammal, Ahmad, et al.
Pubblicazione: (2026)
di: Rammal, Ahmad, et al.
Pubblicazione: (2026)
On a few pitfalls in KL divergence gradient estimation for RL
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
Clustering Head: A Visual Case Study of the Training Dynamics in Transformers
di: Odonnat, Ambroise, et al.
Pubblicazione: (2024)
di: Odonnat, Ambroise, et al.
Pubblicazione: (2024)
The Galerkin method beats Graph-Based Approaches for Spectral Algorithms
di: Cabannes, Vivien, et al.
Pubblicazione: (2023)
di: Cabannes, Vivien, et al.
Pubblicazione: (2023)
Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification
di: Donhauser, Konstantin, et al.
Pubblicazione: (2025)
di: Donhauser, Konstantin, et al.
Pubblicazione: (2025)
Automatic Textbook Formalization
di: Gloeckle, Fabian, et al.
Pubblicazione: (2026)
di: Gloeckle, Fabian, et al.
Pubblicazione: (2026)
Learning Associative Memories with Gradient Descent
di: Cabannes, Vivien, et al.
Pubblicazione: (2024)
di: Cabannes, Vivien, et al.
Pubblicazione: (2024)
Easing Optimization Paths: a Circuit Perspective
di: Odonnat, Ambroise, et al.
Pubblicazione: (2025)
di: Odonnat, Ambroise, et al.
Pubblicazione: (2025)
Off-policy Distributional Q($λ$): Distributional RL without Importance Sampling
di: Tang, Yunhao, et al.
Pubblicazione: (2024)
di: Tang, Yunhao, et al.
Pubblicazione: (2024)
Super-Exponential Regret for UCT, AlphaGo and Variants
di: Orseau, Laurent, et al.
Pubblicazione: (2024)
di: Orseau, Laurent, et al.
Pubblicazione: (2024)
Efficient learning by implicit exploration in bandit problems with side observations
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
di: Sancaktar, Cansu, et al.
Pubblicazione: (2026)
di: Sancaktar, Cansu, et al.
Pubblicazione: (2026)
Bandits attack function optimization
di: Preux, Philippe, et al.
Pubblicazione: (2026)
di: Preux, Philippe, et al.
Pubblicazione: (2026)
Stochastic simultaneous optimistic optimization
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO
di: Jiang, Daniel R., et al.
Pubblicazione: (2025)
di: Jiang, Daniel R., et al.
Pubblicazione: (2025)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
Don't Waste Mistakes: Leveraging Negative RL-Groups via Confidence Reweighting
di: Feng, Yunzhen, et al.
Pubblicazione: (2025)
di: Feng, Yunzhen, et al.
Pubblicazione: (2025)
Black-box optimization of noisy functions with unknown smoothness
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
Blazing the trails before beating the path: Sample-efficient Monte-Carlo planning
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
di: Grill, Jean-Bastien, et al.
Pubblicazione: (2026)
Scaling Laws for Associative Memories
di: Cabannes, Vivien, et al.
Pubblicazione: (2023)
di: Cabannes, Vivien, et al.
Pubblicazione: (2023)
Mission Impossible: A Statistical Perspective on Jailbreaking LLMs
di: Su, Jingtong, et al.
Pubblicazione: (2024)
di: Su, Jingtong, et al.
Pubblicazione: (2024)
Spectral Thompson sampling
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
di: Kocak, Tomas, et al.
Pubblicazione: (2026)
Spectral bandits for smooth graph functions
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
VA-learning as a more efficient alternative to Q-learning
di: Tang, Yunhao, et al.
Pubblicazione: (2023)
di: Tang, Yunhao, et al.
Pubblicazione: (2023)
Optimizing Language Models for Inference Time Objectives using Reinforcement Learning
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
di: Tang, Yunhao, et al.
Pubblicazione: (2025)
Revisiting Experience Replayable Conditions
di: Kobayashi, Taisuke
Pubblicazione: (2024)
di: Kobayashi, Taisuke
Pubblicazione: (2024)
Uncertainty Prioritized Experience Replay
di: Carrasco-Davis, Rodrigo, et al.
Pubblicazione: (2025)
di: Carrasco-Davis, Rodrigo, et al.
Pubblicazione: (2025)
Information-driven Affordance Discovery for Efficient Robotic Manipulation
di: Mazzaglia, Pietro, et al.
Pubblicazione: (2024)
di: Mazzaglia, Pietro, et al.
Pubblicazione: (2024)
Enabling On-Device Learning via Experience Replay with Efficient Dataset Condensation
di: Xu, Gelei, et al.
Pubblicazione: (2024)
di: Xu, Gelei, et al.
Pubblicazione: (2024)
Enhanced-FQL($λ$), an Efficient and Interpretable RL with novel Fuzzy Eligibility Traces and Segmented Experience Replay
di: Jalaeian-Farimani, Mohsen, et al.
Pubblicazione: (2026)
di: Jalaeian-Farimani, Mohsen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards
di: Arnal, Charles, et al.
Pubblicazione: (2025) -
Touring sampling with pushforward maps
di: Cabannes, Vivien, et al.
Pubblicazione: (2023) -
RL-finetuning LLMs from on- and off-policy data with a single algorithm
di: Tang, Yunhao, et al.
Pubblicazione: (2025) -
Iteration Head: A Mechanistic Study of Chain-of-Thought
di: Cabannes, Vivien, et al.
Pubblicazione: (2024) -
Outcome-based Exploration for LLM Reasoning
di: Song, Yuda, et al.
Pubblicazione: (2025)