Bridging Offline and Online Reinforcement Learning for LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Lanchantin, Jack, Chen, Angelica, Lan, Janice, Li, Xian, Saha, Swarnadeep, Wang, Tianlu, Xu, Jing, Yu, Ping, Yuan, Weizhe, Weston, Jason E, Sukhbaatar, Sainbayar, Kulikov, Ilia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
por: Yu, Ping, et al.
Publicado: (2025)
por: Yu, Ping, et al.
Publicado: (2025)
Diverse Preference Optimization
por: Lanchantin, Jack, et al.
Publicado: (2025)
por: Lanchantin, Jack, et al.
Publicado: (2025)
Adaptive Decoding via Latent Preference Optimization
por: Dhuliawala, Shehzaad, et al.
Publicado: (2024)
por: Dhuliawala, Shehzaad, et al.
Publicado: (2024)
Following Length Constraints in Instructions
por: Yuan, Weizhe, et al.
Publicado: (2024)
por: Yuan, Weizhe, et al.
Publicado: (2024)
OptimalThinkingBench: Evaluating Over and Underthinking in LLMs
por: Aggarwal, Pranjal, et al.
Publicado: (2025)
por: Aggarwal, Pranjal, et al.
Publicado: (2025)
SPICE: Self-Play In Corpus Environments Improves Reasoning
por: Liu, Bo, et al.
Publicado: (2025)
por: Liu, Bo, et al.
Publicado: (2025)
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
por: Whitehouse, Chenxi, et al.
Publicado: (2025)
por: Whitehouse, Chenxi, et al.
Publicado: (2025)
Thinking LLMs: General Instruction Following with Thought Generation
por: Wu, Tianhao, et al.
Publicado: (2024)
por: Wu, Tianhao, et al.
Publicado: (2024)
Jointly Reinforcing Diversity and Quality in Language Model Generations
por: Li, Tianjian, et al.
Publicado: (2025)
por: Li, Tianjian, et al.
Publicado: (2025)
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
por: Tao, Leitian, et al.
Publicado: (2025)
por: Tao, Leitian, et al.
Publicado: (2025)
Multi-Token Attention
por: Golovneva, Olga, et al.
Publicado: (2025)
por: Golovneva, Olga, et al.
Publicado: (2025)
Contextual Position Encoding: Learning to Count What's Important
por: Golovneva, Olga, et al.
Publicado: (2024)
por: Golovneva, Olga, et al.
Publicado: (2024)
Self-Improving Pretraining: using post-trained models to pretrain better models
por: Tan, Ellen Xiaoqing, et al.
Publicado: (2026)
por: Tan, Ellen Xiaoqing, et al.
Publicado: (2026)
R.I.P.: Better Models by Survival of the Fittest Prompts
por: Yu, Ping, et al.
Publicado: (2025)
por: Yu, Ping, et al.
Publicado: (2025)
Self-Rewarding Language Models
por: Yuan, Weizhe, et al.
Publicado: (2024)
por: Yuan, Weizhe, et al.
Publicado: (2024)
Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss
por: Xu, Jing, et al.
Publicado: (2023)
por: Xu, Jing, et al.
Publicado: (2023)
Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge
por: Saha, Swarnadeep, et al.
Publicado: (2025)
por: Saha, Swarnadeep, et al.
Publicado: (2025)
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
por: Aggarwal, Pranjal, et al.
Publicado: (2026)
por: Aggarwal, Pranjal, et al.
Publicado: (2026)
LLM Pretraining with Continuous Concepts
por: Tack, Jihoon, et al.
Publicado: (2025)
por: Tack, Jihoon, et al.
Publicado: (2025)
The Majority is not always right: RL training for solution aggregation
por: Zhao, Wenting, et al.
Publicado: (2025)
por: Zhao, Wenting, et al.
Publicado: (2025)
Iterative Reasoning Preference Optimization
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024)
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024)
Self-Challenging Language Model Agents
por: Zhou, Yifei, et al.
Publicado: (2025)
por: Zhou, Yifei, et al.
Publicado: (2025)
Distilling System 2 into System 1
por: Yu, Ping, et al.
Publicado: (2024)
por: Yu, Ping, et al.
Publicado: (2024)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
por: Wu, Tianhao, et al.
Publicado: (2024)
por: Wu, Tianhao, et al.
Publicado: (2024)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
NaturalThoughts: Selecting and Distilling Reasoning Traces for General Reasoning Tasks
por: Li, Yang, et al.
Publicado: (2025)
por: Li, Yang, et al.
Publicado: (2025)
Reverse Training to Nurse the Reversal Curse
por: Golovneva, Olga, et al.
Publicado: (2024)
por: Golovneva, Olga, et al.
Publicado: (2024)
Self-Taught Evaluators
por: Wang, Tianlu, et al.
Publicado: (2024)
por: Wang, Tianlu, et al.
Publicado: (2024)
Self-Consistency Preference Optimization
por: Prasad, Archiki, et al.
Publicado: (2024)
por: Prasad, Archiki, et al.
Publicado: (2024)
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
por: Zhou, Yifei, et al.
Publicado: (2025)
por: Zhou, Yifei, et al.
Publicado: (2025)
Training Large Language Models to Reason in a Continuous Latent Space
por: Hao, Shibo, et al.
Publicado: (2024)
por: Hao, Shibo, et al.
Publicado: (2024)
Branch-Solve-Merge Improves Large Language Model Evaluation and Generation
por: Saha, Swarnadeep, et al.
Publicado: (2023)
por: Saha, Swarnadeep, et al.
Publicado: (2023)
Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM
por: Sukhbaatar, Sainbayar, et al.
Publicado: (2024)
por: Sukhbaatar, Sainbayar, et al.
Publicado: (2024)
System-Level Natural Language Feedback
por: Yuan, Weizhe, et al.
Publicado: (2023)
por: Yuan, Weizhe, et al.
Publicado: (2023)
NaturalReasoning: Reasoning in the Wild with 2.8M Challenging Questions
por: Yuan, Weizhe, et al.
Publicado: (2025)
por: Yuan, Weizhe, et al.
Publicado: (2025)
Policy Expansion for Bridging Offline-to-Online Reinforcement Learning
por: Zhang, Haichao, et al.
Publicado: (2023)
por: Zhang, Haichao, et al.
Publicado: (2023)
Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation
por: Lin, Zi, et al.
Publicado: (2025)
por: Lin, Zi, et al.
Publicado: (2025)
TOOLVERIFIER: Generalization to New Tools via Self-Verification
por: Mekala, Dheeraj, et al.
Publicado: (2024)
por: Mekala, Dheeraj, et al.
Publicado: (2024)
Stochastic activations
por: Lomeli, Maria, et al.
Publicado: (2025)
por: Lomeli, Maria, et al.
Publicado: (2025)
ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs
por: Chen, Justin Chih-Yao, et al.
Publicado: (2023)
por: Chen, Justin Chih-Yao, et al.
Publicado: (2023)
Ejemplares similares
-
CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
por: Yu, Ping, et al.
Publicado: (2025) -
Diverse Preference Optimization
por: Lanchantin, Jack, et al.
Publicado: (2025) -
Adaptive Decoding via Latent Preference Optimization
por: Dhuliawala, Shehzaad, et al.
Publicado: (2024) -
Following Length Constraints in Instructions
por: Yuan, Weizhe, et al.
Publicado: (2024) -
OptimalThinkingBench: Evaluating Over and Underthinking in LLMs
por: Aggarwal, Pranjal, et al.
Publicado: (2025)