PipelineRL: Faster On-policy Reinforcement Learning for Long Sequence Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Piché, Alexandre, Kamalloo, Ehsan, Pardinas, Rafael, Chen, Xiaoyin, Bahdanau, Dzmitry |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning
di: Pardinas, Rafael, et al.
Pubblicazione: (2026)
di: Pardinas, Rafael, et al.
Pubblicazione: (2026)
LLMs can learn self-restraint through iterative self-reflection
di: Piché, Alexandre, et al.
Pubblicazione: (2024)
di: Piché, Alexandre, et al.
Pubblicazione: (2024)
Self-Evolving Curriculum for LLM Reasoning
di: Chen, Xiaoyin, et al.
Pubblicazione: (2025)
di: Chen, Xiaoyin, et al.
Pubblicazione: (2025)
LongRecall: A Structured Approach for Robust Recall Evaluation in Long-Form Text
di: Ardestani, MohamamdJavad, et al.
Pubblicazione: (2025)
di: Ardestani, MohamamdJavad, et al.
Pubblicazione: (2025)
Forecasting Downstream Performance of LLMs With Proxy Metrics
di: Patel, Arkil, et al.
Pubblicazione: (2026)
di: Patel, Arkil, et al.
Pubblicazione: (2026)
Bridging the Gap Between Target Networks and Functional Regularization
di: Piche, Alexandre, et al.
Pubblicazione: (2022)
di: Piche, Alexandre, et al.
Pubblicazione: (2022)
BRIDGE: Predicting Human Task Completion Time From Model Performance
di: Liu, Fengyuan, et al.
Pubblicazione: (2026)
di: Liu, Fengyuan, et al.
Pubblicazione: (2026)
TapeAgents: a Holistic Framework for Agent Development and Optimization
di: Bahdanau, Dzmitry, et al.
Pubblicazione: (2024)
di: Bahdanau, Dzmitry, et al.
Pubblicazione: (2024)
RL-GPT: Integrating Reinforcement Learning and Code-as-policy
di: Liu, Shaoteng, et al.
Pubblicazione: (2024)
di: Liu, Shaoteng, et al.
Pubblicazione: (2024)
Improved Off-policy Reinforcement Learning in Biological Sequence Design
di: Kim, Hyeonah, et al.
Pubblicazione: (2024)
di: Kim, Hyeonah, et al.
Pubblicazione: (2024)
JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training
di: Hu, Zhengding, et al.
Pubblicazione: (2026)
di: Hu, Zhengding, et al.
Pubblicazione: (2026)
SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning
di: Wang, Jichao, et al.
Pubblicazione: (2026)
di: Wang, Jichao, et al.
Pubblicazione: (2026)
Exploring validation metrics for offline model-based optimisation with diffusion models
di: Beckham, Christopher, et al.
Pubblicazione: (2022)
di: Beckham, Christopher, et al.
Pubblicazione: (2022)
SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning
di: Zhang, Ruiqi, et al.
Pubblicazione: (2025)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2025)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
di: Dong, Yihong, et al.
Pubblicazione: (2025)
di: Dong, Yihong, et al.
Pubblicazione: (2025)
PokeRL: Reinforcement Learning for Pokemon Red
di: Mudireddy, Dheeraj, et al.
Pubblicazione: (2026)
di: Mudireddy, Dheeraj, et al.
Pubblicazione: (2026)
How to Get Your LLM to Generate Challenging Problems for Evaluation
di: Patel, Arkil, et al.
Pubblicazione: (2025)
di: Patel, Arkil, et al.
Pubblicazione: (2025)
FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies
di: Gao, Chenxiao, et al.
Pubblicazione: (2026)
di: Gao, Chenxiao, et al.
Pubblicazione: (2026)
Conditional Sequence Modeling for Safe Reinforcement Learning
di: Bai, Wensong, et al.
Pubblicazione: (2026)
di: Bai, Wensong, et al.
Pubblicazione: (2026)
RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
di: Bhatia, Abhinav, et al.
Pubblicazione: (2023)
di: Bhatia, Abhinav, et al.
Pubblicazione: (2023)
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
di: Oertell, Owen, et al.
Pubblicazione: (2024)
di: Oertell, Owen, et al.
Pubblicazione: (2024)
ObjectRL: An Object-Oriented Reinforcement Learning Codebase
di: Baykal, Gulcin, et al.
Pubblicazione: (2025)
di: Baykal, Gulcin, et al.
Pubblicazione: (2025)
Automation and Feature Selection Enhancement with Reinforcement Learning (RL)
di: Nagaraju, Sumana Sanyasipura
Pubblicazione: (2025)
di: Nagaraju, Sumana Sanyasipura
Pubblicazione: (2025)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
di: Li, Yuhang, et al.
Pubblicazione: (2026)
di: Li, Yuhang, et al.
Pubblicazione: (2026)
Evaluating In-Context Learning of Libraries for Code Generation
di: Patel, Arkil, et al.
Pubblicazione: (2023)
di: Patel, Arkil, et al.
Pubblicazione: (2023)
Open RL Benchmark: Comprehensive Tracked Experiments for Reinforcement Learning
di: Huang, Shengyi, et al.
Pubblicazione: (2024)
di: Huang, Shengyi, et al.
Pubblicazione: (2024)
Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing
di: Khan, Azal Ahmad, et al.
Pubblicazione: (2026)
di: Khan, Azal Ahmad, et al.
Pubblicazione: (2026)
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
di: Xia, Peng, et al.
Pubblicazione: (2026)
di: Xia, Peng, et al.
Pubblicazione: (2026)
D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
RL-ACRGNet: Reinforcement Learning-Based Chest Radiology Report Generation Network
di: Meena, Yogesh Kumar, et al.
Pubblicazione: (2026)
di: Meena, Yogesh Kumar, et al.
Pubblicazione: (2026)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
RL's Razor: Why Online Reinforcement Learning Forgets Less
di: Shenfeld, Idan, et al.
Pubblicazione: (2025)
di: Shenfeld, Idan, et al.
Pubblicazione: (2025)
RL as Regressor: A Reinforcement Learning Approach for Function Approximation
di: Huang, Yongchao
Pubblicazione: (2025)
di: Huang, Yongchao
Pubblicazione: (2025)
Survival Reinforcement Learning: Toward Scalable Self-Supervised RL
di: Nguimatsia-Tiofack, Franki, et al.
Pubblicazione: (2026)
di: Nguimatsia-Tiofack, Franki, et al.
Pubblicazione: (2026)
Probabilistic Learning and Generation in Deep Sequence Models
di: Chen, Wenlong
Pubblicazione: (2026)
di: Chen, Wenlong
Pubblicazione: (2026)
Reinformer: Max-Return Sequence Modeling for Offline RL
di: Zhuang, Zifeng, et al.
Pubblicazione: (2024)
di: Zhuang, Zifeng, et al.
Pubblicazione: (2024)
FairReweighing: Density Estimation-Based Reweighing Framework for Improving Separation in Fair Regression
di: Xi, Xiaoyin, et al.
Pubblicazione: (2025)
di: Xi, Xiaoyin, et al.
Pubblicazione: (2025)
Mini-Sequence Transformer: Optimizing Intermediate Memory for Long Sequences Training
di: Luo, Cheng, et al.
Pubblicazione: (2024)
di: Luo, Cheng, et al.
Pubblicazione: (2024)
Towards Sample-Efficiency and Generalization of Transfer and Inverse Reinforcement Learning: A Comprehensive Literature Review
di: Hassani, Hossein, et al.
Pubblicazione: (2024)
di: Hassani, Hossein, et al.
Pubblicazione: (2024)
MAGNNET: Multi-Agent Graph Neural Network-based Efficient Task Allocation for Autonomous Vehicles with Deep Reinforcement Learning
di: Ratnabala, Lavanya, et al.
Pubblicazione: (2025)
di: Ratnabala, Lavanya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning
di: Pardinas, Rafael, et al.
Pubblicazione: (2026) -
LLMs can learn self-restraint through iterative self-reflection
di: Piché, Alexandre, et al.
Pubblicazione: (2024) -
Self-Evolving Curriculum for LLM Reasoning
di: Chen, Xiaoyin, et al.
Pubblicazione: (2025) -
LongRecall: A Structured Approach for Robust Recall Evaluation in Long-Form Text
di: Ardestani, MohamamdJavad, et al.
Pubblicazione: (2025) -
Forecasting Downstream Performance of LLMs With Proxy Metrics
di: Patel, Arkil, et al.
Pubblicazione: (2026)