AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Fu, Wei, Gao, Jiaxuan, Shen, Xujie, Zhu, Chen, Mei, Zhiyu, He, Chuyi, Xu, Shusheng, Wei, Guo, Mei, Jun, Wang, Jiashu, Yang, Tongkai, Yuan, Binhang, Wu, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
por: Yan, Ran, et al.
Publicado: (2025)
por: Yan, Ran, et al.
Publicado: (2025)
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
por: Gao, Jiaxuan, et al.
Publicado: (2025)
por: Gao, Jiaxuan, et al.
Publicado: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
por: Gao, Jiaxuan, et al.
Publicado: (2024)
por: Gao, Jiaxuan, et al.
Publicado: (2024)
AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models
por: Zhang, Jiarui, et al.
Publicado: (2026)
por: Zhang, Jiarui, et al.
Publicado: (2026)
SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores
por: Mei, Zhiyu, et al.
Publicado: (2023)
por: Mei, Zhiyu, et al.
Publicado: (2023)
How Far Are We from Optimal Reasoning Efficiency?
por: Gao, Jiaxuan, et al.
Publicado: (2025)
por: Gao, Jiaxuan, et al.
Publicado: (2025)
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
por: Gao, Jiaxuan, et al.
Publicado: (2026)
por: Gao, Jiaxuan, et al.
Publicado: (2026)
Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study
por: Xu, Shusheng, et al.
Publicado: (2024)
por: Xu, Shusheng, et al.
Publicado: (2024)
ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation
por: Mei, Zhiyu, et al.
Publicado: (2024)
por: Mei, Zhiyu, et al.
Publicado: (2024)
Empowering Targeted Neighborhood Search via Hyper Tour for Large-Scale TSP
por: Lu, Tongkai, et al.
Publicado: (2025)
por: Lu, Tongkai, et al.
Publicado: (2025)
UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models
por: He, Guangxin, et al.
Publicado: (2025)
por: He, Guangxin, et al.
Publicado: (2025)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
por: Yan, Ran, et al.
Publicado: (2024)
por: Yan, Ran, et al.
Publicado: (2024)
LAGOON: Language-Guided Motion Control
por: Xu, Shusheng, et al.
Publicado: (2023)
por: Xu, Shusheng, et al.
Publicado: (2023)
Asynchronous measurement-device-independent quantum digital signatures
por: Bian, Jing-Wei, et al.
Publicado: (2024)
por: Bian, Jing-Wei, et al.
Publicado: (2024)
Improving Continuous Sign Language Recognition with Adapted Image Models
por: Hu, Lianyu, et al.
Publicado: (2024)
por: Hu, Lianyu, et al.
Publicado: (2024)
Progress of non‐motor symptoms in early‐onset Parkinson's disease
por: Fanshi Zhang, et al.
Publicado: (2024)
por: Fanshi Zhang, et al.
Publicado: (2024)
GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation
por: He, Jiashu, et al.
Publicado: (2024)
por: He, Jiashu, et al.
Publicado: (2024)
Ordered Momentum for Asynchronous SGD
por: Shi, Chang-Wei, et al.
Publicado: (2024)
por: Shi, Chang-Wei, et al.
Publicado: (2024)
Iridium Oxide Nanoparticle‐Decorated Metal–Organic Framework: A Synergistic Platform for Photodynamic and Photothermal Cancer Therapy
por: Wanqing Teng, et al.
Publicado: (2025)
por: Wanqing Teng, et al.
Publicado: (2025)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
por: Bai, Tianyi, et al.
Publicado: (2025)
por: Bai, Tianyi, et al.
Publicado: (2025)
Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments
por: Luo, Ziyan, et al.
Publicado: (2025)
por: Luo, Ziyan, et al.
Publicado: (2025)
Reinforcement Learning Framework For Stochastic Optimal Control Problem Under Model Uncertainty
por: Hou, Jiaxuan, et al.
Publicado: (2025)
por: Hou, Jiaxuan, et al.
Publicado: (2025)
Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification
por: Xu, Xu, et al.
Publicado: (2025)
por: Xu, Xu, et al.
Publicado: (2025)
GET: Goal-directed Exploration and Targeting for Large-Scale Unknown Environments
por: Zheng, Lanxiang, et al.
Publicado: (2025)
por: Zheng, Lanxiang, et al.
Publicado: (2025)
HEATACO: Heatmap-Guided Ant Colony Decoding for Large-Scale Travelling Salesman Problems
por: Lin, Bo-Cheng, et al.
Publicado: (2026)
por: Lin, Bo-Cheng, et al.
Publicado: (2026)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
por: He, Kaiyu, et al.
Publicado: (2025)
por: He, Kaiyu, et al.
Publicado: (2025)
Large Language Models as Computable Approximations to Solomonoff Induction
por: Wan, Jun, et al.
Publicado: (2025)
por: Wan, Jun, et al.
Publicado: (2025)
Chronosymbolic Learning: Efficient CHC Solving with Symbolic Reasoning and Inductive Learning
por: Luo, Ziyan, et al.
Publicado: (2023)
por: Luo, Ziyan, et al.
Publicado: (2023)
Conference report: opportunity and challenge in wood drying: quality control and energy saving
por: Shusheng Pang
Publicado: (2006)
por: Shusheng Pang
Publicado: (2006)
Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement
por: Yao, Jiashu, et al.
Publicado: (2025)
por: Yao, Jiashu, et al.
Publicado: (2025)
Conceptual Belief-Informed Reinforcement Learning
por: Gu, Xingrui, et al.
Publicado: (2024)
por: Gu, Xingrui, et al.
Publicado: (2024)
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
por: He, Jiashu, et al.
Publicado: (2025)
por: He, Jiashu, et al.
Publicado: (2025)
MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
por: An, Zhiyu, et al.
Publicado: (2025)
por: An, Zhiyu, et al.
Publicado: (2025)
Deep Correlated Prompting for Visual Recognition with Missing Modalities
por: Hu, Lianyu, et al.
Publicado: (2024)
por: Hu, Lianyu, et al.
Publicado: (2024)
NebulaFL: Effective Asynchronous Federated Learning for JointCloud Computing
por: Gao, Fei, et al.
Publicado: (2024)
por: Gao, Fei, et al.
Publicado: (2024)
The Maxwell-Klein-Gordon equation with scattering data
por: Dai, Wei, et al.
Publicado: (2023)
por: Dai, Wei, et al.
Publicado: (2023)
AtmosSci-Bench: Evaluating the Recent Advance of Large Language Model for Atmospheric Science
por: Li, Chenyue, et al.
Publicado: (2025)
por: Li, Chenyue, et al.
Publicado: (2025)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
por: Wan, Qian, et al.
Publicado: (2026)
por: Wan, Qian, et al.
Publicado: (2026)
Stability of Large-Amplitude Viscous Shock Under Periodic Perturbation for 1-d Viscoelasticity with Non-Convex Constitutive Relations
por: Mei, Yu, et al.
Publicado: (2025)
por: Mei, Yu, et al.
Publicado: (2025)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
por: Liao, Yi, et al.
Publicado: (2025)
por: Liao, Yi, et al.
Publicado: (2025)
Ejemplares similares
-
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
por: Yan, Ran, et al.
Publicado: (2025) -
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
por: Gao, Jiaxuan, et al.
Publicado: (2025) -
On Designing Effective RL Reward at Training Time for LLM Reasoning
por: Gao, Jiaxuan, et al.
Publicado: (2024) -
AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models
por: Zhang, Jiarui, et al.
Publicado: (2026) -
SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores
por: Mei, Zhiyu, et al.
Publicado: (2023)