RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Chao, Wang, Yuanqing, Guo, Zhen, Lin, Hao, Xu, Si, Zang, Hongzhi, Zhang, Quanlu, Wu, Yongji, Zhu, Chunyang, Hu, Junhao, Huang, Zixiao, Wei, Mingjie, Xie, Yuqing, Yang, Ke, Dai, Bo, Xu, Zhexuan, Du, Jiakun, Wang, Xiangyuan, Fu, Xu, Shi, Letong, Liu, Zhihao, Chen, Kang, Liu, Weilin, Liu, Gang, Li, Boxun, Yang, Jianlei, Yang, Zhi, Dai, Guohao, Wang, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
by: Zang, Hongzhi, et al.
Published: (2025)
by: Zang, Hongzhi, et al.
Published: (2025)
WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning
by: Xu, Zelai, et al.
Published: (2026)
by: Xu, Zelai, et al.
Published: (2026)
DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training
by: Wang, Yuanqing, et al.
Published: (2026)
by: Wang, Yuanqing, et al.
Published: (2026)
RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI
by: Zang, Hongzhi, et al.
Published: (2026)
by: Zang, Hongzhi, et al.
Published: (2026)
FUSCO: High-Performance Distributed Data Shuffling via Transformation-Communication Fusion
by: Zhu, Zhuoran, et al.
Published: (2025)
by: Zhu, Zhuoran, et al.
Published: (2025)
A Hiplot‐based web service for cold atmospheric plasma high‐throughput data integration and analysis on breast cancer
by: Xiaofeng Dai, et al.
Published: (2025)
by: Xiaofeng Dai, et al.
Published: (2025)
Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
by: Huang, Zixiao, et al.
Published: (2025)
by: Huang, Zixiao, et al.
Published: (2025)
STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning
by: Huang, Zixiao, et al.
Published: (2025)
by: Huang, Zixiao, et al.
Published: (2025)
HETHUB: A Distributed Training System with Heterogeneous Cluster for Large-Scale Models
by: Xu, Si, et al.
Published: (2024)
by: Xu, Si, et al.
Published: (2024)
AMS-KV: Adaptive KV Caching in Multi-Scale Visual Autoregressive Transformers
by: Xu, Boxun, et al.
Published: (2025)
by: Xu, Boxun, et al.
Published: (2025)
Megrez-Omni Technical Report
by: Li, Boxun, et al.
Published: (2025)
by: Li, Boxun, et al.
Published: (2025)
Megrez2 Technical Report
by: Li, Boxun, et al.
Published: (2025)
by: Li, Boxun, et al.
Published: (2025)
Non‐Equilibrium Construction of Layered Ruddlesden–Popper La 2 NiO 4 Porous Nanosheets for Efficient Urea Electrooxidation
by: Mingjie Wang, et al.
Published: (2026)
by: Mingjie Wang, et al.
Published: (2026)
Direct Construction of C‐Alkyl Glycosides from Non‐Activated Olefins via Nickel‐Catalyzed C(sp3)─C(sp3) Coupling Reaction
by: Changyue Yu, et al.
Published: (2024)
by: Changyue Yu, et al.
Published: (2024)
ADO-LLM: Analog Design Bayesian Optimization with In-Context Learning of Large Language Models
by: Yin, Yuxuan, et al.
Published: (2024)
by: Yin, Yuxuan, et al.
Published: (2024)
ReXMoE: Reusing Experts with Minimal Overhead in Mixture-of-Experts
by: Tan, Zheyue, et al.
Published: (2025)
by: Tan, Zheyue, et al.
Published: (2025)
Frequency-Adaptive Low-Latency Object Detection Using Events and Frames
by: Zhang, Haitian, et al.
Published: (2024)
by: Zhang, Haitian, et al.
Published: (2024)
TASP: Topology-aware Sequence Parallelism
by: Wang, Yida, et al.
Published: (2025)
by: Wang, Yida, et al.
Published: (2025)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
by: Chen, Kang, et al.
Published: (2025)
by: Chen, Kang, et al.
Published: (2025)
Exploring the Tradeoff Between Diversity and Discrimination for Continuous Category Discovery
by: Jiang, Ruobing, et al.
Published: (2025)
by: Jiang, Ruobing, et al.
Published: (2025)
SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs
by: Xu, Jiaming, et al.
Published: (2025)
by: Xu, Jiaming, et al.
Published: (2025)
Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
by: Fu, Tianyu, et al.
Published: (2025)
by: Fu, Tianyu, et al.
Published: (2025)
Artificial Intelligence for Microbiology and Microbiome Research
by: Wang, Xu-Wen, et al.
Published: (2024)
by: Wang, Xu-Wen, et al.
Published: (2024)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
by: Fu, Tianyu, et al.
Published: (2024)
by: Fu, Tianyu, et al.
Published: (2024)
Efficient and Effective Retrieval of Dense-Sparse Hybrid Vectors using Graph-based Approximate Nearest Neighbor Search
by: Zhang, Haoyu, et al.
Published: (2024)
by: Zhang, Haoyu, et al.
Published: (2024)
Evaluating Quantized Large Language Models
by: Li, Shiyao, et al.
Published: (2024)
by: Li, Shiyao, et al.
Published: (2024)
Enhancement of Gating Performance for Molecular Field‐Effect Transistors by Tuning Quantum Interference
by: Yuqing Xu, et al.
Published: (2025)
by: Yuqing Xu, et al.
Published: (2025)
The Prediction of CO2 Plume Using Neural Network Based On the Swin Transformer
by: Yaqi Liu, et al.
Published: (2025)
by: Yaqi Liu, et al.
Published: (2025)
Billion-Fold Enhancement of Room-Temperature Ionic Conductivity in h-RMnO3/YSZ Heterostructures via Electric-Field-Assisted Oxygen Deficiency Engineering
by: Yang, Detian, et al.
Published: (2024)
by: Yang, Detian, et al.
Published: (2024)
Enhanced Barrier-Smoothing Technique for Bilevel Optimization with Nonsmooth Mappings
by: Xu, Mengwei, et al.
Published: (2024)
by: Xu, Mengwei, et al.
Published: (2024)
MARCA: Mamba Accelerator with ReConfigurable Architecture
by: Li, Jinhao, et al.
Published: (2024)
by: Li, Jinhao, et al.
Published: (2024)
SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation
by: Pan, Jiayi, et al.
Published: (2025)
by: Pan, Jiayi, et al.
Published: (2025)
Stability of Ecological Systems: A Theoretical Review
by: Chen, Can, et al.
Published: (2023)
by: Chen, Can, et al.
Published: (2023)
Towards Visual Grounding: A Survey
by: Xiao, Linhui, et al.
Published: (2024)
by: Xiao, Linhui, et al.
Published: (2024)
The Combined Treatment of 4EGl‐1 and MK‐2206 Inhibits Nasopharyngeal Carcinoma Progress by Inducing Autophagy
by: Yinghuan Dai, et al.
Published: (2025)
by: Yinghuan Dai, et al.
Published: (2025)
Multi-UAV Formation Control with Static and Dynamic Obstacle Avoidance via Reinforcement Learning
by: Xie, Yuqing, et al.
Published: (2024)
by: Xie, Yuqing, et al.
Published: (2024)
Global $C^{1,α}$ regularity for Monge-Ampère equations on planar convex domains
by: Han, Qing, et al.
Published: (2025)
by: Han, Qing, et al.
Published: (2025)
FlashDecoding++: Faster Large Language Model Inference on GPUs
by: Hong, Ke, et al.
Published: (2023)
by: Hong, Ke, et al.
Published: (2023)
FlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs
by: Zeng, Shulin, et al.
Published: (2024)
by: Zeng, Shulin, et al.
Published: (2024)
PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs
by: Liu, Tengxuan, et al.
Published: (2025)
by: Liu, Tengxuan, et al.
Published: (2025)
Similar Items
-
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
by: Zang, Hongzhi, et al.
Published: (2025) -
WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning
by: Xu, Zelai, et al.
Published: (2026) -
DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training
by: Wang, Yuanqing, et al.
Published: (2026) -
RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI
by: Zang, Hongzhi, et al.
Published: (2026) -
FUSCO: High-Performance Distributed Data Shuffling via Transformation-Communication Fusion
by: Zhu, Zhuoran, et al.
Published: (2025)