Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
Fuente:
arXiv
Salvato in:
| Autori principali: | Luo, Sijia, Zhang, Xiaokang, Hu, Yuxuan, Zhang, Bohan, Wang, Ke, Su, Jinbo, Sun, Mengshu, Liang, Lei, Zhang, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoT-based Synthesizer: Enhancing LLM Performance through Answer Synthesis
di: Zhang, Bohan, et al.
Pubblicazione: (2025)
di: Zhang, Bohan, et al.
Pubblicazione: (2025)
$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2026)
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2026)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
di: Zhang, Hao, et al.
Pubblicazione: (2026)
di: Zhang, Hao, et al.
Pubblicazione: (2026)
EchoRL: Reinforcement Learning via Rollout Echoing
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
di: Hu, Yuxuan, et al.
Pubblicazione: (2026)
di: Hu, Yuxuan, et al.
Pubblicazione: (2026)
SAM Decoding: Speculative Decoding via Suffix Automaton
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation
di: Ma, Zeyao, et al.
Pubblicazione: (2024)
di: Ma, Zeyao, et al.
Pubblicazione: (2024)
Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative Approach
di: Jiang, Zhouyu, et al.
Pubblicazione: (2024)
di: Jiang, Zhouyu, et al.
Pubblicazione: (2024)
Bi'an: A Bilingual Benchmark and Model for Hallucination Detection in Retrieval-Augmented Generation
di: Jiang, Zhouyu, et al.
Pubblicazione: (2025)
di: Jiang, Zhouyu, et al.
Pubblicazione: (2025)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
di: Li, Yuhang, et al.
Pubblicazione: (2026)
di: Li, Yuhang, et al.
Pubblicazione: (2026)
Gaining the Sparse Rewards by Exploring Lottery Tickets in Spiking Neural Network
di: Cheng, Hao, et al.
Pubblicazione: (2023)
di: Cheng, Hao, et al.
Pubblicazione: (2023)
ROAST: Rollout-based On-distribution Activation Steering Technique
di: Su, Xuanbo, et al.
Pubblicazione: (2026)
di: Su, Xuanbo, et al.
Pubblicazione: (2026)
Collaboration of Fusion and Independence: Hypercomplex-driven Robust Multi-Modal Knowledge Graph Completion
di: Liu, Zhiqiang, et al.
Pubblicazione: (2025)
di: Liu, Zhiqiang, et al.
Pubblicazione: (2025)
SparseRL-Sync: Lossless Weight Synchronization with ~100x Less Communication
di: Hu, Lucas, et al.
Pubblicazione: (2026)
di: Hu, Lucas, et al.
Pubblicazione: (2026)
Breaking the Limitations with Sparse Inputs by Variational Frameworks (BLIss) in Terahertz Super-Resolution 3D Reconstruction
di: Zhang, Yiyao, et al.
Pubblicazione: (2024)
di: Zhang, Yiyao, et al.
Pubblicazione: (2024)
Optimizing Native Sparse Attention with Latent Attention and Local Global Alternating Strategies
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
Breaking Memorization Barriers in LLM Code Fine-Tuning via Information Bottleneck for Improved Generalization
di: Wang, Changsheng, et al.
Pubblicazione: (2025)
di: Wang, Changsheng, et al.
Pubblicazione: (2025)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
di: Gu, Hao, et al.
Pubblicazione: (2026)
di: Gu, Hao, et al.
Pubblicazione: (2026)
STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order
di: Gu, Chengyang, et al.
Pubblicazione: (2026)
di: Gu, Chengyang, et al.
Pubblicazione: (2026)
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
di: Chen, Feng, et al.
Pubblicazione: (2025)
di: Chen, Feng, et al.
Pubblicazione: (2025)
Dynamic Scaling of Unit Tests for Code Reward Modeling
di: Ma, Zeyao, et al.
Pubblicazione: (2025)
di: Ma, Zeyao, et al.
Pubblicazione: (2025)
Sparse Tucker Decomposition and Graph Regularization for High-Dimensional Time Series Forecasting
di: Xia, Sijia, et al.
Pubblicazione: (2026)
di: Xia, Sijia, et al.
Pubblicazione: (2026)
Byzantine-Robust Distributed Sparse Learning Revisited
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
LoRS: Efficient Low-Rank Adaptation for Sparse Large Language Model
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer
di: Li, Wenxi, et al.
Pubblicazione: (2025)
di: Li, Wenxi, et al.
Pubblicazione: (2025)
Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving
di: Zhao, Zihan, et al.
Pubblicazione: (2026)
di: Zhao, Zihan, et al.
Pubblicazione: (2026)
Guided Cooperation in Hierarchical Reinforcement Learning via Model-based Rollout
di: Wang, Haoran, et al.
Pubblicazione: (2023)
di: Wang, Haoran, et al.
Pubblicazione: (2023)
Efficient Knowledge Infusion via KG-LLM Alignment
di: Jiang, Zhouyu, et al.
Pubblicazione: (2024)
di: Jiang, Zhouyu, et al.
Pubblicazione: (2024)
Rollout-Training Co-Design for Efficient LLM-Based Multi-Agent Reinforcement Learning
di: Jiang, Zhida, et al.
Pubblicazione: (2026)
di: Jiang, Zhida, et al.
Pubblicazione: (2026)
SparseLGS: Sparse View Language Embedded Gaussian Splatting
di: Hu, Jun, et al.
Pubblicazione: (2024)
di: Hu, Jun, et al.
Pubblicazione: (2024)
XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization
di: Tomar, Aditya, et al.
Pubblicazione: (2025)
di: Tomar, Aditya, et al.
Pubblicazione: (2025)
Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management
di: Zhao, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhao, Yuxuan, et al.
Pubblicazione: (2026)
Customer-R1: Personalized Simulation of Human Behaviors via RL-based LLM Agent in Online Shopping
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
Heddle: A Distributed Orchestration System for Agentic RL Rollout
di: Zhang, Zili, et al.
Pubblicazione: (2026)
di: Zhang, Zili, et al.
Pubblicazione: (2026)
Dynamic Vocabulary Pruning: Stable LLM-RL by Taming the Tail
di: Li, Yingru, et al.
Pubblicazione: (2025)
di: Li, Yingru, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoT-based Synthesizer: Enhancing LLM Performance through Answer Synthesis
di: Zhang, Bohan, et al.
Pubblicazione: (2025) -
$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2026) -
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025) -
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
di: Liu, Bingshuai, et al.
Pubblicazione: (2025) -
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
di: Zhang, Hao, et al.
Pubblicazione: (2026)