AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Jiarui, Yang, Yuchen, Yan, Ran, Mei, Zhiyu, Zhang, Liyuan, Li, Daifeng, Fu, Wei, Gao, Jiaxuan, Xu, Shusheng, Wu, Yi, Yuan, Binhang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
por: Fu, Wei, et al.
Publicado: (2025)
por: Fu, Wei, et al.
Publicado: (2025)
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
por: Yan, Ran, et al.
Publicado: (2025)
por: Yan, Ran, et al.
Publicado: (2025)
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
por: Gao, Jiaxuan, et al.
Publicado: (2025)
por: Gao, Jiaxuan, et al.
Publicado: (2025)
SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores
por: Mei, Zhiyu, et al.
Publicado: (2023)
por: Mei, Zhiyu, et al.
Publicado: (2023)
How Far Are We from Optimal Reasoning Efficiency?
por: Gao, Jiaxuan, et al.
Publicado: (2025)
por: Gao, Jiaxuan, et al.
Publicado: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
por: Gao, Jiaxuan, et al.
Publicado: (2024)
por: Gao, Jiaxuan, et al.
Publicado: (2024)
Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study
por: Xu, Shusheng, et al.
Publicado: (2024)
por: Xu, Shusheng, et al.
Publicado: (2024)
ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation
por: Mei, Zhiyu, et al.
Publicado: (2024)
por: Mei, Zhiyu, et al.
Publicado: (2024)
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
por: Yan, Ran, et al.
Publicado: (2025)
por: Yan, Ran, et al.
Publicado: (2025)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
por: Yan, Ran, et al.
Publicado: (2024)
por: Yan, Ran, et al.
Publicado: (2024)
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
por: Jiang, Youhe, et al.
Publicado: (2025)
por: Jiang, Youhe, et al.
Publicado: (2025)
POSHXURT SHEVASINING AREAL-LINGVISTIK TAVSIFI
por: Ko`chiyeva, Shabnam
Publicado: (2026)
por: Ko`chiyeva, Shabnam
Publicado: (2026)
Cascadia: An Efficient Cascade Serving System for Large Language Models
por: Jiang, Youhe, et al.
Publicado: (2025)
por: Jiang, Youhe, et al.
Publicado: (2025)
LAGOON: Language-Guided Motion Control
por: Xu, Shusheng, et al.
Publicado: (2023)
por: Xu, Shusheng, et al.
Publicado: (2023)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
por: Jiang, Youhe, et al.
Publicado: (2023)
por: Jiang, Youhe, et al.
Publicado: (2023)
A Large Language Model-based Framework for Semi-Structured Tender Document Retrieval-Augmented Generation
por: Zhao, Yilong, et al.
Publicado: (2024)
por: Zhao, Yilong, et al.
Publicado: (2024)
Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics
por: Jiang, Youhe, et al.
Publicado: (2026)
por: Jiang, Youhe, et al.
Publicado: (2026)
DeFT: Decoding with Flash Tree-attention for Efficient Tree-structured LLM Inference
por: Yao, Jinwei, et al.
Publicado: (2024)
por: Yao, Jinwei, et al.
Publicado: (2024)
UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models
por: He, Guangxin, et al.
Publicado: (2025)
por: He, Guangxin, et al.
Publicado: (2025)
Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification
por: Xu, Xu, et al.
Publicado: (2025)
por: Xu, Xu, et al.
Publicado: (2025)
QAMASHI TUMANI AYRIM MAHALLALARI DIALEKTAL LEKSIKASINING AREAL TAHLILI
por: Normurodova Fayoza Boymurod qizi
Publicado: (2025)
por: Normurodova Fayoza Boymurod qizi
Publicado: (2025)
CBP-Tuning: Efficient Local Customization for Black-box Large Language Models
por: Zhao, Jiaxuan, et al.
Publicado: (2025)
por: Zhao, Jiaxuan, et al.
Publicado: (2025)
Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management
por: Zheng, Haoyu, et al.
Publicado: (2026)
por: Zheng, Haoyu, et al.
Publicado: (2026)
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
por: Gao, Jiaxuan, et al.
Publicado: (2026)
por: Gao, Jiaxuan, et al.
Publicado: (2026)
DTA: Dual Temporal-channel-wise Attention for Spiking Neural Networks
por: Kim, Minje, et al.
Publicado: (2025)
por: Kim, Minje, et al.
Publicado: (2025)
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
por: Liang, Yan, et al.
Publicado: (2026)
por: Liang, Yan, et al.
Publicado: (2026)
DynamicDTA: Drug-Target Binding Affinity Prediction Using Dynamic Descriptors and Graph Representation
por: Luo, Dan, et al.
Publicado: (2025)
por: Luo, Dan, et al.
Publicado: (2025)
Iridium Oxide Nanoparticle‐Decorated Metal–Organic Framework: A Synergistic Platform for Photodynamic and Photothermal Cancer Therapy
por: Wanqing Teng, et al.
Publicado: (2025)
por: Wanqing Teng, et al.
Publicado: (2025)
AtmosSci-Bench: Evaluating the Recent Advance of Large Language Model for Atmospheric Science
por: Li, Chenyue, et al.
Publicado: (2025)
por: Li, Chenyue, et al.
Publicado: (2025)
CE-LoRA: Computation-Efficient LoRA Fine-Tuning for Language Models
por: Chen, Guanduo, et al.
Publicado: (2025)
por: Chen, Guanduo, et al.
Publicado: (2025)
Adamas: Hadamard Sparse Attention for Efficient Long-Context Inference
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
ENSI: Efficient Non-Interactive Secure Inference for Large Language Models
por: He, Zhiyu, et al.
Publicado: (2025)
por: He, Zhiyu, et al.
Publicado: (2025)
Toward Label‐Efficient Deep Learning Change Detection for Remote Sensing Imagery: A Comprehensive Review
por: Daifeng Peng, et al.
Publicado: (2025)
por: Daifeng Peng, et al.
Publicado: (2025)
Can Competition Enhance the Proficiency of Agents Powered by Large Language Models in the Realm of News-driven Time Series Forecasting?
por: Zhang, Yuxuan, et al.
Publicado: (2025)
por: Zhang, Yuxuan, et al.
Publicado: (2025)
Sliding Window Attention Training for Efficient Large Language Models
por: Fu, Zichuan, et al.
Publicado: (2025)
por: Fu, Zichuan, et al.
Publicado: (2025)
Goal-Guided Efficient Exploration via Large Language Model in Reinforcement Learning
por: Qi, Yajie, et al.
Publicado: (2025)
por: Qi, Yajie, et al.
Publicado: (2025)
On Predictability of Reinforcement Learning Dynamics for Large Language Models
por: Cai, Yuchen, et al.
Publicado: (2025)
por: Cai, Yuchen, et al.
Publicado: (2025)
Attention-Aligned Reasoning for Large Language Models
por: Zhang, Hongxiang, et al.
Publicado: (2025)
por: Zhang, Hongxiang, et al.
Publicado: (2025)
Learning with Dynamics: Autonomous Regulation of UAV Based Communication Networks with Dynamic UAV Crew
por: Zhang, Ran, et al.
Publicado: (2024)
por: Zhang, Ran, et al.
Publicado: (2024)
Efficient Reinforcement Learning with Large Language Model Priors
por: Yan, Xue, et al.
Publicado: (2024)
por: Yan, Xue, et al.
Publicado: (2024)
Ejemplares similares
-
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
por: Fu, Wei, et al.
Publicado: (2025) -
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
por: Yan, Ran, et al.
Publicado: (2025) -
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
por: Gao, Jiaxuan, et al.
Publicado: (2025) -
SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores
por: Mei, Zhiyu, et al.
Publicado: (2023) -
How Far Are We from Optimal Reasoning Efficiency?
por: Gao, Jiaxuan, et al.
Publicado: (2025)