TurboGR: An Accelerated Training System for Large-Scale Generative Recommendation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chai, Huichao, Wu, Zhixin, Li, Xuemiao, Fan, Shiqing, Wang, Hengfeng, Peng, Maojun, Xu, Lu, Wang, Yaoyuan, Jin, Yibo, Guo, Wei, Feng, Yongxiang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NestPipe: Large-Scale Recommendation Training on 1,500+ Accelerators via Nested Pipelining
par: Jiang, Zhida, et autres
Publié: (2026)
par: Jiang, Zhida, et autres
Publié: (2026)
RelayGR: Scaling Long-Sequence Generative Recommendation via Cross-Stage Relay-Race Inference
par: Wang, Jiarui, et autres
Publié: (2026)
par: Wang, Jiarui, et autres
Publié: (2026)
Accelerating Distributed MoE Training and Inference with Lina
par: Li, Jiamin, et autres
Publié: (2022)
par: Li, Jiamin, et autres
Publié: (2022)
Accelerating Compound LLM Training Workloads with Maestro
par: Yuan, Xiulong, et autres
Publié: (2026)
par: Yuan, Xiulong, et autres
Publié: (2026)
LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind
par: Zhang, Li, et autres
Publié: (2025)
par: Zhang, Li, et autres
Publié: (2025)
RcLLM: Accelerating Generative Recommendation via Beyond-Prefix KV Caching
par: Zhao, Zhan, et autres
Publié: (2026)
par: Zhao, Zhan, et autres
Publié: (2026)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
par: Zhang, Zili, et autres
Publié: (2024)
par: Zhang, Zili, et autres
Publié: (2024)
MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production
par: Xue, Chunyu, et autres
Publié: (2026)
par: Xue, Chunyu, et autres
Publié: (2026)
DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training
par: Wang, Zhixin, et autres
Publié: (2025)
par: Wang, Zhixin, et autres
Publié: (2025)
Two-dimensional Sparse Parallelism for Large Scale Deep Learning Recommendation Model Training
par: Zhang, Xin, et autres
Publié: (2025)
par: Zhang, Xin, et autres
Publié: (2025)
Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation
par: Feng, Weiqi, et autres
Publié: (2024)
par: Feng, Weiqi, et autres
Publié: (2024)
TurboFFT: A High-Performance Fast Fourier Transform with Fault Tolerance on GPU
par: Wu, Shixun, et autres
Publié: (2024)
par: Wu, Shixun, et autres
Publié: (2024)
FLAME: A Serving System Optimized for Large-Scale Generative Recommendation with Efficiency
par: Guo, Xianwen, et autres
Publié: (2025)
par: Guo, Xianwen, et autres
Publié: (2025)
Multi-Resolution Model Fusion for Accelerating the Convolutional Neural Network Training
par: Wang, Kewei, et autres
Publié: (2025)
par: Wang, Kewei, et autres
Publié: (2025)
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
par: Chen, Kefu, et autres
Publié: (2026)
par: Chen, Kefu, et autres
Publié: (2026)
TurboFFT: Co-Designed High-Performance and Fault-Tolerant Fast Fourier Transform on GPUs
par: Wu, Shixun, et autres
Publié: (2024)
par: Wu, Shixun, et autres
Publié: (2024)
PALM: A Efficient Performance Simulator for Tiled Accelerators with Large-scale Model Training
par: Fang, Jiahao, et autres
Publié: (2024)
par: Fang, Jiahao, et autres
Publié: (2024)
MTGenRec: An Efficient Distributed Training System for Generative Recommendation Models in Meituan
par: Wang, Yuxiang, et autres
Publié: (2025)
par: Wang, Yuxiang, et autres
Publié: (2025)
Accelerating Communication in Deep Learning Recommendation Model Training with Dual-Level Adaptive Lossy Compression
par: Feng, Hao, et autres
Publié: (2024)
par: Feng, Hao, et autres
Publié: (2024)
TurboFNO: High-Performance Fourier Neural Operator with Fused FFT-GEMM-iFFT on GPU
par: Wu, Shixun, et autres
Publié: (2025)
par: Wu, Shixun, et autres
Publié: (2025)
Echo: Simulating Distributed Training At Scale
par: Feng, Yicheng, et autres
Publié: (2024)
par: Feng, Yicheng, et autres
Publié: (2024)
CaGR-RAG: Context-aware Query Grouping for Disk-based Vector Search in RAG Systems
par: Jeong, Yeonwoo, et autres
Publié: (2025)
par: Jeong, Yeonwoo, et autres
Publié: (2025)
Performance Characterization of Containerized DNN Training and Inference on Edge Accelerators
par: K., Prashanthi S., et autres
Publié: (2023)
par: K., Prashanthi S., et autres
Publié: (2023)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
par: K., Prashanthi S., et autres
Publié: (2025)
par: K., Prashanthi S., et autres
Publié: (2025)
SGEMM-cube: Precision-Recovery FP32 GEMM Approximation on Ascend NPUs with FP16 Matrix Engines
par: Xue, Weicheng, et autres
Publié: (2025)
par: Xue, Weicheng, et autres
Publié: (2025)
DreamDDP: Accelerating Data Parallel Distributed LLM Training with Layer-wise Scheduled Partial Synchronization
par: Tang, Zhenheng, et autres
Publié: (2025)
par: Tang, Zhenheng, et autres
Publié: (2025)
LoongTrain: Efficient Training of Long-Sequence LLMs with Head-Context Parallelism
par: Gu, Diandian, et autres
Publié: (2024)
par: Gu, Diandian, et autres
Publié: (2024)
Embedding Samples Dispatching for Recommendation Model Training in Edge Environments
par: Li, Guopeng, et autres
Publié: (2025)
par: Li, Guopeng, et autres
Publié: (2025)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
par: Wang, Siqi, et autres
Publié: (2024)
par: Wang, Siqi, et autres
Publié: (2024)
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
par: Luo, Shuqing, et autres
Publié: (2024)
par: Luo, Shuqing, et autres
Publié: (2024)
Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding
par: Wang, Zhibin, et autres
Publié: (2025)
par: Wang, Zhibin, et autres
Publié: (2025)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
par: Schieffer, Gabin, et autres
Publié: (2024)
par: Schieffer, Gabin, et autres
Publié: (2024)
Characterizing the Performance of Accelerated Jetson Edge Devices for Training Deep Learning Models
par: K., Prashanthi S., et autres
Publié: (2025)
par: K., Prashanthi S., et autres
Publié: (2025)
ReviveMoE: Fast Recovery for Hardware Failures in Large-Scale MoE LLM Inference Deployments
par: Li, Haley, et autres
Publié: (2026)
par: Li, Haley, et autres
Publié: (2026)
EPD-Serve: A Flexible Multimodal EPD Disaggregation Inference Serving System On Ascend
par: Bai, Fan, et autres
Publié: (2026)
par: Bai, Fan, et autres
Publié: (2026)
Optimizing Distributed Training Approaches for Scaling Neural Networks
par: Baligodugula, Vishnu Vardhan, et autres
Publié: (2025)
par: Baligodugula, Vishnu Vardhan, et autres
Publié: (2025)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
par: Zhao, Long, et autres
Publié: (2026)
par: Zhao, Long, et autres
Publié: (2026)
DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training
par: Tan, Xin, et autres
Publié: (2025)
par: Tan, Xin, et autres
Publié: (2025)
AQUA: Network-Accelerated Memory Offloading for LLMs in Scale-Up GPU Domains
par: Kumar, Abhishek Vijaya, et autres
Publié: (2024)
par: Kumar, Abhishek Vijaya, et autres
Publié: (2024)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
par: Wijeratne, Sasindu, et autres
Publié: (2025)
par: Wijeratne, Sasindu, et autres
Publié: (2025)
Documents similaires
-
NestPipe: Large-Scale Recommendation Training on 1,500+ Accelerators via Nested Pipelining
par: Jiang, Zhida, et autres
Publié: (2026) -
RelayGR: Scaling Long-Sequence Generative Recommendation via Cross-Stage Relay-Race Inference
par: Wang, Jiarui, et autres
Publié: (2026) -
Accelerating Distributed MoE Training and Inference with Lina
par: Li, Jiamin, et autres
Publié: (2022) -
Accelerating Compound LLM Training Workloads with Maestro
par: Yuan, Xiulong, et autres
Publié: (2026) -
LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind
par: Zhang, Li, et autres
Publié: (2025)