Enregistré dans:
| Auteurs principaux: | Chen, Sirui, Chen, Jingji, Zhu, Siqi, Jiang, Ziheng, Peng, Yanghua, Qian, Xuehai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.20968 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ATTENTION2D: Communication Efficient Distributed Self-Attention Mechanism
par: Elango, Venmugil
Publié: (2025)
par: Elango, Venmugil
Publié: (2025)
MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training
par: Zhao, Juntao, et autres
Publié: (2025)
par: Zhao, Juntao, et autres
Publié: (2025)
EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models
par: Cheng, Jialiang, et autres
Publié: (2024)
par: Cheng, Jialiang, et autres
Publié: (2024)
OpenTinker: Separating Concerns in Agentic Reinforcement Learning
par: Zhu, Siqi, et autres
Publié: (2026)
par: Zhu, Siqi, et autres
Publié: (2026)
FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving
par: Ye, Zihao, et autres
Publié: (2025)
par: Ye, Zihao, et autres
Publié: (2025)
Federated Attention: A Distributed Paradigm for Collaborative LLM Inference over Edge Networks
par: Deng, Xiumei, et autres
Publié: (2025)
par: Deng, Xiumei, et autres
Publié: (2025)
Communication Efficient Distributed Training with Distributed Lion
par: Liu, Bo, et autres
Publié: (2024)
par: Liu, Bo, et autres
Publié: (2024)
DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline
par: Xue, Zhenliang, et autres
Publié: (2025)
par: Xue, Zhenliang, et autres
Publié: (2025)
Communication-Efficient Large-Scale Distributed Deep Learning: A Comprehensive Survey
par: Liang, Feng, et autres
Publié: (2024)
par: Liang, Feng, et autres
Publié: (2024)
Byzantine-Robust and Communication-Efficient Distributed Training: Compressive and Cyclic Gradient Coding
par: Li, Chengxi, et autres
Publié: (2026)
par: Li, Chengxi, et autres
Publié: (2026)
Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation
par: Feng, Weiqi, et autres
Publié: (2024)
par: Feng, Weiqi, et autres
Publié: (2024)
DWDP: Distributed Weight Data Parallelism for High-Performance LLM Inference on NVL72
par: Li, Wanqian, et autres
Publié: (2026)
par: Li, Wanqian, et autres
Publié: (2026)
Sustainable Carbon-Aware and Water-Efficient LLM Scheduling in Geo-Distributed Cloud Datacenters
par: Moore, Hayden, et autres
Publié: (2025)
par: Moore, Hayden, et autres
Publié: (2025)
FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference
par: Liu, Xing, et autres
Publié: (2025)
par: Liu, Xing, et autres
Publié: (2025)
FT-Transformer: Resilient and Reliable Transformer with End-to-End Fault Tolerant Attention
par: Dai, Huangliang, et autres
Publié: (2025)
par: Dai, Huangliang, et autres
Publié: (2025)
DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training
par: Li, Dacheng, et autres
Publié: (2023)
par: Li, Dacheng, et autres
Publié: (2023)
PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning
par: Wang, Yisu, et autres
Publié: (2025)
par: Wang, Yisu, et autres
Publié: (2025)
High-Dimensional Data Processing: Benchmarking Machine Learning and Deep Learning Architectures in Local and Distributed Environments
par: Rodriguez, Julian, et autres
Publié: (2025)
par: Rodriguez, Julian, et autres
Publié: (2025)
Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention
par: Liao, Mengqi, et autres
Publié: (2026)
par: Liao, Mengqi, et autres
Publié: (2026)
Enabling Secure and Ephemeral AI Workloads in Data Mesh Environments
par: Patel, Chinkit, et autres
Publié: (2025)
par: Patel, Chinkit, et autres
Publié: (2025)
Stochastic Sparse Attention for Memory-Bound Inference
par: Lee, Kyle, et autres
Publié: (2026)
par: Lee, Kyle, et autres
Publié: (2026)
Demystifying the Communication Characteristics for Distributed Transformer Models
par: Anthony, Quentin, et autres
Publié: (2024)
par: Anthony, Quentin, et autres
Publié: (2024)
LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization
par: Zhao, Juntao, et autres
Publié: (2024)
par: Zhao, Juntao, et autres
Publié: (2024)
Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Mist: Efficient Distributed Training of Large Language Models via Memory-Parallelism Co-Optimization
par: Zhu, Zhanda, et autres
Publié: (2025)
par: Zhu, Zhanda, et autres
Publié: (2025)
MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services
par: Yu, Dianhai, et autres
Publié: (2022)
par: Yu, Dianhai, et autres
Publié: (2022)
MAC-Attention: a Match-Amend-Complete Scheme for Fast and Accurate Attention Computation
par: Yao, Jinghan, et autres
Publié: (2026)
par: Yao, Jinghan, et autres
Publié: (2026)
Optimizing Data Distribution and Kernel Performance for Efficient Training of Chemistry Foundation Models: A Case Study with MACE
par: Firoz, Jesun, et autres
Publié: (2025)
par: Firoz, Jesun, et autres
Publié: (2025)
Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding
par: Ye, Shengyuan, et autres
Publié: (2025)
par: Ye, Shengyuan, et autres
Publié: (2025)
MoSKA: Mixture of Shared KV Attention for Efficient Long-Sequence LLM Inference
par: Rhee, Myunghyun, et autres
Publié: (2025)
par: Rhee, Myunghyun, et autres
Publié: (2025)
FlashCommunication V2: Bit Splitting and Spike Reserving for Any Bit Communication
par: Li, Qingyuan, et autres
Publié: (2025)
par: Li, Qingyuan, et autres
Publié: (2025)
Latency-Aware 2-Opt Monotonic Local Search for Distributed Constraint Optimization
par: Rachmut, Ben, et autres
Publié: (2025)
par: Rachmut, Ben, et autres
Publié: (2025)
Using Sequential Runtime Distributions for the Parallel Speedup Prediction of SAT Local Search
par: Arbelaez, Alejandro, et autres
Publié: (2024)
par: Arbelaez, Alejandro, et autres
Publié: (2024)
FedFT: Improving Communication Performance for Federated Learning with Frequency Space Transformation
par: Palihawadana, Chamath, et autres
Publié: (2024)
par: Palihawadana, Chamath, et autres
Publié: (2024)
Cloudless-Training: A Framework to Improve Efficiency of Geo-Distributed ML Training
par: Tan, Wenting, et autres
Publié: (2023)
par: Tan, Wenting, et autres
Publié: (2023)
Data-Juicer 2.0: Cloud-Scale Adaptive Data Processing for and with Foundation Models
par: Chen, Daoyuan, et autres
Publié: (2024)
par: Chen, Daoyuan, et autres
Publié: (2024)
VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
par: Ma, Qianli, et autres
Publié: (2025)
par: Ma, Qianli, et autres
Publié: (2025)
ECCENTRIC: Edge-Cloud Collaboration Framework for Distributed Inference Using Knowledge Adaptation
par: Kamani, Mohammad Mahdi, et autres
Publié: (2025)
par: Kamani, Mohammad Mahdi, et autres
Publié: (2025)
KunServe: Parameter-centric Memory Management for Efficient Memory Overloading Handling in LLM Serving
par: Cheng, Rongxin, et autres
Publié: (2024)
par: Cheng, Rongxin, et autres
Publié: (2024)
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
par: Song, Jingwei, et autres
Publié: (2025)
par: Song, Jingwei, et autres
Publié: (2025)
Documents similaires
-
ATTENTION2D: Communication Efficient Distributed Self-Attention Mechanism
par: Elango, Venmugil
Publié: (2025) -
MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training
par: Zhao, Juntao, et autres
Publié: (2025) -
EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models
par: Cheng, Jialiang, et autres
Publié: (2024) -
OpenTinker: Separating Concerns in Agentic Reinforcement Learning
par: Zhu, Siqi, et autres
Publié: (2026) -
FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving
par: Ye, Zihao, et autres
Publié: (2025)