Guardado en:
| Autor principal: | Lyu, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.01607 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ModServe: Modality- and Stage-Aware Resource Disaggregation for Scalable Multimodal Model Serving
por: Qiu, Haoran, et al.
Publicado: (2025)
por: Qiu, Haoran, et al.
Publicado: (2025)
HETHUB: A Distributed Training System with Heterogeneous Cluster for Large-Scale Models
por: Xu, Si, et al.
Publicado: (2024)
por: Xu, Si, et al.
Publicado: (2024)
Optimizing Data Distribution and Kernel Performance for Efficient Training of Chemistry Foundation Models: A Case Study with MACE
por: Firoz, Jesun, et al.
Publicado: (2025)
por: Firoz, Jesun, et al.
Publicado: (2025)
Cloudless-Training: A Framework to Improve Efficiency of Geo-Distributed ML Training
por: Tan, Wenting, et al.
Publicado: (2023)
por: Tan, Wenting, et al.
Publicado: (2023)
EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models
por: Cheng, Jialiang, et al.
Publicado: (2024)
por: Cheng, Jialiang, et al.
Publicado: (2024)
Mist: Efficient Distributed Training of Large Language Models via Memory-Parallelism Co-Optimization
por: Zhu, Zhanda, et al.
Publicado: (2025)
por: Zhu, Zhanda, et al.
Publicado: (2025)
FedComLoc: Communication-Efficient Distributed Training of Sparse and Quantized Models
por: Yi, Kai, et al.
Publicado: (2024)
por: Yi, Kai, et al.
Publicado: (2024)
Byzantine-Robust and Communication-Efficient Distributed Training: Compressive and Cyclic Gradient Coding
por: Li, Chengxi, et al.
Publicado: (2026)
por: Li, Chengxi, et al.
Publicado: (2026)
ParaGAN: A Scalable Distributed Training Framework for Generative Adversarial Networks
por: Shi, Ziji, et al.
Publicado: (2024)
por: Shi, Ziji, et al.
Publicado: (2024)
TrainVerify: Equivalence-Based Verification for Distributed LLM Training
por: Lu, Yunchi, et al.
Publicado: (2025)
por: Lu, Yunchi, et al.
Publicado: (2025)
MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services
por: Yu, Dianhai, et al.
Publicado: (2022)
por: Yu, Dianhai, et al.
Publicado: (2022)
TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training
por: Liu, Man, et al.
Publicado: (2026)
por: Liu, Man, et al.
Publicado: (2026)
PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning
por: Wang, Yisu, et al.
Publicado: (2025)
por: Wang, Yisu, et al.
Publicado: (2025)
Training Overhead Ratio: A Practical Reliability Metric for Large Language Model Training Systems
por: Lu, Ning, et al.
Publicado: (2024)
por: Lu, Ning, et al.
Publicado: (2024)
Demystifying the Communication Characteristics for Distributed Transformer Models
por: Anthony, Quentin, et al.
Publicado: (2024)
por: Anthony, Quentin, et al.
Publicado: (2024)
VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
por: Ma, Qianli, et al.
Publicado: (2025)
por: Ma, Qianli, et al.
Publicado: (2025)
Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning
por: Xu, Lang, et al.
Publicado: (2025)
por: Xu, Lang, et al.
Publicado: (2025)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
por: Xu, Lang, et al.
Publicado: (2024)
por: Xu, Lang, et al.
Publicado: (2024)
Lumos: Efficient Performance Modeling and Estimation for Large-scale LLM Training
por: Liang, Mingyu, et al.
Publicado: (2025)
por: Liang, Mingyu, et al.
Publicado: (2025)
DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline
por: Xue, Zhenliang, et al.
Publicado: (2025)
por: Xue, Zhenliang, et al.
Publicado: (2025)
Why Should the Server Do It All?: A Scalable, Versatile, and Model-Agnostic Framework for Server-Light DNN Inference over Massively Distributed Clients via Training-Free Intermediate Feature Compression
por: Sung, Mingyu, et al.
Publicado: (2025)
por: Sung, Mingyu, et al.
Publicado: (2025)
Dora: QoE-Aware Hybrid Parallelism for Distributed Edge AI
por: Jin, Jianli, et al.
Publicado: (2025)
por: Jin, Jianli, et al.
Publicado: (2025)
Towards an Introspective Dynamic Model of Globally Distributed Computing Infrastructures
por: Kilic, Ozgur O., et al.
Publicado: (2025)
por: Kilic, Ozgur O., et al.
Publicado: (2025)
TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training
por: Han, Shujie, et al.
Publicado: (2026)
por: Han, Shujie, et al.
Publicado: (2026)
MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training
por: Zhao, Juntao, et al.
Publicado: (2025)
por: Zhao, Juntao, et al.
Publicado: (2025)
Galvatron: An Automatic Distributed System for Efficient Foundation Model Training
por: Liu, Xinyi, et al.
Publicado: (2025)
por: Liu, Xinyi, et al.
Publicado: (2025)
Training Through Failure: Effects of Data Consistency in Parallel Machine Learning Training
por: Cao, Ray, et al.
Publicado: (2024)
por: Cao, Ray, et al.
Publicado: (2024)
Failure-Resilient Distributed Inference with Model Compression over Heterogeneous Edge Devices
por: Wang, Li, et al.
Publicado: (2024)
por: Wang, Li, et al.
Publicado: (2024)
Verify Distributed Deep Learning Model Implementation Refinement with Iterative Relation Inference
por: Wang, Zhanghan, et al.
Publicado: (2025)
por: Wang, Zhanghan, et al.
Publicado: (2025)
FairBatching: Fairness-Aware Batch Formation for LLM Inference
por: Lyu, Hongtao, et al.
Publicado: (2025)
por: Lyu, Hongtao, et al.
Publicado: (2025)
Multi-Agentic AI for Fairness-Aware and Accelerated Multi-modal Large Model Inference in Real-world Mobile Edge Networks
por: Li, Haiyuan, et al.
Publicado: (2026)
por: Li, Haiyuan, et al.
Publicado: (2026)
IoT-MCP: Bridging LLMs and IoT Systems Through Model Context Protocol
por: Yang, Ningyuan, et al.
Publicado: (2025)
por: Yang, Ningyuan, et al.
Publicado: (2025)
CCL-D: A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training
por: Gu, Yida, et al.
Publicado: (2026)
por: Gu, Yida, et al.
Publicado: (2026)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
por: Zheng, Yijie, et al.
Publicado: (2025)
por: Zheng, Yijie, et al.
Publicado: (2025)
ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation
por: Kaplan, Erel, et al.
Publicado: (2026)
por: Kaplan, Erel, et al.
Publicado: (2026)
Why Smaller Is Slower? Dimensional Misalignment in Compressed LLMs
por: Xin, Jihao, et al.
Publicado: (2026)
por: Xin, Jihao, et al.
Publicado: (2026)
UNIFERENCE: A Discrete Event Simulation Framework for Developing Distributed AI Models
por: Eldenk, Doğaç, et al.
Publicado: (2026)
por: Eldenk, Doğaç, et al.
Publicado: (2026)
Training Ultra Long Context Language Model with Fully Pipelined Distributed Transformer
por: Yao, Jinghan, et al.
Publicado: (2024)
por: Yao, Jinghan, et al.
Publicado: (2024)
Revisiting Parameter Server in LLM Post-Training
por: Wan, Xinyi, et al.
Publicado: (2026)
por: Wan, Xinyi, et al.
Publicado: (2026)
Lightweight Trustworthy Distributed Clustering
por: Li, Hongyang, et al.
Publicado: (2025)
por: Li, Hongyang, et al.
Publicado: (2025)
Ejemplares similares
-
ModServe: Modality- and Stage-Aware Resource Disaggregation for Scalable Multimodal Model Serving
por: Qiu, Haoran, et al.
Publicado: (2025) -
HETHUB: A Distributed Training System with Heterogeneous Cluster for Large-Scale Models
por: Xu, Si, et al.
Publicado: (2024) -
Optimizing Data Distribution and Kernel Performance for Efficient Training of Chemistry Foundation Models: A Case Study with MACE
por: Firoz, Jesun, et al.
Publicado: (2025) -
Cloudless-Training: A Framework to Improve Efficiency of Geo-Distributed ML Training
por: Tan, Wenting, et al.
Publicado: (2023) -
EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models
por: Cheng, Jialiang, et al.
Publicado: (2024)