Salvato in:
| Autori principali: | Fu, Rong, Su, Zhongling, Zhong, Han-Sen, Zhao, Xiti, Zhang, Jianyang, Pan, Feng, Zhang, Pan, Zhao, Xianhe, Chen, Ming-Cheng, Lu, Chao-Yang, Pan, Jian-Wei, Pei, Zhiling, Zhang, Xingcheng, Ouyang, Wanli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2407.00769 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Quantum Circuit Simulation by Tensor Network Methods on Modern GPUs
di: Pan, Feng, et al.
Pubblicazione: (2023)
di: Pan, Feng, et al.
Pubblicazione: (2023)
More for Less: Integrating Capability-Predominant and Capacity-Predominant Computing
di: Zheng, Zhong, et al.
Pubblicazione: (2025)
di: Zheng, Zhong, et al.
Pubblicazione: (2025)
Towards Energy Efficient Co-Scheduling in HPC
di: Zheng, Zhong, et al.
Pubblicazione: (2026)
di: Zheng, Zhong, et al.
Pubblicazione: (2026)
EcoShift: Performance-Aware Power Management for Power-Constrained Heterogeneous Systems
di: Zheng, Zhong, et al.
Pubblicazione: (2026)
di: Zheng, Zhong, et al.
Pubblicazione: (2026)
NanoCP: Request-Level Dynamic Context Parallelism for Data-Expert Parallel Decoding
di: Chen, Jiefei, et al.
Pubblicazione: (2026)
di: Chen, Jiefei, et al.
Pubblicazione: (2026)
H2:Towards Efficient Large-Scale LLM Training on Hyper-Heterogeneous Cluster over 1,000 Chips
di: Tang, Ding, et al.
Pubblicazione: (2025)
di: Tang, Ding, et al.
Pubblicazione: (2025)
ZeroPP: Unleashing Exceptional Parallelism Efficiency through Tensor-Parallelism-Free Methodology
di: Tang, Ding, et al.
Pubblicazione: (2024)
di: Tang, Ding, et al.
Pubblicazione: (2024)
Exploring Uncore Frequency Scaling for Heterogeneous Computing
di: Zheng, Zhong, et al.
Pubblicazione: (2025)
di: Zheng, Zhong, et al.
Pubblicazione: (2025)
Union: An Automatic Workload Manager for Accelerating Network Simulation
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
High-performance Vector-length Agnostic Quantum Circuit Simulations on ARM Processors
di: Shi, Ruimin, et al.
Pubblicazione: (2026)
di: Shi, Ruimin, et al.
Pubblicazione: (2026)
A Real-Time Digital Twin for Adaptive Scheduling
di: Zhang, Yihe, et al.
Pubblicazione: (2025)
di: Zhang, Yihe, et al.
Pubblicazione: (2025)
FFTrainer: Fast Failover in Large-Language Model Training with Almost-Free State Management
di: Zhao, Bohan, et al.
Pubblicazione: (2025)
di: Zhao, Bohan, et al.
Pubblicazione: (2025)
GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
di: Han, Yu, et al.
Pubblicazione: (2025)
di: Han, Yu, et al.
Pubblicazione: (2025)
Overcoming Memory Constraints in Quantum Circuit Simulation with a High-Fidelity Compression Framework
di: Zhang, Boyuan, et al.
Pubblicazione: (2024)
di: Zhang, Boyuan, et al.
Pubblicazione: (2024)
MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM Serving
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
Coordinated Power Management on Heterogeneous Systems
di: Zheng, Zhong, et al.
Pubblicazione: (2025)
di: Zheng, Zhong, et al.
Pubblicazione: (2025)
FLAMMABLE: A Multi-Model Federated Learning Framework with Multi-Model Engagement and Adaptive Batch Sizes
di: Lin, Shouxu, et al.
Pubblicazione: (2025)
di: Lin, Shouxu, et al.
Pubblicazione: (2025)
MuxTune: Efficient Multi-Task LLM Fine-Tuning in Multi-Tenant Datacenters via Spatial-Temporal Backbone Multiplexing
di: Xue, Chunyu, et al.
Pubblicazione: (2026)
di: Xue, Chunyu, et al.
Pubblicazione: (2026)
MOSS: A Large-scale Open Microscopic Traffic Simulation System
di: Zhang, Jun, et al.
Pubblicazione: (2024)
di: Zhang, Jun, et al.
Pubblicazione: (2024)
TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training
di: Han, Shujie, et al.
Pubblicazione: (2026)
di: Han, Shujie, et al.
Pubblicazione: (2026)
UNIQ: Communication-Efficient Distributed Quantum Computing via Unified Nonlinear Integer Programming
di: Zhong, Hui, et al.
Pubblicazione: (2025)
di: Zhong, Hui, et al.
Pubblicazione: (2025)
Maple: A Multi-agent System for Portable Deep Learning across Clusters
di: Wu, Molang, et al.
Pubblicazione: (2025)
di: Wu, Molang, et al.
Pubblicazione: (2025)
Pier: Efficient Large Language Model pretraining with Relaxed Global Communication
di: Fan, Shuyuan, et al.
Pubblicazione: (2025)
di: Fan, Shuyuan, et al.
Pubblicazione: (2025)
SimDC: A High-Fidelity Device Simulation Platform for Device-Cloud Collaborative Computing
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model Training
di: Sun, Ao, et al.
Pubblicazione: (2024)
di: Sun, Ao, et al.
Pubblicazione: (2024)
Lion: Minimizing Distributed Transactions through Adaptive Replica Provision (Extended Version)
di: Zheng, Qiushi, et al.
Pubblicazione: (2024)
di: Zheng, Qiushi, et al.
Pubblicazione: (2024)
FedHC: A Hierarchical Clustered Federated Learning Framework for Satellite Networks
di: Liu, Zhuocheng, et al.
Pubblicazione: (2025)
di: Liu, Zhuocheng, et al.
Pubblicazione: (2025)
Energy-aware Incremental OTA Update for Flash-based Batteryless IoT Devices
di: Wei, Wei, et al.
Pubblicazione: (2024)
di: Wei, Wei, et al.
Pubblicazione: (2024)
A Survey on Model-heterogeneous Federated Learning: Problems, Methods, and Prospects
di: Fan, Boyu, et al.
Pubblicazione: (2023)
di: Fan, Boyu, et al.
Pubblicazione: (2023)
Towards Lock Modularization for Heterogeneous Environments
di: Zhang, Hanze, et al.
Pubblicazione: (2025)
di: Zhang, Hanze, et al.
Pubblicazione: (2025)
FreeRide: Harvesting Bubbles in Pipeline Parallelism
di: Zhang, Jiashu, et al.
Pubblicazione: (2024)
di: Zhang, Jiashu, et al.
Pubblicazione: (2024)
SMART: When is it Actually Worth Expanding a Speculative Tree?
di: Wang, Lifu, et al.
Pubblicazione: (2026)
di: Wang, Lifu, et al.
Pubblicazione: (2026)
Differential Privacy Preserving Distributed Quantum Computing
di: Zhong, Hui, et al.
Pubblicazione: (2024)
di: Zhong, Hui, et al.
Pubblicazione: (2024)
BlockAMC: Scalable In-Memory Analog Matrix Computing for Solving Linear Systems
di: Pan, Lunshuai, et al.
Pubblicazione: (2024)
di: Pan, Lunshuai, et al.
Pubblicazione: (2024)
CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
di: Hong, Guihang, et al.
Pubblicazione: (2025)
di: Hong, Guihang, et al.
Pubblicazione: (2025)
DynaFlow: Transparent and Flexible Intra-Device Parallelism via Programmable Operator Scheduling
di: Pan, Yi, et al.
Pubblicazione: (2026)
di: Pan, Yi, et al.
Pubblicazione: (2026)
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
Efficient Graph-Based Approximate Nearest Neighbor Search Achieving: Low Latency Without Throughput Loss
di: Luo, Jingjia, et al.
Pubblicazione: (2025)
di: Luo, Jingjia, et al.
Pubblicazione: (2025)
Boosting Scientific Error-Bounded Lossy Compression through Optimized Synergistic Lossy-Lossless Orchestration
di: Wu, Shixun, et al.
Pubblicazione: (2025)
di: Wu, Shixun, et al.
Pubblicazione: (2025)
Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
di: Chang, Zihan, et al.
Pubblicazione: (2024)
di: Chang, Zihan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Efficient Quantum Circuit Simulation by Tensor Network Methods on Modern GPUs
di: Pan, Feng, et al.
Pubblicazione: (2023) -
More for Less: Integrating Capability-Predominant and Capacity-Predominant Computing
di: Zheng, Zhong, et al.
Pubblicazione: (2025) -
Towards Energy Efficient Co-Scheduling in HPC
di: Zheng, Zhong, et al.
Pubblicazione: (2026) -
EcoShift: Performance-Aware Power Management for Power-Constrained Heterogeneous Systems
di: Zheng, Zhong, et al.
Pubblicazione: (2026) -
NanoCP: Request-Level Dynamic Context Parallelism for Data-Expert Parallel Decoding
di: Chen, Jiefei, et al.
Pubblicazione: (2026)