DynaFlow: Transparent and Flexible Intra-Device Parallelism via Programmable Operator Scheduling
Fuente:
arXiv
Guardado en:
| Autores principales: | Pan, Yi, Gu, Yile, Luo, Jinbin, Wu, Yibo, Wang, Ziren, Zhang, Hongtao, Xu, Ziyi, Lin, Shengkai, Kasikci, Baris, Wang, Stephanie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NanoFlow: Towards Optimal Large Language Model Serving Throughput
por: Zhu, Kan, et al.
Publicado: (2024)
por: Zhu, Kan, et al.
Publicado: (2024)
ConsumerBench: Benchmarking Generative AI Applications on End-User Devices
por: Gu, Yile, et al.
Publicado: (2025)
por: Gu, Yile, et al.
Publicado: (2025)
Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models
por: Kamahori, Keisuke, et al.
Publicado: (2024)
por: Kamahori, Keisuke, et al.
Publicado: (2024)
Argos: Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models
por: Gu, Yile, et al.
Publicado: (2025)
por: Gu, Yile, et al.
Publicado: (2025)
Unleashing Scalable Context Parallelism for Foundation Models Pre-Training via FCP
por: Zhao, Yilong, et al.
Publicado: (2026)
por: Zhao, Yilong, et al.
Publicado: (2026)
CFP: Efficient Optimization of Intra-Operator Parallelism Plans for Large Model Training
por: Hu, Weifang, et al.
Publicado: (2025)
por: Hu, Weifang, et al.
Publicado: (2025)
A Flexible Programmable Pipeline Parallelism Framework for Efficient DNN Training
por: Jiang, Lijuan, et al.
Publicado: (2025)
por: Jiang, Lijuan, et al.
Publicado: (2025)
VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?
por: Kamahori, Keisuke, et al.
Publicado: (2026)
por: Kamahori, Keisuke, et al.
Publicado: (2026)
Accelerating Heterogeneous Tensor Parallelism via Flexible Workload Control
por: Wang, Zhigang, et al.
Publicado: (2024)
por: Wang, Zhigang, et al.
Publicado: (2024)
TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval
por: Lin, Chien-Yu, et al.
Publicado: (2025)
por: Lin, Chien-Yu, et al.
Publicado: (2025)
DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training
por: Wang, Yuanqing, et al.
Publicado: (2026)
por: Wang, Yuanqing, et al.
Publicado: (2026)
Fake Runs, Real Fixes -- Analyzing xPU Performance Through Simulation
por: Zarkadas, Ioannis, et al.
Publicado: (2025)
por: Zarkadas, Ioannis, et al.
Publicado: (2025)
Magneton: Optimizing Energy Efficiency of ML Systems via Differential Energy Debugging
por: Pan, Yi, et al.
Publicado: (2025)
por: Pan, Yi, et al.
Publicado: (2025)
JanusPipe: Efficient Pipeline Parallel Training for Machine Learning Interatomic Potentials
por: Wang, Hongyu, et al.
Publicado: (2026)
por: Wang, Hongyu, et al.
Publicado: (2026)
PolyServe: Efficient Multi-SLO Serving at Scale
por: Zhu, Kan, et al.
Publicado: (2025)
por: Zhu, Kan, et al.
Publicado: (2025)
Efficient Task Graph Scheduling for Parallel QR Factorization in SLSQP
por: Chatterjee, Soumyajit, et al.
Publicado: (2025)
por: Chatterjee, Soumyajit, et al.
Publicado: (2025)
A Simulated Annealing Approach to Identical Parallel Machine Scheduling
por: Li, Jiaxing, et al.
Publicado: (2024)
por: Li, Jiaxing, et al.
Publicado: (2024)
Hyperion: Hierarchical Scheduling for Parallel LLM Acceleration in Multi-tier Networks
por: Ma, Mulei, et al.
Publicado: (2025)
por: Ma, Mulei, et al.
Publicado: (2025)
Concurrent Scheduling of High-Level Parallel Programs on Multi-GPU Systems
por: Knorr, Fabian, et al.
Publicado: (2025)
por: Knorr, Fabian, et al.
Publicado: (2025)
DreamDDP: Accelerating Data Parallel Distributed LLM Training with Layer-wise Scheduled Partial Synchronization
por: Tang, Zhenheng, et al.
Publicado: (2025)
por: Tang, Zhenheng, et al.
Publicado: (2025)
Prioritizing Modalities: Flexible Importance Scheduling in Federated Multimodal Learning
por: Bian, Jieming, et al.
Publicado: (2024)
por: Bian, Jieming, et al.
Publicado: (2024)
Optimal Parallel Scheduling under Concave Speedup Functions
por: Li, Chengzhang, et al.
Publicado: (2025)
por: Li, Chengzhang, et al.
Publicado: (2025)
Aryl: An Elastic Cluster Scheduler for Deep Learning
por: Li, Jiamin, et al.
Publicado: (2022)
por: Li, Jiamin, et al.
Publicado: (2022)
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
por: Pan, Xinglin, et al.
Publicado: (2025)
por: Pan, Xinglin, et al.
Publicado: (2025)
SLICE: SLO-Driven Scheduling for LLM Inference on Edge Computing Devices
por: Chow, Will
Publicado: (2025)
por: Chow, Will
Publicado: (2025)
FlexPie: Accelerate Distributed Inference on Edge Devices with Flexible Combinatorial Optimization[Technical Report]
por: Zhang, Runhua, et al.
Publicado: (2025)
por: Zhang, Runhua, et al.
Publicado: (2025)
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
por: Zhang, Han, et al.
Publicado: (2026)
por: Zhang, Han, et al.
Publicado: (2026)
DeFT: Mitigating Data Dependencies for Flexible Communication Scheduling in Distributed Training
por: Meng, Lin, et al.
Publicado: (2025)
por: Meng, Lin, et al.
Publicado: (2025)
A Taxonomy of Schedulers -- Operating Systems, Clusters and Big Data Frameworks
por: Sliwko, Leszek
Publicado: (2025)
por: Sliwko, Leszek
Publicado: (2025)
Communication-Efficient Device Scheduling for Federated Learning Using Lyapunov Optimization
por: Perazzone, Jake B., et al.
Publicado: (2025)
por: Perazzone, Jake B., et al.
Publicado: (2025)
DynaServe: Unified and Elastic Execution for Dynamic Disaggregated LLM Serving
por: Ruan, Chaoyi, et al.
Publicado: (2025)
por: Ruan, Chaoyi, et al.
Publicado: (2025)
VoxServe: Streaming-Centric Serving System for Speech Language Models
por: Kamahori, Keisuke, et al.
Publicado: (2026)
por: Kamahori, Keisuke, et al.
Publicado: (2026)
FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving
por: Ye, Zihao, et al.
Publicado: (2025)
por: Ye, Zihao, et al.
Publicado: (2025)
RingAda: Pipelining Large Model Fine-Tuning on Edge Devices with Scheduled Layer Unfreezing
por: Li, Liang, et al.
Publicado: (2025)
por: Li, Liang, et al.
Publicado: (2025)
GPUOS: A GPU Operating System Primitive for Transparent Operation Fusion
por: Yang, Yiwei, et al.
Publicado: (2026)
por: Yang, Yiwei, et al.
Publicado: (2026)
Efficient Data Labeling and Optimal Device Scheduling in HWNs Using Clustered Federated Semi-Supervised Learning
por: Hamood, Moqbel, et al.
Publicado: (2024)
por: Hamood, Moqbel, et al.
Publicado: (2024)
SP-Chain: Boosting Intra-Shard and Cross-Shard Security and Performance in Blockchain Sharding
por: Li, Mingzhe, et al.
Publicado: (2024)
por: Li, Mingzhe, et al.
Publicado: (2024)
FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism
por: Wang, Yujie, et al.
Publicado: (2024)
por: Wang, Yujie, et al.
Publicado: (2024)
Scheduling Coflows in Multi-Core OCS Networks with Performance Guarantee
por: Wang, Xin, et al.
Publicado: (2026)
por: Wang, Xin, et al.
Publicado: (2026)
Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference
por: Wang, Qipeng
Publicado: (2026)
por: Wang, Qipeng
Publicado: (2026)
Ejemplares similares
-
NanoFlow: Towards Optimal Large Language Model Serving Throughput
por: Zhu, Kan, et al.
Publicado: (2024) -
ConsumerBench: Benchmarking Generative AI Applications on End-User Devices
por: Gu, Yile, et al.
Publicado: (2025) -
Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models
por: Kamahori, Keisuke, et al.
Publicado: (2024) -
Argos: Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models
por: Gu, Yile, et al.
Publicado: (2025) -
Unleashing Scalable Context Parallelism for Foundation Models Pre-Training via FCP
por: Zhao, Yilong, et al.
Publicado: (2026)