Practical Performance Guarantees for Pipelined DNN Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Archer, Aaron, Fahrbach, Matthew, Liu, Kuikui, Prabhu, Prakash |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Survey on Collaborative DNN Inference for Edge Intelligence
di: Ren, Weiqing, et al.
Pubblicazione: (2022)
di: Ren, Weiqing, et al.
Pubblicazione: (2022)
Learning the Optimal Path and DNN Partition for Collaborative Edge Inference
di: Huang, Yin, et al.
Pubblicazione: (2024)
di: Huang, Yin, et al.
Pubblicazione: (2024)
GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism
di: Jeon, Byungsoo, et al.
Pubblicazione: (2024)
di: Jeon, Byungsoo, et al.
Pubblicazione: (2024)
DNN-Powered MLOps Pipeline Optimization for Large Language Models: A Framework for Automated Deployment and Resource Management
di: Krishnamoorthy, Mahesh Vaijainthymala, et al.
Pubblicazione: (2025)
di: Krishnamoorthy, Mahesh Vaijainthymala, et al.
Pubblicazione: (2025)
CARIn: Constraint-Aware and Responsive Inference on Heterogeneous Devices for Single- and Multi-DNN Workloads
di: Panopoulos, Ioannis, et al.
Pubblicazione: (2024)
di: Panopoulos, Ioannis, et al.
Pubblicazione: (2024)
Multi-DNN Inference of Sparse Models on Edge SoCs
di: Luo, Jiawei, et al.
Pubblicazione: (2026)
di: Luo, Jiawei, et al.
Pubblicazione: (2026)
Enabling Large Batch Size Training for DNN Models Beyond the Memory Limit While Maintaining Performance
di: Piao, XinYu, et al.
Pubblicazione: (2021)
di: Piao, XinYu, et al.
Pubblicazione: (2021)
Towards a Flexible and High-Fidelity Approach to Distributed DNN Training Emulation
di: Liu, Banruo, et al.
Pubblicazione: (2024)
di: Liu, Banruo, et al.
Pubblicazione: (2024)
PaSE: Parallelization Strategies for Efficient DNN Training
di: Elango, Venmugil
Pubblicazione: (2024)
di: Elango, Venmugil
Pubblicazione: (2024)
Optimal Scheduling Algorithms for LLM Inference: Theory and Practice
di: Bari, Agrim, et al.
Pubblicazione: (2025)
di: Bari, Agrim, et al.
Pubblicazione: (2025)
Symphony: Optimized DNN Model Serving using Deferred Batch Scheduling
di: Chen, Lequn, et al.
Pubblicazione: (2023)
di: Chen, Lequn, et al.
Pubblicazione: (2023)
An End-to-End DNN Inference Framework for the SpiNNaker2 Neuromorphic MPSoC
di: Jobst, Matthias, et al.
Pubblicazione: (2025)
di: Jobst, Matthias, et al.
Pubblicazione: (2025)
Robust DNN Partitioning and Resource Allocation Under Uncertain Inference Time
di: Nan, Zhaojun, et al.
Pubblicazione: (2025)
di: Nan, Zhaojun, et al.
Pubblicazione: (2025)
PIPO: Pipelined Offloading for Efficient Inference on Consumer Devices
di: Liu, Yangyijian, et al.
Pubblicazione: (2025)
di: Liu, Yangyijian, et al.
Pubblicazione: (2025)
IPA: Inference Pipeline Adaptation to Achieve High Accuracy and Cost-Efficiency
di: Ghafouri, Saeid, et al.
Pubblicazione: (2023)
di: Ghafouri, Saeid, et al.
Pubblicazione: (2023)
FlashMem: Supporting Modern DNN Workloads on Mobile with GPU Memory Hierarchy Optimizations
di: Shu, Zhihao, et al.
Pubblicazione: (2026)
di: Shu, Zhihao, et al.
Pubblicazione: (2026)
Performance Characterization of Containerized DNN Training and Inference on Edge Accelerators
di: K., Prashanthi S., et al.
Pubblicazione: (2023)
di: K., Prashanthi S., et al.
Pubblicazione: (2023)
HiDP: Hierarchical DNN Partitioning for Distributed Inference on Heterogeneous Edge Platforms
di: Taufique, Zain, et al.
Pubblicazione: (2024)
di: Taufique, Zain, et al.
Pubblicazione: (2024)
MiCRO: Near-Zero Cost Gradient Sparsification for Scaling and Accelerating Distributed DNN Training
di: Yoon, Daegun, et al.
Pubblicazione: (2023)
di: Yoon, Daegun, et al.
Pubblicazione: (2023)
Making MoE-based LLM Inference Resilient with Tarragon
di: Zhang, Songyu, et al.
Pubblicazione: (2026)
di: Zhang, Songyu, et al.
Pubblicazione: (2026)
Understanding and Improving Communication Performance in Multi-node LLM Inference
di: Singhania, Prajwal, et al.
Pubblicazione: (2025)
di: Singhania, Prajwal, et al.
Pubblicazione: (2025)
Exploring the Boundaries of On-Device Inference: When Tiny Falls Short, Go Hierarchical
di: Behera, Adarsh Prasad, et al.
Pubblicazione: (2024)
di: Behera, Adarsh Prasad, et al.
Pubblicazione: (2024)
Universal Checkpointing: A Flexible and Efficient Distributed Checkpointing System for Large-Scale DNN Training with Reconfigurable Parallelis
di: Lian, Xinyu, et al.
Pubblicazione: (2024)
di: Lian, Xinyu, et al.
Pubblicazione: (2024)
Governing Cloud Data Pipelines with Agentic AI
di: Kirubakaran, Aswathnarayan Muthukrishnan, et al.
Pubblicazione: (2025)
di: Kirubakaran, Aswathnarayan Muthukrishnan, et al.
Pubblicazione: (2025)
Nesterov Method for Asynchronous Pipeline Parallel Optimization
di: Ajanthan, Thalaiyasingam, et al.
Pubblicazione: (2025)
di: Ajanthan, Thalaiyasingam, et al.
Pubblicazione: (2025)
PipeInfer: Accelerating LLM Inference using Asynchronous Pipelined Speculation
di: Butler, Branden, et al.
Pubblicazione: (2024)
di: Butler, Branden, et al.
Pubblicazione: (2024)
Context-Driven Performance Modeling for Causal Inference Operators on Neural Processing Units
di: Gupta, Neelesh, et al.
Pubblicazione: (2025)
di: Gupta, Neelesh, et al.
Pubblicazione: (2025)
BLaST: High Performance Inference and Pretraining using BLock Sparse Transformers
di: Okanovic, Patrik, et al.
Pubblicazione: (2025)
di: Okanovic, Patrik, et al.
Pubblicazione: (2025)
Collaborative Speculative Inference for Efficient LLM Inference Serving
di: Gao, Luyao, et al.
Pubblicazione: (2025)
di: Gao, Luyao, et al.
Pubblicazione: (2025)
TaxBreak: Unmasking the Hidden Costs of LLM Inference Through Overhead Decomposition
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2026)
di: Vellaisamy, Prabhu, et al.
Pubblicazione: (2026)
A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability
di: Liu, Ruitao, et al.
Pubblicazione: (2026)
di: Liu, Ruitao, et al.
Pubblicazione: (2026)
SwapNet: Efficient Swapping for DNN Inference on Edge AI Devices Beyond the Memory Budget
di: Wang, Kun, et al.
Pubblicazione: (2024)
di: Wang, Kun, et al.
Pubblicazione: (2024)
Hermes: Memory-Efficient Pipeline Inference for Large Models on Edge Devices
di: Han, Xueyuan, et al.
Pubblicazione: (2024)
di: Han, Xueyuan, et al.
Pubblicazione: (2024)
PiPar: Pipeline Parallelism for Collaborative Machine Learning
di: Zhang, Zihan, et al.
Pubblicazione: (2022)
di: Zhang, Zihan, et al.
Pubblicazione: (2022)
HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism
di: Zhang, Geng, et al.
Pubblicazione: (2025)
di: Zhang, Geng, et al.
Pubblicazione: (2025)
FlexLLM: Token-Level Co-Serving of LLM Inference and Finetuning with SLO Guarantees
di: Oliaro, Gabriele, et al.
Pubblicazione: (2024)
di: Oliaro, Gabriele, et al.
Pubblicazione: (2024)
AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism
di: Ajanthan, Thalaiyasingam, et al.
Pubblicazione: (2026)
di: Ajanthan, Thalaiyasingam, et al.
Pubblicazione: (2026)
Decentralized Sporadic Federated Learning: A Unified Algorithmic Framework with Convergence Guarantees
di: Zehtabi, Shahryar, et al.
Pubblicazione: (2024)
di: Zehtabi, Shahryar, et al.
Pubblicazione: (2024)
LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load
di: Tummalapalli, Pranay, et al.
Pubblicazione: (2026)
di: Tummalapalli, Pranay, et al.
Pubblicazione: (2026)
MSPipe: Efficient Temporal GNN Training via Staleness-Aware Pipeline
di: Sheng, Guangming, et al.
Pubblicazione: (2024)
di: Sheng, Guangming, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Survey on Collaborative DNN Inference for Edge Intelligence
di: Ren, Weiqing, et al.
Pubblicazione: (2022) -
Learning the Optimal Path and DNN Partition for Collaborative Edge Inference
di: Huang, Yin, et al.
Pubblicazione: (2024) -
GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism
di: Jeon, Byungsoo, et al.
Pubblicazione: (2024) -
DNN-Powered MLOps Pipeline Optimization for Large Language Models: A Framework for Automated Deployment and Resource Management
di: Krishnamoorthy, Mahesh Vaijainthymala, et al.
Pubblicazione: (2025) -
CARIn: Constraint-Aware and Responsive Inference on Heterogeneous Devices for Single- and Multi-DNN Workloads
di: Panopoulos, Ioannis, et al.
Pubblicazione: (2024)