Multi-DNN Inference of Sparse Models on Edge SoCs
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Jiawei, Wu, Di, Dobson, Simon, Varghese, Blesson |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Ecomap: Sustainability-Driven Optimization of Multi-Tenant DNN Execution on Edge Servers
por: Paramanayakam, Varatheepan, et al.
Publicado: (2025)
por: Paramanayakam, Varatheepan, et al.
Publicado: (2025)
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
por: Xu, Guanyu, et al.
Publicado: (2025)
por: Xu, Guanyu, et al.
Publicado: (2025)
EMO: Edge Model Overlays to Scale Model Size in Federated Learning
por: Wu, Di, et al.
Publicado: (2025)
por: Wu, Di, et al.
Publicado: (2025)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
por: Russo, Enrico, et al.
Publicado: (2026)
por: Russo, Enrico, et al.
Publicado: (2026)
Adaptive Workload Distribution for Accuracy-aware DNN Inference on Collaborative Edge Platforms
por: Taufique, Zain, et al.
Publicado: (2023)
por: Taufique, Zain, et al.
Publicado: (2023)
InkStream: Real-time GNN Inference on Streaming Graphs via Incremental Update
por: Wu, Dan, et al.
Publicado: (2023)
por: Wu, Dan, et al.
Publicado: (2023)
KVDirect: Distributed Disaggregated LLM Inference
por: Chen, Shiyang, et al.
Publicado: (2024)
por: Chen, Shiyang, et al.
Publicado: (2024)
Less is More: Optimizing Function Calling for LLM Execution on Edge Devices
por: Paramanayakam, Varatheepan, et al.
Publicado: (2024)
por: Paramanayakam, Varatheepan, et al.
Publicado: (2024)
ReLATE: Learning Efficient Sparse Encoding for High-Performance Tensor Decomposition
por: Helal, Ahmed E., et al.
Publicado: (2025)
por: Helal, Ahmed E., et al.
Publicado: (2025)
When Less is More: Achieving Faster Convergence in Distributed Edge Machine Learning
por: Basani, Advik Raj, et al.
Publicado: (2024)
por: Basani, Advik Raj, et al.
Publicado: (2024)
Collaborative Processing for Multi-Tenant Inference on Memory-Constrained Edge TPUs
por: Ng, Nathan, et al.
Publicado: (2026)
por: Ng, Nathan, et al.
Publicado: (2026)
Glinthawk: A Two-Tiered Architecture for Offline LLM Inference
por: Hamadanian, Pouya, et al.
Publicado: (2025)
por: Hamadanian, Pouya, et al.
Publicado: (2025)
Sometimes Painful but Certainly Promising: Feasibility and Trade-offs of Language Model Inference at the Edge
por: Abstreiter, Maximilian, et al.
Publicado: (2025)
por: Abstreiter, Maximilian, et al.
Publicado: (2025)
QPART: Adaptive Model Quantization and Dynamic Workload Balancing for Accuracy-aware Edge Inference
por: Li, Xiangchen, et al.
Publicado: (2025)
por: Li, Xiangchen, et al.
Publicado: (2025)
IPA: Inference Pipeline Adaptation to Achieve High Accuracy and Cost-Efficiency
por: Ghafouri, Saeid, et al.
Publicado: (2023)
por: Ghafouri, Saeid, et al.
Publicado: (2023)
iSpLib: A Library for Accelerating Graph Neural Networks using Auto-tuned Sparse Operations
por: Anik, Md Saidul Hoque, et al.
Publicado: (2024)
por: Anik, Md Saidul Hoque, et al.
Publicado: (2024)
TaxBreak: Unmasking the Hidden Costs of LLM Inference Through Overhead Decomposition
por: Vellaisamy, Prabhu, et al.
Publicado: (2026)
por: Vellaisamy, Prabhu, et al.
Publicado: (2026)
Accelerating Mobile Inference through Fine-Grained CPU-GPU Co-Execution
por: Li, Zhuojin, et al.
Publicado: (2025)
por: Li, Zhuojin, et al.
Publicado: (2025)
AutoChunk: Automated Activation Chunk for Memory-Efficient Long Sequence Inference
por: Zhao, Xuanlei, et al.
Publicado: (2024)
por: Zhao, Xuanlei, et al.
Publicado: (2024)
Towards Universal Performance Modeling for Machine Learning Training on Multi-GPU Platforms
por: Lin, Zhongyi, et al.
Publicado: (2024)
por: Lin, Zhongyi, et al.
Publicado: (2024)
KVPR: Efficient LLM Inference with I/O-Aware KV Cache Partial Recomputation
por: Jiang, Chaoyi, et al.
Publicado: (2024)
por: Jiang, Chaoyi, et al.
Publicado: (2024)
FedOptima: Optimizing Resource Utilization in Federated Learning
por: Zhang, Zihan, et al.
Publicado: (2025)
por: Zhang, Zihan, et al.
Publicado: (2025)
Ampere: Communication-Efficient and High-Accuracy Split Federated Learning
por: Zhang, Zihan, et al.
Publicado: (2025)
por: Zhang, Zihan, et al.
Publicado: (2025)
Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers
por: Maczan, Jędrzej
Publicado: (2026)
por: Maczan, Jędrzej
Publicado: (2026)
A Survey on Collaborative DNN Inference for Edge Intelligence
por: Ren, Weiqing, et al.
Publicado: (2022)
por: Ren, Weiqing, et al.
Publicado: (2022)
MIREncoder: Multi-modal IR-based Pretrained Embeddings for Performance Optimizations
por: Dutta, Akash, et al.
Publicado: (2024)
por: Dutta, Akash, et al.
Publicado: (2024)
Phantora: Maximizing Code Reuse in Simulation-based Machine Learning System Performance Estimation
por: Qin, Jianxing, et al.
Publicado: (2025)
por: Qin, Jianxing, et al.
Publicado: (2025)
Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
por: Wei, Xinming, et al.
Publicado: (2025)
por: Wei, Xinming, et al.
Publicado: (2025)
Ariel-ML: Computing Parallelization with Embedded Rust for Neural Networks on Heterogeneous Multi-core Microcontrollers
por: Huang, Zhaolan, et al.
Publicado: (2025)
por: Huang, Zhaolan, et al.
Publicado: (2025)
DeepCQ: General-Purpose Deep-Surrogate Framework for Lossy Compression Quality Prediction
por: Mumenin, Khondoker Mirazul, et al.
Publicado: (2025)
por: Mumenin, Khondoker Mirazul, et al.
Publicado: (2025)
LLMPerf: GPU Performance Modeling meets Large Language Models
por: Nguyen, Khoi N. M., et al.
Publicado: (2025)
por: Nguyen, Khoi N. M., et al.
Publicado: (2025)
Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices
por: Sedlak, Boris, et al.
Publicado: (2025)
por: Sedlak, Boris, et al.
Publicado: (2025)
EcoFed: Efficient Communication for DNN Partitioning-based Federated Learning
por: Wu, Di, et al.
Publicado: (2023)
por: Wu, Di, et al.
Publicado: (2023)
Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference
por: Chen, Le, et al.
Publicado: (2025)
por: Chen, Le, et al.
Publicado: (2025)
A Delta-Aware Orchestration Framework for Scalable Multi-Agent Edge Computing
por: Singh, Samaresh Kumar, et al.
Publicado: (2026)
por: Singh, Samaresh Kumar, et al.
Publicado: (2026)
You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models
por: Ding, Shiwei, et al.
Publicado: (2025)
por: Ding, Shiwei, et al.
Publicado: (2025)
Adaptive DNN Partitioning and Offloading in Heterogeneous Edge-Cloud Continuum
por: Deng, Akuen Akoi, et al.
Publicado: (2026)
por: Deng, Akuen Akoi, et al.
Publicado: (2026)
Learning the Optimal Path and DNN Partition for Collaborative Edge Inference
por: Huang, Yin, et al.
Publicado: (2024)
por: Huang, Yin, et al.
Publicado: (2024)
MLCommons Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces
por: Sridharan, Srinivas, et al.
Publicado: (2026)
por: Sridharan, Srinivas, et al.
Publicado: (2026)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
por: Fan, Ruibo, et al.
Publicado: (2026)
por: Fan, Ruibo, et al.
Publicado: (2026)
Ejemplares similares
-
Ecomap: Sustainability-Driven Optimization of Multi-Tenant DNN Execution on Edge Servers
por: Paramanayakam, Varatheepan, et al.
Publicado: (2025) -
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
por: Xu, Guanyu, et al.
Publicado: (2025) -
EMO: Edge Model Overlays to Scale Model Size in Federated Learning
por: Wu, Di, et al.
Publicado: (2025) -
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
por: Russo, Enrico, et al.
Publicado: (2026) -
Adaptive Workload Distribution for Accuracy-aware DNN Inference on Collaborative Edge Platforms
por: Taufique, Zain, et al.
Publicado: (2023)