Environment-Aware Dynamic Pruning for Pipelined Edge Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | O'Quinn, Austin, Snedeker, Conor, Zhang, Siyuan, Kline, Jenna |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ACE-GNN: Adaptive GNN Co-Inference with System-Aware Scheduling in Dynamic Edge Environments
por: Zhou, Ao, et al.
Publicado: (2025)
por: Zhou, Ao, et al.
Publicado: (2025)
Adaptive Configuration Selection for Multi-Model Inference Pipelines in Edge Computing
por: Sheng, Jinhao, et al.
Publicado: (2025)
por: Sheng, Jinhao, et al.
Publicado: (2025)
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
por: Zhang, Yida, et al.
Publicado: (2026)
por: Zhang, Yida, et al.
Publicado: (2026)
PipeSD: An Efficient Cloud-Edge Collaborative Pipeline Inference Framework with Speculative Decoding
por: Han, Yunhe, et al.
Publicado: (2026)
por: Han, Yunhe, et al.
Publicado: (2026)
Toward Sustainability-Aware LLM Inference on Edge Clusters
por: Rajashekar, Kolichala, et al.
Publicado: (2025)
por: Rajashekar, Kolichala, et al.
Publicado: (2025)
Modular Foundation Model Inference at the Edge: Network-Aware Microservice Optimization
por: Zhu, Juan, et al.
Publicado: (2026)
por: Zhu, Juan, et al.
Publicado: (2026)
Private Model Personalization Revisited
por: Snedeker, Conor, et al.
Publicado: (2025)
por: Snedeker, Conor, et al.
Publicado: (2025)
OCTOPINF: Workload-Aware Inference Serving for Edge Video Analytics
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
Power Aware Dynamic Reallocation For Inference
por: Jiang, Yiwei, et al.
Publicado: (2026)
por: Jiang, Yiwei, et al.
Publicado: (2026)
Preemption Aware Task Scheduling for Priority and Deadline Constrained DNN Inference Task Offloading in Homogeneous Mobile-Edge Networks
por: Cotter, Jamie, et al.
Publicado: (2025)
por: Cotter, Jamie, et al.
Publicado: (2025)
Infer-EDGE: Dynamic DNN Inference Optimization in 'Just-in-time' Edge-AI Implementations
por: Mounesan, Motahare, et al.
Publicado: (2025)
por: Mounesan, Motahare, et al.
Publicado: (2025)
SneakPeek: Data-Aware Model Selection and Scheduling for Inference Serving on the Edge
por: Wolfrath, Joel, et al.
Publicado: (2025)
por: Wolfrath, Joel, et al.
Publicado: (2025)
EdgeShard: Efficient LLM Inference via Collaborative Edge Computing
por: Zhang, Mingjin, et al.
Publicado: (2024)
por: Zhang, Mingjin, et al.
Publicado: (2024)
Communication-Computation Pipeline Parallel Split Learning over Wireless Edge Networks
por: Liu, Chenyu, et al.
Publicado: (2025)
por: Liu, Chenyu, et al.
Publicado: (2025)
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
por: Cao, Jiahe, et al.
Publicado: (2026)
por: Cao, Jiahe, et al.
Publicado: (2026)
Cicada: A Pipeline-Efficient Approach to Serverless Inference with Decoupled Management
por: Wu, Z., et al.
Publicado: (2025)
por: Wu, Z., et al.
Publicado: (2025)
MoA-Off: Adaptive Heterogeneous Modality-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
por: Yang, Zheming, et al.
Publicado: (2025)
por: Yang, Zheming, et al.
Publicado: (2025)
PARD: Enhancing Goodput for Inference Pipeline via Proactive Request Dropping
por: Zhao, Zhixin, et al.
Publicado: (2026)
por: Zhao, Zhixin, et al.
Publicado: (2026)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
por: Yang, Zheming, et al.
Publicado: (2026)
por: Yang, Zheming, et al.
Publicado: (2026)
TD-Pipe: Temporally-Disaggregated Pipeline Parallelism Architecture for High-Throughput LLM Inference
por: Zhang, Hongbin, et al.
Publicado: (2025)
por: Zhang, Hongbin, et al.
Publicado: (2025)
PICO: Pipeline Inference Framework for Versatile CNNs on Diverse Mobile Devices
por: Yang, Xiang, et al.
Publicado: (2022)
por: Yang, Xiang, et al.
Publicado: (2022)
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
por: Zhang, Han, et al.
Publicado: (2026)
por: Zhang, Han, et al.
Publicado: (2026)
Loki: A System for Serving ML Inference Pipelines with Hardware and Accuracy Scaling
por: Ahmad, Sohaib, et al.
Publicado: (2024)
por: Ahmad, Sohaib, et al.
Publicado: (2024)
RingAda: Pipelining Large Model Fine-Tuning on Edge Devices with Scheduled Layer Unfreezing
por: Li, Liang, et al.
Publicado: (2025)
por: Li, Liang, et al.
Publicado: (2025)
Understanding the Performance and Power of LLM Inferencing on Edge Accelerators
por: Arya, Mayank, et al.
Publicado: (2025)
por: Arya, Mayank, et al.
Publicado: (2025)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
por: Wu, Tian, et al.
Publicado: (2025)
por: Wu, Tian, et al.
Publicado: (2025)
Accelerating End-Cloud Collaborative Inference via Near Bubble-free Pipeline Optimization
por: Gao, Luyao, et al.
Publicado: (2024)
por: Gao, Luyao, et al.
Publicado: (2024)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
por: Sun, Mingyu, et al.
Publicado: (2025)
por: Sun, Mingyu, et al.
Publicado: (2025)
Evaluating Container Orchestration for Neuromorphic Workloads in Virtual Edge Environments
por: Pham, Huyen, et al.
Publicado: (2026)
por: Pham, Huyen, et al.
Publicado: (2026)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2025)
por: K., Prashanthi S., et al.
Publicado: (2025)
Performance Characterization of Containerized DNN Training and Inference on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2023)
por: K., Prashanthi S., et al.
Publicado: (2023)
Decentralized LLM Inference over Edge Networks with Energy Harvesting
por: Khoshsirat, Aria, et al.
Publicado: (2024)
por: Khoshsirat, Aria, et al.
Publicado: (2024)
Priority-Aware Model-Distributed Inference at Edge Networks
por: Li, Teng, et al.
Publicado: (2024)
por: Li, Teng, et al.
Publicado: (2024)
PICE: A Semantic-Driven Progressive Inference System for LLM Serving in Cloud-Edge Networks
por: Zhan, Huiyou, et al.
Publicado: (2025)
por: Zhan, Huiyou, et al.
Publicado: (2025)
Squeezing Edge Performance: A Sensitivity-Aware Container Management for Heterogeneous Tasks
por: Zhang, Yongmin, et al.
Publicado: (2025)
por: Zhang, Yongmin, et al.
Publicado: (2025)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
por: He, Yongchao, et al.
Publicado: (2025)
por: He, Yongchao, et al.
Publicado: (2025)
DGNNFlow: A Streaming Dataflow Architecture for Real-Time Edge-based Dynamic GNN Inference in HL-LHC Trigger Systems
por: Maharaj, Davendra, et al.
Publicado: (2026)
por: Maharaj, Davendra, et al.
Publicado: (2026)
A Decentralized Root Cause Localization Approach for Edge Computing Environments
por: Fernando, Duneesha, et al.
Publicado: (2025)
por: Fernando, Duneesha, et al.
Publicado: (2025)
Resilience Evaluation of Kubernetes in Cloud-Edge Environments via Failure Injection
por: Chen, Zihao, et al.
Publicado: (2025)
por: Chen, Zihao, et al.
Publicado: (2025)
RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models
por: Zheng, Zihao, et al.
Publicado: (2026)
por: Zheng, Zihao, et al.
Publicado: (2026)
Ejemplares similares
-
ACE-GNN: Adaptive GNN Co-Inference with System-Aware Scheduling in Dynamic Edge Environments
por: Zhou, Ao, et al.
Publicado: (2025) -
Adaptive Configuration Selection for Multi-Model Inference Pipelines in Edge Computing
por: Sheng, Jinhao, et al.
Publicado: (2025) -
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
por: Zhang, Yida, et al.
Publicado: (2026) -
PipeSD: An Efficient Cloud-Edge Collaborative Pipeline Inference Framework with Speculative Decoding
por: Han, Yunhe, et al.
Publicado: (2026) -
Toward Sustainability-Aware LLM Inference on Edge Clusters
por: Rajashekar, Kolichala, et al.
Publicado: (2025)