Collaborative Inference Acceleration with Non-Penetrative Tensor Partitioning
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zhibang, Xu, Chaonong, Lv, Zhenjie, Liu, Zhizhuo, Zhao, Suyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cooperative Inference with Interleaved Operator Partitioning for CNNs
por: Liu, Zhibang, et al.
Publicado: (2024)
por: Liu, Zhibang, et al.
Publicado: (2024)
Accelerating End-Cloud Collaborative Inference via Near Bubble-free Pipeline Optimization
por: Gao, Luyao, et al.
Publicado: (2024)
por: Gao, Luyao, et al.
Publicado: (2024)
Many Hands Make Light Work: Accelerating Edge Inference via Multi-Client Collaborative Caching
por: Liang, Wenyi, et al.
Publicado: (2024)
por: Liang, Wenyi, et al.
Publicado: (2024)
Learning the Optimal Path and DNN Partition for Collaborative Edge Inference
por: Huang, Yin, et al.
Publicado: (2024)
por: Huang, Yin, et al.
Publicado: (2024)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
por: Sun, Mingyu, et al.
Publicado: (2025)
por: Sun, Mingyu, et al.
Publicado: (2025)
Accelerating Heterogeneous Tensor Parallelism via Flexible Workload Control
por: Wang, Zhigang, et al.
Publicado: (2024)
por: Wang, Zhigang, et al.
Publicado: (2024)
Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services
por: Chen, Haoyu, et al.
Publicado: (2025)
por: Chen, Haoyu, et al.
Publicado: (2025)
Collaborative Inference for Large Models with Task Offloading and Early Exiting
por: Xie, Zuan, et al.
Publicado: (2024)
por: Xie, Zuan, et al.
Publicado: (2024)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
Accelerating Distributed MoE Training and Inference with Lina
por: Li, Jiamin, et al.
Publicado: (2022)
por: Li, Jiamin, et al.
Publicado: (2022)
Scaling LLM Inference Beyond Amdahl`s Limits via Eliminating Non-Scalable Overheads
por: Zhao, Alan, et al.
Publicado: (2026)
por: Zhao, Alan, et al.
Publicado: (2026)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
por: Wang, Siqi, et al.
Publicado: (2024)
por: Wang, Siqi, et al.
Publicado: (2024)
AnchorTP: Resilient LLM Inference with State-Preserving Elastic Tensor Parallelism
por: Xu, Wendong, et al.
Publicado: (2025)
por: Xu, Wendong, et al.
Publicado: (2025)
PRISM: Processing-In-Memory Sparse MTTKRP for Tensor Decomposition Acceleration
por: Pacheco, Daniel, et al.
Publicado: (2026)
por: Pacheco, Daniel, et al.
Publicado: (2026)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
por: Schieffer, Gabin, et al.
Publicado: (2024)
por: Schieffer, Gabin, et al.
Publicado: (2024)
Where to Split? A Pareto-Front Analysis of DNN Partitioning for Edge Inference
por: Masud, Adiba, et al.
Publicado: (2026)
por: Masud, Adiba, et al.
Publicado: (2026)
Online Optimization of DNN Inference Network Utility in Collaborative Edge Computing
por: Li, Rui, et al.
Publicado: (2024)
por: Li, Rui, et al.
Publicado: (2024)
Collaborative Speculative Inference for Efficient LLM Inference Serving
por: Gao, Luyao, et al.
Publicado: (2025)
por: Gao, Luyao, et al.
Publicado: (2025)
MOPAR: A Model Partitioning Framework for Deep Learning Inference Services on Serverless Platforms
por: Duan, Jiaang, et al.
Publicado: (2024)
por: Duan, Jiaang, et al.
Publicado: (2024)
Federated Inference for Heterogeneous LLM Communication and Collaboration
por: Chen, Zihan, et al.
Publicado: (2026)
por: Chen, Zihan, et al.
Publicado: (2026)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
por: Wijeratne, Sasindu, et al.
Publicado: (2025)
Understanding the Performance and Power of LLM Inferencing on Edge Accelerators
por: Arya, Mayank, et al.
Publicado: (2025)
por: Arya, Mayank, et al.
Publicado: (2025)
LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind
por: Zhang, Li, et al.
Publicado: (2025)
por: Zhang, Li, et al.
Publicado: (2025)
MoA-Off: Adaptive Heterogeneous Modality-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
por: Yang, Zheming, et al.
Publicado: (2025)
por: Yang, Zheming, et al.
Publicado: (2025)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
por: Wu, Tian, et al.
Publicado: (2025)
por: Wu, Tian, et al.
Publicado: (2025)
Gensor: A Graph-based Construction Tensor Compilation Method for Deep Learning
por: Liu, Hangda, et al.
Publicado: (2025)
por: Liu, Hangda, et al.
Publicado: (2025)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
por: Yang, Zheming, et al.
Publicado: (2026)
por: Yang, Zheming, et al.
Publicado: (2026)
SpecInF: Exploiting Idle GPU Resources in Distributed DL Training via Speculative Inference Filling
por: Lv, Cunchi, et al.
Publicado: (2025)
por: Lv, Cunchi, et al.
Publicado: (2025)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2025)
por: K., Prashanthi S., et al.
Publicado: (2025)
Performance Characterization of Containerized DNN Training and Inference on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2023)
por: K., Prashanthi S., et al.
Publicado: (2023)
Accelerating OpenPangu Inference on NPU via Speculative Decoding
por: Dai, Yuntao, et al.
Publicado: (2026)
por: Dai, Yuntao, et al.
Publicado: (2026)
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
por: Luo, Shuqing, et al.
Publicado: (2025)
por: Luo, Shuqing, et al.
Publicado: (2025)
EdgeShard: Efficient LLM Inference via Collaborative Edge Computing
por: Zhang, Mingjin, et al.
Publicado: (2024)
por: Zhang, Mingjin, et al.
Publicado: (2024)
Communication-Efficient Collaborative LLM Inference over LEO Satellite Networks
por: Zhang, Songge, et al.
Publicado: (2026)
por: Zhang, Songge, et al.
Publicado: (2026)
Collaborative Inference in DNN-based Satellite Systems with Dynamic Task Streams
por: Guan, Jinglong, et al.
Publicado: (2023)
por: Guan, Jinglong, et al.
Publicado: (2023)
Evaluating Multi-Instance DNN Inferencing on Multiple Accelerators of an Edge Device
por: Tayal, Mumuksh, et al.
Publicado: (2025)
por: Tayal, Mumuksh, et al.
Publicado: (2025)
Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding
por: Wang, Zhibin, et al.
Publicado: (2025)
por: Wang, Zhibin, et al.
Publicado: (2025)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
por: Chen, Fahao, et al.
Publicado: (2025)
por: Chen, Fahao, et al.
Publicado: (2025)
Federated Learning Using Coupled Tensor Train Decomposition
por: Zhang, Xiangtao, et al.
Publicado: (2024)
por: Zhang, Xiangtao, et al.
Publicado: (2024)
Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges
por: Li, Senyao, et al.
Publicado: (2025)
por: Li, Senyao, et al.
Publicado: (2025)
Ejemplares similares
-
Cooperative Inference with Interleaved Operator Partitioning for CNNs
por: Liu, Zhibang, et al.
Publicado: (2024) -
Accelerating End-Cloud Collaborative Inference via Near Bubble-free Pipeline Optimization
por: Gao, Luyao, et al.
Publicado: (2024) -
Many Hands Make Light Work: Accelerating Edge Inference via Multi-Client Collaborative Caching
por: Liang, Wenyi, et al.
Publicado: (2024) -
Learning the Optimal Path and DNN Partition for Collaborative Edge Inference
por: Huang, Yin, et al.
Publicado: (2024) -
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
por: Sun, Mingyu, et al.
Publicado: (2025)