Dual-pronged deep learning preprocessing on heterogeneous platforms with CPU, Accelerator and CSD
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wei, Jia, Zhang, Xingjun, Pedrycz, Witold, Wang, Longxiang, Zhao, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Service Level Agreements and Security SLA: A Comprehensive Survey
par: Nicolazzo, Serena, et autres
Publié: (2024)
par: Nicolazzo, Serena, et autres
Publié: (2024)
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
par: Chen, Kefu, et autres
Publié: (2026)
par: Chen, Kefu, et autres
Publié: (2026)
A Unified Programming Model for Heterogeneous Computing with CPU and Accelerator Technologies
par: Xiong, Yuqing
Publié: (2022)
par: Xiong, Yuqing
Publié: (2022)
Regent based parallel meshfree LSKUM solver for heterogenous HPC platforms
par: Salil, Sanath, et autres
Publié: (2024)
par: Salil, Sanath, et autres
Publié: (2024)
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
par: Schieffer, Gabin, et autres
Publié: (2026)
par: Schieffer, Gabin, et autres
Publié: (2026)
FLEX: Leveraging FPGA-CPU Synergy for Mixed-Cell-Height Legalization Acceleration
par: Liu, Xingyu, et autres
Publié: (2025)
par: Liu, Xingyu, et autres
Publié: (2025)
Towards CXL Resilience to CPU Failures
par: Psistakis, Antonis, et autres
Publié: (2026)
par: Psistakis, Antonis, et autres
Publié: (2026)
Efficient Column-Wise N:M Pruning on RISC-V CPU
par: Chu, Chi-Wei, et autres
Publié: (2025)
par: Chu, Chi-Wei, et autres
Publié: (2025)
MMStencil: Optimizing High-order Stencils on Multicore CPU using Matrix Unit
par: Wang, Yinuo, et autres
Publié: (2025)
par: Wang, Yinuo, et autres
Publié: (2025)
Harnessing Integrated CPU-GPU System Memory for HPC: a first look into Grace Hopper
par: Schieffer, Gabin, et autres
Publié: (2024)
par: Schieffer, Gabin, et autres
Publié: (2024)
HeteroSTA: A CPU-GPU Heterogeneous Static Timing Analysis Engine with Holistic Industrial Design Support
par: Guo, Zizheng, et autres
Publié: (2025)
par: Guo, Zizheng, et autres
Publié: (2025)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
par: He, Yongchao, et autres
Publié: (2025)
par: He, Yongchao, et autres
Publié: (2025)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
par: Li, Suyi, et autres
Publié: (2024)
par: Li, Suyi, et autres
Publié: (2024)
A Unified CPU-GPU Protocol for GNN Training
par: Lin, Yi-Chien, et autres
Publié: (2024)
par: Lin, Yi-Chien, et autres
Publié: (2024)
WindVE: Collaborative CPU-NPU Vector Embedding
par: Huang, Jinqi, et autres
Publié: (2025)
par: Huang, Jinqi, et autres
Publié: (2025)
Combining GPU and CPU for accelerating evolutionary computing workloads
par: Eynaliyev, Rustam, et autres
Publié: (2025)
par: Eynaliyev, Rustam, et autres
Publié: (2025)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
par: Zhang, Jinxiao, et autres
Publié: (2026)
par: Zhang, Jinxiao, et autres
Publié: (2026)
Towards Affordable, Adaptive and Automatic GNN Training on CPU-GPU Heterogeneous Platforms
par: Qiao, Tong, et autres
Publié: (2025)
par: Qiao, Tong, et autres
Publié: (2025)
APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs
par: Fan, Jiakun, et autres
Publié: (2025)
par: Fan, Jiakun, et autres
Publié: (2025)
TURNIP: A "Nondeterministic" GPU Runtime with CPU RAM Offload
par: Ding, Zhimin, et autres
Publié: (2024)
par: Ding, Zhimin, et autres
Publié: (2024)
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
par: Maurya, Avinash, et autres
Publié: (2024)
par: Maurya, Avinash, et autres
Publié: (2024)
Accelerating Heterogeneous Tensor Parallelism via Flexible Workload Control
par: Wang, Zhigang, et autres
Publié: (2024)
par: Wang, Zhigang, et autres
Publié: (2024)
Efficient Graph Embedding at Scale: Optimizing CPU-GPU-SSD Integration
par: Li, Zhonggen, et autres
Publié: (2025)
par: Li, Zhonggen, et autres
Publié: (2025)
Justin: Hybrid CPU/Memory Elastic Scaling for Distributed Stream Processing
par: Schmitz, Donatien, et autres
Publié: (2025)
par: Schmitz, Donatien, et autres
Publié: (2025)
KAITIAN: A Unified Communication Framework for Enabling Efficient Collaboration Across Heterogeneous Accelerators in Embodied AI Systems
par: Lin, Jieke, et autres
Publié: (2025)
par: Lin, Jieke, et autres
Publié: (2025)
Flotilla: A scalable, modular and resilient federated learning framework for heterogeneous resources
par: Banerjee, Roopkatha, et autres
Publié: (2025)
par: Banerjee, Roopkatha, et autres
Publié: (2025)
Performance characterisation of the 64-core SG2042 RISC-V CPU for HPC
par: Brown, Nick, et autres
Publié: (2024)
par: Brown, Nick, et autres
Publié: (2024)
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
par: Yi, Xinyao
Publié: (2024)
par: Yi, Xinyao
Publié: (2024)
Distributed Retrieval-Augmented Generation
par: Xu, Chenhao, et autres
Publié: (2025)
par: Xu, Chenhao, et autres
Publié: (2025)
Co-Design and Evaluation of a CPU-Free MPI GPU Communication Abstraction and Implementation
par: Bridges, Patrick G., et autres
Publié: (2026)
par: Bridges, Patrick G., et autres
Publié: (2026)
Serving Hybrid LLM Loads with SLO Guarantees Using CPU-GPU Attention Piggybacking
par: Mo, Zizhao, et autres
Publié: (2026)
par: Mo, Zizhao, et autres
Publié: (2026)
Aging-aware CPU Core Management for Embodied Carbon Amortization in Cloud LLM Inference
par: Hewage, Tharindu B., et autres
Publié: (2025)
par: Hewage, Tharindu B., et autres
Publié: (2025)
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
par: Huang, En-Ming, et autres
Publié: (2025)
par: Huang, En-Ming, et autres
Publié: (2025)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
par: Chung, Euijun, et autres
Publié: (2026)
par: Chung, Euijun, et autres
Publié: (2026)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
Cost-Performance Analysis: A Comparative Study of CPU-Based Serverless and GPU-Based Training Architectures
par: Barrak, Amine, et autres
Publié: (2025)
par: Barrak, Amine, et autres
Publié: (2025)
Orchestrated Co-scheduling, Resource Partitioning, and Power Capping on CPU-GPU Heterogeneous Systems via Machine Learning
par: Saba, Issa, et autres
Publié: (2024)
par: Saba, Issa, et autres
Publié: (2024)
GPU-Accelerated Batch-Dynamic Subgraph Matching
par: Qiu, Linshan, et autres
Publié: (2024)
par: Qiu, Linshan, et autres
Publié: (2024)
T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge
par: Wei, Jianyu, et autres
Publié: (2024)
par: Wei, Jianyu, et autres
Publié: (2024)
Scaling Large-scale GNN Training to Thousands of Processors on CPU-based Supercomputers
par: Zhuang, Chen, et autres
Publié: (2024)
par: Zhuang, Chen, et autres
Publié: (2024)
Documents similaires
-
Service Level Agreements and Security SLA: A Comprehensive Survey
par: Nicolazzo, Serena, et autres
Publié: (2024) -
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
par: Chen, Kefu, et autres
Publié: (2026) -
A Unified Programming Model for Heterogeneous Computing with CPU and Accelerator Technologies
par: Xiong, Yuqing
Publié: (2022) -
Regent based parallel meshfree LSKUM solver for heterogenous HPC platforms
par: Salil, Sanath, et autres
Publié: (2024) -
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
par: Schieffer, Gabin, et autres
Publié: (2026)