Towards Fair and Firm Real-Time Scheduling in DNN Multi-Tenant Multi-Accelerator Systems via Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Russo, Enrico, Blanco, Francesco Giulio, Palesi, Maurizio, Ascia, Giuseppe, Patti, Davide, Catania, Vincenzo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Deep Reinforcement Learning based Online Scheduling Policy for Deep Neural Network Multi-Tenant Multi-Accelerator Systems
por: Blanco, Francesco G., et al.
Publicado: (2024)
por: Blanco, Francesco G., et al.
Publicado: (2024)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
por: Russo, Enrico, et al.
Publicado: (2026)
por: Russo, Enrico, et al.
Publicado: (2026)
Multi-Objective Hardware-Mapping Co-Optimisation for Multi-DNN Workloads on Chiplet-based Accelerators
por: Das, Abhijit, et al.
Publicado: (2022)
por: Das, Abhijit, et al.
Publicado: (2022)
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
por: Shi, Man, et al.
Publicado: (2024)
por: Shi, Man, et al.
Publicado: (2024)
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
por: Mei, Linyan, et al.
Publicado: (2022)
por: Mei, Linyan, et al.
Publicado: (2022)
CHAOS: Controlled Hardware fAult injectOr System for gem5
por: Vinciguerra, Elio, et al.
Publicado: (2026)
por: Vinciguerra, Elio, et al.
Publicado: (2026)
Assessing the Role of Communication in Scalable Multi-Core Quantum Architectures
por: Palesi, Maurizio, et al.
Publicado: (2024)
por: Palesi, Maurizio, et al.
Publicado: (2024)
A Survey of Real-time Scheduling on Accelerator-based Heterogeneous Architecture for Time Critical Applications
por: Zou, An, et al.
Publicado: (2025)
por: Zou, An, et al.
Publicado: (2025)
Accelerating Triangle Counting with Real Processing-in-Memory Systems
por: Asquini, Lorenzo, et al.
Publicado: (2025)
por: Asquini, Lorenzo, et al.
Publicado: (2025)
Attention-Based Deep Reinforcement Learning for Qubit Allocation in Modular Quantum Architectures
por: Russo, Enrico, et al.
Publicado: (2024)
por: Russo, Enrico, et al.
Publicado: (2024)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
por: Zhang, Qijun, et al.
Publicado: (2026)
por: Zhang, Qijun, et al.
Publicado: (2026)
FlexStep: Enabling Flexible Error Detection in Multi/Many-core Real-time Systems
por: Wang, Tinglue, et al.
Publicado: (2025)
por: Wang, Tinglue, et al.
Publicado: (2025)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
por: Kong, Fanchen, et al.
Publicado: (2025)
por: Kong, Fanchen, et al.
Publicado: (2025)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
por: Zhou, Zhuoshan, et al.
Publicado: (2026)
por: Zhou, Zhuoshan, et al.
Publicado: (2026)
SCAR: Scheduling Multi-Model AI Workloads on Heterogeneous Multi-Chiplet Module Accelerators
por: Odema, Mohanad, et al.
Publicado: (2024)
por: Odema, Mohanad, et al.
Publicado: (2024)
Multi-Partner Project: Multi-GPU Performance Portability Analysis for CFD Simulations at Scale
por: Eleftherakis, Panagiotis-Eleftherios, et al.
Publicado: (2026)
por: Eleftherakis, Panagiotis-Eleftherios, et al.
Publicado: (2026)
Optimizing Task Scheduling in Fog Computing with Deadline Awareness
por: Sirjani, Mohammad Sadegh, et al.
Publicado: (2025)
por: Sirjani, Mohammad Sadegh, et al.
Publicado: (2025)
TeleSABRE: Layout Synthesis in Multi-Core Quantum Systems with Teleport Interconnect
por: Russo, Enrico, et al.
Publicado: (2025)
por: Russo, Enrico, et al.
Publicado: (2025)
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
por: Garg, Raveesh, et al.
Publicado: (2023)
por: Garg, Raveesh, et al.
Publicado: (2023)
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
por: Majeed, Ashiyana Abdul, et al.
Publicado: (2025)
por: Majeed, Ashiyana Abdul, et al.
Publicado: (2025)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
por: Chung, Euijun, et al.
Publicado: (2026)
por: Chung, Euijun, et al.
Publicado: (2026)
LFOC: A Lightweight Fairness-Oriented Cache Clustering Policy for Commodity Multicores
por: García-García, Adrián, et al.
Publicado: (2024)
por: García-García, Adrián, et al.
Publicado: (2024)
MLDSE: Scaling Design Space Exploration Infrastructure for Multi-Level Hardware
por: Qu, Huanyu, et al.
Publicado: (2025)
por: Qu, Huanyu, et al.
Publicado: (2025)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
por: Wijeratne, Sasindu, et al.
Publicado: (2024)
por: Wijeratne, Sasindu, et al.
Publicado: (2024)
Leveraging SIMD for Accelerating Large-number Arithmetic
por: Das, Subhrajit, et al.
Publicado: (2026)
por: Das, Subhrajit, et al.
Publicado: (2026)
Analyzing Reverse Address Translation Overheads in Multi-GPU Scale-Up Pods
por: Fatima, Amel, et al.
Publicado: (2026)
por: Fatima, Amel, et al.
Publicado: (2026)
PUDTune: Multi-Level Charging for High-Precision Calibration in Processing-Using-DRAM
por: Kubo, Tatsuya, et al.
Publicado: (2025)
por: Kubo, Tatsuya, et al.
Publicado: (2025)
Adaptive Multi-Objective Tiered Storage Configuration for KV Cache in LLM Service
por: Zheng, Xianzhe, et al.
Publicado: (2026)
por: Zheng, Xianzhe, et al.
Publicado: (2026)
Muchisim: A Simulation Framework for Design Exploration of Multi-Chip Manycore Systems
por: Orenes-Vera, Marcelo, et al.
Publicado: (2023)
por: Orenes-Vera, Marcelo, et al.
Publicado: (2023)
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
por: Ibrahim, Mohamed Assem, et al.
Publicado: (2024)
por: Ibrahim, Mohamed Assem, et al.
Publicado: (2024)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
por: Zhang, Chen, et al.
Publicado: (2026)
por: Zhang, Chen, et al.
Publicado: (2026)
Improving Multi-Instance GPU Efficiency via Sub-Entry Sharing TLB Design
por: Li, Bingyao, et al.
Publicado: (2024)
por: Li, Bingyao, et al.
Publicado: (2024)
Accelerating Data Chunking in Deduplication Systems using Vector Instructions
por: Udayashankar, Sreeharsha, et al.
Publicado: (2025)
por: Udayashankar, Sreeharsha, et al.
Publicado: (2025)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
por: Kurzynski, Marco, et al.
Publicado: (2025)
por: Kurzynski, Marco, et al.
Publicado: (2025)
SpeedMalloc: Improving Multi-threaded Applications via a Lightweight Core for Memory Allocation
por: Li, Ruihao, et al.
Publicado: (2025)
por: Li, Ruihao, et al.
Publicado: (2025)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
por: Sharma, Harsh, et al.
Publicado: (2023)
por: Sharma, Harsh, et al.
Publicado: (2023)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
por: Elwasif, Wael, et al.
Publicado: (2022)
por: Elwasif, Wael, et al.
Publicado: (2022)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
por: Adnan, Muhammad, et al.
Publicado: (2024)
por: Adnan, Muhammad, et al.
Publicado: (2024)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
por: Prakriya, Neha, et al.
Publicado: (2023)
por: Prakriya, Neha, et al.
Publicado: (2023)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
por: Shen, Aofeng, et al.
Publicado: (2025)
por: Shen, Aofeng, et al.
Publicado: (2025)
Ejemplares similares
-
Deep Reinforcement Learning based Online Scheduling Policy for Deep Neural Network Multi-Tenant Multi-Accelerator Systems
por: Blanco, Francesco G., et al.
Publicado: (2024) -
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
por: Russo, Enrico, et al.
Publicado: (2026) -
Multi-Objective Hardware-Mapping Co-Optimisation for Multi-DNN Workloads on Chiplet-based Accelerators
por: Das, Abhijit, et al.
Publicado: (2022) -
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
por: Shi, Man, et al.
Publicado: (2024) -
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
por: Mei, Linyan, et al.
Publicado: (2022)