Exploring Parallelism in FPGA-Based Accelerators for Machine Learning Applications
Fuente:
arXiv
Salvato in:
| Autori principali: | Centeno, Sed, Sprague, Christopher, Purkayastha, Arnab A, Simar, Ray, Magotra, Neeraj |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Accelerating Transposed Convolutions on FPGA-based Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2025)
di: Haris, Jude, et al.
Pubblicazione: (2025)
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
di: Zhu, Yu, et al.
Pubblicazione: (2025)
di: Zhu, Yu, et al.
Pubblicazione: (2025)
FPGA or GPU? Analyzing comparative research for application-specific guidance
di: Purkayastha, Arnab A, et al.
Pubblicazione: (2025)
di: Purkayastha, Arnab A, et al.
Pubblicazione: (2025)
MAD Max Beyond Single-Node: Enabling Large Machine Learning Model Acceleration on Distributed Systems
di: Hsia, Samuel, et al.
Pubblicazione: (2023)
di: Hsia, Samuel, et al.
Pubblicazione: (2023)
The Feasibility of Implementing Large-Scale Transformers on Multi-FPGA Platforms
di: Gao, Yu, et al.
Pubblicazione: (2024)
di: Gao, Yu, et al.
Pubblicazione: (2024)
FLEX: Leveraging FPGA-CPU Synergy for Mixed-Cell-Height Legalization Acceleration
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
FastGL: A GPU-Efficient Framework for Accelerating Sampling-Based GNN Training at Large Scale
di: Zhu, Zeyu, et al.
Pubblicazione: (2024)
di: Zhu, Zeyu, et al.
Pubblicazione: (2024)
Deep Reinforcement Learning based Online Scheduling Policy for Deep Neural Network Multi-Tenant Multi-Accelerator Systems
di: Blanco, Francesco G., et al.
Pubblicazione: (2024)
di: Blanco, Francesco G., et al.
Pubblicazione: (2024)
Towards Fair and Firm Real-Time Scheduling in DNN Multi-Tenant Multi-Accelerator Systems via Reinforcement Learning
di: Russo, Enrico, et al.
Pubblicazione: (2024)
di: Russo, Enrico, et al.
Pubblicazione: (2024)
ELK: Exploring the Efficiency of Inter-core Connected AI Chips with Deep Learning Compiler Techniques
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
Deep Learning and Machine Learning with GPGPU and CUDA: Unlocking the Power of Parallel Computing
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
MLPerf Power: Benchmarking the Energy Efficiency of Machine Learning Systems from Microwatts to Megawatts for Sustainable AI
di: Tschand, Arya, et al.
Pubblicazione: (2024)
di: Tschand, Arya, et al.
Pubblicazione: (2024)
F-BFQ: Flexible Block Floating-Point Quantization Accelerator for LLMs
di: Haris, Jude, et al.
Pubblicazione: (2025)
di: Haris, Jude, et al.
Pubblicazione: (2025)
A Survey on Graph Neural Network Acceleration: Algorithms, Systems, and Customized Hardware
di: Zhang, Shichang, et al.
Pubblicazione: (2023)
di: Zhang, Shichang, et al.
Pubblicazione: (2023)
MANOJAVAM: A Scalable, Unified FPGA Accelerator for Matrix Multiplication and Singular Value Decomposition in Principal Component Analysis
di: Ramasubramanian, Srivaths, et al.
Pubblicazione: (2026)
di: Ramasubramanian, Srivaths, et al.
Pubblicazione: (2026)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
di: Russo, Enrico, et al.
Pubblicazione: (2026)
di: Russo, Enrico, et al.
Pubblicazione: (2026)
Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation
di: Klein, Bernhard, et al.
Pubblicazione: (2025)
di: Klein, Bernhard, et al.
Pubblicazione: (2025)
Detecting Anomalies in Machine Learning Infrastructure via Hardware Telemetry
di: Chen, Ziji, et al.
Pubblicazione: (2025)
di: Chen, Ziji, et al.
Pubblicazione: (2025)
A Survey of Real-time Scheduling on Accelerator-based Heterogeneous Architecture for Time Critical Applications
di: Zou, An, et al.
Pubblicazione: (2025)
di: Zou, An, et al.
Pubblicazione: (2025)
FPGA Innovation Research in the Netherlands: Present Landscape and Future Outlook
di: Alachiotis, Nikolaos, et al.
Pubblicazione: (2025)
di: Alachiotis, Nikolaos, et al.
Pubblicazione: (2025)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
di: Yang, Peiming, et al.
Pubblicazione: (2025)
di: Yang, Peiming, et al.
Pubblicazione: (2025)
FedUHD: Unsupervised Federated Learning using Hyperdimensional Computing
di: Lee, You Hak, et al.
Pubblicazione: (2025)
di: Lee, You Hak, et al.
Pubblicazione: (2025)
Hierarchical Resource Partitioning on Modern GPUs: A Reinforcement Learning Approach
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
Memory-Aware Partitioning of Machine Learning Applications for Optimal Energy Use in Batteryless Systems
di: Gomez, Andres, et al.
Pubblicazione: (2021)
di: Gomez, Andres, et al.
Pubblicazione: (2021)
EPOCH: Enabling Preemption Operation for Context Saving in Heterogeneous FPGA Systems
di: Malik, Arsalan Ali, et al.
Pubblicazione: (2025)
di: Malik, Arsalan Ali, et al.
Pubblicazione: (2025)
Enabling Time-Aware Priority Traffic Management over Distributed FPGA Nodes
di: Scionti, Alberto, et al.
Pubblicazione: (2025)
di: Scionti, Alberto, et al.
Pubblicazione: (2025)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
RapidOMS: FPGA-based Open Modification Spectral Library Searching with HD Computing
di: Pinge, Sumukh, et al.
Pubblicazione: (2024)
di: Pinge, Sumukh, et al.
Pubblicazione: (2024)
Context-aware Simopt-Power: Using structural data with simulation metadata to optimise FPGA designs
di: Wadhwa, Eashan, et al.
Pubblicazione: (2026)
di: Wadhwa, Eashan, et al.
Pubblicazione: (2026)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
di: Shen, Aofeng, et al.
Pubblicazione: (2025)
di: Shen, Aofeng, et al.
Pubblicazione: (2025)
Parendi: Thousand-Way Parallel RTL Simulation
di: Emami, Mahyar, et al.
Pubblicazione: (2024)
di: Emami, Mahyar, et al.
Pubblicazione: (2024)
Efficient, VRAM-Constrained xLM Inference on Clients
di: Ukarande, Aditya, et al.
Pubblicazione: (2026)
di: Ukarande, Aditya, et al.
Pubblicazione: (2026)
Llumnix: Dynamic Scheduling for Large Language Model Serving
di: Sun, Biao, et al.
Pubblicazione: (2024)
di: Sun, Biao, et al.
Pubblicazione: (2024)
FlashMoE: Fast Distributed MoE in a Single Kernel
di: Aimuyo, Osayamen Jonathan, et al.
Pubblicazione: (2025)
di: Aimuyo, Osayamen Jonathan, et al.
Pubblicazione: (2025)
Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
di: Ding, Jianru, et al.
Pubblicazione: (2026)
di: Ding, Jianru, et al.
Pubblicazione: (2026)
SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference
di: Zhang, Hengrui, et al.
Pubblicazione: (2025)
di: Zhang, Hengrui, et al.
Pubblicazione: (2025)
WWW: What, When, Where to Compute-in-Memory
di: Sharma, Tanvi, et al.
Pubblicazione: (2023)
di: Sharma, Tanvi, et al.
Pubblicazione: (2023)
LayerDAG: A Layerwise Autoregressive Diffusion Model for Directed Acyclic Graph Generation
di: Li, Mufei, et al.
Pubblicazione: (2024)
di: Li, Mufei, et al.
Pubblicazione: (2024)
AI and Memory Wall
di: Gholami, Amir, et al.
Pubblicazione: (2024)
di: Gholami, Amir, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Accelerating Transposed Convolutions on FPGA-based Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2025) -
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
di: Zhu, Yu, et al.
Pubblicazione: (2025) -
FPGA or GPU? Analyzing comparative research for application-specific guidance
di: Purkayastha, Arnab A, et al.
Pubblicazione: (2025) -
MAD Max Beyond Single-Node: Enabling Large Machine Learning Model Acceleration on Distributed Systems
di: Hsia, Samuel, et al.
Pubblicazione: (2023) -
The Feasibility of Implementing Large-Scale Transformers on Multi-FPGA Platforms
di: Gao, Yu, et al.
Pubblicazione: (2024)