AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Gimenes, Pedro, Zhao, Yiren, Constantinides, George |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
di: Huang, Wei, et al.
Pubblicazione: (2023)
di: Huang, Wei, et al.
Pubblicazione: (2023)
GNNBuilder: An Automated Framework for Generic Graph Neural Network Accelerator Generation, Simulation, and Optimization
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023)
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023)
NeuraLUT: Hiding Neural Network Density in Boolean Synthesizable Functions
di: Andronic, Marta, et al.
Pubblicazione: (2024)
di: Andronic, Marta, et al.
Pubblicazione: (2024)
NeuralMatrix: Compute the Entire Neural Networks with Linear Matrix Operations for Efficient Inference
di: Sun, Ruiqi, et al.
Pubblicazione: (2023)
di: Sun, Ruiqi, et al.
Pubblicazione: (2023)
FPGA Resource-aware Structured Pruning for Real-Time Neural Networks
di: Ramhorst, Benjamin, et al.
Pubblicazione: (2023)
di: Ramhorst, Benjamin, et al.
Pubblicazione: (2023)
PolyLUT: Learning Piecewise Polynomials for Ultra-Low Latency FPGA LUT-based Inference
di: Andronic, Marta, et al.
Pubblicazione: (2023)
di: Andronic, Marta, et al.
Pubblicazione: (2023)
MCU-MixQ: A HW/SW Co-optimized Mixed-precision Neural Network Design Framework for MCUs
di: Gong, Junfeng, et al.
Pubblicazione: (2024)
di: Gong, Junfeng, et al.
Pubblicazione: (2024)
FINN-GL: Generalized Mixed-Precision Extensions for FPGA-Accelerated LSTMs
di: Khandelwal, Shashwat, et al.
Pubblicazione: (2025)
di: Khandelwal, Shashwat, et al.
Pubblicazione: (2025)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
di: Yadav, Divakar Kumar, et al.
Pubblicazione: (2026)
di: Yadav, Divakar Kumar, et al.
Pubblicazione: (2026)
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
di: Ma, Shaobo, et al.
Pubblicazione: (2025)
di: Ma, Shaobo, et al.
Pubblicazione: (2025)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
di: Ma, Shaobo, et al.
Pubblicazione: (2024)
di: Ma, Shaobo, et al.
Pubblicazione: (2024)
GATMesh: Clock Mesh Timing Analysis using Graph Neural Networks
di: Khan, Muhammad Hadir, et al.
Pubblicazione: (2025)
di: Khan, Muhammad Hadir, et al.
Pubblicazione: (2025)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
Neural Network Acceleration on MPSoC board: Integrating SLAC's SNL, Rogue Software and Auto-SNL
di: Rahali, Hamza Ezzaoui, et al.
Pubblicazione: (2025)
di: Rahali, Hamza Ezzaoui, et al.
Pubblicazione: (2025)
TransPlace: Transferable Circuit Global Placement via Graph Neural Network
di: Hou, Yunbo, et al.
Pubblicazione: (2025)
di: Hou, Yunbo, et al.
Pubblicazione: (2025)
GraNNite: Enabling High-Performance Execution of Graph Neural Networks on Resource-Constrained Neural Processing Units
di: Das, Arghadip, et al.
Pubblicazione: (2025)
di: Das, Arghadip, et al.
Pubblicazione: (2025)
LUTMUL: Exceed Conventional FPGA Roofline Limit by LUT-based Efficient Multiplication for Neural Network Inference
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
Graph Computation Meets Circuit Algebra: A Task-Aligned Analysis of Graph Neural Networks for Electronic Design Automation
di: Kim, Hyunmog
Pubblicazione: (2026)
di: Kim, Hyunmog
Pubblicazione: (2026)
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
di: Kim, Daeun, et al.
Pubblicazione: (2025)
di: Kim, Daeun, et al.
Pubblicazione: (2025)
PolyLUT: Ultra-low Latency Polynomial Inference with Hardware-Aware Structured Pruning
di: Andronic, Marta, et al.
Pubblicazione: (2025)
di: Andronic, Marta, et al.
Pubblicazione: (2025)
Taming the Tail: NoI Topology Synthesis for Mixed DL Workloads on Chiplet-Based Accelerators
di: Shukla, Arnav, et al.
Pubblicazione: (2025)
di: Shukla, Arnav, et al.
Pubblicazione: (2025)
ALADIN: Accuracy-Latency-Aware Design-space Inference Analysis for Embedded AI Accelerators
di: Baldi, T., et al.
Pubblicazione: (2026)
di: Baldi, T., et al.
Pubblicazione: (2026)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
di: Liang, Yanbiao, et al.
Pubblicazione: (2025)
di: Liang, Yanbiao, et al.
Pubblicazione: (2025)
Automatic Generation of Fast and Accurate Performance Models for Deep Neural Network Accelerators
di: Lübeck, Konstantin, et al.
Pubblicazione: (2024)
di: Lübeck, Konstantin, et al.
Pubblicazione: (2024)
Towards Cheaper Inference in Deep Networks with Lower Bit-Width Accumulators
di: Blumenfeld, Yaniv, et al.
Pubblicazione: (2024)
di: Blumenfeld, Yaniv, et al.
Pubblicazione: (2024)
On-Sensor Convolutional Neural Networks with Early-Exits
di: Shalby, Hazem Hesham Yousef, et al.
Pubblicazione: (2025)
di: Shalby, Hazem Hesham Yousef, et al.
Pubblicazione: (2025)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024)
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024)
ATHEENA: A Toolflow for Hardware Early-Exit Network Automation
di: Biggs, Benjamin, et al.
Pubblicazione: (2023)
di: Biggs, Benjamin, et al.
Pubblicazione: (2023)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
Revolutionizing TCAD Simulations with Universal Device Encoding and Graph Attention Networks
di: Fan, Guangxi, et al.
Pubblicazione: (2023)
di: Fan, Guangxi, et al.
Pubblicazione: (2023)
KirchhoffNet: A Scalable Ultra Fast Analog Neural Network
di: Gao, Zhengqi, et al.
Pubblicazione: (2023)
di: Gao, Zhengqi, et al.
Pubblicazione: (2023)
Extending Straight-Through Estimation for Robust Neural Networks on Analog CIM Hardware
di: Feng, Yuannuo, et al.
Pubblicazione: (2025)
di: Feng, Yuannuo, et al.
Pubblicazione: (2025)
Neural Network Quantization for Microcontrollers: A Comprehensive Survey of Methods, Platforms, and Applications
di: Abushahla, Hamza A., et al.
Pubblicazione: (2025)
di: Abushahla, Hamza A., et al.
Pubblicazione: (2025)
SPARQ: Spiking Early-Exit Neural Networks for Energy-Efficient Edge AI
di: Patne, Parth, et al.
Pubblicazione: (2026)
di: Patne, Parth, et al.
Pubblicazione: (2026)
Automated and Holistic Co-design of Neural Networks and ASICs for Enabling In-Pixel Intelligence
di: Kharel, Shubha R., et al.
Pubblicazione: (2024)
di: Kharel, Shubha R., et al.
Pubblicazione: (2024)
MC$^2$A: Enabling Algorithm-Hardware Co-Design for Efficient Markov Chain Monte Carlo Acceleration
di: Zhao, Shirui, et al.
Pubblicazione: (2025)
di: Zhao, Shirui, et al.
Pubblicazione: (2025)
RESQ: A Unified Framework for REliability- and Security Enhancement of Quantized Deep Neural Networks
di: Mohammadi, Ali Soltan, et al.
Pubblicazione: (2026)
di: Mohammadi, Ali Soltan, et al.
Pubblicazione: (2026)
Heterogeneous Acceleration Pipeline for Recommendation System Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2022)
di: Adnan, Muhammad, et al.
Pubblicazione: (2022)
Tensor-Compressed and Fully-Quantized Training of Neural PDE Solvers
di: Lu, Jinming, et al.
Pubblicazione: (2025)
di: Lu, Jinming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
di: Huang, Wei, et al.
Pubblicazione: (2023) -
GNNBuilder: An Automated Framework for Generic Graph Neural Network Accelerator Generation, Simulation, and Optimization
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023) -
NeuraLUT: Hiding Neural Network Density in Boolean Synthesizable Functions
di: Andronic, Marta, et al.
Pubblicazione: (2024) -
NeuralMatrix: Compute the Entire Neural Networks with Linear Matrix Operations for Efficient Inference
di: Sun, Ruiqi, et al.
Pubblicazione: (2023) -
FPGA Resource-aware Structured Pruning for Real-Time Neural Networks
di: Ramhorst, Benjamin, et al.
Pubblicazione: (2023)