Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
Fuente:
arXiv
Salvato in:
| Autori principali: | Jeong, Geonhwa, Tsai, Po-An, Bambhaniya, Abhimanyu R., Keckler, Stephen W., Krishna, Tushar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)
SDQ: Sparse Decomposed Quantization for LLM Inference
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024)
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024)
Demystifying AI Platform Design for Distributed Inference of Next-Generation LLM models
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2024)
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2024)
MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
Algorithm-Hardware Co-Design of Distribution-Aware Logarithmic-Posit Encodings for Efficient DNN Inference
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
AIRCHITECT v2: Learning the Hardware Accelerator Design Space through Unified Representations
di: Seo, Jamin, et al.
Pubblicazione: (2025)
di: Seo, Jamin, et al.
Pubblicazione: (2025)
Hardware/Software Co-Design of RISC-V Extensions for Accelerating Sparse DNNs on FPGAs
di: Sabih, Muhammad, et al.
Pubblicazione: (2025)
di: Sabih, Muhammad, et al.
Pubblicazione: (2025)
VUSA: Virtually Upscaled Systolic Array Architecture to Exploit Unstructured Sparsity in AI Acceleration
di: Helal, Shereef, et al.
Pubblicazione: (2025)
di: Helal, Shereef, et al.
Pubblicazione: (2025)
FlexiSAGA: A Flexible Systolic Array GEMM Accelerator for Sparse and Dense Processing
di: Müller, Mika Markus, et al.
Pubblicazione: (2025)
di: Müller, Mika Markus, et al.
Pubblicazione: (2025)
Progressive Gradient Flow for Robust N:M Sparsity Training in Transformers
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2024)
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2024)
COGNATE: Acceleration of Sparse Tensor Programs on Emerging Hardware using Transfer Learning
di: Sudusinghe, Chamika, et al.
Pubblicazione: (2025)
di: Sudusinghe, Chamika, et al.
Pubblicazione: (2025)
Sorted Weight Sectioning for Energy-Efficient Unstructured Sparse DNNs on Compute-in-Memory Crossbars
di: Farias, Matheus, et al.
Pubblicazione: (2024)
di: Farias, Matheus, et al.
Pubblicazione: (2024)
Enabling Physical AI at the Edge: Hardware-Accelerated Recovery of System Dynamics
di: Xu, Bin, et al.
Pubblicazione: (2025)
di: Xu, Bin, et al.
Pubblicazione: (2025)
TRAM: Training Approximate Multiplier Structures for Low-Power AI Accelerators
di: Meng, Chang, et al.
Pubblicazione: (2026)
di: Meng, Chang, et al.
Pubblicazione: (2026)
Dynamic Sparse Attention: Access Patterns and Architecture
di: Levy, Noam
Pubblicazione: (2026)
di: Levy, Noam
Pubblicazione: (2026)
MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2025)
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2025)
MC$^2$A: Enabling Algorithm-Hardware Co-Design for Efficient Markov Chain Monte Carlo Acceleration
di: Zhao, Shirui, et al.
Pubblicazione: (2025)
di: Zhao, Shirui, et al.
Pubblicazione: (2025)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
Heterogeneous Acceleration Pipeline for Recommendation System Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2022)
di: Adnan, Muhammad, et al.
Pubblicazione: (2022)
TurboAttention: Efficient Attention Approximation For High Throughputs LLMs
di: Kang, Hao, et al.
Pubblicazione: (2024)
di: Kang, Hao, et al.
Pubblicazione: (2024)
FAMOUS: Flexible Accelerator for the Attention Mechanism of Transformer on UltraScale+ FPGAs
di: Kabir, Ehsan, et al.
Pubblicazione: (2024)
di: Kabir, Ehsan, et al.
Pubblicazione: (2024)
LEGO: Spatial Accelerator Generation and Optimization for Tensor Applications
di: Lin, Yujun, et al.
Pubblicazione: (2025)
di: Lin, Yujun, et al.
Pubblicazione: (2025)
Mirage: An RNS-Based Photonic Accelerator for DNN Training
di: Demirkiran, Cansu, et al.
Pubblicazione: (2023)
di: Demirkiran, Cansu, et al.
Pubblicazione: (2023)
MoNDE: Mixture of Near-Data Experts for Large-Scale Sparse Models
di: Kim, Taehyun, et al.
Pubblicazione: (2024)
di: Kim, Taehyun, et al.
Pubblicazione: (2024)
Accelerating Sparse Graph Neural Networks with Tensor Core Optimization
di: Wu, Ka Wai
Pubblicazione: (2024)
di: Wu, Ka Wai
Pubblicazione: (2024)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
di: Liu, Mingju, et al.
Pubblicazione: (2026)
di: Liu, Mingju, et al.
Pubblicazione: (2026)
The Role of Advanced Computer Architectures in Accelerating Artificial Intelligence Workloads
di: Amin, Shahid, et al.
Pubblicazione: (2025)
di: Amin, Shahid, et al.
Pubblicazione: (2025)
MonoSparse-CAM: Efficient Tree Model Processing via Monotonicity and Sparsity in CAMs
di: Molom-Ochir, Tergel, et al.
Pubblicazione: (2024)
di: Molom-Ochir, Tergel, et al.
Pubblicazione: (2024)
REASON: Accelerating Probabilistic Logical Reasoning for Scalable Neuro-Symbolic Intelligence
di: Wan, Zishen, et al.
Pubblicazione: (2026)
di: Wan, Zishen, et al.
Pubblicazione: (2026)
AutoHLS: Learning to Accelerate Design Space Exploration for HLS Designs
di: Ahmed, Md Rubel, et al.
Pubblicazione: (2024)
di: Ahmed, Md Rubel, et al.
Pubblicazione: (2024)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
di: Qiao, Ye, et al.
Pubblicazione: (2026)
di: Qiao, Ye, et al.
Pubblicazione: (2026)
AdAM: Adaptive Fault-Tolerant Approximate Multiplier for Edge DNN Accelerators
di: Taheri, Mahdi, et al.
Pubblicazione: (2024)
di: Taheri, Mahdi, et al.
Pubblicazione: (2024)
SAFFIRA: a Framework for Assessing the Reliability of Systolic-Array-Based DNN Accelerators
di: Taheri, Mahdi, et al.
Pubblicazione: (2024)
di: Taheri, Mahdi, et al.
Pubblicazione: (2024)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
di: Ma, Shaobo, et al.
Pubblicazione: (2024)
di: Ma, Shaobo, et al.
Pubblicazione: (2024)
FlexLLM: Composable HLS Library for Flexible Hybrid LLM Accelerator Design
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
di: Ma, Shaobo, et al.
Pubblicazione: (2025)
di: Ma, Shaobo, et al.
Pubblicazione: (2025)
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
di: Gimenes, Pedro, et al.
Pubblicazione: (2025)
di: Gimenes, Pedro, et al.
Pubblicazione: (2025)
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction
di: Kulp, Gabriel, et al.
Pubblicazione: (2024)
di: Kulp, Gabriel, et al.
Pubblicazione: (2024)
iEEG Seizure Detection with a Sparse Hyperdimensional Computing Accelerator
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026) -
SDQ: Sparse Decomposed Quantization for LLM Inference
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024) -
Demystifying AI Platform Design for Distributed Inference of Next-Generation LLM models
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2024) -
MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024) -
Algorithm-Hardware Co-Design of Distribution-Aware Logarithmic-Posit Encodings for Efficient DNN Inference
di: Ramachandran, Akshat, et al.
Pubblicazione: (2024)