Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Geens, Robin, Heldens, Joran, Dumoulin, Joren, Verhelst, Marian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hardware-Centric Analysis of DeepSeek's Multi-Head Latent Attention
di: Geens, Robin, et al.
Pubblicazione: (2025)
di: Geens, Robin, et al.
Pubblicazione: (2025)
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
di: Dumoulin, Joren, et al.
Pubblicazione: (2025)
di: Dumoulin, Joren, et al.
Pubblicazione: (2025)
Fine-Grained Fusion: The Missing Piece in Area-Efficient State Space Model Acceleration
di: Geens, Robin, et al.
Pubblicazione: (2025)
di: Geens, Robin, et al.
Pubblicazione: (2025)
Precision-Scalable Microscaling Datapaths with Optimized Reduction Tree for Efficient NPU Integration
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
The Hyperscale Lottery: How State-Space Models Have Sacrificed Edge Efficiency
di: Geens, Robin, et al.
Pubblicazione: (2026)
di: Geens, Robin, et al.
Pubblicazione: (2026)
A 16 nm 1.60TOPS/W High Utilization DNN Accelerator with 3D Spatial Data Reuse and Efficient Shared Memory Access
di: Yi, Xiaoling, et al.
Pubblicazione: (2026)
di: Yi, Xiaoling, et al.
Pubblicazione: (2026)
Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format
di: Fang, Chao, et al.
Pubblicazione: (2024)
di: Fang, Chao, et al.
Pubblicazione: (2024)
OpenGeMM: A High-Utilization GeMM Accelerator Generator with Lightweight RISC-V Control and Tight Memory Coupling
di: Yi, Xiaoling, et al.
Pubblicazione: (2024)
di: Yi, Xiaoling, et al.
Pubblicazione: (2024)
An Open-Source HW-SW Co-Development Framework Enabling Efficient Multi-Accelerator Systems
di: Antonio, Ryan Albert, et al.
Pubblicazione: (2025)
di: Antonio, Ryan Albert, et al.
Pubblicazione: (2025)
SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
BitROM: Weight Reload-Free CiROM Architecture Towards Billion-Parameter 1.58-bit LLM Inference
di: Zhang, Wenlun, et al.
Pubblicazione: (2025)
di: Zhang, Wenlun, et al.
Pubblicazione: (2025)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
di: Symons, Arne, et al.
Pubblicazione: (2022)
di: Symons, Arne, et al.
Pubblicazione: (2022)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
di: Wei, Jianyu, et al.
Pubblicazione: (2025)
di: Wei, Jianyu, et al.
Pubblicazione: (2025)
Efficient Precision-Scalable Hardware for Microscaling (MX) Processing in Robotics Learning
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
How to keep pushing ML accelerator performance? Know your rooflines!
di: Verhelst, Marian, et al.
Pubblicazione: (2025)
di: Verhelst, Marian, et al.
Pubblicazione: (2025)
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
di: Mei, Linyan, et al.
Pubblicazione: (2022)
di: Mei, Linyan, et al.
Pubblicazione: (2022)
iEEG Seizure Detection with a Sparse Hyperdimensional Computing Accelerator
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
DataMaestro: A Versatile and Efficient Data Streaming Engine Bringing Decoupled Memory Access To Dataflow Accelerators
di: Yi, Xiaoling, et al.
Pubblicazione: (2025)
di: Yi, Xiaoling, et al.
Pubblicazione: (2025)
DiffAxE: Diffusion-driven Hardware Accelerator Generation and Design Space Exploration
di: Ghosh, Arkapravo, et al.
Pubblicazione: (2025)
di: Ghosh, Arkapravo, et al.
Pubblicazione: (2025)
bitSMM: A bit-Serial Matrix Multiplication Accelerator
di: Antunes, Pedro, et al.
Pubblicazione: (2026)
di: Antunes, Pedro, et al.
Pubblicazione: (2026)
MC$^2$A: Enabling Algorithm-Hardware Co-Design for Efficient Markov Chain Monte Carlo Acceleration
di: Zhao, Shirui, et al.
Pubblicazione: (2025)
di: Zhao, Shirui, et al.
Pubblicazione: (2025)
Pack my weights and run! Minimizing overheads for in-memory computing accelerators
di: Houshmand, Pouya, et al.
Pubblicazione: (2024)
di: Houshmand, Pouya, et al.
Pubblicazione: (2024)
Lookup Table-based Multiplication-free All-digital DNN Accelerator Featuring Self-Synchronous Pipeline Accumulation
di: Tagata, Hiroto, et al.
Pubblicazione: (2025)
di: Tagata, Hiroto, et al.
Pubblicazione: (2025)
Mapping Space Exploration for Multi-Chiplet Accelerators Targeting LLM Inference Serving Workloads
di: Li, Boyu, et al.
Pubblicazione: (2025)
di: Li, Boyu, et al.
Pubblicazione: (2025)
Hardware-Algorithm Co-Optimization of Early-Exit Neural Networks for Multi-Core Edge Accelerators
di: Zniber, Alaa, et al.
Pubblicazione: (2025)
di: Zniber, Alaa, et al.
Pubblicazione: (2025)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) for Lightweight Edge Inference
di: Huang, Wei-Hsing, et al.
Pubblicazione: (2024)
di: Huang, Wei-Hsing, et al.
Pubblicazione: (2024)
Optimizing Layer-Fused Scheduling of Transformer Networks on Multi-accelerator Platforms
di: Colleman, Steven, et al.
Pubblicazione: (2024)
di: Colleman, Steven, et al.
Pubblicazione: (2024)
SALSA: Simulated Annealing based Loop-Ordering Scheduler for DNN Accelerators
di: Jung, Victor J. B., et al.
Pubblicazione: (2023)
di: Jung, Victor J. B., et al.
Pubblicazione: (2023)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
Optimising GPGPU Execution Through Runtime Micro-Architecture Parameter Analysis
di: Sarda, Giuseppe M., et al.
Pubblicazione: (2024)
di: Sarda, Giuseppe M., et al.
Pubblicazione: (2024)
Decoupled Control Flow and Data Access in RISC-V GPGPUs
di: Sarda, Giuseppe M., et al.
Pubblicazione: (2025)
di: Sarda, Giuseppe M., et al.
Pubblicazione: (2025)
Hardware-Efficient Accurate 4-bit Multiplier for Xilinx 7 Series FPGAs
di: Kida, Misaki, et al.
Pubblicazione: (2025)
di: Kida, Misaki, et al.
Pubblicazione: (2025)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
Table-Lookup MAC: Scalable Processing of Quantised Neural Networks in FPGA Soft Logic
di: Gerlinghoff, Daniel, et al.
Pubblicazione: (2024)
di: Gerlinghoff, Daniel, et al.
Pubblicazione: (2024)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
Accelerating OTA Circuit Design: Transistor Sizing Based on a Transformer Model and Precomputed Lookup Tables
di: Ghosh, Subhadip, et al.
Pubblicazione: (2025)
di: Ghosh, Subhadip, et al.
Pubblicazione: (2025)
Hardware-Software Co-design for 3D-DRAM-based LLM Serving Accelerator
di: Li, Cong, et al.
Pubblicazione: (2026)
di: Li, Cong, et al.
Pubblicazione: (2026)
Lyra: A Hardware-Accelerated RISC-V Verification Framework with Generative Model-Based Processor Fuzzing
di: Huo, Juncheng, et al.
Pubblicazione: (2025)
di: Huo, Juncheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Hardware-Centric Analysis of DeepSeek's Multi-Head Latent Attention
di: Geens, Robin, et al.
Pubblicazione: (2025) -
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
di: Dumoulin, Joren, et al.
Pubblicazione: (2025) -
Fine-Grained Fusion: The Missing Piece in Area-Efficient State Space Model Acceleration
di: Geens, Robin, et al.
Pubblicazione: (2025) -
Precision-Scalable Microscaling Datapaths with Optimized Reduction Tree for Efficient NPU Integration
di: Cuyckens, Stef, et al.
Pubblicazione: (2025) -
The Hyperscale Lottery: How State-Space Models Have Sacrificed Edge Efficiency
di: Geens, Robin, et al.
Pubblicazione: (2026)