EVA: Recasting LLM Decoding into GEMM via an Efficient Vector Quantization Architecture
Fuente:
Zenodo
Enregistré dans:
| Auteurs principaux: | Duan, Bowen, Guo, Cong, Wei, Chiyue, Shan, Haoxuan, Fu, Yuzhe, Chen, Xinhua, Xu, Yifan, Zhang, Ziyue, Zhou, Changchun, Li, Hai, Chen, Yiran |
|---|---|
| Format: | Recurso digital |
| Publié: |
Zenodo
2026
|
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
par: Duan, Bowen, et autres
Publié: (2026)
par: Duan, Bowen, et autres
Publié: (2026)
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
par: Guo, Cong, et autres
Publié: (2025)
par: Guo, Cong, et autres
Publié: (2025)
FractalCloud: A Fractal-Inspired Architecture for Efficient Large-Scale Point Cloud Processing
par: Fu, Yuzhe, et autres
Publié: (2025)
par: Fu, Yuzhe, et autres
Publié: (2025)
Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models
par: Wei, Chiyue, et autres
Publié: (2025)
par: Wei, Chiyue, et autres
Publié: (2025)
Platinum: Path-Adaptable LUT-Based Accelerator Tailored for Low-Bit Weight Matrix Multiplication
par: Shan, Haoxuan, et autres
Publié: (2025)
par: Shan, Haoxuan, et autres
Publié: (2025)
DPad: Efficient Diffusion Language Models with Suffix Dropout
par: Chen, Xinhua, et autres
Publié: (2025)
par: Chen, Xinhua, et autres
Publié: (2025)
Phi: Leveraging Pattern-based Hierarchical Sparsity for High-Efficiency Spiking Neural Networks
par: Wei, Chiyue, et autres
Publié: (2025)
par: Wei, Chiyue, et autres
Publié: (2025)
FlashFPS: Efficient Farthest Point Sampling for Large-Scale Point Clouds via Pruning and Caching
par: Fu, Yuzhe, et autres
Publié: (2026)
par: Fu, Yuzhe, et autres
Publié: (2026)
CodeGEMM: A Codebook-Centric Approach to Efficient GEMM in Quantized LLMs
par: Park, Gunho, et autres
Publié: (2025)
par: Park, Gunho, et autres
Publié: (2025)
Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving
par: Hu, Huanqi, et autres
Publié: (2025)
par: Hu, Huanqi, et autres
Publié: (2025)
tuGEMM: Area-Power-Efficient Temporal Unary GEMM Architecture for Low-Precision Edge AI
par: Nair, Harideep, et autres
Publié: (2024)
par: Nair, Harideep, et autres
Publié: (2024)
ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized Transformers
par: Gu, Yuzhe, et autres
Publié: (2024)
par: Gu, Yuzhe, et autres
Publié: (2024)
Prosperity: Accelerating Spiking Neural Networks via Product Sparsity
par: Wei, Chiyue, et autres
Publié: (2025)
par: Wei, Chiyue, et autres
Publié: (2025)
Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers
par: Horton, Mark, et autres
Publié: (2025)
par: Horton, Mark, et autres
Publié: (2025)
MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems
par: Wang, Yifei, et autres
Publié: (2026)
par: Wang, Yifei, et autres
Publié: (2026)
Accelerating Sparse DNNs Based on Tiled GEMM
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
KLLM: Fast LLM Inference with K-Means Quantization
par: Wu, Xueying, et autres
Publié: (2025)
par: Wu, Xueying, et autres
Publié: (2025)
VQ-LLM: High-performance Code Generation for Vector Quantization Augmented LLM Inference
par: Liu, Zihan, et autres
Publié: (2025)
par: Liu, Zihan, et autres
Publié: (2025)
FlashEVA: Accelerating LLM inference via Efficient Attention
par: Kostelec, Juan Gabriel, et autres
Publié: (2025)
par: Kostelec, Juan Gabriel, et autres
Publié: (2025)
GEMM-GS: Accelerating 3D Gaussian Splatting on Tensor Cores with GEMM-Compatible Blending
par: Li, Haomin, et autres
Publié: (2026)
par: Li, Haomin, et autres
Publié: (2026)
A Small Math Model: Recasting Strategy Choice Theory in an LLM-Inspired Architecture
par: Rahman, Roussel, et autres
Publié: (2025)
par: Rahman, Roussel, et autres
Publié: (2025)
Accelerating Sparse Ternary GEMM for Quantized ML on Apple Silicon
par: Lipshitz, Baraq, et autres
Publié: (2025)
par: Lipshitz, Baraq, et autres
Publié: (2025)
VectorMaton: Efficient Vector Search with Pattern Constraints via an Enhanced Suffix Automaton
par: Xie, Haoxuan, et autres
Publié: (2026)
par: Xie, Haoxuan, et autres
Publié: (2026)
Leech Lattice Vector Quantization for Efficient LLM Compression
par: van der Ouderaa, Tycho F. A., et autres
Publié: (2026)
par: van der Ouderaa, Tycho F. A., et autres
Publié: (2026)
Golden Returns From Green Investments: The Impact of Corporate Environmental Behaviour on Product Market Performance
par: Changchun Pan, et autres
Publié: (2025)
par: Changchun Pan, et autres
Publié: (2025)
CAMformer: Associative Memory is All You Need
par: Molom-Ochir, Tergel, et autres
Publié: (2025)
par: Molom-Ochir, Tergel, et autres
Publié: (2025)
Optimizing GEMM for Energy and Performance on Versal ACAP Architectures
par: Papalamprou, Ilias, et autres
Publié: (2025)
par: Papalamprou, Ilias, et autres
Publié: (2025)
Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures
par: Bronzini, Marco, et autres
Publié: (2025)
par: Bronzini, Marco, et autres
Publié: (2025)
Revisiting Adaptive Rounding with Vectorized Reparameterization for LLM Quantization
par: Zhou, Yuli, et autres
Publié: (2026)
par: Zhou, Yuli, et autres
Publié: (2026)
SBVR: Summation of BitVector Representation for Efficient LLM Quantization
par: Bang, Wonjun, et autres
Publié: (2025)
par: Bang, Wonjun, et autres
Publié: (2025)
GenAI at the Edge: Comprehensive Survey on Empowering Edge Devices
par: Navardi, Mozhgan, et autres
Publié: (2025)
par: Navardi, Mozhgan, et autres
Publié: (2025)
LP-GEMM: Integrating Layout Propagation into GEMM Operations
par: Carneiro, César Guedes, et autres
Publié: (2026)
par: Carneiro, César Guedes, et autres
Publié: (2026)
LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models
par: Park, Gunho, et autres
Publié: (2022)
par: Park, Gunho, et autres
Publié: (2022)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
par: Hu, Lulu, et autres
Publié: (2026)
par: Hu, Lulu, et autres
Publié: (2026)
Recasting Islamic Law
par: Scott, Rachel M.
Publié: (2023)
par: Scott, Rachel M.
Publié: (2023)
Delta-NAS: Difference of Architecture Encoding for Predictor-based Evolutionary Neural Architecture Search
par: Sridhar, Arjun, et autres
Publié: (2024)
par: Sridhar, Arjun, et autres
Publié: (2024)
Trinity: Disaggregating Vector Search from Prefill-Decode Disaggregation in LLM Serving
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
Decoder-Hybrid-Decoder Architecture for Efficient Reasoning with Long Generation
par: Ren, Liliang, et autres
Publié: (2025)
par: Ren, Liliang, et autres
Publié: (2025)
Documents similaires
-
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
par: Duan, Bowen, et autres
Publié: (2026) -
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
par: Guo, Cong, et autres
Publié: (2025) -
FractalCloud: A Fractal-Inspired Architecture for Efficient Large-Scale Point Cloud Processing
par: Fu, Yuzhe, et autres
Publié: (2025) -
Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models
par: Wei, Chiyue, et autres
Publié: (2025) -
Platinum: Path-Adaptable LUT-Based Accelerator Tailored for Low-Bit Weight Matrix Multiplication
par: Shan, Haoxuan, et autres
Publié: (2025)