MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ramachandran, Akshat, Kundu, Souvik, Krishna, Tushar |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
AIRCHITECT v2: Learning the Hardware Accelerator Design Space through Unified Representations
par: Seo, Jamin, et autres
Publié: (2025)
par: Seo, Jamin, et autres
Publié: (2025)
Algorithm-Hardware Co-Design of Distribution-Aware Logarithmic-Posit Encodings for Efficient DNN Inference
par: Ramachandran, Akshat, et autres
Publié: (2024)
par: Ramachandran, Akshat, et autres
Publié: (2024)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
par: Koo, Jahyun, et autres
Publié: (2024)
par: Koo, Jahyun, et autres
Publié: (2024)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
par: Jeong, Geonhwa, et autres
Publié: (2024)
par: Jeong, Geonhwa, et autres
Publié: (2024)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
par: Qiao, Ye, et autres
Publié: (2026)
par: Qiao, Ye, et autres
Publié: (2026)
TurboAttention: Efficient Attention Approximation For High Throughputs LLMs
par: Kang, Hao, et autres
Publié: (2024)
par: Kang, Hao, et autres
Publié: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Precision-Scalable Microscaling Datapaths with Optimized Reduction Tree for Efficient NPU Integration
par: Cuyckens, Stef, et autres
Publié: (2025)
par: Cuyckens, Stef, et autres
Publié: (2025)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
par: Kim, Jiyoon, et autres
Publié: (2025)
par: Kim, Jiyoon, et autres
Publié: (2025)
Demystifying AI Platform Design for Distributed Inference of Next-Generation LLM models
par: Bambhaniya, Abhimanyu, et autres
Publié: (2024)
par: Bambhaniya, Abhimanyu, et autres
Publié: (2024)
Improving Quantization with Post-Training Model Expansion
par: Franco, Giuseppe, et autres
Publié: (2025)
par: Franco, Giuseppe, et autres
Publié: (2025)
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
par: Bambhaniya, Abhimanyu, et autres
Publié: (2026)
par: Bambhaniya, Abhimanyu, et autres
Publié: (2026)
ALADIN: Accuracy-Latency-Aware Design-space Inference Analysis for Embedded AI Accelerators
par: Baldi, T., et autres
Publié: (2026)
par: Baldi, T., et autres
Publié: (2026)
SmartQuant: CXL-based AI Model Store in Support of Runtime Configurable Weight Quantization
par: Xie, Rui, et autres
Publié: (2024)
par: Xie, Rui, et autres
Publié: (2024)
Late Breaking Results: Quamba-SE: Soft-edge Quantizer for Activations in State Space Models
par: Chen, Yizhi, et autres
Publié: (2026)
par: Chen, Yizhi, et autres
Publié: (2026)
NSFlow: An End-to-End FPGA Framework with Scalable Dataflow Architecture for Neuro-Symbolic AI
par: Yang, Hanchen, et autres
Publié: (2025)
par: Yang, Hanchen, et autres
Publié: (2025)
Characterization and Mitigation of Training Instabilities in Microscaling Formats
par: Su, Huangyuan, et autres
Publié: (2025)
par: Su, Huangyuan, et autres
Publié: (2025)
MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference
par: Bambhaniya, Abhimanyu Rajeshkumar, et autres
Publié: (2025)
par: Bambhaniya, Abhimanyu Rajeshkumar, et autres
Publié: (2025)
Tensor-Compressed and Fully-Quantized Training of Neural PDE Solvers
par: Lu, Jinming, et autres
Publié: (2025)
par: Lu, Jinming, et autres
Publié: (2025)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
par: Ma, Shaobo, et autres
Publié: (2024)
par: Ma, Shaobo, et autres
Publié: (2024)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
AQPIM: Breaking the PIM Capacity Wall for LLMs with In-Memory Activation Quantization
par: Matsushima, Kosuke, et autres
Publié: (2026)
par: Matsushima, Kosuke, et autres
Publié: (2026)
Neural Network Quantization for Microcontrollers: A Comprehensive Survey of Methods, Platforms, and Applications
par: Abushahla, Hamza A., et autres
Publié: (2025)
par: Abushahla, Hamza A., et autres
Publié: (2025)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
par: Chhugani, Jatin, et autres
Publié: (2026)
par: Chhugani, Jatin, et autres
Publié: (2026)
RESQ: A Unified Framework for REliability- and Security Enhancement of Quantized Deep Neural Networks
par: Mohammadi, Ali Soltan, et autres
Publié: (2026)
par: Mohammadi, Ali Soltan, et autres
Publié: (2026)
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
par: Lee, Jungi, et autres
Publié: (2025)
par: Lee, Jungi, et autres
Publié: (2025)
GraNNite: Enabling High-Performance Execution of Graph Neural Networks on Resource-Constrained Neural Processing Units
par: Das, Arghadip, et autres
Publié: (2025)
par: Das, Arghadip, et autres
Publié: (2025)
Heterogeneous Acceleration Pipeline for Recommendation System Training
par: Adnan, Muhammad, et autres
Publié: (2022)
par: Adnan, Muhammad, et autres
Publié: (2022)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
par: Cong, Rongqing, et autres
Publié: (2024)
par: Cong, Rongqing, et autres
Publié: (2024)
LEGO: Spatial Accelerator Generation and Optimization for Tensor Applications
par: Lin, Yujun, et autres
Publié: (2025)
par: Lin, Yujun, et autres
Publié: (2025)
Mirage: An RNS-Based Photonic Accelerator for DNN Training
par: Demirkiran, Cansu, et autres
Publié: (2023)
par: Demirkiran, Cansu, et autres
Publié: (2023)
REASON: Accelerating Probabilistic Logical Reasoning for Scalable Neuro-Symbolic Intelligence
par: Wan, Zishen, et autres
Publié: (2026)
par: Wan, Zishen, et autres
Publié: (2026)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
par: Liu, Mingju, et autres
Publié: (2026)
par: Liu, Mingju, et autres
Publié: (2026)
The Role of Advanced Computer Architectures in Accelerating Artificial Intelligence Workloads
par: Amin, Shahid, et autres
Publié: (2025)
par: Amin, Shahid, et autres
Publié: (2025)
FAMOUS: Flexible Accelerator for the Attention Mechanism of Transformer on UltraScale+ FPGAs
par: Kabir, Ehsan, et autres
Publié: (2024)
par: Kabir, Ehsan, et autres
Publié: (2024)
AutoHLS: Learning to Accelerate Design Space Exploration for HLS Designs
par: Ahmed, Md Rubel, et autres
Publié: (2024)
par: Ahmed, Md Rubel, et autres
Publié: (2024)
TRAM: Training Approximate Multiplier Structures for Low-Power AI Accelerators
par: Meng, Chang, et autres
Publié: (2026)
par: Meng, Chang, et autres
Publié: (2026)
Enabling Physical AI at the Edge: Hardware-Accelerated Recovery of System Dynamics
par: Xu, Bin, et autres
Publié: (2025)
par: Xu, Bin, et autres
Publié: (2025)
MCU-MixQ: A HW/SW Co-optimized Mixed-precision Neural Network Design Framework for MCUs
par: Gong, Junfeng, et autres
Publié: (2024)
par: Gong, Junfeng, et autres
Publié: (2024)
Documents similaires
-
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
par: Ramachandran, Akshat, et autres
Publié: (2025) -
AIRCHITECT v2: Learning the Hardware Accelerator Design Space through Unified Representations
par: Seo, Jamin, et autres
Publié: (2025) -
Algorithm-Hardware Co-Design of Distribution-Aware Logarithmic-Posit Encodings for Efficient DNN Inference
par: Ramachandran, Akshat, et autres
Publié: (2024) -
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
par: Koo, Jahyun, et autres
Publié: (2024) -
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
par: Jeong, Geonhwa, et autres
Publié: (2024)