Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
Fuente:
arXiv
Salvato in:
| Autori principali: | Chhugani, Jatin, Jeong, Geonhwa, Su, Bor-Yiing, Pan, Yunjie, Yang, Hanmei, Ankit, Aayush, Yu, Jiecao, Deng, Summer, Chen, Yunqing, Satish, Nadathur, Kim, Changkyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A2Q+: Improving Accumulator-Aware Weight Quantization
di: Colbert, Ian, et al.
Pubblicazione: (2024)
di: Colbert, Ian, et al.
Pubblicazione: (2024)
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
di: Saha, Rappy, et al.
Pubblicazione: (2026)
di: Saha, Rappy, et al.
Pubblicazione: (2026)
HiKonv: Maximizing the Throughput of Quantized Convolution With Novel Bit-wise Management and Computation
di: Chen, Yao, et al.
Pubblicazione: (2022)
di: Chen, Yao, et al.
Pubblicazione: (2022)
SONIQ: System-Optimized Noise-Injected Ultra-Low-Precision Quantization with Full-Precision Parity
di: Zhou, Cyrus, et al.
Pubblicazione: (2023)
di: Zhou, Cyrus, et al.
Pubblicazione: (2023)
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)
A Quantitative Analysis and Guidelines of Data Streaming Accelerator in Modern Intel Xeon Scalable Processors
di: Kuper, Reese, et al.
Pubblicazione: (2023)
di: Kuper, Reese, et al.
Pubblicazione: (2023)
USEFUSE: Uniform Stride for Enhanced Performance in Fused Layer Architecture of Deep Neural Networks
di: Ibrahim, Muhammad Sohail, et al.
Pubblicazione: (2024)
di: Ibrahim, Muhammad Sohail, et al.
Pubblicazione: (2024)
Shedding the Bits: Pushing the Boundaries of Quantization with Minifloats on FPGAs
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
di: Aggarwal, Shivam, et al.
Pubblicazione: (2023)
3RSeT: Read Disturbance Rate Reduction in STT-MRAM Caches by Selective Tag Comparison
di: Cheshmikhani, Elham, et al.
Pubblicazione: (2025)
di: Cheshmikhani, Elham, et al.
Pubblicazione: (2025)
Heterogeneous Memory Benchmarking Toolkit
di: Ghaemi, Golsana, et al.
Pubblicazione: (2025)
di: Ghaemi, Golsana, et al.
Pubblicazione: (2025)
Simulation-Driven Evaluation of Chiplet-Based Architectures Using VisualSim
di: Ali, Wajid, et al.
Pubblicazione: (2025)
di: Ali, Wajid, et al.
Pubblicazione: (2025)
Enhancing Instruction Prefetching via Cache and TLB Management
di: Jamet, Alexandre Valentin, et al.
Pubblicazione: (2026)
di: Jamet, Alexandre Valentin, et al.
Pubblicazione: (2026)
ETM2: Empowering Traditional Memory Bandwidth Regulation using ETM
di: Zuepke, Alexander, et al.
Pubblicazione: (2026)
di: Zuepke, Alexander, et al.
Pubblicazione: (2026)
Towards CPU Performance Prediction: New Challenge Benchmark Dataset and Novel Approach
di: Liu, Xiaoman
Pubblicazione: (2024)
di: Liu, Xiaoman
Pubblicazione: (2024)
Adaptive Cache Pollution Control for Large Language Model Inference Workloads Using Temporal CNN-Based Prediction and Priority-Aware Replacement
di: Liu, Songze, et al.
Pubblicazione: (2025)
di: Liu, Songze, et al.
Pubblicazione: (2025)
Recurrent CircuitSAT Sampling for Sequential Circuits
di: Ardakani, Arash, et al.
Pubblicazione: (2025)
di: Ardakani, Arash, et al.
Pubblicazione: (2025)
Introducing the Arm-membench Throughput Benchmark
di: Burth, Cyrill, et al.
Pubblicazione: (2025)
di: Burth, Cyrill, et al.
Pubblicazione: (2025)
Enhancing software-hardware co-design for HEP by low-overhead profiling of single- and multi-threaded programs on diverse architectures with Adaptyst
di: Graczyk, Maksymilian, et al.
Pubblicazione: (2025)
di: Graczyk, Maksymilian, et al.
Pubblicazione: (2025)
SPEC CPU2026: Characterization, Representativeness, and Cross-Suite Comparison
di: Li, Ruihao, et al.
Pubblicazione: (2026)
di: Li, Ruihao, et al.
Pubblicazione: (2026)
Single 32-bit Sub-Channel DDR5 DIMMs: Architecture, Performance Bounds, and Standardisation
di: Ke, Chih-Hua
Pubblicazione: (2026)
di: Ke, Chih-Hua
Pubblicazione: (2026)
Regular-Dead on Arrival: Characterizing and Protecting Against Dead-Entry TLB Misses in GPU Microarchitectures
di: Anik, Shafayat Mowla, et al.
Pubblicazione: (2026)
di: Anik, Shafayat Mowla, et al.
Pubblicazione: (2026)
Makinote: An FPGA-Based HW/SW Platform for Pre-Silicon Emulation of RISC-V Designs
di: Perdomo, Elias, et al.
Pubblicazione: (2024)
di: Perdomo, Elias, et al.
Pubblicazione: (2024)
AI Load Dynamics--A Power Electronics Perspective
di: Li, Yuzhuo, et al.
Pubblicazione: (2025)
di: Li, Yuzhuo, et al.
Pubblicazione: (2025)
SAHM: State-Aware Heterogeneous Multicore for Single-Thread Performance
di: Wadle, Shayne, et al.
Pubblicazione: (2025)
di: Wadle, Shayne, et al.
Pubblicazione: (2025)
ONNXim: A Fast, Cycle-level Multi-core NPU Simulator
di: Ham, Hyungkyu, et al.
Pubblicazione: (2024)
di: Ham, Hyungkyu, et al.
Pubblicazione: (2024)
LightningSimV2: Faster and Scalable Simulation for High-Level Synthesis via Graph Compilation and Optimization
di: Sarkar, Rishov, et al.
Pubblicazione: (2024)
di: Sarkar, Rishov, et al.
Pubblicazione: (2024)
Range, Not Precision: Block-Floating-Point Half-Precision FFT and SAR Imaging on Apple Silicon
di: Bergach, Mohamed Amine
Pubblicazione: (2026)
di: Bergach, Mohamed Amine
Pubblicazione: (2026)
CXL-Interference: Analysis and Characterization in Modern Computer Systems
di: Mao, Shunyu, et al.
Pubblicazione: (2024)
di: Mao, Shunyu, et al.
Pubblicazione: (2024)
OPTIMA: Design-Space Exploration of Discharge-Based In-SRAM Computing: Quantifying Energy-Accuracy Trade-Offs
di: Seyedfaraji, Saeed, et al.
Pubblicazione: (2024)
di: Seyedfaraji, Saeed, et al.
Pubblicazione: (2024)
Data-Driven Power Modeling and Monitoring via Hardware Performance Counter Tracking
di: Mazzola, Sergio, et al.
Pubblicazione: (2025)
di: Mazzola, Sergio, et al.
Pubblicazione: (2025)
An Analytical Cost Model for Fast Evaluation of Multiple Compute-Engine CNN Accelerators
di: Qararyah, Fareed, et al.
Pubblicazione: (2025)
di: Qararyah, Fareed, et al.
Pubblicazione: (2025)
Characterizing and Optimizing Realistic Workloads on a Commercial Compute-in-SRAM Device
di: Zhang, Niansong, et al.
Pubblicazione: (2025)
di: Zhang, Niansong, et al.
Pubblicazione: (2025)
Accelerating Transistor-Level Simulation of Integrated Circuits via Equivalence of RC Long-Chain Structures
di: Tang, Ruibai, et al.
Pubblicazione: (2025)
di: Tang, Ruibai, et al.
Pubblicazione: (2025)
The Bicameral Cache: a split cache for vector architectures
di: Rebolledo, Susana, et al.
Pubblicazione: (2024)
di: Rebolledo, Susana, et al.
Pubblicazione: (2024)
A$^3$PIM: An Automated, Analytic and Accurate Processing-in-Memory Offloader
di: Jiang, Qingcai, et al.
Pubblicazione: (2024)
di: Jiang, Qingcai, et al.
Pubblicazione: (2024)
SCALE-Sim v3: A modular cycle-accurate systolic accelerator simulator for end-to-end system analysis
di: Raj, Ritik, et al.
Pubblicazione: (2025)
di: Raj, Ritik, et al.
Pubblicazione: (2025)
Gem5-AcceSys: Enabling System-Level Exploration of Standard Interconnects for Novel Accelerators
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
OmniSim: Simulating Hardware with C Speed and RTL Accuracy for High-Level Synthesis Designs
di: Sarkar, Rishov, et al.
Pubblicazione: (2025)
di: Sarkar, Rishov, et al.
Pubblicazione: (2025)
SCALE-Sim TPU: Validating and Extending SCALE-Sim for TPUs
di: Dang, Jingtian, et al.
Pubblicazione: (2026)
di: Dang, Jingtian, et al.
Pubblicazione: (2026)
GeneTEK: Low-power, high-performance and scalable FPGA architecture for exact unit-cost edit distance
di: Espinosa, Elena, et al.
Pubblicazione: (2025)
di: Espinosa, Elena, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A2Q+: Improving Accumulator-Aware Weight Quantization
di: Colbert, Ian, et al.
Pubblicazione: (2024) -
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
di: Saha, Rappy, et al.
Pubblicazione: (2026) -
HiKonv: Maximizing the Throughput of Quantized Convolution With Novel Bit-wise Management and Computation
di: Chen, Yao, et al.
Pubblicazione: (2022) -
SONIQ: System-Optimized Noise-Injected Ultra-Low-Precision Quantization with Full-Precision Parity
di: Zhou, Cyrus, et al.
Pubblicazione: (2023) -
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2026)