PQS (Prune, Quantize, and Sort): Low-Bitwidth Accumulation of Dot Products in Neural Network Computations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Natesh, Vikas, Kung, H. T. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MGS: Markov Greedy Sums for Accurate Low-Bitwidth Floating-Point Accumulation
par: Natesh, Vikas, et autres
Publié: (2025)
par: Natesh, Vikas, et autres
Publié: (2025)
StableQAT: Stable Quantization-Aware Training at Ultra-Low Bitwidths
par: Chen, Tianyi, et autres
Publié: (2026)
par: Chen, Tianyi, et autres
Publié: (2026)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
par: Liu, Jing, et autres
Publié: (2023)
par: Liu, Jing, et autres
Publié: (2023)
Sorted Weight Sectioning for Energy-Efficient Unstructured Sparse DNNs on Compute-in-Memory Crossbars
par: Farias, Matheus, et autres
Publié: (2024)
par: Farias, Matheus, et autres
Publié: (2024)
An Efficient Sparse Fine-Tuning with Low Quantization Error via Neural Network Pruning
par: Li, Cen-Jhih, et autres
Publié: (2025)
par: Li, Cen-Jhih, et autres
Publié: (2025)
Efficient Reprogramming of Memristive Crossbars for DNNs: Weight Sorting and Bit Stucking
par: Farias, Matheus, et autres
Publié: (2024)
par: Farias, Matheus, et autres
Publié: (2024)
Bitwidth-Specific Logarithmic Arithmetic for Future Hardware-Accelerated Training
par: Hamad, Hassan, et autres
Publié: (2025)
par: Hamad, Hassan, et autres
Publié: (2025)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
par: Zhou, Longsheng, et autres
Publié: (2026)
par: Zhou, Longsheng, et autres
Publié: (2026)
ScaleBITS: Scalable Bitwidth Search for Hardware-Aligned Mixed-Precision LLMs
par: Li, Xinlin, et autres
Publié: (2026)
par: Li, Xinlin, et autres
Publié: (2026)
Low-bit Model Quantization for Deep Neural Networks: A Survey
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
PruneSymNet: A Symbolic Neural Network and Pruning Algorithm for Symbolic Regression
par: Wu, Min, et autres
Publié: (2024)
par: Wu, Min, et autres
Publié: (2024)
Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and Compression
par: Qu, Xiaoyi, et autres
Publié: (2025)
par: Qu, Xiaoyi, et autres
Publié: (2025)
The Impact of Quantization and Pruning on Deep Reinforcement Learning Models
par: Lu, Heng, et autres
Publié: (2024)
par: Lu, Heng, et autres
Publié: (2024)
Gradient-Free Training of Quantized Neural Networks
par: Cohen, Noa, et autres
Publié: (2024)
par: Cohen, Noa, et autres
Publié: (2024)
Continuous Product Graph Neural Networks
par: Einizade, Aref, et autres
Publié: (2024)
par: Einizade, Aref, et autres
Publié: (2024)
Exchangeability in Neural Network and its Application to Dynamic Pruning
par: Pu, et autres
Publié: (2025)
par: Pu, et autres
Publié: (2025)
Spectral Theory for Edge Pruning in Asynchronous Recurrent Graph Neural Networks
par: Bessone, Nicolas
Publié: (2025)
par: Bessone, Nicolas
Publié: (2025)
Budgeted Broadcast: An Activity-Dependent Pruning Rule for Neural Network Efficiency
par: Meirovitch, Yaron, et autres
Publié: (2025)
par: Meirovitch, Yaron, et autres
Publié: (2025)
Hierarchical Attention-based Graph Neural Network with Relevance-driven Pruning
par: Kum, Seungwoo
Publié: (2026)
par: Kum, Seungwoo
Publié: (2026)
The Neural Pruning Law Hypothesis
par: Barbulescu, Eugen, et autres
Publié: (2025)
par: Barbulescu, Eugen, et autres
Publié: (2025)
Proficient Graph Neural Network Design by Accumulating Knowledge on Large Language Models
par: Wang, Jialiang, et autres
Publié: (2024)
par: Wang, Jialiang, et autres
Publié: (2024)
Drug Release Modeling using Physics-Informed Neural Networks
par: Qureshi, Daanish Aleem, et autres
Publié: (2026)
par: Qureshi, Daanish Aleem, et autres
Publié: (2026)
Quantum-Classical Hybrid Quantized Neural Network
par: Li, Wenxin, et autres
Publié: (2025)
par: Li, Wenxin, et autres
Publié: (2025)
Resource-Aware Neural Network Pruning Using Graph-based Reinforcement Learning
par: Balemans, Dieter, et autres
Publié: (2025)
par: Balemans, Dieter, et autres
Publié: (2025)
MPruner: Optimizing Neural Network Size with CKA-Based Mutual Information Pruning
par: Hu, Seungbeom, et autres
Publié: (2024)
par: Hu, Seungbeom, et autres
Publié: (2024)
Neural Computers
par: Zhuge, Mingchen, et autres
Publié: (2026)
par: Zhuge, Mingchen, et autres
Publié: (2026)
The Graphon Limit Hypothesis: Understanding Neural Network Pruning via Infinite Width Analysis
par: Pham, Hoang, et autres
Publié: (2025)
par: Pham, Hoang, et autres
Publié: (2025)
A Dynamical Systems-Inspired Pruning Strategy for Addressing Oversmoothing in Graph Neural Networks
par: Chakraborty, Biswadeep, et autres
Publié: (2024)
par: Chakraborty, Biswadeep, et autres
Publié: (2024)
Accumulator-Aware Post-Training Quantization for Large Language Models
par: Colbert, Ian, et autres
Publié: (2024)
par: Colbert, Ian, et autres
Publié: (2024)
Sensitivity-Guided Framework for Pruned and Quantized Reservoir Computing Accelerators
par: Jafari, Atousa, et autres
Publié: (2026)
par: Jafari, Atousa, et autres
Publié: (2026)
Neural-Symbolic Message Passing with Dynamic Pruning
par: Zhang, Chongzhi, et autres
Publié: (2025)
par: Zhang, Chongzhi, et autres
Publié: (2025)
On-Device Training of Fully Quantized Deep Neural Networks on Cortex-M Microcontrollers
par: Deutel, Mark, et autres
Publié: (2024)
par: Deutel, Mark, et autres
Publié: (2024)
Compute-Optimal Quantization-Aware Training
par: Dremov, Aleksandr, et autres
Publié: (2025)
par: Dremov, Aleksandr, et autres
Publié: (2025)
Boolean Product Graph Neural Networks
par: Wang, Ziyan, et autres
Publié: (2024)
par: Wang, Ziyan, et autres
Publié: (2024)
Robust Simulation-Based Inference under Missing Data via Neural Processes
par: Verma, Yogesh, et autres
Publié: (2025)
par: Verma, Yogesh, et autres
Publié: (2025)
Integrated Encoding and Quantization to Enhance Quanvolutional Neural Networks
par: Bosco, Daniele Lizzio, et autres
Publié: (2024)
par: Bosco, Daniele Lizzio, et autres
Publié: (2024)
Application-Specific Component-Aware Structured Pruning of Deep Neural Networks in Control via Soft Coefficient Optimization
par: Sundaram, Ganesh, et autres
Publié: (2025)
par: Sundaram, Ganesh, et autres
Publié: (2025)
Quantized Evolution Strategies: High-precision Fine-tuning of Quantized LLMs at Low-precision Cost
par: Xu, Yinggan, et autres
Publié: (2026)
par: Xu, Yinggan, et autres
Publié: (2026)
Training-Free Restoration of Pruned Neural Networks
par: Lee, Keonho, et autres
Publié: (2025)
par: Lee, Keonho, et autres
Publié: (2025)
Documents similaires
-
MGS: Markov Greedy Sums for Accurate Low-Bitwidth Floating-Point Accumulation
par: Natesh, Vikas, et autres
Publié: (2025) -
StableQAT: Stable Quantization-Aware Training at Ultra-Low Bitwidths
par: Chen, Tianyi, et autres
Publié: (2026) -
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
par: Liu, Jing, et autres
Publié: (2023) -
Sorted Weight Sectioning for Energy-Efficient Unstructured Sparse DNNs on Compute-in-Memory Crossbars
par: Farias, Matheus, et autres
Publié: (2024) -
An Efficient Sparse Fine-Tuning with Low Quantization Error via Neural Network Pruning
par: Li, Cen-Jhih, et autres
Publié: (2025)