Identifying Sensitive Weights via Post-quantization Integral
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Yuezhou, Huang, Weiyu, Liang, Zichen, Chen, Chang, Zhang, Jintao, Zhu, Jun, Chen, Jianfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
di: Huang, Weiyu, et al.
Pubblicazione: (2025)
di: Huang, Weiyu, et al.
Pubblicazione: (2025)
Accelerating Transformer Pre-training with 2:4 Sparsity
di: Hu, Yuezhou, et al.
Pubblicazione: (2024)
di: Hu, Yuezhou, et al.
Pubblicazione: (2024)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
di: Huang, Weiyu, et al.
Pubblicazione: (2024)
di: Huang, Weiyu, et al.
Pubblicazione: (2024)
S-STE: Continuous Pruning Function for Efficient 2:4 Sparse Pre-training
di: Hu, Yuezhou, et al.
Pubblicazione: (2024)
di: Hu, Yuezhou, et al.
Pubblicazione: (2024)
SageBwd: A Trainable Low-bit Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
Artificial Geographically Weighted Neural Network: A Novel Framework for Spatial Analysis with Geographically Weighted Layers
di: Cao, Jianfei, et al.
Pubblicazione: (2025)
di: Cao, Jianfei, et al.
Pubblicazione: (2025)
Beyond 2:4: exploring V:N:M sparsity for efficient transformer inference on GPUs
di: Zhao, Kang, et al.
Pubblicazione: (2024)
di: Zhao, Kang, et al.
Pubblicazione: (2024)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
di: Zhang, Jintao, et al.
Pubblicazione: (2024)
di: Zhang, Jintao, et al.
Pubblicazione: (2024)
Tackling the Non-IID Issue in Heterogeneous Federated Learning by Gradient Harmonization
di: Zhang, Xinyu, et al.
Pubblicazione: (2023)
di: Zhang, Xinyu, et al.
Pubblicazione: (2023)
SparseDM: Toward Sparse Efficient Diffusion Models
di: Wang, Kafeng, et al.
Pubblicazione: (2024)
di: Wang, Kafeng, et al.
Pubblicazione: (2024)
DAQ: Density-Aware Post-Training Weight-Only Quantization For LLMs
di: Luo, Yingsong, et al.
Pubblicazione: (2024)
di: Luo, Yingsong, et al.
Pubblicazione: (2024)
Topology-Independent Robustness of the Weighted Mean under Label Poisoning Attacks in Heterogeneous Decentralized Learning
di: Peng, Jie, et al.
Pubblicazione: (2026)
di: Peng, Jie, et al.
Pubblicazione: (2026)
SageAttention2++: A More Efficient Implementation of SageAttention2
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
Brep2Shape: Boundary and Shape Representation Alignment via Self-Supervised Transformers
di: Sun, Yuanxu, et al.
Pubblicazione: (2026)
di: Sun, Yuanxu, et al.
Pubblicazione: (2026)
Speculative Decoding for Autoregressive Video Generation
di: Hu, Yuezhou, et al.
Pubblicazione: (2026)
di: Hu, Yuezhou, et al.
Pubblicazione: (2026)
TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
Oscillation-Reduced MXFP4 Training for Vision Transformers
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
Locality Sensitive Sparse Encoding for Learning World Models Online
di: Liu, Zichen, et al.
Pubblicazione: (2024)
di: Liu, Zichen, et al.
Pubblicazione: (2024)
Reconciling In-Context and In-Weight Learning via Dual Representation Space Encoding
di: Chen, Guanyu, et al.
Pubblicazione: (2026)
di: Chen, Guanyu, et al.
Pubblicazione: (2026)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
Maximum Redundancy Pruning: A Principle-Driven Layerwise Sparsity Allocation for LLMs
di: Gao, Chang, et al.
Pubblicazione: (2025)
di: Gao, Chang, et al.
Pubblicazione: (2025)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
POWQMIX: Weighted Value Factorization with Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning
di: Huang, Chang, et al.
Pubblicazione: (2024)
di: Huang, Chang, et al.
Pubblicazione: (2024)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
di: Yu, Xiaoming, et al.
Pubblicazione: (2026)
di: Yu, Xiaoming, et al.
Pubblicazione: (2026)
Theory Foundation of Physics-Enhanced Residual Learning
di: Liang, Shixiao, et al.
Pubblicazione: (2025)
di: Liang, Shixiao, et al.
Pubblicazione: (2025)
Discerning Temporal Difference Learning
di: Ma, Jianfei
Pubblicazione: (2023)
di: Ma, Jianfei
Pubblicazione: (2023)
SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
The Forecast After the Forecast: A Post-Processing Shift in Time Series
di: Liang, Daojun, et al.
Pubblicazione: (2026)
di: Liang, Daojun, et al.
Pubblicazione: (2026)
SLA2: Sparse-Linear Attention with Learnable Routing and QAT
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
FLAIN: Mitigating Backdoor Attacks in Federated Learning via Flipping Weight Updates of Low-Activation Input Neurons
di: Ding, Binbin, et al.
Pubblicazione: (2024)
di: Ding, Binbin, et al.
Pubblicazione: (2024)
OSDTW: Optimal Shared Depth and Task Weighting for Long-Tailed Recognition
di: Chu, Chang, et al.
Pubblicazione: (2026)
di: Chu, Chang, et al.
Pubblicazione: (2026)
SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
Heterogeneous Graph Prompt Learning via Adaptive Weight Pruning
di: Wei, Chu-Yuan, et al.
Pubblicazione: (2025)
di: Wei, Chu-Yuan, et al.
Pubblicazione: (2025)
MagR: Weight Magnitude Reduction for Enhancing Post-Training Quantization
di: Zhang, Aozhong, et al.
Pubblicazione: (2024)
di: Zhang, Aozhong, et al.
Pubblicazione: (2024)
Improving MLLM Training Efficiency via Stage-Aware Sparsity
di: Shi, Kean, et al.
Pubblicazione: (2025)
di: Shi, Kean, et al.
Pubblicazione: (2025)
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
FrameBridge: Improving Image-to-Video Generation with Bridge Models
di: Wang, Yuji, et al.
Pubblicazione: (2024)
di: Wang, Yuji, et al.
Pubblicazione: (2024)
Activation Sensitivity as a Unifying Principle for Post-Training Quantization
di: Xu, Bruce Changlong
Pubblicazione: (2026)
di: Xu, Bruce Changlong
Pubblicazione: (2026)
Documenti analoghi
-
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
di: Huang, Weiyu, et al.
Pubblicazione: (2025) -
Accelerating Transformer Pre-training with 2:4 Sparsity
di: Hu, Yuezhou, et al.
Pubblicazione: (2024) -
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
di: Huang, Weiyu, et al.
Pubblicazione: (2024) -
S-STE: Continuous Pruning Function for Efficient 2:4 Sparse Pre-training
di: Hu, Yuezhou, et al.
Pubblicazione: (2024) -
SageBwd: A Trainable Low-bit Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2026)