Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Pengxiang, Zhen, Hui-Ling, Li, Xing, Bao, Han, Lin, Weizhe, Yang, Zhiyuan, Zhang, Manyi, Luo, Yuanyong, Yu, Ziwei, Wang, Xin, Yuan, Mingxuan, Yu, Xianzhi, Dong, Zhenhua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HiFloat4 Format for Language Model Pre-training on Ascend NPUs
di: Taghian, Mehran, et al.
Pubblicazione: (2026)
di: Taghian, Mehran, et al.
Pubblicazione: (2026)
Ascend HiFloat8 Format for Deep Learning
di: Luo, Yuanyong, et al.
Pubblicazione: (2024)
di: Luo, Yuanyong, et al.
Pubblicazione: (2024)
HiFloat4 Format for Language Model Inference
di: Luo, Yuanyong, et al.
Pubblicazione: (2026)
di: Luo, Yuanyong, et al.
Pubblicazione: (2026)
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
What Matters For Safety Alignment?
di: Li, Xing, et al.
Pubblicazione: (2026)
di: Li, Xing, et al.
Pubblicazione: (2026)
Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2
di: Feng, Zhanfeng, et al.
Pubblicazione: (2026)
di: Feng, Zhanfeng, et al.
Pubblicazione: (2026)
ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs
di: Yang, Jinwu, et al.
Pubblicazione: (2026)
di: Yang, Jinwu, et al.
Pubblicazione: (2026)
Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers
di: Zhao, Yiming
Pubblicazione: (2026)
di: Zhao, Yiming
Pubblicazione: (2026)
SGEMM-cube: Precision-Recovery FP32 GEMM Approximation on Ascend NPUs with FP16 Matrix Engines
di: Xue, Weicheng, et al.
Pubblicazione: (2025)
di: Xue, Weicheng, et al.
Pubblicazione: (2025)
PreMoE: Proactive Inference for Efficient Mixture-of-Experts
di: Pei, Zehua, et al.
Pubblicazione: (2025)
di: Pei, Zehua, et al.
Pubblicazione: (2025)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
di: Lin, Weizhe, et al.
Pubblicazione: (2025)
di: Lin, Weizhe, et al.
Pubblicazione: (2025)
Behavioral Fingerprinting of Large Language Models
di: Pei, Zehua, et al.
Pubblicazione: (2025)
di: Pei, Zehua, et al.
Pubblicazione: (2025)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
di: Lv, Keyu, et al.
Pubblicazione: (2026)
di: Lv, Keyu, et al.
Pubblicazione: (2026)
T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
di: Wei, Jianyu, et al.
Pubblicazione: (2025)
di: Wei, Jianyu, et al.
Pubblicazione: (2025)
Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs
di: Tang, Yehui, et al.
Pubblicazione: (2025)
di: Tang, Yehui, et al.
Pubblicazione: (2025)
Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs
di: Yin, Yichun, et al.
Pubblicazione: (2025)
di: Yin, Yichun, et al.
Pubblicazione: (2025)
SwiftMem: Fast Agentic Memory via Query-aware Indexing
di: Tian, Anxin, et al.
Pubblicazione: (2026)
di: Tian, Anxin, et al.
Pubblicazione: (2026)
EAGLE-Pangu: Accelerator-Safe Tree Speculative Decoding on Ascend NPUs
di: Han, Chang, et al.
Pubblicazione: (2026)
di: Han, Chang, et al.
Pubblicazione: (2026)
Towards Efficient Agents: A Co-Design of Inference Architecture and System
di: Lin, Weizhe, et al.
Pubblicazione: (2025)
di: Lin, Weizhe, et al.
Pubblicazione: (2025)
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
di: Li, Ji-Fu, et al.
Pubblicazione: (2026)
di: Li, Ji-Fu, et al.
Pubblicazione: (2026)
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
di: Chen, Feilong, et al.
Pubblicazione: (2025)
di: Chen, Feilong, et al.
Pubblicazione: (2025)
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
di: Sun, Shengyin, et al.
Pubblicazione: (2025)
di: Sun, Shengyin, et al.
Pubblicazione: (2025)
Enhancing Learned Knowledge in LoRA Adapters Through Efficient Contrastive Decoding on Ascend NPUs
di: Heisler, Morgan Lindsay, et al.
Pubblicazione: (2025)
di: Heisler, Morgan Lindsay, et al.
Pubblicazione: (2025)
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
di: Yankun, Hong, et al.
Pubblicazione: (2025)
di: Yankun, Hong, et al.
Pubblicazione: (2025)
Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence
di: Sun, Shengyin, et al.
Pubblicazione: (2026)
di: Sun, Shengyin, et al.
Pubblicazione: (2026)
FastAttention: Extend FlashAttention2 to NPUs and Low-resource GPUs
di: Lin, Haoran, et al.
Pubblicazione: (2024)
di: Lin, Haoran, et al.
Pubblicazione: (2024)
Quant-Trim in Practice: Improved Cross-Platform Low-Bit Deployment on Edge NPUs
di: Dhahri, Rayen, et al.
Pubblicazione: (2025)
di: Dhahri, Rayen, et al.
Pubblicazione: (2025)
Multi‐Bit Floating‐Gate Memory with an Ultrawide Programmable Window
di: Ce Li, et al.
Pubblicazione: (2026)
di: Ce Li, et al.
Pubblicazione: (2026)
FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning
di: Pei, Zehua, et al.
Pubblicazione: (2026)
di: Pei, Zehua, et al.
Pubblicazione: (2026)
From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion
di: Pei, Zehua, et al.
Pubblicazione: (2024)
di: Pei, Zehua, et al.
Pubblicazione: (2024)
Fast On-device LLM Inference with NPUs
di: Xu, Daliang, et al.
Pubblicazione: (2024)
di: Xu, Daliang, et al.
Pubblicazione: (2024)
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
di: Sun, Shengyin, et al.
Pubblicazione: (2026)
di: Sun, Shengyin, et al.
Pubblicazione: (2026)
QuantClaw: Precision Where It Matters for OpenClaw
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
di: Zhang, Manyi, et al.
Pubblicazione: (2026)
NITRO: LLM Inference on Intel Laptop NPUs
di: Fei, Anthony, et al.
Pubblicazione: (2024)
di: Fei, Anthony, et al.
Pubblicazione: (2024)
OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs
di: Liao, Yujie, et al.
Pubblicazione: (2026)
di: Liao, Yujie, et al.
Pubblicazione: (2026)
Benchmarking Ultra-Low-Power $μ$NPUs
di: Millar, Josh, et al.
Pubblicazione: (2025)
di: Millar, Josh, et al.
Pubblicazione: (2025)
EPD-Serve: A Flexible Multimodal EPD Disaggregation Inference Serving System On Ascend
di: Bai, Fan, et al.
Pubblicazione: (2026)
di: Bai, Fan, et al.
Pubblicazione: (2026)
W4A16 Mixed-Precision Matrix Multiplication on Decoupled Architecture: Kernel Design and Memory Bottleneck Analysis for Ascend NPUs
di: He, Yuanhong, et al.
Pubblicazione: (2026)
di: He, Yuanhong, et al.
Pubblicazione: (2026)
Analytical FFN-to-MoE Restructuring via Activation Pattern Analysis
di: Pei, Zehua, et al.
Pubblicazione: (2025)
di: Pei, Zehua, et al.
Pubblicazione: (2025)
Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs
di: Benazir, Afsara, et al.
Pubblicazione: (2026)
di: Benazir, Afsara, et al.
Pubblicazione: (2026)
Documenti analoghi
-
HiFloat4 Format for Language Model Pre-training on Ascend NPUs
di: Taghian, Mehran, et al.
Pubblicazione: (2026) -
Ascend HiFloat8 Format for Deep Learning
di: Luo, Yuanyong, et al.
Pubblicazione: (2024) -
HiFloat4 Format for Language Model Inference
di: Luo, Yuanyong, et al.
Pubblicazione: (2026) -
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
di: Zhang, Manyi, et al.
Pubblicazione: (2026) -
What Matters For Safety Alignment?
di: Li, Xing, et al.
Pubblicazione: (2026)