Ascend HiFloat8 Format for Deep Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Luo, Yuanyong, Zhang, Zhongxing, Wu, Richard, Liu, Hu, Jin, Ying, Zheng, Kai, Wang, Minmin, He, Zhanying, Hu, Guipeng, Chen, Luyao, Hu, Tianchi, Wang, Junsong, Chen, Minqi, Dmitry, Mikhaylov, Vladimir, Korviakov, Maxim, Bobrin, Hu, Yuhao, Chen, Guanfu, Huang, Zeyi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HiFloat4 Format for Language Model Inference
by: Luo, Yuanyong, et al.
Published: (2026)
by: Luo, Yuanyong, et al.
Published: (2026)
HiFloat4 Format for Language Model Pre-training on Ascend NPUs
by: Taghian, Mehran, et al.
Published: (2026)
by: Taghian, Mehran, et al.
Published: (2026)
M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization
by: Hu, Weiming, et al.
Published: (2026)
by: Hu, Weiming, et al.
Published: (2026)
Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats
by: Zhao, Pengxiang, et al.
Published: (2026)
by: Zhao, Pengxiang, et al.
Published: (2026)
From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
by: Zhao, Yushu, et al.
Published: (2025)
by: Zhao, Yushu, et al.
Published: (2025)
BoolE: Exact Symbolic Reasoning via Boolean Equality Saturation
by: Yin, Jiaqi, et al.
Published: (2025)
by: Yin, Jiaqi, et al.
Published: (2025)
AutoPDR: Circuit-Aware Solver Configuration Prediction for Hardware Model Checking
by: Hu, Guangyu, et al.
Published: (2026)
by: Hu, Guangyu, et al.
Published: (2026)
Timing-driven Approximate Logic Synthesis Based on Double-chase Grey Wolf Optimizer
by: Hu, Xiangfei, et al.
Published: (2024)
by: Hu, Xiangfei, et al.
Published: (2024)
LLM-Powered Code Analysis and Optimization for Gaussian Splatting Kernels
by: Hu, Yi, et al.
Published: (2025)
by: Hu, Yi, et al.
Published: (2025)
TransDot: An Area-efficient Reconfigurable Floating-Point Unit for Trans-Precision Dot-Product Accumulation for FPGA AI Engines
by: Wang, Jiayi, et al.
Published: (2026)
by: Wang, Jiayi, et al.
Published: (2026)
Fast Cross-Operator Optimization of Attention Dataflow
by: Chang, Haodong, et al.
Published: (2026)
by: Chang, Haodong, et al.
Published: (2026)
TimeFloats: Train-in-Memory with Time-Domain Floating-Point Scalar Products
by: Hashem, Maeesha Binte, et al.
Published: (2024)
by: Hashem, Maeesha Binte, et al.
Published: (2024)
E-Syn: E-Graph Rewriting with Technology-Aware Cost Functions for Logic Synthesis
by: Chen, Chen, et al.
Published: (2024)
by: Chen, Chen, et al.
Published: (2024)
Mixed Structural Choice Operator: Enhancing Technology Mapping with Heterogeneous Representations
by: Hu, Zhang, et al.
Published: (2025)
by: Hu, Zhang, et al.
Published: (2025)
HiKonv: Maximizing the Throughput of Quantized Convolution With Novel Bit-wise Management and Computation
by: Chen, Yao, et al.
Published: (2022)
by: Chen, Yao, et al.
Published: (2022)
AI-Powered Agile Analog Circuit Design and Optimization
by: Hu, Jinhai, et al.
Published: (2025)
by: Hu, Jinhai, et al.
Published: (2025)
Theseus: Exploring Efficient Wafer-Scale Chip Design for Large Language Models
by: Zhu, Jingchen, et al.
Published: (2024)
by: Zhu, Jingchen, et al.
Published: (2024)
BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models
by: Han, Xiaomeng, et al.
Published: (2025)
by: Han, Xiaomeng, et al.
Published: (2025)
HiHGNN: Accelerating HGNNs through Parallelism and Data Reusability Exploitation
by: Xue, Runzhen, et al.
Published: (2023)
by: Xue, Runzhen, et al.
Published: (2023)
A Systematic Characterization of LLM Inference on GPUs
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
SecFSM: Knowledge Graph-Guided Verilog Code Generation for Secure Finite State Machines in Systems-on-Chip
by: Hu, Ziteng, et al.
Published: (2025)
by: Hu, Ziteng, et al.
Published: (2025)
Closing the Gap Between Float and Posit Hardware Efficiency
by: Jonnalagadda, Aditya Anirudh, et al.
Published: (2026)
by: Jonnalagadda, Aditya Anirudh, et al.
Published: (2026)
A Computing-in-Memory-based One-Class Hyperdimensional Computing Model for Outlier Detection
by: Wang, Ruixuan, et al.
Published: (2023)
by: Wang, Ruixuan, et al.
Published: (2023)
Secure Scattered Memory: Rethinking Secure Enclave Memory with Secret Sharing
by: Geng, Haoran, et al.
Published: (2024)
by: Geng, Haoran, et al.
Published: (2024)
WIP: Turning Fake Chips into Learning Opportunities
by: Mehraban, Haniye, et al.
Published: (2025)
by: Mehraban, Haniye, et al.
Published: (2025)
Fast Graph Vector Search via Hardware Acceleration and Delayed-Synchronization Traversal
by: Jiang, Wenqi, et al.
Published: (2024)
by: Jiang, Wenqi, et al.
Published: (2024)
Apple vs. Oranges: Evaluating the Apple Silicon M-Series SoCs for HPC Performance and Efficiency
by: Hübner, Paul, et al.
Published: (2025)
by: Hübner, Paul, et al.
Published: (2025)
Fast Generation of Custom Floating-Point Spatial Filters on FPGAs
by: Campos, Nelson, et al.
Published: (2024)
by: Campos, Nelson, et al.
Published: (2024)
Online Alignment and Addition in Multi-Term Floating-Point Adders
by: Alexandridis, Kosmas, et al.
Published: (2024)
by: Alexandridis, Kosmas, et al.
Published: (2024)
Floating Point HUB Adder for RISC-V Sargantana Processor
by: Bandera, Gerardo, et al.
Published: (2024)
by: Bandera, Gerardo, et al.
Published: (2024)
SegSEM: Enabling and Enhancing SAM2 for SEM Contour Extraction
by: Chen, Da, et al.
Published: (2026)
by: Chen, Da, et al.
Published: (2026)
Random and Safe Cache Architecture to Defeat Cache Timing Attacks
by: Hu, Guangyuan, et al.
Published: (2023)
by: Hu, Guangyuan, et al.
Published: (2023)
SoK: Fully Homomorphic Encryption Accelerators
by: Zhang, Junxue, et al.
Published: (2022)
by: Zhang, Junxue, et al.
Published: (2022)
HiMA: Hierarchical Quantum Microarchitecture for Qubit-Scaling and Quantum Process-Level Parallelism
by: Zhou, Qi, et al.
Published: (2024)
by: Zhou, Qi, et al.
Published: (2024)
Efficient yet Accurate End-to-End SC Accelerator Design
by: Li, Meng, et al.
Published: (2024)
by: Li, Meng, et al.
Published: (2024)
Shift-Left Techniques in Electronic Design Automation: A Survey
by: Wu, Xinyue, et al.
Published: (2025)
by: Wu, Xinyue, et al.
Published: (2025)
The AetherFloat Family: Block-Scale-Free Quad-Radix Floating-Point Architectures for AI Accelerators
by: Morisaki, Keita
Published: (2026)
by: Morisaki, Keita
Published: (2026)
Floating-Point Multiply-Add with Approximate Normalization for Low-Cost Matrix Engines
by: Alexandridis, Kosmas, et al.
Published: (2024)
by: Alexandridis, Kosmas, et al.
Published: (2024)
Converting Binary Floating-Point Numbers to Shortest Decimal Strings: An Experimental Review
by: Gareau, Jaël Champagne, et al.
Published: (2026)
by: Gareau, Jaël Champagne, et al.
Published: (2026)
Accelerator-assisted Floating-point ASIP for Communication and Positioning in Massive MIMO Systems
by: Attari, Mohammad, et al.
Published: (2025)
by: Attari, Mohammad, et al.
Published: (2025)
Similar Items
-
HiFloat4 Format for Language Model Inference
by: Luo, Yuanyong, et al.
Published: (2026) -
HiFloat4 Format for Language Model Pre-training on Ascend NPUs
by: Taghian, Mehran, et al.
Published: (2026) -
M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization
by: Hu, Weiming, et al.
Published: (2026) -
Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats
by: Zhao, Pengxiang, et al.
Published: (2026) -
From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
by: Zhao, Yushu, et al.
Published: (2025)