M$^2$-ViT: Accelerating Hybrid Vision Transformers with Two-Level Mixed Quantization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liang, Yanbiao, Shi, Huihong, Wang, Zhongfeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
von: Liang, Yanbiao, et al.
Veröffentlicht: (2025)
von: Liang, Yanbiao, et al.
Veröffentlicht: (2025)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
von: Shao, Haikuo, et al.
Veröffentlicht: (2024)
von: Shao, Haikuo, et al.
Veröffentlicht: (2024)
BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge
von: Ji, Yuhao, et al.
Veröffentlicht: (2024)
von: Ji, Yuhao, et al.
Veröffentlicht: (2024)
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
von: Wang, Aotao, et al.
Veröffentlicht: (2025)
von: Wang, Aotao, et al.
Veröffentlicht: (2025)
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
von: Dumoulin, Joren, et al.
Veröffentlicht: (2025)
von: Dumoulin, Joren, et al.
Veröffentlicht: (2025)
P$^2$-ViT: Power-of-Two Post-Training Quantization and Acceleration for Fully Quantized Vision Transformer
von: Shi, Huihong, et al.
Veröffentlicht: (2024)
von: Shi, Huihong, et al.
Veröffentlicht: (2024)
HG-PIPE: Vision Transformer Acceleration with Hybrid-Grained Pipeline
von: Guo, Qingyu, et al.
Veröffentlicht: (2024)
von: Guo, Qingyu, et al.
Veröffentlicht: (2024)
Opto-ViT: Architecting a Near-Sensor Region of Interest-Aware Vision Transformer Accelerator with Silicon Photonics
von: Morsali, Mehrdad, et al.
Veröffentlicht: (2025)
von: Morsali, Mehrdad, et al.
Veröffentlicht: (2025)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
von: Ma, Shaobo, et al.
Veröffentlicht: (2024)
von: Ma, Shaobo, et al.
Veröffentlicht: (2024)
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
von: Ma, Shaobo, et al.
Veröffentlicht: (2025)
von: Ma, Shaobo, et al.
Veröffentlicht: (2025)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
von: Shi, Huihong, et al.
Veröffentlicht: (2024)
von: Shi, Huihong, et al.
Veröffentlicht: (2024)
CDM-QTA: Quantized Training Acceleration for Efficient LoRA Fine-Tuning of Diffusion Model
von: Lu, Jinming, et al.
Veröffentlicht: (2025)
von: Lu, Jinming, et al.
Veröffentlicht: (2025)
Enable Lightweight and Precision-Scalable Posit/IEEE-754 Arithmetic in RISC-V Cores for Transprecision Computing
von: Li, Qiong, et al.
Veröffentlicht: (2025)
von: Li, Qiong, et al.
Veröffentlicht: (2025)
MICSim: A Modular Simulator for Mixed-signal Compute-in-Memory based AI Accelerator
von: Wang, Cong, et al.
Veröffentlicht: (2024)
von: Wang, Cong, et al.
Veröffentlicht: (2024)
A 10.60 $μ$W 150 GOPS Mixed-Bit-Width Sparse CNN Accelerator for Life-Threatening Ventricular Arrhythmia Detection
von: Qin, Yifan, et al.
Veröffentlicht: (2024)
von: Qin, Yifan, et al.
Veröffentlicht: (2024)
Bitwise Systolic Array Architecture for Runtime-Reconfigurable Multi-precision Quantized Multiplication on Hardware Accelerators
von: Liu, Yuhao, et al.
Veröffentlicht: (2026)
von: Liu, Yuhao, et al.
Veröffentlicht: (2026)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
von: Huang, Wei, et al.
Veröffentlicht: (2023)
von: Huang, Wei, et al.
Veröffentlicht: (2023)
Panacea: Novel DNN Accelerator using Accuracy-Preserving Asymmetric Quantization and Energy-Saving Bit-Slice Sparsity
von: Kam, Dongyun, et al.
Veröffentlicht: (2024)
von: Kam, Dongyun, et al.
Veröffentlicht: (2024)
Refining Datapath for Microscaling ViTs
von: Xiao, Can, et al.
Veröffentlicht: (2025)
von: Xiao, Can, et al.
Veröffentlicht: (2025)
SWAT: Scalable and Efficient Window Attention-based Transformers Acceleration on FPGAs
von: Bai, Zhenyu, et al.
Veröffentlicht: (2024)
von: Bai, Zhenyu, et al.
Veröffentlicht: (2024)
Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
von: Chen, Chun-Ting, et al.
Veröffentlicht: (2025)
von: Chen, Chun-Ting, et al.
Veröffentlicht: (2025)
Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format
von: Fang, Chao, et al.
Veröffentlicht: (2024)
von: Fang, Chao, et al.
Veröffentlicht: (2024)
An Efficient Sparse Hardware Accelerator for Spike-Driven Transformer
von: Li, Zhengke, et al.
Veröffentlicht: (2025)
von: Li, Zhengke, et al.
Veröffentlicht: (2025)
CktEvo: Repository-Level RTL Code Benchmark for Design Evolution
von: Shi, Zhengyuan, et al.
Veröffentlicht: (2026)
von: Shi, Zhengyuan, et al.
Veröffentlicht: (2026)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
von: Qiao, Ye, et al.
Veröffentlicht: (2026)
von: Qiao, Ye, et al.
Veröffentlicht: (2026)
APSQ: Additive Partial Sum Quantization with Algorithm-Hardware Co-Design
von: Tan, Yonghao, et al.
Veröffentlicht: (2025)
von: Tan, Yonghao, et al.
Veröffentlicht: (2025)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
von: Zhang, Yu, et al.
Veröffentlicht: (2024)
von: Zhang, Yu, et al.
Veröffentlicht: (2024)
A Two Level Neural Approach Combining Off-Chip Prediction with Adaptive Prefetch Filtering
von: Jamet, Alexandre Valentin, et al.
Veröffentlicht: (2024)
von: Jamet, Alexandre Valentin, et al.
Veröffentlicht: (2024)
TReX- Reusing Vision Transformer's Attention for Efficient Xbar-based Computing
von: Moitra, Abhishek, et al.
Veröffentlicht: (2024)
von: Moitra, Abhishek, et al.
Veröffentlicht: (2024)
ROMA: a Read-Only-Memory-based Accelerator for QLoRA-based On-Device LLM
von: Wang, Wenqiang, et al.
Veröffentlicht: (2025)
von: Wang, Wenqiang, et al.
Veröffentlicht: (2025)
ViTAD: Timing Violation-Aware Debugging of RTL Code using Large Language Models
von: Lv, Wenhao, et al.
Veröffentlicht: (2025)
von: Lv, Wenhao, et al.
Veröffentlicht: (2025)
TSB: Tiny Shared Block for Efficient DNN Deployment on NVCIM Accelerators
von: Qin, Yifan, et al.
Veröffentlicht: (2024)
von: Qin, Yifan, et al.
Veröffentlicht: (2024)
ViTCoD: Vision Transformer Acceleration via Dedicated Algorithm and Accelerator Co-Design
von: You, Haoran, et al.
Veröffentlicht: (2022)
von: You, Haoran, et al.
Veröffentlicht: (2022)
LLM-DSE: Searching Accelerator Parameters with LLM Agents
von: Wang, Hanyu, et al.
Veröffentlicht: (2025)
von: Wang, Hanyu, et al.
Veröffentlicht: (2025)
KWT-Tiny: RISC-V Accelerated, Embedded Keyword Spotting Transformer
von: Al-Qawlaq, Aness, et al.
Veröffentlicht: (2024)
von: Al-Qawlaq, Aness, et al.
Veröffentlicht: (2024)
KANtize: Exploring Low-bit Quantization of Kolmogorov-Arnold Networks for Efficient Inference
von: Errabii, Sohaib, et al.
Veröffentlicht: (2026)
von: Errabii, Sohaib, et al.
Veröffentlicht: (2026)
MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
von: Ramachandran, Akshat, et al.
Veröffentlicht: (2024)
von: Ramachandran, Akshat, et al.
Veröffentlicht: (2024)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
von: Kim, Jiyoon, et al.
Veröffentlicht: (2025)
von: Kim, Jiyoon, et al.
Veröffentlicht: (2025)
ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators
von: Zou, Guoqiang, et al.
Veröffentlicht: (2025)
von: Zou, Guoqiang, et al.
Veröffentlicht: (2025)
A Fully Hardware Implemented Accelerator Design in ReRAM Analog Computing without ADCs
von: Dang, Peng, et al.
Veröffentlicht: (2024)
von: Dang, Peng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
von: Liang, Yanbiao, et al.
Veröffentlicht: (2025) -
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
von: Shao, Haikuo, et al.
Veröffentlicht: (2024) -
BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge
von: Ji, Yuhao, et al.
Veröffentlicht: (2024) -
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
von: Wang, Aotao, et al.
Veröffentlicht: (2025) -
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
von: Dumoulin, Joren, et al.
Veröffentlicht: (2025)