ViM-Q: Scalable Algorithm-Hardware Co-Design for Vision Mamba Model Inference on FPGA
Fuente:
arXiv
Guardado en:
| Autores principales: | Lyu, Shengzhe, She, Yuhan, Hung, Patrick S. Y., Cheung, Ray C. C., Xu, Weitao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SwiftChannel: Algorithm-Hardware Co-Design for Deep Learning-Based 5G Channel Estimation
por: Lyu, Shengzhe, et al.
Publicado: (2026)
por: Lyu, Shengzhe, et al.
Publicado: (2026)
SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
por: Zhong, Linfeng, et al.
Publicado: (2025)
por: Zhong, Linfeng, et al.
Publicado: (2025)
STI-SNN: A 0.14 GOPS/W/PE Single-Timestep Inference FPGA-based SNN Accelerator with Algorithm and Hardware Co-Design
por: Wang, Kainan, et al.
Publicado: (2025)
por: Wang, Kainan, et al.
Publicado: (2025)
CogSys: Efficient and Scalable Neurosymbolic Cognition System via Algorithm-Hardware Co-Design
por: Wan, Zishen, et al.
Publicado: (2025)
por: Wan, Zishen, et al.
Publicado: (2025)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
por: Wang, Xinyu, et al.
Publicado: (2026)
por: Wang, Xinyu, et al.
Publicado: (2026)
CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA
por: Dong, Jiale, et al.
Publicado: (2025)
por: Dong, Jiale, et al.
Publicado: (2025)
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
por: Dumoulin, Joren, et al.
Publicado: (2025)
por: Dumoulin, Joren, et al.
Publicado: (2025)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
por: Kim, Dong Eun, et al.
Publicado: (2025)
por: Kim, Dong Eun, et al.
Publicado: (2025)
Bombyx: OpenCilk Compilation for FPGA Hardware Acceleration
por: Shahawy, Mohamed, et al.
Publicado: (2025)
por: Shahawy, Mohamed, et al.
Publicado: (2025)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
por: Wang, Peipei, et al.
Publicado: (2025)
por: Wang, Peipei, et al.
Publicado: (2025)
FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference
por: Hsieh, Fen-Yu, et al.
Publicado: (2025)
por: Hsieh, Fen-Yu, et al.
Publicado: (2025)
TurboFuzz: FPGA Accelerated Hardware Fuzzing for Processor Agile Verification
por: Zhong, Yang, et al.
Publicado: (2025)
por: Zhong, Yang, et al.
Publicado: (2025)
always_comm: An FPGA-based Hardware Accelerator for Audio/Video Compression and Transmission
por: Parthasarathy, Rishab, et al.
Publicado: (2025)
por: Parthasarathy, Rishab, et al.
Publicado: (2025)
Hardware-Software Co-Design of Scalable, Energy-Efficient Analog Recurrent Computations
por: Fyon, Arthur, et al.
Publicado: (2026)
por: Fyon, Arthur, et al.
Publicado: (2026)
Real Time FPGA Based Transformers & VLMs for Vision Tasks: SOTA Designs and Optimizations
por: Sali, Safa Mohammed, et al.
Publicado: (2025)
por: Sali, Safa Mohammed, et al.
Publicado: (2025)
ONNX-to-Hardware Design Flow for Adaptive Neural-Network Inference on FPGAs
por: Manca, Federico, et al.
Publicado: (2024)
por: Manca, Federico, et al.
Publicado: (2024)
Algorithm and Hardware Co-Design for Efficient Complex-Valued Uncertainty Estimation
por: Zhang, Zehuan, et al.
Publicado: (2026)
por: Zhang, Zehuan, et al.
Publicado: (2026)
APSQ: Additive Partial Sum Quantization with Algorithm-Hardware Co-Design
por: Tan, Yonghao, et al.
Publicado: (2025)
por: Tan, Yonghao, et al.
Publicado: (2025)
FPGA-Optimized Hardware Accelerator for Fast Fourier Transform and Singular Value Decomposition in AI
por: Ding, Hong, et al.
Publicado: (2025)
por: Ding, Hong, et al.
Publicado: (2025)
GenDRAM:Hardware-Software Co-Design of General Platform in DRAM
por: Lu, Tsung-Han, et al.
Publicado: (2026)
por: Lu, Tsung-Han, et al.
Publicado: (2026)
An Efficient Hardware Implementation of Elliptic Curve Point Multiplication over $GF(2^m)$ on FPGA
por: Kumari, Ruby, et al.
Publicado: (2025)
por: Kumari, Ruby, et al.
Publicado: (2025)
GenPairX: A Hardware-Algorithm Co-Designed Accelerator for Paired-End Read Mapping
por: Eudine, Julien, et al.
Publicado: (2026)
por: Eudine, Julien, et al.
Publicado: (2026)
Finesse: An Agile Design Framework for Pairing-based Cryptography via Software/Hardware Co-Design
por: Pan, Tianwei, et al.
Publicado: (2025)
por: Pan, Tianwei, et al.
Publicado: (2025)
TerEffic: Highly Efficient Ternary LLM Inference on FPGA
por: Yin, Chenyang, et al.
Publicado: (2025)
por: Yin, Chenyang, et al.
Publicado: (2025)
Palermo: Improving the Performance of Oblivious Memory using Protocol-Hardware Co-Design
por: Ye, Haojie, et al.
Publicado: (2024)
por: Ye, Haojie, et al.
Publicado: (2024)
CRYPTONITE: Scalable Accelerator Design for Cryptographic Primitives and Algorithms
por: Maheswaran, Karthikeya Sharma, et al.
Publicado: (2025)
por: Maheswaran, Karthikeya Sharma, et al.
Publicado: (2025)
METRO: A Software-Hardware Co-Design of Interconnections for Spatial DNN Accelerators
por: Wang, Zhao, et al.
Publicado: (2021)
por: Wang, Zhao, et al.
Publicado: (2021)
NeoMem: Hardware/Software Co-Design for CXL-Native Memory Tiering
por: Zhou, Zhe, et al.
Publicado: (2024)
por: Zhou, Zhe, et al.
Publicado: (2024)
QED: Scalable Verification of Hardware Memory Consistency
por: Ravi, Gokulan, et al.
Publicado: (2024)
por: Ravi, Gokulan, et al.
Publicado: (2024)
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
por: Wang, Aotao, et al.
Publicado: (2025)
por: Wang, Aotao, et al.
Publicado: (2025)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
por: Liang, Yanbiao, et al.
Publicado: (2025)
por: Liang, Yanbiao, et al.
Publicado: (2025)
Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
por: Yoon, Dongho, et al.
Publicado: (2025)
por: Yoon, Dongho, et al.
Publicado: (2025)
A Scalable FPGA Architecture With Adaptive Memory Utilization for GEMM-Based Operations
por: Petropoulos, Anastasios, et al.
Publicado: (2025)
por: Petropoulos, Anastasios, et al.
Publicado: (2025)
Embedded FPGA Acceleration of Brain-Like Neural Networks: Online Learning to Scalable Inference
por: Hafiz, Muhammad Ihsan Al, et al.
Publicado: (2025)
por: Hafiz, Muhammad Ihsan Al, et al.
Publicado: (2025)
ModSRAM: Algorithm-Hardware Co-Design for Large Number Modular Multiplication in SRAM
por: Ku, Jonathan, et al.
Publicado: (2024)
por: Ku, Jonathan, et al.
Publicado: (2024)
MERE: Hardware-Software Co-Design for Masking Cache Miss Latency in Embedded Processors
por: You, Dean, et al.
Publicado: (2025)
por: You, Dean, et al.
Publicado: (2025)
PIM-FW: Hardware-Software Co-Design of All-pairs Shortest Paths in DRAM
por: Lu, Tsung-Han, et al.
Publicado: (2025)
por: Lu, Tsung-Han, et al.
Publicado: (2025)
Design and Implementation of BNN-Based Object Detection on FPGA
por: Zhao, Xuyu, et al.
Publicado: (2026)
por: Zhao, Xuyu, et al.
Publicado: (2026)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
por: Shao, Haikuo, et al.
Publicado: (2024)
por: Shao, Haikuo, et al.
Publicado: (2024)
A Novel FPGA-based CNN Hardware Accelerator: Optimization for Convolutional Layers using Karatsuba Ofman Multiplier
por: Sarkar, Amit
Publicado: (2024)
por: Sarkar, Amit
Publicado: (2024)
Ejemplares similares
-
SwiftChannel: Algorithm-Hardware Co-Design for Deep Learning-Based 5G Channel Estimation
por: Lyu, Shengzhe, et al.
Publicado: (2026) -
SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
por: Zhong, Linfeng, et al.
Publicado: (2025) -
STI-SNN: A 0.14 GOPS/W/PE Single-Timestep Inference FPGA-based SNN Accelerator with Algorithm and Hardware Co-Design
por: Wang, Kainan, et al.
Publicado: (2025) -
CogSys: Efficient and Scalable Neurosymbolic Cognition System via Algorithm-Hardware Co-Design
por: Wan, Zishen, et al.
Publicado: (2025) -
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
por: Wang, Xinyu, et al.
Publicado: (2026)