HG-PIPE: Vision Transformer Acceleration with Hybrid-Grained Pipeline
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Qingyu, Wan, Jiayong, Xu, Songqiang, Li, Meng, Wang, Yuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
par: Zhong, Linfeng, et autres
Publié: (2025)
par: Zhong, Linfeng, et autres
Publié: (2025)
M$^2$-ViT: Accelerating Hybrid Vision Transformers with Two-Level Mixed Quantization
par: Liang, Yanbiao, et autres
Publié: (2024)
par: Liang, Yanbiao, et autres
Publié: (2024)
Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
par: Chen, Chun-Ting, et autres
Publié: (2025)
par: Chen, Chun-Ting, et autres
Publié: (2025)
BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge
par: Ji, Yuhao, et autres
Publié: (2024)
par: Ji, Yuhao, et autres
Publié: (2024)
From Buffers to Registers: Unlocking Fine-Grained FlashAttention with Hybrid-Bonded 3D NPU Co-Design
par: Yu, Jinxin, et autres
Publié: (2026)
par: Yu, Jinxin, et autres
Publié: (2026)
SWAT: Scalable and Efficient Window Attention-based Transformers Acceleration on FPGAs
par: Bai, Zhenyu, et autres
Publié: (2024)
par: Bai, Zhenyu, et autres
Publié: (2024)
CGRA4ML: A Hardware/Software Framework to Implement Neural Networks for Scientific Edge Computing
par: Abarajithan, G, et autres
Publié: (2024)
par: Abarajithan, G, et autres
Publié: (2024)
MARCA: Mamba Accelerator with ReConfigurable Architecture
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
Heterogeneous Acceleration Pipeline for Recommendation System Training
par: Adnan, Muhammad, et autres
Publié: (2022)
par: Adnan, Muhammad, et autres
Publié: (2022)
REASON: Accelerating Probabilistic Logical Reasoning for Scalable Neuro-Symbolic Intelligence
par: Wan, Zishen, et autres
Publié: (2026)
par: Wan, Zishen, et autres
Publié: (2026)
TReX- Reusing Vision Transformer's Attention for Efficient Xbar-based Computing
par: Moitra, Abhishek, et autres
Publié: (2024)
par: Moitra, Abhishek, et autres
Publié: (2024)
A Fully Hardware Implemented Accelerator Design in ReRAM Analog Computing without ADCs
par: Dang, Peng, et autres
Publié: (2024)
par: Dang, Peng, et autres
Publié: (2024)
ROMA: a Read-Only-Memory-based Accelerator for QLoRA-based On-Device LLM
par: Wang, Wenqiang, et autres
Publié: (2025)
par: Wang, Wenqiang, et autres
Publié: (2025)
LLM-DSE: Searching Accelerator Parameters with LLM Agents
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
ReasoningV: Efficient Verilog Code Generation with Adaptive Hybrid Reasoning Model
par: Qin, Haiyan, et autres
Publié: (2025)
par: Qin, Haiyan, et autres
Publié: (2025)
RISC-V R-Extension: Advancing Efficiency with Rented-Pipeline for Edge DNN Processing
par: Kim, Won Hyeok, et autres
Publié: (2024)
par: Kim, Won Hyeok, et autres
Publié: (2024)
HAVEN: Hybrid Automated Verification ENgine for UVM Testbench Synthesis with LLMs
par: Meng, Chang-Chih, et autres
Publié: (2026)
par: Meng, Chang-Chih, et autres
Publié: (2026)
KWT-Tiny: RISC-V Accelerated, Embedded Keyword Spotting Transformer
par: Al-Qawlaq, Aness, et autres
Publié: (2024)
par: Al-Qawlaq, Aness, et autres
Publié: (2024)
T-REX: A 68-567 μs/token, 0.41-3.95 μJ/token Transformer Accelerator with Reduced External Memory Access and Enhanced Hardware Utilization in 16nm FinFET
par: Moon, Seunghyun, et autres
Publié: (2025)
par: Moon, Seunghyun, et autres
Publié: (2025)
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
par: Wang, Aotao, et autres
Publié: (2025)
par: Wang, Aotao, et autres
Publié: (2025)
Comprehensive Design Space Exploration for Tensorized Neural Network Hardware Accelerators
par: Zhang, Jinsong, et autres
Publié: (2025)
par: Zhang, Jinsong, et autres
Publié: (2025)
MICSim: A Modular Simulator for Mixed-signal Compute-in-Memory based AI Accelerator
par: Wang, Cong, et autres
Publié: (2024)
par: Wang, Cong, et autres
Publié: (2024)
ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators
par: Zou, Guoqiang, et autres
Publié: (2025)
par: Zou, Guoqiang, et autres
Publié: (2025)
Learning in Log-Domain: Subthreshold Analog AI Accelerator Based on Stochastic Gradient Descent
par: Tageldeen, Momen K, et autres
Publié: (2025)
par: Tageldeen, Momen K, et autres
Publié: (2025)
Design and Implementation of a Takum Arithmetic Hardware Codec
par: Hunhold, Laslo
Publié: (2024)
par: Hunhold, Laslo
Publié: (2024)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
par: Fang, Yunhua, et autres
Publié: (2025)
par: Fang, Yunhua, et autres
Publié: (2025)
Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding
par: Fan, Wang, et autres
Publié: (2026)
par: Fan, Wang, et autres
Publié: (2026)
Hardware Acceleration of LLMs: A comprehensive survey and comparison
par: Koilia, Nikoletta, et autres
Publié: (2024)
par: Koilia, Nikoletta, et autres
Publié: (2024)
Exploring the Potential of Wireless-enabled Multi-Chip AI Accelerators
par: Irabor, Emmanuel, et autres
Publié: (2025)
par: Irabor, Emmanuel, et autres
Publié: (2025)
Monitor Placement for Fault Localization in Deep Neural Network Accelerators
par: Liu, Wei-Kai
Publié: (2023)
par: Liu, Wei-Kai
Publié: (2023)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
par: Liu, Mingju, et autres
Publié: (2026)
par: Liu, Mingju, et autres
Publié: (2026)
A Configurable and Efficient Memory Hierarchy for Neural Network Hardware Accelerator
par: Bause, Oliver, et autres
Publié: (2024)
par: Bause, Oliver, et autres
Publié: (2024)
Accelerating MRI Uncertainty Estimation with Mask-based Bayesian Neural Network
par: Zhang, Zehuan, et autres
Publié: (2024)
par: Zhang, Zehuan, et autres
Publié: (2024)
TSB: Tiny Shared Block for Efficient DNN Deployment on NVCIM Accelerators
par: Qin, Yifan, et autres
Publié: (2024)
par: Qin, Yifan, et autres
Publié: (2024)
A3D: Agentic AI flow for autonomous Accelerator Design
par: Nallathambi, Abinand, et autres
Publié: (2026)
par: Nallathambi, Abinand, et autres
Publié: (2026)
KAN-SAs: Efficient Acceleration of Kolmogorov-Arnold Networks on Systolic Arrays
par: Errabii, Sohaib, et autres
Publié: (2025)
par: Errabii, Sohaib, et autres
Publié: (2025)
SALSA: Simulated Annealing based Loop-Ordering Scheduler for DNN Accelerators
par: Jung, Victor J. B., et autres
Publié: (2023)
par: Jung, Victor J. B., et autres
Publié: (2023)
Carbon-Efficient 3D DNN Acceleration: Optimizing Performance and Sustainability
par: Panteleaki, Aikaterini Maria, et autres
Publié: (2025)
par: Panteleaki, Aikaterini Maria, et autres
Publié: (2025)
A Survey on Design Methodologies for Accelerating Deep Learning on Heterogeneous Architectures
par: Curzel, Serena, et autres
Publié: (2023)
par: Curzel, Serena, et autres
Publié: (2023)
FPGA-Based Neural Network Accelerators for Space Applications: A Survey
par: Antunes, Pedro, et autres
Publié: (2025)
par: Antunes, Pedro, et autres
Publié: (2025)
Documents similaires
-
SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
par: Zhong, Linfeng, et autres
Publié: (2025) -
M$^2$-ViT: Accelerating Hybrid Vision Transformers with Two-Level Mixed Quantization
par: Liang, Yanbiao, et autres
Publié: (2024) -
Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
par: Chen, Chun-Ting, et autres
Publié: (2025) -
BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge
par: Ji, Yuhao, et autres
Publié: (2024) -
From Buffers to Registers: Unlocking Fine-Grained FlashAttention with Hybrid-Bonded 3D NPU Co-Design
par: Yu, Jinxin, et autres
Publié: (2026)