COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Qiao, Ye, Chen, Zhiheng, Wang, Yian, Zhang, Yifan, Deng, Yunzhe, Huang, Sitao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
von: Qiao, Ye, et al.
Veröffentlicht: (2025)
von: Qiao, Ye, et al.
Veröffentlicht: (2025)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
von: Qiao, Ye, et al.
Veröffentlicht: (2025)
von: Qiao, Ye, et al.
Veröffentlicht: (2025)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
von: Qiao, Ye, et al.
Veröffentlicht: (2026)
von: Qiao, Ye, et al.
Veröffentlicht: (2026)
PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Optimized Spatial Architecture Mapping Flow for Transformer Accelerators
von: Xu, Haocheng, et al.
Veröffentlicht: (2024)
von: Xu, Haocheng, et al.
Veröffentlicht: (2024)
Atleus: Accelerating Transformers on the Edge Enabled by 3D Heterogeneous Manycore Architectures
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2025)
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2025)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
von: Yang, Xiaoxuan, et al.
Veröffentlicht: (2025)
von: Yang, Xiaoxuan, et al.
Veröffentlicht: (2025)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
von: Chen, Yanru, et al.
Veröffentlicht: (2025)
von: Chen, Yanru, et al.
Veröffentlicht: (2025)
SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
von: Zhang, Jintao, et al.
Veröffentlicht: (2026)
von: Zhang, Jintao, et al.
Veröffentlicht: (2026)
GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design
von: You, Haoran, et al.
Veröffentlicht: (2021)
von: You, Haoran, et al.
Veröffentlicht: (2021)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
von: Duan, Bowen, et al.
Veröffentlicht: (2026)
von: Duan, Bowen, et al.
Veröffentlicht: (2026)
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
von: Sharma, Amit
Veröffentlicht: (2025)
von: Sharma, Amit
Veröffentlicht: (2025)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
von: Chen, Yuzong, et al.
Veröffentlicht: (2025)
von: Chen, Yuzong, et al.
Veröffentlicht: (2025)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
von: Kim, Daeun, et al.
Veröffentlicht: (2025)
von: Kim, Daeun, et al.
Veröffentlicht: (2025)
Accelerating PoT Quantization on Edge Devices
von: Saha, Rappy, et al.
Veröffentlicht: (2024)
von: Saha, Rappy, et al.
Veröffentlicht: (2024)
TrainDeeploy: Hardware-Accelerated Parameter-Efficient Fine-Tuning of Small Transformer Models at the Extreme Edge
von: Wang, Run, et al.
Veröffentlicht: (2026)
von: Wang, Run, et al.
Veröffentlicht: (2026)
Designing Efficient LLM Accelerators for Edge Devices
von: Haris, Jude, et al.
Veröffentlicht: (2024)
von: Haris, Jude, et al.
Veröffentlicht: (2024)
TorR: Towards Brain-Inspired Task-Oriented Reasoning via Cache-Oriented Algorithm-Architecture Co-design
von: Oh, Hyunwoo, et al.
Veröffentlicht: (2026)
von: Oh, Hyunwoo, et al.
Veröffentlicht: (2026)
SOLE: Hardware-Software Co-design of Softmax and LayerNorm for Efficient Transformer Inference
von: Wang, Wenxun, et al.
Veröffentlicht: (2025)
von: Wang, Wenxun, et al.
Veröffentlicht: (2025)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
von: Liang, Yanbiao, et al.
Veröffentlicht: (2025)
von: Liang, Yanbiao, et al.
Veröffentlicht: (2025)
ESACT: An End-to-End Sparse Accelerator for Compute-Intensive Transformers via Local Similarity
von: Liu, Hongxiang, et al.
Veröffentlicht: (2025)
von: Liu, Hongxiang, et al.
Veröffentlicht: (2025)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction
von: Kulp, Gabriel, et al.
Veröffentlicht: (2024)
von: Kulp, Gabriel, et al.
Veröffentlicht: (2024)
Algorithm and Hardware Co-Design for Efficient Complex-Valued Uncertainty Estimation
von: Zhang, Zehuan, et al.
Veröffentlicht: (2026)
von: Zhang, Zehuan, et al.
Veröffentlicht: (2026)
Accelerating Computer Architecture Simulation through Machine Learning
von: Ali, Wajid, et al.
Veröffentlicht: (2024)
von: Ali, Wajid, et al.
Veröffentlicht: (2024)
A Sparsity-Aware Autonomous Path Planning Accelerator with HW/SW Co-Design and Multi-Level Dataflow Optimization
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
von: Zhou, Wenyong, et al.
Veröffentlicht: (2025)
von: Zhou, Wenyong, et al.
Veröffentlicht: (2025)
Dynamic Tsetlin Machine Accelerators for On-Chip Training at the Edge using FPGAs
von: Mao, Gang, et al.
Veröffentlicht: (2025)
von: Mao, Gang, et al.
Veröffentlicht: (2025)
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices
von: Yan, Minghao, et al.
Veröffentlicht: (2023)
von: Yan, Minghao, et al.
Veröffentlicht: (2023)
L3: DIMM-PIM Integrated Architecture and Coordination for Scalable Long-Context LLM Inference
von: Liu, Qingyuan, et al.
Veröffentlicht: (2025)
von: Liu, Qingyuan, et al.
Veröffentlicht: (2025)
SCATTER: Algorithm-Circuit Co-Sparse Photonic Accelerator with Thermal-Tolerant, Power-Efficient In-situ Light Redistribution
von: Yin, Ziang, et al.
Veröffentlicht: (2024)
von: Yin, Ziang, et al.
Veröffentlicht: (2024)
SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision
von: Choi, Yuseon, et al.
Veröffentlicht: (2025)
von: Choi, Yuseon, et al.
Veröffentlicht: (2025)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
von: Liu, Qunyou, et al.
Veröffentlicht: (2026)
von: Liu, Qunyou, et al.
Veröffentlicht: (2026)
Taming the Exponential: A Fast Softmax Surrogate for Integer-Native Edge Inference
von: Danopoulos, Dimitrios, et al.
Veröffentlicht: (2026)
von: Danopoulos, Dimitrios, et al.
Veröffentlicht: (2026)
MiCo: End-to-End Mixed Precision Neural Network Co-Exploration Framework for Edge AI
von: Jiang, Zijun, et al.
Veröffentlicht: (2025)
von: Jiang, Zijun, et al.
Veröffentlicht: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
von: Zhang, Chengming, et al.
Veröffentlicht: (2024)
von: Zhang, Chengming, et al.
Veröffentlicht: (2024)
ViTCoD: Vision Transformer Acceleration via Dedicated Algorithm and Accelerator Co-Design
von: You, Haoran, et al.
Veröffentlicht: (2022)
von: You, Haoran, et al.
Veröffentlicht: (2022)
DAISM: Digital Approximate In-SRAM Multiplier-based Accelerator for DNN Training and Inference
von: Sonnino, Lorenzo, et al.
Veröffentlicht: (2023)
von: Sonnino, Lorenzo, et al.
Veröffentlicht: (2023)
Algorithmic Strategies for Sustainable Reuse of Neural Network Accelerators with Permanent Faults
von: Alama, Youssef A. Ait, et al.
Veröffentlicht: (2024)
von: Alama, Youssef A. Ait, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
von: Qiao, Ye, et al.
Veröffentlicht: (2025) -
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
von: Qiao, Ye, et al.
Veröffentlicht: (2025) -
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
von: Qiao, Ye, et al.
Veröffentlicht: (2026) -
PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration
von: Zhang, Yifan, et al.
Veröffentlicht: (2025) -
Optimized Spatial Architecture Mapping Flow for Transformer Accelerators
von: Xu, Haocheng, et al.
Veröffentlicht: (2024)