HAAN: A Holistic Approach for Accelerating Normalization Operations in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Tianfan, Qin, Jiajun, Xia, Tianhua, Zhang, Sai Qian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hyft: A Reconfigurable Softmax Accelerator with Hybrid Numeric Format for both Training and Inference
par: Xia, Tianhua, et autres
Publié: (2023)
par: Xia, Tianhua, et autres
Publié: (2023)
Kelle: Co-design KV Caching and eDRAM for Efficient LLM Serving in Edge Computing
par: Xia, Tianhua, et autres
Publié: (2025)
par: Xia, Tianhua, et autres
Publié: (2025)
Hummingbird: A Smaller and Faster Large Language Model Accelerator on Embedded FPGA
par: Li, Jindong, et autres
Publié: (2025)
par: Li, Jindong, et autres
Publié: (2025)
Holistic Optimization Framework for FPGA Accelerators
par: Pouget, Stéphane, et autres
Publié: (2025)
par: Pouget, Stéphane, et autres
Publié: (2025)
SimulatorCoder: DNN Accelerator Simulator Code Generation and Optimization via Large Language Models
par: Xia, Yuhuan, et autres
Publié: (2026)
par: Xia, Yuhuan, et autres
Publié: (2026)
EdgeLLM: A Highly Efficient CPU-FPGA Heterogeneous Edge Accelerator for Large Language Models
par: Huang, Mingqiang, et autres
Publié: (2024)
par: Huang, Mingqiang, et autres
Publié: (2024)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
par: Wang, Peipei, et autres
Publié: (2025)
par: Wang, Peipei, et autres
Publié: (2025)
SA-DS: A Dataset for Large Language Model-Driven AI Accelerator Design Generation
par: Vungarala, Deepak, et autres
Publié: (2024)
par: Vungarala, Deepak, et autres
Publié: (2024)
BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models
par: Han, Xiaomeng, et autres
Publié: (2025)
par: Han, Xiaomeng, et autres
Publié: (2025)
A Review on Proprietary Accelerators for Large Language Models
par: Park, Sihyeong, et autres
Publié: (2025)
par: Park, Sihyeong, et autres
Publié: (2025)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
par: Duan, Cenlin, et autres
Publié: (2025)
par: Duan, Cenlin, et autres
Publié: (2025)
A3D-MoE: Acceleration of Large Language Models with Mixture of Experts via 3D Heterogeneous Integration
par: Huang, Wei-Hsing, et autres
Publié: (2025)
par: Huang, Wei-Hsing, et autres
Publié: (2025)
Managing Hybrid Solid-State Drives Using Large Language Models
par: Wei, Qian, et autres
Publié: (2025)
par: Wei, Qian, et autres
Publié: (2025)
Memory-efficient Sketch Acceleration for Handling Large Network Flows on FPGAs
par: Han, Zhaoyang, et autres
Publié: (2025)
par: Han, Zhaoyang, et autres
Publié: (2025)
AnalogMaster: Large Language Model-based Automated Analog IC Design Framework from Image to Layout
par: Qin, Xian Rong, et autres
Publié: (2026)
par: Qin, Xian Rong, et autres
Publié: (2026)
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
par: Yubeaton, Patrick, et autres
Publié: (2025)
par: Yubeaton, Patrick, et autres
Publié: (2025)
SuperUROP: An FPGA-Based Spatial Accelerator for Sparse Matrix Operations
par: Parthasarathy, Rishab
Publié: (2025)
par: Parthasarathy, Rishab
Publié: (2025)
Chiplet Cloud: Building AI Supercomputers for Serving Large Generative Language Models
par: Peng, Huwan, et autres
Publié: (2023)
par: Peng, Huwan, et autres
Publié: (2023)
31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding
par: Dong, Pingcheng, et autres
Publié: (2026)
par: Dong, Pingcheng, et autres
Publié: (2026)
Leveraging Application-Specific Knowledge for Energy-Efficient Deep Learning Accelerators on Resource-Constrained FPGAs
par: Qian, Chao
Publié: (2025)
par: Qian, Chao
Publié: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
par: Zhang, Chengming, et autres
Publié: (2024)
par: Zhang, Chengming, et autres
Publié: (2024)
TATAA: Programmable Mixed-Precision Transformer Acceleration with a Transformable Arithmetic Architecture
par: Wu, Jiajun, et autres
Publié: (2024)
par: Wu, Jiajun, et autres
Publié: (2024)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
AccelSync: Verifying Synchronization Coverage in Accelerator Pipeline Programs
par: An, Hangcheng, et autres
Publié: (2026)
par: An, Hangcheng, et autres
Publié: (2026)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Large Attention-Based Model Inference on Tile-Based Accelerators
par: Zhang, Chi, et autres
Publié: (2026)
par: Zhang, Chi, et autres
Publié: (2026)
Mixed Structural Choice Operator: Enhancing Technology Mapping with Heterogeneous Representations
par: Hu, Zhang, et autres
Publié: (2025)
par: Hu, Zhang, et autres
Publié: (2025)
RAS: A Bit-Exact rANS Accelerator For High-Performance Neural Lossless Compression
par: Qin, Yuchao, et autres
Publié: (2025)
par: Qin, Yuchao, et autres
Publié: (2025)
Graphitron: A Domain Specific Language for FPGA-based Graph Processing Accelerator Generation
par: Zhang, Xinmiao, et autres
Publié: (2024)
par: Zhang, Xinmiao, et autres
Publié: (2024)
Chiplets on Wheels: Review Paper on Holistic Chiplet Solutions for Autonomous Vehicles
par: Narashiman, Swathi, et autres
Publié: (2024)
par: Narashiman, Swathi, et autres
Publié: (2024)
Energy Efficient LSTM Accelerators for Embedded FPGAs through Parameterised Architecture Design
par: Qian, Chao, et autres
Publié: (2026)
par: Qian, Chao, et autres
Publié: (2026)
GSIM: Accelerating RTL Simulation for Large-Scale Designs
par: Chen, Lu, et autres
Publié: (2025)
par: Chen, Lu, et autres
Publié: (2025)
Efficient Approaches for GEMM Acceleration on Leading AI-Optimized FPGAs
par: Taka, Endri, et autres
Publié: (2024)
par: Taka, Endri, et autres
Publié: (2024)
Subitizing-Inspired_Large_Language_Models_for_Floorplanning
par: Lu, Shao-Chien, et autres
Publié: (2025)
par: Lu, Shao-Chien, et autres
Publié: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
par: Kim, Wonung, et autres
Publié: (2025)
par: Kim, Wonung, et autres
Publié: (2025)
FireFly-P: FPGA-Accelerated Spiking Neural Network Plasticity for Robust Adaptive Control
par: Li, Tenglong, et autres
Publié: (2026)
par: Li, Tenglong, et autres
Publié: (2026)
SpecLLM: Exploring Generation and Review of VLSI Design Specification with Large Language Model
par: Li, Mengming, et autres
Publié: (2024)
par: Li, Mengming, et autres
Publié: (2024)
FireFly-T: High-Throughput Sparsity Exploitation for Spiking Transformer Acceleration with Dual-Engine Overlay Architecture
par: Li, Tenglong, et autres
Publié: (2025)
par: Li, Tenglong, et autres
Publié: (2025)
FireFly-S: Exploiting Dual-Side Sparsity for Spiking Neural Networks Acceleration with Reconfigurable Spatial Architecture
par: Li, Tenglong, et autres
Publié: (2024)
par: Li, Tenglong, et autres
Publié: (2024)
Verification and Validation (V&V)-in-the-Loop for RISC-V Design: The Holistic Vision of BZL
par: Ahmed, Sajjad, et autres
Publié: (2026)
par: Ahmed, Sajjad, et autres
Publié: (2026)
HOPE: Holistic STT-RAM Architecture Exploration Framework for Future Cross-Platform Analysis
par: SeyedFaraji, Saeed, et autres
Publié: (2024)
par: SeyedFaraji, Saeed, et autres
Publié: (2024)
Documents similaires
-
Hyft: A Reconfigurable Softmax Accelerator with Hybrid Numeric Format for both Training and Inference
par: Xia, Tianhua, et autres
Publié: (2023) -
Kelle: Co-design KV Caching and eDRAM for Efficient LLM Serving in Edge Computing
par: Xia, Tianhua, et autres
Publié: (2025) -
Hummingbird: A Smaller and Faster Large Language Model Accelerator on Embedded FPGA
par: Li, Jindong, et autres
Publié: (2025) -
Holistic Optimization Framework for FPGA Accelerators
par: Pouget, Stéphane, et autres
Publié: (2025) -
SimulatorCoder: DNN Accelerator Simulator Code Generation and Optimization via Large Language Models
par: Xia, Yuhuan, et autres
Publié: (2026)