TriGen: NPU Architecture for End-to-End Acceleration of Large Language Models based on SW-HW Co-Design
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Jonghun, Lee, Junghoon, Kim, Hyeonjin, Jeon, Seoho, Yoon, Jisup, Park, Hyunbin, Park, Meejeong, Ha, Heonjae |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
par: Yoon, Dongho, et autres
Publié: (2025)
par: Yoon, Dongho, et autres
Publié: (2025)
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
par: Heo, Guseul, et autres
Publié: (2024)
par: Heo, Guseul, et autres
Publié: (2024)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
par: Seo, Minseok, et autres
Publié: (2024)
par: Seo, Minseok, et autres
Publié: (2024)
A Sparsity-Aware Autonomous Path Planning Accelerator with HW/SW Co-Design and Multi-Level Dataflow Optimization
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
An Open-Source HW-SW Co-Development Framework Enabling Efficient Multi-Accelerator Systems
par: Antonio, Ryan Albert, et autres
Publié: (2025)
par: Antonio, Ryan Albert, et autres
Publié: (2025)
Integrating HW/SW Functionality for Flexible Wireless Radio
par: Strachan, Alexander, et autres
Publié: (2024)
par: Strachan, Alexander, et autres
Publié: (2024)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025)
par: Yang, Xiaoxuan, et autres
Publié: (2025)
GenPairX: A Hardware-Algorithm Co-Designed Accelerator for Paired-End Read Mapping
par: Eudine, Julien, et autres
Publié: (2026)
par: Eudine, Julien, et autres
Publié: (2026)
Efficient yet Accurate End-to-End SC Accelerator Design
par: Li, Meng, et autres
Publié: (2024)
par: Li, Meng, et autres
Publié: (2024)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
par: Sun, Xiaotian, et autres
Publié: (2024)
par: Sun, Xiaotian, et autres
Publié: (2024)
ONNXim: A Fast, Cycle-level Multi-core NPU Simulator
par: Ham, Hyungkyu, et autres
Publié: (2024)
par: Ham, Hyungkyu, et autres
Publié: (2024)
A Review on Proprietary Accelerators for Large Language Models
par: Park, Sihyeong, et autres
Publié: (2025)
par: Park, Sihyeong, et autres
Publié: (2025)
Voyager: An End-to-End Framework for Design-Space Exploration and Generation of DNN Accelerators
par: Prabhu, Kartik, et autres
Publié: (2025)
par: Prabhu, Kartik, et autres
Publié: (2025)
SLDB: An End-To-End Heterogeneous System-on-Chip Benchmark Suite for LLM-Aided Design
par: Alvanaki, Elisavet Lydia, et autres
Publié: (2025)
par: Alvanaki, Elisavet Lydia, et autres
Publié: (2025)
AutoGNN: End-to-End Hardware-Driven Graph Preprocessing for Enhanced GNN Performance
par: Kang, Seungkwan, et autres
Publié: (2026)
par: Kang, Seungkwan, et autres
Publié: (2026)
MCMComm: Hardware-Software Co-Optimization for End-to-End Communication in Multi-Chip-Modules
par: Raj, Ritik, et autres
Publié: (2025)
par: Raj, Ritik, et autres
Publié: (2025)
CIMR-V: An End-to-End SRAM-based CIM Accelerator with RISC-V for AI Edge Device
par: and, Yan-Cheng Guo, et autres
Publié: (2025)
par: and, Yan-Cheng Guo, et autres
Publié: (2025)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
par: Sharma, Harsh, et autres
Publié: (2023)
par: Sharma, Harsh, et autres
Publié: (2023)
FIGLUT: An Energy-Efficient Accelerator Design for FP-INT GEMM Using Look-Up Tables
par: Park, Gunho, et autres
Publié: (2025)
par: Park, Gunho, et autres
Publié: (2025)
IBEX: Internal Bandwidth-Efficient Compression Architecture for Scalable CXL Memory Expansion
par: Ko, Younghoon, et autres
Publié: (2026)
par: Ko, Younghoon, et autres
Publié: (2026)
elasticAI.explorer: Towards a Unified End-to-End Framework for Hardware-Aware Neural Architecture Search
par: Maman, Natalie, et autres
Publié: (2026)
par: Maman, Natalie, et autres
Publié: (2026)
HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip
par: Tsai, Pei-Huan, et autres
Publié: (2026)
par: Tsai, Pei-Huan, et autres
Publié: (2026)
Makinote: An FPGA-Based HW/SW Platform for Pre-Silicon Emulation of RISC-V Designs
par: Perdomo, Elias, et autres
Publié: (2024)
par: Perdomo, Elias, et autres
Publié: (2024)
HyperCroc: End-to-End Open-Source RISC-V MCU with a Plug-In Interface for Domain-Specific Accelerators
par: Sauter, Philippe, et autres
Publié: (2026)
par: Sauter, Philippe, et autres
Publié: (2026)
Who Checks the Checker? Enhancing Component-level Architectural SEU Fault Tolerance for End-to-End SoC Protection
par: Rogenmoser, Michael, et autres
Publié: (2026)
par: Rogenmoser, Michael, et autres
Publié: (2026)
LP5X-PIM Sim: A High-Fidelity HW/SW Integrated Simulator for LPDDR5X-PIM
par: Cha, SangHoon, et autres
Publié: (2026)
par: Cha, SangHoon, et autres
Publié: (2026)
SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
par: Zhang, Jingyao, et autres
Publié: (2025)
par: Zhang, Jingyao, et autres
Publié: (2025)
HW-SW Optimization of DNNs for Privacy-preserving People Counting on Low-resolution Infrared Arrays
par: Risso, Matteo, et autres
Publié: (2024)
par: Risso, Matteo, et autres
Publié: (2024)
FIXME: Towards End-to-End Benchmarking of LLM-Aided Design Verification
par: Wan, Gwok-Waa, et autres
Publié: (2025)
par: Wan, Gwok-Waa, et autres
Publié: (2025)
NSFlow: An End-to-End FPGA Framework with Scalable Dataflow Architecture for Neuro-Symbolic AI
par: Yang, Hanchen, et autres
Publié: (2025)
par: Yang, Hanchen, et autres
Publié: (2025)
ESACT: An End-to-End Sparse Accelerator for Compute-Intensive Transformers via Local Similarity
par: Liu, Hongxiang, et autres
Publié: (2025)
par: Liu, Hongxiang, et autres
Publié: (2025)
MiCo: End-to-End Mixed Precision Neural Network Co-Exploration Framework for Edge AI
par: Jiang, Zijun, et autres
Publié: (2025)
par: Jiang, Zijun, et autres
Publié: (2025)
Hardware-Software Co-Design for Event-Driven SNN Deployment on Low-Cost Neuromorphic FPGAs
par: Lee, Jiwoon, et autres
Publié: (2026)
par: Lee, Jiwoon, et autres
Publié: (2026)
EONSim: An NPU Simulator for On-Chip Memory and Embedding Vector Operations
par: Choi, Sangun, et autres
Publié: (2025)
par: Choi, Sangun, et autres
Publié: (2025)
Towards an End-To-End System for Real-Time Gesture Recognition from Surface Vibrations
par: Hettstedt, Florian, et autres
Publié: (2026)
par: Hettstedt, Florian, et autres
Publié: (2026)
MemIntelli: A Generic End-to-End Simulation Framework for Memristive Intelligent Computing
par: Zhou, Houji, et autres
Publié: (2025)
par: Zhou, Houji, et autres
Publié: (2025)
FASE: FPGA-Assisted Syscall Emulation for Rapid End-to-End Processor Performance Validation
par: Meng, Chengzhen, et autres
Publié: (2025)
par: Meng, Chengzhen, et autres
Publié: (2025)
From Characterization to Microarchitecture: Designing an Elegant and Reliable BFP-Based NPU
par: Zhang, Jie, et autres
Publié: (2026)
par: Zhang, Jie, et autres
Publié: (2026)
Strix: Re-thinking NPU Reliability from a System Perspective
par: Guan, Jiapeng, et autres
Publié: (2026)
par: Guan, Jiapeng, et autres
Publié: (2026)
System-Level Design Space Exploration for High-Level Synthesis under End-to-End Latency Constraints
par: Liao, Yuchao, et autres
Publié: (2024)
par: Liao, Yuchao, et autres
Publié: (2024)
Documents similaires
-
Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
par: Yoon, Dongho, et autres
Publié: (2025) -
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
par: Heo, Guseul, et autres
Publié: (2024) -
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
par: Seo, Minseok, et autres
Publié: (2024) -
A Sparsity-Aware Autonomous Path Planning Accelerator with HW/SW Co-Design and Multi-Level Dataflow Optimization
par: Zhang, Yifan, et autres
Publié: (2025) -
An Open-Source HW-SW Co-Development Framework Enabling Efficient Multi-Accelerator Systems
par: Antonio, Ryan Albert, et autres
Publié: (2025)