T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
Fuente:
arXiv
Guardado en:
| Autores principales: | Wei, Jianyu, Li, Qingtao, Cao, Shijie, Ma, Lingxiao, Hao, Zixu, Zhang, Yanyong, Hu, Xiaoyan, Cao, Ting |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator
por: Li, Guoyu, et al.
Publicado: (2025)
por: Li, Guoyu, et al.
Publicado: (2025)
LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference
por: Mo, Zhiwen, et al.
Publicado: (2024)
por: Mo, Zhiwen, et al.
Publicado: (2024)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
por: Qiao, Ye, et al.
Publicado: (2025)
por: Qiao, Ye, et al.
Publicado: (2025)
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
por: Huang, Zhirui, et al.
Publicado: (2025)
por: Huang, Zhirui, et al.
Publicado: (2025)
SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
por: Zhang, Jingyao, et al.
Publicado: (2025)
por: Zhang, Jingyao, et al.
Publicado: (2025)
Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference
por: Geens, Robin, et al.
Publicado: (2026)
por: Geens, Robin, et al.
Publicado: (2026)
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
por: Yubeaton, Patrick, et al.
Publicado: (2025)
por: Yubeaton, Patrick, et al.
Publicado: (2025)
BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache
por: Du, Dayou, et al.
Publicado: (2025)
por: Du, Dayou, et al.
Publicado: (2025)
MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs
por: Wu, Haoran, et al.
Publicado: (2026)
por: Wu, Haoran, et al.
Publicado: (2026)
PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration
por: Zhang, Yifan, et al.
Publicado: (2025)
por: Zhang, Yifan, et al.
Publicado: (2025)
FIXME: Towards End-to-End Benchmarking of LLM-Aided Design Verification
por: Wan, Gwok-Waa, et al.
Publicado: (2025)
por: Wan, Gwok-Waa, et al.
Publicado: (2025)
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
por: Kubo, Tatsuya, et al.
Publicado: (2025)
por: Kubo, Tatsuya, et al.
Publicado: (2025)
SLDB: An End-To-End Heterogeneous System-on-Chip Benchmark Suite for LLM-Aided Design
por: Alvanaki, Elisavet Lydia, et al.
Publicado: (2025)
por: Alvanaki, Elisavet Lydia, et al.
Publicado: (2025)
Efficient yet Accurate End-to-End SC Accelerator Design
por: Li, Meng, et al.
Publicado: (2024)
por: Li, Meng, et al.
Publicado: (2024)
elasticAI.explorer: Towards a Unified End-to-End Framework for Hardware-Aware Neural Architecture Search
por: Maman, Natalie, et al.
Publicado: (2026)
por: Maman, Natalie, et al.
Publicado: (2026)
When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference
por: Li, Pu, et al.
Publicado: (2026)
por: Li, Pu, et al.
Publicado: (2026)
PowerFlow-DNN: Compiler-Directed Fine-Grained Power Orchestration for End-to-End Edge AI Inference
por: Chen, Paul, et al.
Publicado: (2026)
por: Chen, Paul, et al.
Publicado: (2026)
Benchmarking Ultra-Low-Power $μ$NPUs
por: Millar, Josh, et al.
Publicado: (2025)
por: Millar, Josh, et al.
Publicado: (2025)
Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
por: Hwang, Ranggi, et al.
Publicado: (2023)
por: Hwang, Ranggi, et al.
Publicado: (2023)
SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
por: Zhang, Jintao, et al.
Publicado: (2026)
por: Zhang, Jintao, et al.
Publicado: (2026)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
por: Sun, Xiaotian, et al.
Publicado: (2024)
por: Sun, Xiaotian, et al.
Publicado: (2024)
Cool-3D: An End-to-End Thermal-Aware Framework for Early-Phase Design Space Exploration of Microfluidic-Cooled 3DICs
por: Wang, Runxi, et al.
Publicado: (2025)
por: Wang, Runxi, et al.
Publicado: (2025)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
por: Wang, Huizheng, et al.
Publicado: (2025)
por: Wang, Huizheng, et al.
Publicado: (2025)
Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
por: Yoon, Dongho, et al.
Publicado: (2025)
por: Yoon, Dongho, et al.
Publicado: (2025)
Voyager: An End-to-End Framework for Design-Space Exploration and Generation of DNN Accelerators
por: Prabhu, Kartik, et al.
Publicado: (2025)
por: Prabhu, Kartik, et al.
Publicado: (2025)
Table-Lookup MAC: Scalable Processing of Quantised Neural Networks in FPGA Soft Logic
por: Gerlinghoff, Daniel, et al.
Publicado: (2024)
por: Gerlinghoff, Daniel, et al.
Publicado: (2024)
AutoGNN: End-to-End Hardware-Driven Graph Preprocessing for Enhanced GNN Performance
por: Kang, Seungkwan, et al.
Publicado: (2026)
por: Kang, Seungkwan, et al.
Publicado: (2026)
Towards an End-To-End System for Real-Time Gesture Recognition from Surface Vibrations
por: Hettstedt, Florian, et al.
Publicado: (2026)
por: Hettstedt, Florian, et al.
Publicado: (2026)
MCMComm: Hardware-Software Co-Optimization for End-to-End Communication in Multi-Chip-Modules
por: Raj, Ritik, et al.
Publicado: (2025)
por: Raj, Ritik, et al.
Publicado: (2025)
MemIntelli: A Generic End-to-End Simulation Framework for Memristive Intelligent Computing
por: Zhou, Houji, et al.
Publicado: (2025)
por: Zhou, Houji, et al.
Publicado: (2025)
FASE: FPGA-Assisted Syscall Emulation for Rapid End-to-End Processor Performance Validation
por: Meng, Chengzhen, et al.
Publicado: (2025)
por: Meng, Chengzhen, et al.
Publicado: (2025)
Striking the Balance: GEMM Performance Optimization Across Generations of Ryzen AI NPUs
por: Taka, Endri, et al.
Publicado: (2025)
por: Taka, Endri, et al.
Publicado: (2025)
HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip
por: Tsai, Pei-Huan, et al.
Publicado: (2026)
por: Tsai, Pei-Huan, et al.
Publicado: (2026)
System-Level Design Space Exploration for High-Level Synthesis under End-to-End Latency Constraints
por: Liao, Yuchao, et al.
Publicado: (2024)
por: Liao, Yuchao, et al.
Publicado: (2024)
EasyDRAM: An FPGA-based Infrastructure for Fast and Accurate End-to-End Evaluation of Emerging DRAM Techniques
por: Canpolat, Oğuzhan, et al.
Publicado: (2025)
por: Canpolat, Oğuzhan, et al.
Publicado: (2025)
CIMR-V: An End-to-End SRAM-based CIM Accelerator with RISC-V for AI Edge Device
por: and, Yan-Cheng Guo, et al.
Publicado: (2025)
por: and, Yan-Cheng Guo, et al.
Publicado: (2025)
ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs
por: Yang, Jinwu, et al.
Publicado: (2026)
por: Yang, Jinwu, et al.
Publicado: (2026)
T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge
por: Wei, Jianyu, et al.
Publicado: (2024)
por: Wei, Jianyu, et al.
Publicado: (2024)
ITERA-LLM: Boosting Sub-8-Bit Large Language Model Inference via Iterative Tensor Decomposition
por: Zheng, Keran, et al.
Publicado: (2025)
por: Zheng, Keran, et al.
Publicado: (2025)
MARVEL: An End-to-End Framework for Generating Model-Class Aware Custom RISC-V Extensions for Lightweight AI
por: M, Ajay Kumar, et al.
Publicado: (2025)
por: M, Ajay Kumar, et al.
Publicado: (2025)
Ejemplares similares
-
LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator
por: Li, Guoyu, et al.
Publicado: (2025) -
LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference
por: Mo, Zhiwen, et al.
Publicado: (2024) -
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
por: Qiao, Ye, et al.
Publicado: (2025) -
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
por: Huang, Zhirui, et al.
Publicado: (2025) -
SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
por: Zhang, Jingyao, et al.
Publicado: (2025)