TOM: A Ternary Read-only Memory Accelerator for LLM-powered Edge Intelligence
Fuente:
arXiv
Salvato in:
| Autori principali: | Guan, Hongyi, Zhang, Yijia, Wang, Wenqiang, Gao, Yizhao, Cao, Shijie, Zhang, Chen, Xu, Ningyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ROMA: a Read-Only-Memory-based Accelerator for QLoRA-based On-Device LLM
di: Wang, Wenqiang, et al.
Pubblicazione: (2025)
di: Wang, Wenqiang, et al.
Pubblicazione: (2025)
NeuroPDE: A Neuromorphic PDE Solver Based on Spintronic and Ferroelectric Devices
di: Fu, Siqing, et al.
Pubblicazione: (2025)
di: Fu, Siqing, et al.
Pubblicazione: (2025)
Dataflow & Tiling Strategies in Edge-AI FPGA Accelerators: A Comprehensive Literature Review
di: Li, Richie
Pubblicazione: (2025)
di: Li, Richie
Pubblicazione: (2025)
DSPE: An Energy-Efficient Edge Processor for DeepSeek Inference with MerkleTree-based Incremental Pruning, Multi-Stage Boothing Lookup and Dynamic Adaptive Posit Processing
di: Zhang, Yuhan, et al.
Pubblicazione: (2026)
di: Zhang, Yuhan, et al.
Pubblicazione: (2026)
RISC-V Based TinyML Accelerator for Depthwise Separable Convolutions in Edge AI
di: Yildirim, Muhammed, et al.
Pubblicazione: (2025)
di: Yildirim, Muhammed, et al.
Pubblicazione: (2025)
basic_RV32s: An Open-Source Microarchitectural Roadmap for RISC-V RV32I
di: Kang, Hyun Woo, et al.
Pubblicazione: (2025)
di: Kang, Hyun Woo, et al.
Pubblicazione: (2025)
A flexible framework for early power and timing comparison of time-multiplexed CGRA kernel executions
di: Aspros, Maxime Henri, et al.
Pubblicazione: (2025)
di: Aspros, Maxime Henri, et al.
Pubblicazione: (2025)
RISCBench: Benchmarking RISC-V Orchestration Efficiency in FPGA and FPGA-Like Computing Engines
di: Ojika, Dave, et al.
Pubblicazione: (2025)
di: Ojika, Dave, et al.
Pubblicazione: (2025)
Time Domain Near Memory Computing Engine
di: Antal, Sarthak, et al.
Pubblicazione: (2026)
di: Antal, Sarthak, et al.
Pubblicazione: (2026)
Design and Implementation of an FPGA-Based Hardware Accelerator for Transformer
di: Li, Richie, et al.
Pubblicazione: (2025)
di: Li, Richie, et al.
Pubblicazione: (2025)
RV-IM100: Quantifying ISA Extension, Datapath Width, and Pipeline Depth Trade-offs in RISC-V Microarchitectures
di: Kang, Hyunwoo
Pubblicazione: (2026)
di: Kang, Hyunwoo
Pubblicazione: (2026)
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
di: Huang, Zhirui, et al.
Pubblicazione: (2025)
di: Huang, Zhirui, et al.
Pubblicazione: (2025)
Minimal Neuron Circuits -- Part I: Resonators
di: Nabil, Amr, et al.
Pubblicazione: (2025)
di: Nabil, Amr, et al.
Pubblicazione: (2025)
Minimal Neuron Circuits: Bursters
di: Nabil, Amr, et al.
Pubblicazione: (2025)
di: Nabil, Amr, et al.
Pubblicazione: (2025)
ECOLogic: Enabling Circular, Obfuscated, and Adaptive Logic via eFPGA-Augmented SoCs
di: Tashdid, Ishraq, et al.
Pubblicazione: (2025)
di: Tashdid, Ishraq, et al.
Pubblicazione: (2025)
Biological Intuition on Digital Hardware: An RTL Implementation of Poisson-Encoded SNNs for Static Image Classification
di: Das, Debabrata, et al.
Pubblicazione: (2026)
di: Das, Debabrata, et al.
Pubblicazione: (2026)
InterPUF: Distributed Authentication via Physically Unclonable Functions and Multi-party Computation for Reconfigurable Interposers
di: Tashdid, Ishraq, et al.
Pubblicazione: (2026)
di: Tashdid, Ishraq, et al.
Pubblicazione: (2026)
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
Nonvolatile Charge-Domain Attention with HZO Ferroelectric Capacitors: A Simulation-Based Device-to-System Evaluation
di: Abouagour, Faris
Pubblicazione: (2026)
di: Abouagour, Faris
Pubblicazione: (2026)
SwiftKV: An Edge-Oriented Attention Algorithm and Multi-Head Accelerator for Fast, Efficient LLM Decoding
di: Zhang, Junming, et al.
Pubblicazione: (2026)
di: Zhang, Junming, et al.
Pubblicazione: (2026)
VitaLLM: A Versatile, Ultra-Compact Ternary LLM Accelerator with Dependency-Aware Scheduling
di: Lin, Zi-Wei, et al.
Pubblicazione: (2026)
di: Lin, Zi-Wei, et al.
Pubblicazione: (2026)
GainSight: A Unified Framework for Data Lifetime Profiling and Heterogeneous Memory Composition
di: Li, Peijing, et al.
Pubblicazione: (2025)
di: Li, Peijing, et al.
Pubblicazione: (2025)
TATAA: Programmable Mixed-Precision Transformer Acceleration with a Transformable Arithmetic Architecture
di: Wu, Jiajun, et al.
Pubblicazione: (2024)
di: Wu, Jiajun, et al.
Pubblicazione: (2024)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
A Composable Dynamic Sparse Dataflow Architecture for Efficient Event-based Vision Processing on FPGA
di: Gao, Yizhao, et al.
Pubblicazione: (2024)
di: Gao, Yizhao, et al.
Pubblicazione: (2024)
CCSS: Hardware-Accelerated RTL Simulation with Fast Combinational Logic Computing and Sequential Logic Synchronization
di: Feng, Weigang, et al.
Pubblicazione: (2025)
di: Feng, Weigang, et al.
Pubblicazione: (2025)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
di: Chen, Yanru, et al.
Pubblicazione: (2025)
di: Chen, Yanru, et al.
Pubblicazione: (2025)
CompAir: Synergizing Complementary PIMs and In-Transit NoC Computation for Efficient LLM Acceleration
di: Li, Hongyi, et al.
Pubblicazione: (2025)
di: Li, Hongyi, et al.
Pubblicazione: (2025)
CGRA4ML: A Hardware/Software Framework to Implement Neural Networks for Scientific Edge Computing
di: Abarajithan, G, et al.
Pubblicazione: (2024)
di: Abarajithan, G, et al.
Pubblicazione: (2024)
ISAAC: Intelligent, Scalable, Agile, and Accelerated CPU Verification via LLM-aided FPGA Parallelism
di: Sun, Jialin, et al.
Pubblicazione: (2025)
di: Sun, Jialin, et al.
Pubblicazione: (2025)
A 65 nm Bayesian Neural Network Accelerator with 360 fJ/Sample In-Word GRNG for AI Uncertainty Estimation
di: Enciso, Zephan M., et al.
Pubblicazione: (2025)
di: Enciso, Zephan M., et al.
Pubblicazione: (2025)
Accelerating OTA Circuit Design: Transistor Sizing Based on a Transformer Model and Precomputed Lookup Tables
di: Ghosh, Subhadip, et al.
Pubblicazione: (2025)
di: Ghosh, Subhadip, et al.
Pubblicazione: (2025)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
di: Jiang, Aojie, et al.
Pubblicazione: (2026)
di: Jiang, Aojie, et al.
Pubblicazione: (2026)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
di: Wang, Peipei, et al.
Pubblicazione: (2025)
di: Wang, Peipei, et al.
Pubblicazione: (2025)
EdgeLLM: A Highly Efficient CPU-FPGA Heterogeneous Edge Accelerator for Large Language Models
di: Huang, Mingqiang, et al.
Pubblicazione: (2024)
di: Huang, Mingqiang, et al.
Pubblicazione: (2024)
VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices
di: Lin, Zi-Wei, et al.
Pubblicazione: (2026)
di: Lin, Zi-Wei, et al.
Pubblicazione: (2026)
RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write
di: Guo, Yan-Cheng, et al.
Pubblicazione: (2026)
di: Guo, Yan-Cheng, et al.
Pubblicazione: (2026)
T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
di: Wei, Jianyu, et al.
Pubblicazione: (2025)
di: Wei, Jianyu, et al.
Pubblicazione: (2025)
TerEffic: Highly Efficient Ternary LLM Inference on FPGA
di: Yin, Chenyang, et al.
Pubblicazione: (2025)
di: Yin, Chenyang, et al.
Pubblicazione: (2025)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ROMA: a Read-Only-Memory-based Accelerator for QLoRA-based On-Device LLM
di: Wang, Wenqiang, et al.
Pubblicazione: (2025) -
NeuroPDE: A Neuromorphic PDE Solver Based on Spintronic and Ferroelectric Devices
di: Fu, Siqing, et al.
Pubblicazione: (2025) -
Dataflow & Tiling Strategies in Edge-AI FPGA Accelerators: A Comprehensive Literature Review
di: Li, Richie
Pubblicazione: (2025) -
DSPE: An Energy-Efficient Edge Processor for DeepSeek Inference with MerkleTree-based Incremental Pruning, Multi-Stage Boothing Lookup and Dynamic Adaptive Posit Processing
di: Zhang, Yuhan, et al.
Pubblicazione: (2026) -
RISC-V Based TinyML Accelerator for Depthwise Separable Convolutions in Edge AI
di: Yildirim, Muhammed, et al.
Pubblicazione: (2025)