ROMA: a Read-Only-Memory-based Accelerator for QLoRA-based On-Device LLM
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Wenqiang, Zhang, Yijia, Zhang, Zikai, Huo, Guanting, Liang, Hao, Cao, Shijie, Xu, Ningyi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TOM: A Ternary Read-only Memory Accelerator for LLM-powered Edge Intelligence
von: Guan, Hongyi, et al.
Veröffentlicht: (2026)
von: Guan, Hongyi, et al.
Veröffentlicht: (2026)
RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write
von: Guo, Yan-Cheng, et al.
Veröffentlicht: (2026)
von: Guo, Yan-Cheng, et al.
Veröffentlicht: (2026)
FPGA-based Emulation and Device-Side Management for CXL-based Memory Tiering Systems
von: Chen, Yiqi, et al.
Veröffentlicht: (2025)
von: Chen, Yiqi, et al.
Veröffentlicht: (2025)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
von: Xuan, Zihao, et al.
Veröffentlicht: (2026)
von: Xuan, Zihao, et al.
Veröffentlicht: (2026)
Bancroft: Genomics Acceleration Beyond On-Device Memory
von: Lim, Se-Min, et al.
Veröffentlicht: (2025)
von: Lim, Se-Min, et al.
Veröffentlicht: (2025)
SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
von: Zhang, Jingyao, et al.
Veröffentlicht: (2025)
von: Zhang, Jingyao, et al.
Veröffentlicht: (2025)
CCSS: Hardware-Accelerated RTL Simulation with Fast Combinational Logic Computing and Sequential Logic Synchronization
von: Feng, Weigang, et al.
Veröffentlicht: (2025)
von: Feng, Weigang, et al.
Veröffentlicht: (2025)
T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
von: Wei, Jianyu, et al.
Veröffentlicht: (2025)
von: Wei, Jianyu, et al.
Veröffentlicht: (2025)
Monad: Towards Cost-effective Specialization for Chiplet-based Spatial Accelerators
von: Hao, Xiaochen, et al.
Veröffentlicht: (2023)
von: Hao, Xiaochen, et al.
Veröffentlicht: (2023)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
von: Chen, Yanru, et al.
Veröffentlicht: (2025)
von: Chen, Yanru, et al.
Veröffentlicht: (2025)
PIMSIM-NN: An ISA-based Simulation Framework for Processing-in-Memory Accelerators
von: Wang, Xinyu, et al.
Veröffentlicht: (2024)
von: Wang, Xinyu, et al.
Veröffentlicht: (2024)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
von: Seo, Minseok, et al.
Veröffentlicht: (2024)
von: Seo, Minseok, et al.
Veröffentlicht: (2024)
A Hybrid-Domain Floating-Point Compute-in-Memory Architecture for Efficient Acceleration of High-Precision Deep Neural Networks
von: Yi, Zhiqiang, et al.
Veröffentlicht: (2025)
von: Yi, Zhiqiang, et al.
Veröffentlicht: (2025)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
von: Cheng, Feng, et al.
Veröffentlicht: (2025)
von: Cheng, Feng, et al.
Veröffentlicht: (2025)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
von: Duan, Cenlin, et al.
Veröffentlicht: (2025)
von: Duan, Cenlin, et al.
Veröffentlicht: (2025)
CAMASim: A Comprehensive Simulation Framework for Content-Addressable Memory based Accelerators
von: Li, Mengyuan, et al.
Veröffentlicht: (2024)
von: Li, Mengyuan, et al.
Veröffentlicht: (2024)
SpNeRF: Memory Efficient Sparse Volumetric Neural Rendering Accelerator for Edge Devices
von: Zhang, Yipu, et al.
Veröffentlicht: (2025)
von: Zhang, Yipu, et al.
Veröffentlicht: (2025)
VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
Accelerating Electrostatics-based Global Placement with Enhanced FFT Computation
von: Zhang, Hangyu, et al.
Veröffentlicht: (2025)
von: Zhang, Hangyu, et al.
Veröffentlicht: (2025)
LowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits
von: Zhou, Zikai, et al.
Veröffentlicht: (2025)
von: Zhou, Zikai, et al.
Veröffentlicht: (2025)
Cambricon-LLM: A Chiplet-Based Hybrid Architecture for On-Device Inference of 70B LLM
von: Yu, Zhongkai, et al.
Veröffentlicht: (2024)
von: Yu, Zhongkai, et al.
Veröffentlicht: (2024)
Graphitron: A Domain Specific Language for FPGA-based Graph Processing Accelerator Generation
von: Zhang, Xinmiao, et al.
Veröffentlicht: (2024)
von: Zhang, Xinmiao, et al.
Veröffentlicht: (2024)
CIMR-V: An End-to-End SRAM-based CIM Accelerator with RISC-V for AI Edge Device
von: and, Yan-Cheng Guo, et al.
Veröffentlicht: (2025)
von: and, Yan-Cheng Guo, et al.
Veröffentlicht: (2025)
Voxel-CIM: An Efficient Compute-in-Memory Accelerator for Voxel-based Point Cloud Neural Networks
von: Lin, Xipeng, et al.
Veröffentlicht: (2024)
von: Lin, Xipeng, et al.
Veröffentlicht: (2024)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
von: Chong, Yue Jiet, et al.
Veröffentlicht: (2026)
von: Chong, Yue Jiet, et al.
Veröffentlicht: (2026)
LMB: Augmenting PCIe Devices with CXL-Linked Memory Buffer
von: Wang, Jiapin, et al.
Veröffentlicht: (2024)
von: Wang, Jiapin, et al.
Veröffentlicht: (2024)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
von: Wang, Peipei, et al.
Veröffentlicht: (2025)
von: Wang, Peipei, et al.
Veröffentlicht: (2025)
A Review of SRAM-based Compute-in-Memory Circuits
von: Yoshioka, Kentaro, et al.
Veröffentlicht: (2024)
von: Yoshioka, Kentaro, et al.
Veröffentlicht: (2024)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
von: Wang, Chuanzhen, et al.
Veröffentlicht: (2026)
von: Wang, Chuanzhen, et al.
Veröffentlicht: (2026)
MARCA: Mamba Accelerator with ReConfigurable Architecture
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
Hardware-Software Co-design for 3D-DRAM-based LLM Serving Accelerator
von: Li, Cong, et al.
Veröffentlicht: (2026)
von: Li, Cong, et al.
Veröffentlicht: (2026)
Mapping Space Exploration for Multi-Chiplet Accelerators Targeting LLM Inference Serving Workloads
von: Li, Boyu, et al.
Veröffentlicht: (2025)
von: Li, Boyu, et al.
Veröffentlicht: (2025)
ApproxPilot: A GNN-based Accelerator Approximation Framework
von: Zhang, Qing, et al.
Veröffentlicht: (2024)
von: Zhang, Qing, et al.
Veröffentlicht: (2024)
A Full-Stack Performance Evaluation Infrastructure for 3D-DRAM-based LLM Accelerators
von: Li, Cong, et al.
Veröffentlicht: (2026)
von: Li, Cong, et al.
Veröffentlicht: (2026)
Ironman: Accelerating Oblivious Transfer Extension for Privacy-Preserving AI with Near-Memory Processing
von: Lin, Chenqi, et al.
Veröffentlicht: (2025)
von: Lin, Chenqi, et al.
Veröffentlicht: (2025)
Designing Efficient LLM Accelerators for Edge Devices
von: Haris, Jude, et al.
Veröffentlicht: (2024)
von: Haris, Jude, et al.
Veröffentlicht: (2024)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
An Event-Driven Spiking Compute-In-Memory Macro based on SOT-MRAM
von: Yu, Deyang, et al.
Veröffentlicht: (2025)
von: Yu, Deyang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
TOM: A Ternary Read-only Memory Accelerator for LLM-powered Edge Intelligence
von: Guan, Hongyi, et al.
Veröffentlicht: (2026) -
RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write
von: Guo, Yan-Cheng, et al.
Veröffentlicht: (2026) -
FPGA-based Emulation and Device-Side Management for CXL-based Memory Tiering Systems
von: Chen, Yiqi, et al.
Veröffentlicht: (2025) -
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
von: Xuan, Zihao, et al.
Veröffentlicht: (2026) -
Bancroft: Genomics Acceleration Beyond On-Device Memory
von: Lim, Se-Min, et al.
Veröffentlicht: (2025)