HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Taiqiang, Ding, Chenchen, Zhou, Wenyong, Cheng, Yuxin, Feng, Xincheng, Wang, Shuqi, Xu, Wendong, Shi, Chufan, Liu, Zhengwu, Wong, Ngai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
par: Zhou, Wenyong, et autres
Publié: (2025)
par: Zhou, Wenyong, et autres
Publié: (2025)
HPD: Hybrid Projection Decomposition for Robust State Space Models on Analog CIM Hardware
par: Feng, Yuannuo, et autres
Publié: (2025)
par: Feng, Yuannuo, et autres
Publié: (2025)
Extending Straight-Through Estimation for Robust Neural Networks on Analog CIM Hardware
par: Feng, Yuannuo, et autres
Publié: (2025)
par: Feng, Yuannuo, et autres
Publié: (2025)
A Time- and Energy-Efficient CNN with Dense Connections on Memristor-Based Chips
par: Zhou, Wenyong, et autres
Publié: (2025)
par: Zhou, Wenyong, et autres
Publié: (2025)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
par: Chong, Yue Jiet, et autres
Publié: (2026)
par: Chong, Yue Jiet, et autres
Publié: (2026)
In-Memory Computing Architecture for Efficient Hardware Security
par: Ajmi, Hala, et autres
Publié: (2024)
par: Ajmi, Hala, et autres
Publié: (2024)
Accelerating PageRank Algorithmic Tasks with a new Programmable Hardware Architecture
par: Chowdhury, Md Rownak Hossain, et autres
Publié: (2024)
par: Chowdhury, Md Rownak Hossain, et autres
Publié: (2024)
An Efficient Sparse Hardware Accelerator for Spike-Driven Transformer
par: Li, Zhengke, et autres
Publié: (2025)
par: Li, Zhengke, et autres
Publié: (2025)
Towards the Certification of Hybrid Architectures: Analysing Interference on Hardware Accelerators through PML
par: Lesage, Benjamin, et autres
Publié: (2024)
par: Lesage, Benjamin, et autres
Publié: (2024)
Hardware Memory Management for Future Mobile Hybrid Memory Systems
par: Wen, Fei, et autres
Publié: (2020)
par: Wen, Fei, et autres
Publié: (2020)
PUMA: Efficient and Low-Cost Memory Allocation and Alignment Support for Processing-Using-Memory Architectures
par: Oliveira, Geraldo F., et autres
Publié: (2024)
par: Oliveira, Geraldo F., et autres
Publié: (2024)
QED: Scalable Verification of Hardware Memory Consistency
par: Ravi, Gokulan, et autres
Publié: (2024)
par: Ravi, Gokulan, et autres
Publié: (2024)
An Event-Driven Spiking Compute-In-Memory Macro based on SOT-MRAM
par: Yu, Deyang, et autres
Publié: (2025)
par: Yu, Deyang, et autres
Publié: (2025)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
par: Wang, Chuanzhen, et autres
Publié: (2026)
par: Wang, Chuanzhen, et autres
Publié: (2026)
Hardware-based Heterogeneous Memory Management for Large Language Model Inference
par: Hwang, Soojin, et autres
Publié: (2025)
par: Hwang, Soojin, et autres
Publié: (2025)
Xpikeformer: Hybrid Analog-Digital Hardware Acceleration for Spiking Transformers
par: Song, Zihang, et autres
Publié: (2024)
par: Song, Zihang, et autres
Publié: (2024)
Hybrid SLC-MLC RRAM Mixed-Signal Processing-in-Memory Architecture for Transformer Acceleration via Gradient Redistribution
par: Song, Chang Eun, et autres
Publié: (2025)
par: Song, Chang Eun, et autres
Publié: (2025)
CiMNet: Towards Joint Optimization for DNN Architecture and Configuration for Compute-In-Memory Hardware
par: Kundu, Souvik, et autres
Publié: (2024)
par: Kundu, Souvik, et autres
Publié: (2024)
HLStrans: Dataset for C-to-HLS Hardware Code Synthesis
par: Zou, Qingyun, et autres
Publié: (2025)
par: Zou, Qingyun, et autres
Publié: (2025)
SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations
par: Wang, Zhican, et autres
Publié: (2025)
par: Wang, Zhican, et autres
Publié: (2025)
Cocco: Hardware-Mapping Co-Exploration towards Memory Capacity-Communication Optimization
par: Tan, Zhanhong, et autres
Publié: (2024)
par: Tan, Zhanhong, et autres
Publié: (2024)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
par: Kim, Dong Eun, et autres
Publié: (2025)
par: Kim, Dong Eun, et autres
Publié: (2025)
NeoMem: Hardware/Software Co-Design for CXL-Native Memory Tiering
par: Zhou, Zhe, et autres
Publié: (2024)
par: Zhou, Zhe, et autres
Publié: (2024)
GEM3D CIM General Purpose Matrix Computation Using 3D Integrated SRAM eDRAM Hybrid Compute In Memory on Memory Architecture
par: Chakraborty, Subhradip, et autres
Publié: (2026)
par: Chakraborty, Subhradip, et autres
Publié: (2026)
A Hybrid-Domain Floating-Point Compute-in-Memory Architecture for Efficient Acceleration of High-Precision Deep Neural Networks
par: Yi, Zhiqiang, et autres
Publié: (2025)
par: Yi, Zhiqiang, et autres
Publié: (2025)
VeRA+: Vector-Based Lightweight Digital Compensation for Drift-Resilient RRAM In-Memory Computing
par: Dong, Weirong, et autres
Publié: (2026)
par: Dong, Weirong, et autres
Publié: (2026)
Inclusive-PIM: Hardware-Software Co-design for Broad Acceleration on Commercial PIM Architectures
par: Alsop, Johnathan, et autres
Publié: (2023)
par: Alsop, Johnathan, et autres
Publié: (2023)
Adaptive Hybrid FFT: A Novel Pipeline and Memory-Based Architecture for Radix-$2^k$ FFT in Large Size Processing
par: Zhao, Fangyu, et autres
Publié: (2025)
par: Zhao, Fangyu, et autres
Publié: (2025)
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
par: Dumoulin, Joren, et autres
Publié: (2025)
par: Dumoulin, Joren, et autres
Publié: (2025)
CDM-QTA: Quantized Training Acceleration for Efficient LoRA Fine-Tuning of Diffusion Model
par: Lu, Jinming, et autres
Publié: (2025)
par: Lu, Jinming, et autres
Publié: (2025)
Limited Read-Write/Set Hardware Transactional Memory without modifying the ISA or the Coherence Protocol
par: Kafousis, Konstantinos
Publié: (2025)
par: Kafousis, Konstantinos
Publié: (2025)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
PULSE: Parametric Hardware Units for Low-power Sparsity-Aware Convolution Engine
par: Aliyev, Ilkin, et autres
Publié: (2024)
par: Aliyev, Ilkin, et autres
Publié: (2024)
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
par: Lee, Dongjae, et autres
Publié: (2025)
par: Lee, Dongjae, et autres
Publié: (2025)
Efficient Page Migration in Hybrid Memory Systems
par: Upasna, et autres
Publié: (2026)
par: Upasna, et autres
Publié: (2026)
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
par: Zhao, Shixin, et autres
Publié: (2025)
par: Zhao, Shixin, et autres
Publié: (2025)
Bi-SamplerZ: A Hardware-Efficient Gaussian Sampler Architecture for Quantum-Resistant Falcon Signatures
par: Zhao, Binke, et autres
Publié: (2025)
par: Zhao, Binke, et autres
Publié: (2025)
A Fully Pipelined FIFO Based Polynomial Multiplication Hardware Architecture Based On Number Theoretic Transform
par: Heidarpur, Moslem, et autres
Publié: (2025)
par: Heidarpur, Moslem, et autres
Publié: (2025)
SkyByte: Architecting an Efficient Memory-Semantic CXL-based SSD with OS and Hardware Co-design
par: Zhang, Haoyang, et autres
Publié: (2025)
par: Zhang, Haoyang, et autres
Publié: (2025)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
par: Shao, Haikuo, et autres
Publié: (2024)
par: Shao, Haikuo, et autres
Publié: (2024)
Documents similaires
-
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
par: Zhou, Wenyong, et autres
Publié: (2025) -
HPD: Hybrid Projection Decomposition for Robust State Space Models on Analog CIM Hardware
par: Feng, Yuannuo, et autres
Publié: (2025) -
Extending Straight-Through Estimation for Robust Neural Networks on Analog CIM Hardware
par: Feng, Yuannuo, et autres
Publié: (2025) -
A Time- and Energy-Efficient CNN with Dense Connections on Memristor-Based Chips
par: Zhou, Wenyong, et autres
Publié: (2025) -
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
par: Chong, Yue Jiet, et autres
Publié: (2026)