Optimizing and Exploring System Performance in Compact Processing-in-Memory-based Chips
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Peilin, Yang, Xiaoxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration
par: Chen, Peilin, et autres
Publié: (2025)
par: Chen, Peilin, et autres
Publié: (2025)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025)
par: Yang, Xiaoxuan, et autres
Publié: (2025)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching
par: Gao, Hanyuan, et autres
Publié: (2026)
par: Gao, Hanyuan, et autres
Publié: (2026)
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
par: Wang, Ruibao, et autres
Publié: (2024)
par: Wang, Ruibao, et autres
Publié: (2024)
Allspark: Workload Orchestration for Visual Transformers on Processing In-Memory Systems
par: Ge, Mengke, et autres
Publié: (2024)
par: Ge, Mengke, et autres
Publié: (2024)
EONSim: An NPU Simulator for On-Chip Memory and Embedding Vector Operations
par: Choi, Sangun, et autres
Publié: (2025)
par: Choi, Sangun, et autres
Publié: (2025)
Theseus: Exploring Efficient Wafer-Scale Chip Design for Large Language Models
par: Zhu, Jingchen, et autres
Publié: (2024)
par: Zhu, Jingchen, et autres
Publié: (2024)
PIMSIM-NN: An ISA-based Simulation Framework for Processing-in-Memory Accelerators
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
Retrieve, Schedule, Reflect: LLM Agents for Chip QoR Optimization
par: ouyang, Yikang, et autres
Publié: (2026)
par: ouyang, Yikang, et autres
Publié: (2026)
Search-in-Memory (SiM): Reliable, Versatile, and Efficient Data Matching in SSD's NAND Flash Memory Chip for Data Indexing Acceleration
par: Chen, Yun-Chih, et autres
Publié: (2024)
par: Chen, Yun-Chih, et autres
Publié: (2024)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
par: Duan, Cenlin, et autres
Publié: (2025)
par: Duan, Cenlin, et autres
Publié: (2025)
TEMP: A Memory Efficient Physical-aware Tensor Partition-Mapping Framework on Wafer-scale Chips
par: Wang, Huizheng, et autres
Publié: (2025)
par: Wang, Huizheng, et autres
Publié: (2025)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
par: Wolters, Christopher, et autres
Publié: (2024)
par: Wolters, Christopher, et autres
Publié: (2024)
DL-PIM: Improving Data Locality in Processing-in-Memory Systems
par: Tian, Parker Hao, et autres
Publié: (2025)
par: Tian, Parker Hao, et autres
Publié: (2025)
Co-Designing Graph-based Approximate Nearest Neighbor Search at Billion Scale for Processing-in-Memory
par: Chen, Sitian, et autres
Publié: (2026)
par: Chen, Sitian, et autres
Publié: (2026)
Optimized Memory System Architecture for VESA VDC-M Decoder with Multi-Slice Support
par: Yang, Hannah, et autres
Publié: (2025)
par: Yang, Hannah, et autres
Publié: (2025)
FPGA-based Emulation and Device-Side Management for CXL-based Memory Tiering Systems
par: Chen, Yiqi, et autres
Publié: (2025)
par: Chen, Yiqi, et autres
Publié: (2025)
FPGA-based Hyrbid Memory Emulation System
par: Wen, Fei, et autres
Publié: (2020)
par: Wen, Fei, et autres
Publié: (2020)
Resilient and Secure Programmable System-on-Chip Accelerator Offload
par: Gouveia, Inês Pinto, et autres
Publié: (2024)
par: Gouveia, Inês Pinto, et autres
Publié: (2024)
HFRWKV: A High-Performance Fully On-Chip Hardware Accelerator for RWKV
par: Shijie, Liu, et autres
Publié: (2026)
par: Shijie, Liu, et autres
Publié: (2026)
Triangel: A High-Performance, Accurate, Timely On-Chip Temporal Prefetcher
par: Ainsworth, Sam, et autres
Publié: (2024)
par: Ainsworth, Sam, et autres
Publié: (2024)
LinkBo: An Adaptive Single-Wire, Low-Latency, and Fault-Tolerant Communications Interface for Variable-Distance Chip-to-Chip Systems
par: Ye, Bochen, et autres
Publié: (2025)
par: Ye, Bochen, et autres
Publié: (2025)
Per-Bank Memory Bandwidth Regulation for Predictable and Performant Real-Time System
par: Sullivan, Connor Rudy, et autres
Publié: (2026)
par: Sullivan, Connor Rudy, et autres
Publié: (2026)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
par: Sun, Xiaotian, et autres
Publié: (2024)
par: Sun, Xiaotian, et autres
Publié: (2024)
Exploring DRAM Cache Prefetching for Pooled Memory
par: Tirumalasetty, Chandrahas, et autres
Publié: (2024)
par: Tirumalasetty, Chandrahas, et autres
Publié: (2024)
Large Processor Chip Model
par: Chang, Kaiyan, et autres
Publié: (2025)
par: Chang, Kaiyan, et autres
Publié: (2025)
Ironman: Accelerating Oblivious Transfer Extension for Privacy-Preserving AI with Near-Memory Processing
par: Lin, Chenqi, et autres
Publié: (2025)
par: Lin, Chenqi, et autres
Publié: (2025)
Enabling Efficient Transaction Processing on CXL-Based Memory Sharing
par: Wang, Zhao, et autres
Publié: (2025)
par: Wang, Zhao, et autres
Publié: (2025)
Beyond Static Policies: Exploring Dynamic Policy Selection for Single-Thread Performance Optimization
par: Zhang, Yanxin, et autres
Publié: (2026)
par: Zhang, Yanxin, et autres
Publié: (2026)
MCMComm: Hardware-Software Co-Optimization for End-to-End Communication in Multi-Chip-Modules
par: Raj, Ritik, et autres
Publié: (2025)
par: Raj, Ritik, et autres
Publié: (2025)
ChipLight: Cross-Layer Optimization of Chiplet Design with Optical Interconnects for LLM Training
par: Bai, Kangbo, et autres
Publié: (2026)
par: Bai, Kangbo, et autres
Publié: (2026)
Ultra Low-Power SDM-based Circuit-Switching for Networks-on-Chip
par: Zaeemi, Meysam, et autres
Publié: (2026)
par: Zaeemi, Meysam, et autres
Publié: (2026)
HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip
par: Tsai, Pei-Huan, et autres
Publié: (2026)
par: Tsai, Pei-Huan, et autres
Publié: (2026)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
par: Seo, Minseok, et autres
Publié: (2024)
par: Seo, Minseok, et autres
Publié: (2024)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
par: Li, Huize, et autres
Publié: (2026)
par: Li, Huize, et autres
Publié: (2026)
SAL-PIM: A Subarray-level Processing-in-Memory Architecture with LUT-based Linear Interpolation for Transformer-based Text Generation
par: Han, Wontak, et autres
Publié: (2024)
par: Han, Wontak, et autres
Publié: (2024)
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
par: Lee, Dongjae, et autres
Publié: (2025)
par: Lee, Dongjae, et autres
Publié: (2025)
PUMA: Efficient and Low-Cost Memory Allocation and Alignment Support for Processing-Using-Memory Architectures
par: Oliveira, Geraldo F., et autres
Publié: (2024)
par: Oliveira, Geraldo F., et autres
Publié: (2024)
SLDB: An End-To-End Heterogeneous System-on-Chip Benchmark Suite for LLM-Aided Design
par: Alvanaki, Elisavet Lydia, et autres
Publié: (2025)
par: Alvanaki, Elisavet Lydia, et autres
Publié: (2025)
Documents similaires
-
Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration
par: Chen, Peilin, et autres
Publié: (2025) -
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025) -
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
par: Cheng, Feng, et autres
Publié: (2025) -
Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching
par: Gao, Hanyuan, et autres
Publié: (2026) -
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
par: Wang, Ruibao, et autres
Publié: (2024)