Asynchronous Memory Access Unit: Exploiting Massive Parallelism for Far Memory Access
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Luming, Zhang, Xu, Wang, Songyue, Jiang, Zhuolun, Lu, Tianyue, Chen, Mingyu, Luo, Siwei, Huang, Keji |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoroAMU: Unleashing Memory-Driven Coroutines through Latency-Aware Decoupled Operations
par: Jiang, Zhuolun, et autres
Publié: (2025)
par: Jiang, Zhuolun, et autres
Publié: (2025)
ICP: Exploiting Instruction Correlation for Prefetching Irregular Memory Accesses
par: Li, Mengming, et autres
Publié: (2026)
par: Li, Mengming, et autres
Publié: (2026)
DASICS White Paper: Enhancing Memory Protection with Dynamic Compartmentalization
par: Jin, Yue, et autres
Publié: (2023)
par: Jin, Yue, et autres
Publié: (2023)
Fat-Tree QRAM: A High-Bandwidth Shared Quantum Random Access Memory for Parallel Queries
par: Xu, Shifan, et autres
Publié: (2025)
par: Xu, Shifan, et autres
Publié: (2025)
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
par: Xie, Rui, et autres
Publié: (2025)
par: Xie, Rui, et autres
Publié: (2025)
BARD: Reducing Write Latency of DDR5 Memory by Exploiting Bank-Parallelism
par: Vittal, Suhas, et autres
Publié: (2025)
par: Vittal, Suhas, et autres
Publié: (2025)
NVR: Vector Runahead on NPUs for Sparse Memory Access
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
ORAP: Optimized Row Access Prefetching for Rowhammer-mitigated Memory
par: Merrell, Maccoy, et autres
Publié: (2026)
par: Merrell, Maccoy, et autres
Publié: (2026)
RoMe: Row Granularity Access Memory System for Large Language Models
par: Nam, Hwayong, et autres
Publié: (2025)
par: Nam, Hwayong, et autres
Publié: (2025)
Hemlet: A Heterogeneous Compute-in-Memory Chiplet Architecture for Vision Transformers with Group-Level Parallelism
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
Ironman: Accelerating Oblivious Transfer Extension for Privacy-Preserving AI with Near-Memory Processing
par: Lin, Chenqi, et autres
Publié: (2025)
par: Lin, Chenqi, et autres
Publié: (2025)
A Direct Memory Access Controller (DMAC) for Irregular Data Transfers on RISC-V Linux Systems
par: Benz, Thomas, et autres
Publié: (2025)
par: Benz, Thomas, et autres
Publié: (2025)
Stab-QRAM: An All-Clifford Quantum Random Access Memory for Special Data
par: Li, Guangyi, et autres
Publié: (2025)
par: Li, Guangyi, et autres
Publié: (2025)
Trimma: Trimming Metadata Storage and Latency for Hybrid Memory Systems
par: Li, Yiwei, et autres
Publié: (2024)
par: Li, Yiwei, et autres
Publié: (2024)
TLV-HGNN: Thinking Like a Vertex for Memory-efficient HGNN Inference
par: Han, Dengke, et autres
Publié: (2025)
par: Han, Dengke, et autres
Publié: (2025)
DataMaestro: A Versatile and Efficient Data Streaming Engine Bringing Decoupled Memory Access To Dataflow Accelerators
par: Yi, Xiaoling, et autres
Publié: (2025)
par: Yi, Xiaoling, et autres
Publié: (2025)
LMB: Augmenting PCIe Devices with CXL-Linked Memory Buffer
par: Wang, Jiapin, et autres
Publié: (2024)
par: Wang, Jiapin, et autres
Publié: (2024)
PaCKD: Pattern-Clustered Knowledge Distillation for Compressing Memory Access Prediction Models
par: Gupta, Neelesh, et autres
Publié: (2024)
par: Gupta, Neelesh, et autres
Publié: (2024)
Tensor Manipulation Unit (TMU): Reconfigurable, Near-Memory Tensor Manipulation for High-Throughput AI SoC
par: Zhou, Weiyu, et autres
Publié: (2025)
par: Zhou, Weiyu, et autres
Publié: (2025)
FlexMem: High-Parallel Near-Memory Architecture for Flexible Dataflow in Fully Homomorphic Encryption
par: Shi, Shangyi, et autres
Publié: (2025)
par: Shi, Shangyi, et autres
Publié: (2025)
AraOS: Analyzing the Impact of Virtual Memory Management on Vector Unit Performance
par: Perotti, Matteo, et autres
Publié: (2025)
par: Perotti, Matteo, et autres
Publié: (2025)
Memory Access Characterization of Large Language Models in CPU Environment and its Potential Impacts
par: Banasik, Spencer
Publié: (2025)
par: Banasik, Spencer
Publié: (2025)
Efficient Architecture for RISC-V Vector Memory Access
par: Guan, Hongyi, et autres
Publié: (2025)
par: Guan, Hongyi, et autres
Publié: (2025)
DaPPA: A Data-Parallel Programming Framework for Processing-in-Memory Architectures
par: Oliveira, Geraldo F., et autres
Publié: (2023)
par: Oliveira, Geraldo F., et autres
Publié: (2023)
PIM-GPT: A Hybrid Process-in-Memory Accelerator for Autoregressive Transformers
par: Wu, Yuting, et autres
Publié: (2023)
par: Wu, Yuting, et autres
Publié: (2023)
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
par: Wang, Ruibao, et autres
Publié: (2024)
par: Wang, Ruibao, et autres
Publié: (2024)
A 16 nm 1.60TOPS/W High Utilization DNN Accelerator with 3D Spatial Data Reuse and Efficient Shared Memory Access
par: Yi, Xiaoling, et autres
Publié: (2026)
par: Yi, Xiaoling, et autres
Publié: (2026)
PIM-MMU: A Memory Management Unit for Accelerating Data Transfers in Commercial PIM Systems
par: Lee, Dongjae, et autres
Publié: (2024)
par: Lee, Dongjae, et autres
Publié: (2024)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
par: Li, Huize, et autres
Publié: (2026)
par: Li, Huize, et autres
Publié: (2026)
SPPAM: Signature Pattern Prediction and Access-Map Prefetcher
par: Merrell, Maccoy, et autres
Publié: (2026)
par: Merrell, Maccoy, et autres
Publié: (2026)
ReTern: Exploiting Natural Redundancy and Sign Transformations for Enhanced Fault Tolerance in Compute-in-Memory based Ternary LLMs
par: Malhotra, Akul, et autres
Publié: (2025)
par: Malhotra, Akul, et autres
Publié: (2025)
Voxel-CIM: An Efficient Compute-in-Memory Accelerator for Voxel-based Point Cloud Neural Networks
par: Lin, Xipeng, et autres
Publié: (2024)
par: Lin, Xipeng, et autres
Publié: (2024)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
par: Wang, Chuanzhen, et autres
Publié: (2026)
par: Wang, Chuanzhen, et autres
Publié: (2026)
NeoMem: Hardware/Software Co-Design for CXL-Native Memory Tiering
par: Zhou, Zhe, et autres
Publié: (2024)
par: Zhou, Zhe, et autres
Publié: (2024)
DAE4HLS: Exposing Memory-Level Parallelism for High-Level Synthesis using Explicit Decoupling
par: Metz, David, et autres
Publié: (2026)
par: Metz, David, et autres
Publié: (2026)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
par: Sun, Xiaotian, et autres
Publié: (2024)
par: Sun, Xiaotian, et autres
Publié: (2024)
Allspark: Workload Orchestration for Visual Transformers on Processing In-Memory Systems
par: Ge, Mengke, et autres
Publié: (2024)
par: Ge, Mengke, et autres
Publié: (2024)
PIMSIM-NN: An ISA-based Simulation Framework for Processing-in-Memory Accelerators
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
No One-Size-Fits-All: A Workload-Driven Characterization of Bit-Parallel vs. Bit-Serial Data Layouts for Processing-using-Memory
par: Zhang, Jingyao, et autres
Publié: (2025)
par: Zhang, Jingyao, et autres
Publié: (2025)
Documents similaires
-
CoroAMU: Unleashing Memory-Driven Coroutines through Latency-Aware Decoupled Operations
par: Jiang, Zhuolun, et autres
Publié: (2025) -
ICP: Exploiting Instruction Correlation for Prefetching Irregular Memory Accesses
par: Li, Mengming, et autres
Publié: (2026) -
DASICS White Paper: Enhancing Memory Protection with Dynamic Compartmentalization
par: Jin, Yue, et autres
Publié: (2023) -
Fat-Tree QRAM: A High-Bandwidth Shared Quantum Random Access Memory for Parallel Queries
par: Xu, Shifan, et autres
Publié: (2025) -
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
par: Xie, Rui, et autres
Publié: (2025)