CMD: A Cache-assisted GPU Memory Deduplication Architecture
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Wei, Feng, Dan, Tong, Wei, Wei, Xueliang, Wu, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression
di: Cheng, Feng, et al.
Pubblicazione: (2025)
di: Cheng, Feng, et al.
Pubblicazione: (2025)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
di: Li, Huize, et al.
Pubblicazione: (2026)
di: Li, Huize, et al.
Pubblicazione: (2026)
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
di: Gouk, Donghyun, et al.
Pubblicazione: (2025)
di: Gouk, Donghyun, et al.
Pubblicazione: (2025)
PIM-GPT: A Hybrid Process-in-Memory Accelerator for Autoregressive Transformers
di: Wu, Yuting, et al.
Pubblicazione: (2023)
di: Wu, Yuting, et al.
Pubblicazione: (2023)
An O(m+n)-Space Spatiotemporal Denoising Filter with Cache-Like Memories for Dynamic Vision Sensors
di: Zhao, Qinghang, et al.
Pubblicazione: (2024)
di: Zhao, Qinghang, et al.
Pubblicazione: (2024)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
di: Xuan, Zihao, et al.
Pubblicazione: (2026)
di: Xuan, Zihao, et al.
Pubblicazione: (2026)
Exploring DRAM Cache Prefetching for Pooled Memory
di: Tirumalasetty, Chandrahas, et al.
Pubblicazione: (2024)
di: Tirumalasetty, Chandrahas, et al.
Pubblicazione: (2024)
Benchmarking and Dissecting the Nvidia Hopper GPU Architecture
di: Luo, Weile, et al.
Pubblicazione: (2024)
di: Luo, Weile, et al.
Pubblicazione: (2024)
Improving the Representativeness of Simulation Intervals for the Cache Memory System
di: Bueno, Nicolas, et al.
Pubblicazione: (2024)
di: Bueno, Nicolas, et al.
Pubblicazione: (2024)
Multiport Support for Vortex OpenGPU Memory Hierarchy
di: Shin, Injae, et al.
Pubblicazione: (2025)
di: Shin, Injae, et al.
Pubblicazione: (2025)
WebGPU-SPY: Finding Fingerprints in the Sandbox through GPU Cache Attacks
di: Ferguson, Ethan, et al.
Pubblicazione: (2024)
di: Ferguson, Ethan, et al.
Pubblicazione: (2024)
Bandwidth-Effective DRAM Cache for GPUs with Storage-Class Memory
di: Hong, Jeongmin, et al.
Pubblicazione: (2024)
di: Hong, Jeongmin, et al.
Pubblicazione: (2024)
Thermal Analysis for NVIDIA GTX480 Fermi GPU Architecture
di: Nagendra, Savinay
Pubblicazione: (2024)
di: Nagendra, Savinay
Pubblicazione: (2024)
ARCANE: Adaptive RISC-V Cache Architecture for Near-memory Extensions
di: Petrolo, Vincenzo, et al.
Pubblicazione: (2025)
di: Petrolo, Vincenzo, et al.
Pubblicazione: (2025)
Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching
di: Gao, Hanyuan, et al.
Pubblicazione: (2026)
di: Gao, Hanyuan, et al.
Pubblicazione: (2026)
Efficient LLM inference solution on Intel GPU
di: Wu, Hui, et al.
Pubblicazione: (2023)
di: Wu, Hui, et al.
Pubblicazione: (2023)
MERE: Hardware-Software Co-Design for Masking Cache Miss Latency in Embedded Processors
di: You, Dean, et al.
Pubblicazione: (2025)
di: You, Dean, et al.
Pubblicazione: (2025)
The Avatar Cache: Enabling On-Demand Security with Morphable Cache Architecture
di: Bhatla, Anubhav, et al.
Pubblicazione: (2026)
di: Bhatla, Anubhav, et al.
Pubblicazione: (2026)
Random and Safe Cache Architecture to Defeat Cache Timing Attacks
di: Hu, Guangyuan, et al.
Pubblicazione: (2023)
di: Hu, Guangyuan, et al.
Pubblicazione: (2023)
Rhea: a Framework for Fast Design and Validation of RTL Cache-Coherent Memory Subsystems
di: Zoni, Davide, et al.
Pubblicazione: (2025)
di: Zoni, Davide, et al.
Pubblicazione: (2025)
Search-in-Memory (SiM): Reliable, Versatile, and Efficient Data Matching in SSD's NAND Flash Memory Chip for Data Indexing Acceleration
di: Chen, Yun-Chih, et al.
Pubblicazione: (2024)
di: Chen, Yun-Chih, et al.
Pubblicazione: (2024)
Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
di: Kim, Dowon, et al.
Pubblicazione: (2025)
di: Kim, Dowon, et al.
Pubblicazione: (2025)
A Memory-Efficient Retrieval Architecture for RAG-Enabled Wearable Medical LLMs-Agents
di: Liao, Zhipeng, et al.
Pubblicazione: (2025)
di: Liao, Zhipeng, et al.
Pubblicazione: (2025)
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
di: Lee, Dongjae, et al.
Pubblicazione: (2025)
di: Lee, Dongjae, et al.
Pubblicazione: (2025)
A System Architecture for Low Latency Multiprogramming Quantum Computing
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
In-Memory Computing Architecture for Efficient Hardware Security
di: Ajmi, Hala, et al.
Pubblicazione: (2024)
di: Ajmi, Hala, et al.
Pubblicazione: (2024)
Enabling Efficient Transaction Processing on CXL-Based Memory Sharing
di: Wang, Zhao, et al.
Pubblicazione: (2025)
di: Wang, Zhao, et al.
Pubblicazione: (2025)
PREFENDER: A Prefetching Defender against Cache Side Channel Attacks as A Pretender
di: Li, Luyi, et al.
Pubblicazione: (2023)
di: Li, Luyi, et al.
Pubblicazione: (2023)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
di: Zhao, Shixin, et al.
Pubblicazione: (2025)
di: Zhao, Shixin, et al.
Pubblicazione: (2025)
A Near-Cache Architectural Framework for Cryptographic Computing
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
di: Liu, Lian, et al.
Pubblicazione: (2025)
di: Liu, Lian, et al.
Pubblicazione: (2025)
PUMA: Efficient and Low-Cost Memory Allocation and Alignment Support for Processing-Using-Memory Architectures
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2024)
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2024)
Adaptive Hybrid FFT: A Novel Pipeline and Memory-Based Architecture for Radix-$2^k$ FFT in Large Size Processing
di: Zhao, Fangyu, et al.
Pubblicazione: (2025)
di: Zhao, Fangyu, et al.
Pubblicazione: (2025)
DaPPA: A Data-Parallel Programming Framework for Processing-in-Memory Architectures
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2023)
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2023)
A Scalable FPGA Architecture With Adaptive Memory Utilization for GEMM-Based Operations
di: Petropoulos, Anastasios, et al.
Pubblicazione: (2025)
di: Petropoulos, Anastasios, et al.
Pubblicazione: (2025)
UniCAIM: A Unified CAM/CIM Architecture with Static-Dynamic KV Cache Pruning for Efficient Long-Context LLM Inference
di: Xu, Weikai, et al.
Pubblicazione: (2025)
di: Xu, Weikai, et al.
Pubblicazione: (2025)
RoboGPU: Accelerating GPU Collision Detection for Robotics
di: Liu, Lufei, et al.
Pubblicazione: (2026)
di: Liu, Lufei, et al.
Pubblicazione: (2026)
CuLifter: Lifting GPU Binaries to Typed IR
di: Zhao, Jisheng, et al.
Pubblicazione: (2026)
di: Zhao, Jisheng, et al.
Pubblicazione: (2026)
APACHE: A Processing-Near-Memory Architecture for Multi-Scheme Fully Homomorphic Encryption
di: Ding, Lin, et al.
Pubblicazione: (2024)
di: Ding, Lin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression
di: Cheng, Feng, et al.
Pubblicazione: (2025) -
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
di: Li, Huize, et al.
Pubblicazione: (2026) -
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
di: Gouk, Donghyun, et al.
Pubblicazione: (2025) -
PIM-GPT: A Hybrid Process-in-Memory Accelerator for Autoregressive Transformers
di: Wu, Yuting, et al.
Pubblicazione: (2023) -
An O(m+n)-Space Spatiotemporal Denoising Filter with Cache-Like Memories for Dynamic Vision Sensors
di: Zhao, Qinghang, et al.
Pubblicazione: (2024)