RoMe: Row Granularity Access Memory System for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nam, Hwayong, Baek, Seungmin, Kim, Jumin, Kim, Michael Jaemin, Ahn, Jung Ho |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SoK: Systematizing a Decade of Architectural RowHammer Defenses Through the Lens of Streaming Algorithms
par: Kim, Michael Jaemin, et autres
Publié: (2025)
par: Kim, Michael Jaemin, et autres
Publié: (2025)
PVAC: A RowHammer Mitigation Architecture Exploiting Per-victim-row Counting
par: Kim, Jumin, et autres
Publié: (2026)
par: Kim, Jumin, et autres
Publié: (2026)
Per-Row Activation Counting on Real Hardware: Demystifying Performance Overheads
par: Kim, Jumin, et autres
Publié: (2025)
par: Kim, Jumin, et autres
Publié: (2025)
DRAMScope: Uncovering DRAM Microarchitecture and Characteristics by Issuing Memory Commands
par: Nam, Hwayong, et autres
Publié: (2024)
par: Nam, Hwayong, et autres
Publié: (2024)
Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts
par: Yun, Sungmin, et autres
Publié: (2025)
par: Yun, Sungmin, et autres
Publié: (2025)
Sudoku: Decomposing DRAM Address Mapping into Component Functions
par: Wi, Minbok, et autres
Publié: (2025)
par: Wi, Minbok, et autres
Publié: (2025)
ORAP: Optimized Row Access Prefetching for Rowhammer-mitigated Memory
par: Merrell, Maccoy, et autres
Publié: (2026)
par: Merrell, Maccoy, et autres
Publié: (2026)
Hardware-based Heterogeneous Memory Management for Large Language Model Inference
par: Hwang, Soojin, et autres
Publié: (2025)
par: Hwang, Soojin, et autres
Publié: (2025)
CiFHER: A Chiplet-Based FHE Accelerator with a Resizable Structure
par: Kim, Sangpyo, et autres
Publié: (2023)
par: Kim, Sangpyo, et autres
Publié: (2023)
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
par: Yun, Sungmin, et autres
Publié: (2024)
par: Yun, Sungmin, et autres
Publié: (2024)
Theodosian: A Deep Dive into Memory-Hierarchy-Centric FHE Acceleration
par: Choi, Wonseok, et autres
Publié: (2025)
par: Choi, Wonseok, et autres
Publié: (2025)
CoMeT: Count-Min-Sketch-based Row Tracking to Mitigate RowHammer at Low Cost
par: Bostanci, F. Nisa, et autres
Publié: (2024)
par: Bostanci, F. Nisa, et autres
Publié: (2024)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
par: Seo, Minseok, et autres
Publié: (2024)
par: Seo, Minseok, et autres
Publié: (2024)
SSD Offloading for LLM Mixture-of-Experts Weights Considered Harmful in Energy Efficiency
par: Kyung, Kwanhee, et autres
Publié: (2025)
par: Kyung, Kwanhee, et autres
Publié: (2025)
AnalogToBi: Device-Level Analog Circuit Topology Generation via Bipartite Graph and Grammar Guided Decoding
par: Kim, Seungmin, et autres
Publié: (2026)
par: Kim, Seungmin, et autres
Publié: (2026)
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
par: Gouk, Donghyun, et autres
Publié: (2025)
par: Gouk, Donghyun, et autres
Publié: (2025)
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
par: Moon, Seungjae, et autres
Publié: (2024)
par: Moon, Seungjae, et autres
Publié: (2024)
Securing DRAM at Scale: ARFM-Driven Row Hammer Defense with Unveiling the Threat of Short tRC Patterns
par: Joo, Nogeun, et autres
Publié: (2025)
par: Joo, Nogeun, et autres
Publié: (2025)
Cosmos: A CXL-Based Full In-Memory System for Approximate Nearest Neighbor Search
par: Ko, Seoyoung, et autres
Publié: (2025)
par: Ko, Seoyoung, et autres
Publié: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
par: Kim, Wonung, et autres
Publié: (2025)
par: Kim, Wonung, et autres
Publié: (2025)
Optimized Memory System Architecture for VESA VDC-M Decoder with Multi-Slice Support
par: Yang, Hannah, et autres
Publié: (2025)
par: Yang, Hannah, et autres
Publié: (2025)
IVE: An Accelerator for Single-Server Private Information Retrieval Using Versatile Processing Elements
par: Kim, Sangpyo, et autres
Publié: (2025)
par: Kim, Sangpyo, et autres
Publié: (2025)
Asynchronous Memory Access Unit: Exploiting Massive Parallelism for Far Memory Access
par: Wang, Luming, et autres
Publié: (2024)
par: Wang, Luming, et autres
Publié: (2024)
A Direct Memory Access Controller (DMAC) for Irregular Data Transfers on RISC-V Linux Systems
par: Benz, Thomas, et autres
Publié: (2025)
par: Benz, Thomas, et autres
Publié: (2025)
Memory Access Characterization of Large Language Models in CPU Environment and its Potential Impacts
par: Banasik, Spencer
Publié: (2025)
par: Banasik, Spencer
Publié: (2025)
Cerberus: Cross-Layer ECC Co-Design for Robust and Efficient Memory Protection
par: Kim, Junhwan, et autres
Publié: (2026)
par: Kim, Junhwan, et autres
Publié: (2026)
Bandwidth-Effective DRAM Cache for GPUs with Storage-Class Memory
par: Hong, Jeongmin, et autres
Publié: (2024)
par: Hong, Jeongmin, et autres
Publié: (2024)
Smart-Infinity: Fast Large Language Model Training using Near-Storage Processing on a Real System
par: Jang, Hongsun, et autres
Publié: (2024)
par: Jang, Hongsun, et autres
Publié: (2024)
From Block to Byte: Transforming PCIe SSDs with CXL Memory Protocol and Instruction Annotation
par: Kwon, Miryeong, et autres
Publié: (2025)
par: Kwon, Miryeong, et autres
Publié: (2025)
Hybrid SLC-MLC RRAM Mixed-Signal Processing-in-Memory Architecture for Transformer Acceleration via Gradient Redistribution
par: Song, Chang Eun, et autres
Publié: (2025)
par: Song, Chang Eun, et autres
Publié: (2025)
PIM-MMU: A Memory Management Unit for Accelerating Data Transfers in Commercial PIM Systems
par: Lee, Dongjae, et autres
Publié: (2024)
par: Lee, Dongjae, et autres
Publié: (2024)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
par: Duan, Cenlin, et autres
Publié: (2025)
par: Duan, Cenlin, et autres
Publié: (2025)
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
par: Xie, Rui, et autres
Publié: (2025)
par: Xie, Rui, et autres
Publié: (2025)
HammerSim: A System-Level Tool to Model RowHammer
par: Goswami, Kaustav, et autres
Publié: (2026)
par: Goswami, Kaustav, et autres
Publié: (2026)
Compromising the Intelligence of Modern DNNs: On the Effectiveness of Targeted RowPress
par: Zhou, Ranyang, et autres
Publié: (2024)
par: Zhou, Ranyang, et autres
Publié: (2024)
A Review on Proprietary Accelerators for Large Language Models
par: Park, Sihyeong, et autres
Publié: (2025)
par: Park, Sihyeong, et autres
Publié: (2025)
GPIR: Enabling Practical Private Information Retrieval with GPUs
par: Ji, Hyesung, et autres
Publié: (2026)
par: Ji, Hyesung, et autres
Publié: (2026)
SAL-PIM: A Subarray-level Processing-in-Memory Architecture with LUT-based Linear Interpolation for Transformer-based Text Generation
par: Han, Wontak, et autres
Publié: (2024)
par: Han, Wontak, et autres
Publié: (2024)
ICP: Exploiting Instruction Correlation for Prefetching Irregular Memory Accesses
par: Li, Mengming, et autres
Publié: (2026)
par: Li, Mengming, et autres
Publié: (2026)
Piccolo: Large-Scale Graph Processing with Fine-Grained In-Memory Scatter-Gather
par: Shin, Changmin, et autres
Publié: (2025)
par: Shin, Changmin, et autres
Publié: (2025)
Documents similaires
-
SoK: Systematizing a Decade of Architectural RowHammer Defenses Through the Lens of Streaming Algorithms
par: Kim, Michael Jaemin, et autres
Publié: (2025) -
PVAC: A RowHammer Mitigation Architecture Exploiting Per-victim-row Counting
par: Kim, Jumin, et autres
Publié: (2026) -
Per-Row Activation Counting on Real Hardware: Demystifying Performance Overheads
par: Kim, Jumin, et autres
Publié: (2025) -
DRAMScope: Uncovering DRAM Microarchitecture and Characteristics by Issuing Memory Commands
par: Nam, Hwayong, et autres
Publié: (2024) -
Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts
par: Yun, Sungmin, et autres
Publié: (2025)