Mitigating the Memory Bottleneck with Machine Learning-Driven and Data-Aware Microarchitectural Techniques
Fuente:
arXiv
Salvato in:
| Autore principale: | Bera, Rahul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Machine Learning-Driven Intelligent Memory System Design: From On-Chip Caches to Storage
di: Bera, Rahul, et al.
Pubblicazione: (2026)
di: Bera, Rahul, et al.
Pubblicazione: (2026)
Athena: Synergizing Data Prefetching and Off-Chip Prediction via Online Reinforcement Learning
di: Bera, Rahul, et al.
Pubblicazione: (2026)
di: Bera, Rahul, et al.
Pubblicazione: (2026)
Chameleon: Adaptive Caching and Scheduling for Many-Adapter LLM Inference Environments
di: Iliakopoulou, Nikoleta, et al.
Pubblicazione: (2024)
di: Iliakopoulou, Nikoleta, et al.
Pubblicazione: (2024)
Affinity Tailor: Dynamic Locality-Aware Scheduling at Scale
di: Ng, Jin Xin, et al.
Pubblicazione: (2026)
di: Ng, Jin Xin, et al.
Pubblicazione: (2026)
Lincoln AI Computing Survey (LAICS) and Trends
di: Reuther, Albert, et al.
Pubblicazione: (2025)
di: Reuther, Albert, et al.
Pubblicazione: (2025)
T3: Transparent Tracking & Triggering for Fine-grained Overlap of Compute & Collectives
di: Pati, Suchita, et al.
Pubblicazione: (2024)
di: Pati, Suchita, et al.
Pubblicazione: (2024)
Evaluating Emerging AI/ML Accelerators: IPU, RDU, and NVIDIA/AMD GPUs
di: Peng, Hongwu, et al.
Pubblicazione: (2023)
di: Peng, Hongwu, et al.
Pubblicazione: (2023)
Multi-Objective Memory Bandwidth Regulation and Cache Partitioning for Multicore Real-Time Systems
di: Sun, Binqi, et al.
Pubblicazione: (2025)
di: Sun, Binqi, et al.
Pubblicazione: (2025)
Random Adaptive Cache Placement Policy
di: Ahire, Vrushank, et al.
Pubblicazione: (2025)
di: Ahire, Vrushank, et al.
Pubblicazione: (2025)
The Hitchhiker's Guide to Programming and Optimizing Cache Coherent Heterogeneous Systems: CXL, NVLink-C2C, and AMD Infinity Fabric
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
LLaMCAT: Optimizing Large Language Model Inference with Cache Arbitration and Throttling
di: Zhou, Zhongchun, et al.
Pubblicazione: (2025)
di: Zhou, Zhongchun, et al.
Pubblicazione: (2025)
PIMDAL: Mitigating the Memory Bottleneck in Data Analytics using a Real Processing-in-Memory System
di: Frouzakis, Manos, et al.
Pubblicazione: (2025)
di: Frouzakis, Manos, et al.
Pubblicazione: (2025)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
di: Yang, Peiming, et al.
Pubblicazione: (2025)
di: Yang, Peiming, et al.
Pubblicazione: (2025)
Exploring the Design Space for Message-Driven Systems for Dynamic Graph Processing using CCA
di: Chandio, Bibrak Qamar, et al.
Pubblicazione: (2024)
di: Chandio, Bibrak Qamar, et al.
Pubblicazione: (2024)
Ultra Ethernet's Design Principles and Architectural Innovations
di: Hoefler, Torsten, et al.
Pubblicazione: (2025)
di: Hoefler, Torsten, et al.
Pubblicazione: (2025)
Accelerator-as-a-Service in Public Clouds: An Intra-Host Traffic Management View for Performance Isolation in the Wild
di: Zhao, Jiechen, et al.
Pubblicazione: (2024)
di: Zhao, Jiechen, et al.
Pubblicazione: (2024)
Global Optimizations & Lightweight Dynamic Logic for Concurrency
di: Pati, Suchita, et al.
Pubblicazione: (2024)
di: Pati, Suchita, et al.
Pubblicazione: (2024)
Rotary GPU: Exploring Local Execution Paths for Large Mixture-of-Experts Models Under Limited GPU Memory
di: Jo, Myeong Jun
Pubblicazione: (2026)
di: Jo, Myeong Jun
Pubblicazione: (2026)
Toward a Universal GPU Instruction Set Architecture: A Cross-Vendor Analysis of Hardware-Invariant Computational Primitives in Parallel Processors
di: Abraham, Ojima, et al.
Pubblicazione: (2026)
di: Abraham, Ojima, et al.
Pubblicazione: (2026)
Memory-Aware Partitioning of Machine Learning Applications for Optimal Energy Use in Batteryless Systems
di: Gomez, Andres, et al.
Pubblicazione: (2021)
di: Gomez, Andres, et al.
Pubblicazione: (2021)
ELK: Exploring the Efficiency of Inter-core Connected AI Chips with Deep Learning Compiler Techniques
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
AI and Memory Wall
di: Gholami, Amir, et al.
Pubblicazione: (2024)
di: Gholami, Amir, et al.
Pubblicazione: (2024)
Exploring Parallelism in FPGA-Based Accelerators for Machine Learning Applications
di: Centeno, Sed, et al.
Pubblicazione: (2025)
di: Centeno, Sed, et al.
Pubblicazione: (2025)
WWW: What, When, Where to Compute-in-Memory
di: Sharma, Tanvi, et al.
Pubblicazione: (2023)
di: Sharma, Tanvi, et al.
Pubblicazione: (2023)
Hazel: Secure and Efficient Disaggregated Storage
di: Chrapek, Marcin, et al.
Pubblicazione: (2025)
di: Chrapek, Marcin, et al.
Pubblicazione: (2025)
MLPerf Power: Benchmarking the Energy Efficiency of Machine Learning Systems from Microwatts to Megawatts for Sustainable AI
di: Tschand, Arya, et al.
Pubblicazione: (2024)
di: Tschand, Arya, et al.
Pubblicazione: (2024)
MAD Max Beyond Single-Node: Enabling Large Machine Learning Model Acceleration on Distributed Systems
di: Hsia, Samuel, et al.
Pubblicazione: (2023)
di: Hsia, Samuel, et al.
Pubblicazione: (2023)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
di: Fan, Ruibo, et al.
Pubblicazione: (2026)
di: Fan, Ruibo, et al.
Pubblicazione: (2026)
Compute Can't Handle the Truth: Why Communication Tax Prioritizes Memory and Interconnects in Modern AI Infrastructure
di: Jung, Myoungsoo
Pubblicazione: (2025)
di: Jung, Myoungsoo
Pubblicazione: (2025)
Survey of Disaggregated Memory: Cross-layer Technique Insights for Next-Generation Datacenters
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
Accelerating Precise End-to-End Simulation: Latency-Sensitive Many-core System Modeling
di: Li, Yinrong, et al.
Pubblicazione: (2026)
di: Li, Yinrong, et al.
Pubblicazione: (2026)
SAGe: A Lightweight Algorithm-Architecture Co-Design for Mitigating the Data Preparation Bottleneck in Large-Scale Genome Sequence Analysis
di: Ghiasi, Nika Mansouri, et al.
Pubblicazione: (2025)
di: Ghiasi, Nika Mansouri, et al.
Pubblicazione: (2025)
Detecting Anomalies in Machine Learning Infrastructure via Hardware Telemetry
di: Chen, Ziji, et al.
Pubblicazione: (2025)
di: Chen, Ziji, et al.
Pubblicazione: (2025)
Conduit: Programmer-Transparent Near-Data Processing Using Multiple Compute-Capable Resources in Solid State Drives
di: Nadig, Rakesh, et al.
Pubblicazione: (2026)
di: Nadig, Rakesh, et al.
Pubblicazione: (2026)
Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation
di: Cheng, Long, et al.
Pubblicazione: (2026)
di: Cheng, Long, et al.
Pubblicazione: (2026)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
di: Meng, William, et al.
Pubblicazione: (2025)
di: Meng, William, et al.
Pubblicazione: (2025)
FedUHD: Unsupervised Federated Learning using Hyperdimensional Computing
di: Lee, You Hak, et al.
Pubblicazione: (2025)
di: Lee, You Hak, et al.
Pubblicazione: (2025)
Hierarchical Resource Partitioning on Modern GPUs: A Reinforcement Learning Approach
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
CUCo: An Agentic Framework for Compute and Communication Co-design
di: Hu, Bodun, et al.
Pubblicazione: (2026)
di: Hu, Bodun, et al.
Pubblicazione: (2026)
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
di: Ibrahim, Mohamed Assem, et al.
Pubblicazione: (2024)
di: Ibrahim, Mohamed Assem, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Machine Learning-Driven Intelligent Memory System Design: From On-Chip Caches to Storage
di: Bera, Rahul, et al.
Pubblicazione: (2026) -
Athena: Synergizing Data Prefetching and Off-Chip Prediction via Online Reinforcement Learning
di: Bera, Rahul, et al.
Pubblicazione: (2026) -
Chameleon: Adaptive Caching and Scheduling for Many-Adapter LLM Inference Environments
di: Iliakopoulou, Nikoleta, et al.
Pubblicazione: (2024) -
Affinity Tailor: Dynamic Locality-Aware Scheduling at Scale
di: Ng, Jin Xin, et al.
Pubblicazione: (2026) -
Lincoln AI Computing Survey (LAICS) and Trends
di: Reuther, Albert, et al.
Pubblicazione: (2025)