SLOFetch: Compressed-Hierarchical Instruction Prefetching for Cloud Microservices
Fuente:
arXiv
Guardado en:
| Autores principales: | Bao, Zerui, Zhu, Di, Jiang, Liu, Sheng, Shiqi, Wang, Ziwei, Zhang, Haoyun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Joint Learning Approach to Hardware Caching and Prefetching
por: Yuan, Samuel, et al.
Publicado: (2025)
por: Yuan, Samuel, et al.
Publicado: (2025)
ICP: Exploiting Instruction Correlation for Prefetching Irregular Memory Accesses
por: Li, Mengming, et al.
Publicado: (2026)
por: Li, Mengming, et al.
Publicado: (2026)
Integrating Prefetcher Selection with Dynamic Request Allocation Improves Prefetching Efficiency
por: Li, Mengming, et al.
Publicado: (2025)
por: Li, Mengming, et al.
Publicado: (2025)
Enhancing Instruction Prefetching via Cache and TLB Management
por: Jamet, Alexandre Valentin, et al.
Publicado: (2026)
por: Jamet, Alexandre Valentin, et al.
Publicado: (2026)
Pickle Prefetcher: Programmable and Scalable Last-Level Cache Prefetcher
por: Nguyen, Hoa, et al.
Publicado: (2025)
por: Nguyen, Hoa, et al.
Publicado: (2025)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
por: Xiang, Maoyang, et al.
Publicado: (2025)
por: Xiang, Maoyang, et al.
Publicado: (2025)
PaCKD: Pattern-Clustered Knowledge Distillation for Compressing Memory Access Prediction Models
por: Gupta, Neelesh, et al.
Publicado: (2024)
por: Gupta, Neelesh, et al.
Publicado: (2024)
SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
por: Zhang, Jintao, et al.
Publicado: (2026)
por: Zhang, Jintao, et al.
Publicado: (2026)
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
por: Yubeaton, Patrick, et al.
Publicado: (2025)
por: Yubeaton, Patrick, et al.
Publicado: (2025)
Profile-Guided Temporal Prefetching
por: Li, Mengming, et al.
Publicado: (2025)
por: Li, Mengming, et al.
Publicado: (2025)
DEER: Deep Runahead for Instruction Prefetching on Modern Mobile Workloads
por: Vahdatniya, Parmida, et al.
Publicado: (2025)
por: Vahdatniya, Parmida, et al.
Publicado: (2025)
Introducing Instruction-Accurate Simulators for Performance Estimation of Autotuning Workloads
por: Pelke, Rebecca, et al.
Publicado: (2025)
por: Pelke, Rebecca, et al.
Publicado: (2025)
Efficient Tabular Data Preprocessing of ML Pipelines
por: Zhu, Yu, et al.
Publicado: (2024)
por: Zhu, Yu, et al.
Publicado: (2024)
GENIE-ASI: Generative Instruction and Executable Code for Analog Subcircuit Identification
por: Pham, Phuoc, et al.
Publicado: (2025)
por: Pham, Phuoc, et al.
Publicado: (2025)
PointODE: Lightweight Point Cloud Learning with Neural Ordinary Differential Equations on Edge
por: Sugiura, Keisuke, et al.
Publicado: (2025)
por: Sugiura, Keisuke, et al.
Publicado: (2025)
Attention, Distillation, and Tabularization: Towards Practical Neural Network-Based Prefetching
por: Zhang, Pengmiao, et al.
Publicado: (2023)
por: Zhang, Pengmiao, et al.
Publicado: (2023)
ArtNet: Hierarchical Clustering-Based Artificial Netlist Generator for ML and DTCO Application
por: Kang, Andrew B. Kahng. Seokhyeong, et al.
Publicado: (2025)
por: Kang, Andrew B. Kahng. Seokhyeong, et al.
Publicado: (2025)
Hardware-Aware Data and Instruction Mapping for AI Tasks: Balancing Parallelism, I/O and Memory Tradeoffs
por: Chowdhury, Md Rownak Hossain, et al.
Publicado: (2025)
por: Chowdhury, Md Rownak Hossain, et al.
Publicado: (2025)
ROSA: Robust and Energy-Efficient Microring-Based Optical Neural Networks via Optical Shift-and-Add and Layer-Wise Hybrid Mapping
por: Zhang, Huifan, et al.
Publicado: (2026)
por: Zhang, Huifan, et al.
Publicado: (2026)
A Case for Kolmogorov-Arnold Networks in Prefetching: Towards Low-Latency, Generalizable ML-Based Prefetchers
por: Kulkarni, Dhruv, et al.
Publicado: (2025)
por: Kulkarni, Dhruv, et al.
Publicado: (2025)
PDA-LSTM: Knowledge-driven page data arrangement based on LSTM for LCM supression in QLC 3D NAND flash memories
por: Li, Qianhui, et al.
Publicado: (2025)
por: Li, Qianhui, et al.
Publicado: (2025)
Torch2Chip: An End-to-end Customizable Deep Neural Network Compression and Deployment Toolkit for Prototype Hardware Accelerator Design
por: Meng, Jian, et al.
Publicado: (2024)
por: Meng, Jian, et al.
Publicado: (2024)
SPPAM: Signature Pattern Prediction and Access-Map Prefetcher
por: Merrell, Maccoy, et al.
Publicado: (2026)
por: Merrell, Maccoy, et al.
Publicado: (2026)
BiHDTrans: binary hyperdimensional transformer for efficient multivariate time series classification
por: Zhang, Jingtao, et al.
Publicado: (2025)
por: Zhang, Jingtao, et al.
Publicado: (2025)
SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision
por: Choi, Yuseon, et al.
Publicado: (2025)
por: Choi, Yuseon, et al.
Publicado: (2025)
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
por: Jin, Pengwei, et al.
Publicado: (2025)
por: Jin, Pengwei, et al.
Publicado: (2025)
Exploring DRAM Cache Prefetching for Pooled Memory
por: Tirumalasetty, Chandrahas, et al.
Publicado: (2024)
por: Tirumalasetty, Chandrahas, et al.
Publicado: (2024)
Agile TLB Prefetching and Prediction Replacement Policy
por: Mersha, Melkamu, et al.
Publicado: (2024)
por: Mersha, Melkamu, et al.
Publicado: (2024)
AutoPPA: Automated Circuit PPA Optimization via Contrastive Code-based Rule Library Learning
por: Li, Chongxiao, et al.
Publicado: (2026)
por: Li, Chongxiao, et al.
Publicado: (2026)
Mugi: Value Level Parallelism For Efficient LLMs
por: Price, Daniel, et al.
Publicado: (2026)
por: Price, Daniel, et al.
Publicado: (2026)
MiCo: End-to-End Mixed Precision Neural Network Co-Exploration Framework for Edge AI
por: Jiang, Zijun, et al.
Publicado: (2025)
por: Jiang, Zijun, et al.
Publicado: (2025)
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
por: Yao, Jiayi, et al.
Publicado: (2026)
por: Yao, Jiayi, et al.
Publicado: (2026)
EPIM: Efficient Processing-In-Memory Accelerators based on Epitome
por: Wang, Chenyu, et al.
Publicado: (2023)
por: Wang, Chenyu, et al.
Publicado: (2023)
RLPlanner: Reinforcement Learning based Floorplanning for Chiplets with Fast Thermal Analysis
por: Duan, Yuanyuan, et al.
Publicado: (2023)
por: Duan, Yuanyuan, et al.
Publicado: (2023)
QiMeng: Fully Automated Hardware and Software Design for Processor Chip
por: Zhang, Rui, et al.
Publicado: (2025)
por: Zhang, Rui, et al.
Publicado: (2025)
Beyond Tokens: Enhancing RTL Quality Estimation via Structural Graph Learning
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
M100: An Orchestrated Dataflow Architecture Powering General AI Computing
por: Xie, Yan, et al.
Publicado: (2026)
por: Xie, Yan, et al.
Publicado: (2026)
Progressive Gradient Flow for Robust N:M Sparsity Training in Transformers
por: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Publicado: (2024)
por: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Publicado: (2024)
IR-Aware ECO Timing Optimization Using Reinforcement Learning
por: Jiang, Wenjing, et al.
Publicado: (2024)
por: Jiang, Wenjing, et al.
Publicado: (2024)
Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization
por: Tian, Jiayi, et al.
Publicado: (2025)
por: Tian, Jiayi, et al.
Publicado: (2025)
Ejemplares similares
-
A Joint Learning Approach to Hardware Caching and Prefetching
por: Yuan, Samuel, et al.
Publicado: (2025) -
ICP: Exploiting Instruction Correlation for Prefetching Irregular Memory Accesses
por: Li, Mengming, et al.
Publicado: (2026) -
Integrating Prefetcher Selection with Dynamic Request Allocation Improves Prefetching Efficiency
por: Li, Mengming, et al.
Publicado: (2025) -
Enhancing Instruction Prefetching via Cache and TLB Management
por: Jamet, Alexandre Valentin, et al.
Publicado: (2026) -
Pickle Prefetcher: Programmable and Scalable Last-Level Cache Prefetcher
por: Nguyen, Hoa, et al.
Publicado: (2025)