CoroAMU: Unleashing Memory-Driven Coroutines through Latency-Aware Decoupled Operations
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Zhuolun, Wang, Songyue, Pei, Xiaokun, Lu, Tianyue, Chen, Mingyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Asynchronous Memory Access Unit: Exploiting Massive Parallelism for Far Memory Access
por: Wang, Luming, et al.
Publicado: (2024)
por: Wang, Luming, et al.
Publicado: (2024)
Trimma: Trimming Metadata Storage and Latency for Hybrid Memory Systems
por: Li, Yiwei, et al.
Publicado: (2024)
por: Li, Yiwei, et al.
Publicado: (2024)
DASICS White Paper: Enhancing Memory Protection with Dynamic Compartmentalization
por: Jin, Yue, et al.
Publicado: (2023)
por: Jin, Yue, et al.
Publicado: (2023)
BARD: Reducing Write Latency of DDR5 Memory by Exploiting Bank-Parallelism
por: Vittal, Suhas, et al.
Publicado: (2025)
por: Vittal, Suhas, et al.
Publicado: (2025)
TLV-HGNN: Thinking Like a Vertex for Memory-efficient HGNN Inference
por: Han, Dengke, et al.
Publicado: (2025)
por: Han, Dengke, et al.
Publicado: (2025)
GDR-HGNN: A Heterogeneous Graph Neural Networks Accelerator Frontend with Graph Decoupling and Recoupling
por: Xue, Runzhen, et al.
Publicado: (2024)
por: Xue, Runzhen, et al.
Publicado: (2024)
MERE: Hardware-Software Co-Design for Masking Cache Miss Latency in Embedded Processors
por: You, Dean, et al.
Publicado: (2025)
por: You, Dean, et al.
Publicado: (2025)
Ironman: Accelerating Oblivious Transfer Extension for Privacy-Preserving AI with Near-Memory Processing
por: Lin, Chenqi, et al.
Publicado: (2025)
por: Lin, Chenqi, et al.
Publicado: (2025)
The Case for Replication-Aware Memory-Error Protection in Disaggregated Memory
por: Volos, Haris
Publicado: (2023)
por: Volos, Haris
Publicado: (2023)
A System Architecture for Low Latency Multiprogramming Quantum Computing
por: Zhao, Yilun, et al.
Publicado: (2026)
por: Zhao, Yilun, et al.
Publicado: (2026)
Critical Path Aware Timing-Driven Global Placement for Large-Scale Heterogeneous FPGAs
por: Jiang, He, et al.
Publicado: (2025)
por: Jiang, He, et al.
Publicado: (2025)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
por: Xuan, Zihao, et al.
Publicado: (2026)
por: Xuan, Zihao, et al.
Publicado: (2026)
DAE4HLS: Exposing Memory-Level Parallelism for High-Level Synthesis using Explicit Decoupling
por: Metz, David, et al.
Publicado: (2026)
por: Metz, David, et al.
Publicado: (2026)
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
por: Xie, Rui, et al.
Publicado: (2025)
por: Xie, Rui, et al.
Publicado: (2025)
EONSim: An NPU Simulator for On-Chip Memory and Embedding Vector Operations
por: Choi, Sangun, et al.
Publicado: (2025)
por: Choi, Sangun, et al.
Publicado: (2025)
DataMaestro: A Versatile and Efficient Data Streaming Engine Bringing Decoupled Memory Access To Dataflow Accelerators
por: Yi, Xiaoling, et al.
Publicado: (2025)
por: Yi, Xiaoling, et al.
Publicado: (2025)
LMB: Augmenting PCIe Devices with CXL-Linked Memory Buffer
por: Wang, Jiapin, et al.
Publicado: (2024)
por: Wang, Jiapin, et al.
Publicado: (2024)
CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge
por: Tian, Chunlin, et al.
Publicado: (2025)
por: Tian, Chunlin, et al.
Publicado: (2025)
Computing-In-Memory Aware Model Adaption For Edge Devices
por: Lin, Ming-Han, et al.
Publicado: (2025)
por: Lin, Ming-Han, et al.
Publicado: (2025)
Sensitivity-Aware Mixed-Precision Quantization for ReRAM-based Computing-in-Memory
por: Chen, Guan-Cheng, et al.
Publicado: (2025)
por: Chen, Guan-Cheng, et al.
Publicado: (2025)
Accelerating GNN Training through Locality-aware Dropout and Merge
por: Sun, Gongjian, et al.
Publicado: (2025)
por: Sun, Gongjian, et al.
Publicado: (2025)
A Scalable FPGA Architecture With Adaptive Memory Utilization for GEMM-Based Operations
por: Petropoulos, Anastasios, et al.
Publicado: (2025)
por: Petropoulos, Anastasios, et al.
Publicado: (2025)
ADE-HGNN: Accelerating HGNNs through Attention Disparity Exploitation
por: Han, Dengke, et al.
Publicado: (2024)
por: Han, Dengke, et al.
Publicado: (2024)
AssertGen: Enhancement of LLM-aided Assertion Generation through Cross-Layer Signal Bridging
por: Lyu, Hongqin, et al.
Publicado: (2025)
por: Lyu, Hongqin, et al.
Publicado: (2025)
SynDCIM: A Performance-Aware Digital Computing-in-Memory Compiler with Multi-Spec-Oriented Subcircuit Synthesis
por: Shao, Kunming, et al.
Publicado: (2024)
por: Shao, Kunming, et al.
Publicado: (2024)
An Event-Driven Spiking Compute-In-Memory Macro based on SOT-MRAM
por: Yu, Deyang, et al.
Publicado: (2025)
por: Yu, Deyang, et al.
Publicado: (2025)
PIM-GPT: A Hybrid Process-in-Memory Accelerator for Autoregressive Transformers
por: Wu, Yuting, et al.
Publicado: (2023)
por: Wu, Yuting, et al.
Publicado: (2023)
AutoPower: Automated Few-Shot Architecture-Level Power Modeling by Power Group Decoupling
por: Zhang, Qijun, et al.
Publicado: (2025)
por: Zhang, Qijun, et al.
Publicado: (2025)
MIREDO: MIP-Driven Resource-Efficient Dataflow Optimization for Computing-in-Memory Accelerator
por: He, Xiaolin, et al.
Publicado: (2025)
por: He, Xiaolin, et al.
Publicado: (2025)
AgileWatts: An Energy-Efficient CPU Core Idle-State Architecture for Latency-Sensitive Server Applications
por: Yahya, Jawad Haj, et al.
Publicado: (2022)
por: Yahya, Jawad Haj, et al.
Publicado: (2022)
CoverAssert: Iterative LLM Assertion Generation Driven by Functional Coverage via Syntax-Semantic Representations
por: Wang, Yonghao, et al.
Publicado: (2026)
por: Wang, Yonghao, et al.
Publicado: (2026)
In-Memory Computing Enabled Deep MIMO Detection to Support Ultra-Low-Latency Communications
por: Ding, Tingyu, et al.
Publicado: (2025)
por: Ding, Tingyu, et al.
Publicado: (2025)
CXL Topology-Aware and Expander-Driven Prefetching: Unlocking SSD Performance
por: Oh, Dongsuk, et al.
Publicado: (2025)
por: Oh, Dongsuk, et al.
Publicado: (2025)
HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip
por: Tsai, Pei-Huan, et al.
Publicado: (2026)
por: Tsai, Pei-Huan, et al.
Publicado: (2026)
Fast Cross-Operator Optimization of Attention Dataflow
por: Chang, Haodong, et al.
Publicado: (2026)
por: Chang, Haodong, et al.
Publicado: (2026)
HiHGNN: Accelerating HGNNs through Parallelism and Data Reusability Exploitation
por: Xue, Runzhen, et al.
Publicado: (2023)
por: Xue, Runzhen, et al.
Publicado: (2023)
ADOR: A Design Exploration Framework for LLM Serving with Enhanced Latency and Throughput
por: Kim, Junsoo, et al.
Publicado: (2025)
por: Kim, Junsoo, et al.
Publicado: (2025)
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
por: Moon, Seungjae, et al.
Publicado: (2024)
por: Moon, Seungjae, et al.
Publicado: (2024)
Allspark: Workload Orchestration for Visual Transformers on Processing In-Memory Systems
por: Ge, Mengke, et al.
Publicado: (2024)
por: Ge, Mengke, et al.
Publicado: (2024)
PIMSIM-NN: An ISA-based Simulation Framework for Processing-in-Memory Accelerators
por: Wang, Xinyu, et al.
Publicado: (2024)
por: Wang, Xinyu, et al.
Publicado: (2024)
Ejemplares similares
-
Asynchronous Memory Access Unit: Exploiting Massive Parallelism for Far Memory Access
por: Wang, Luming, et al.
Publicado: (2024) -
Trimma: Trimming Metadata Storage and Latency for Hybrid Memory Systems
por: Li, Yiwei, et al.
Publicado: (2024) -
DASICS White Paper: Enhancing Memory Protection with Dynamic Compartmentalization
por: Jin, Yue, et al.
Publicado: (2023) -
BARD: Reducing Write Latency of DDR5 Memory by Exploiting Bank-Parallelism
por: Vittal, Suhas, et al.
Publicado: (2025) -
TLV-HGNN: Thinking Like a Vertex for Memory-efficient HGNN Inference
por: Han, Dengke, et al.
Publicado: (2025)