NPU Design for Diffusion Language Model Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Lou, Binglei, Wu, Haoran, Lau, Kevin, MacDonald, Gregor, Nie, Jiayi, Lai, Yao, Xiao, Can, Guo, Xuan, Cheng, Jianyi, Antonova, Rika, Mullins, Robert, Zhao, Aaron |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
por: Chung, Euijun, et al.
Publicado: (2026)
por: Chung, Euijun, et al.
Publicado: (2026)
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
por: Jarmusch, Aaron, et al.
Publicado: (2026)
por: Jarmusch, Aaron, et al.
Publicado: (2026)
EDEA: Efficient Dual-Engine Accelerator for Depthwise Separable Convolution with Direct Data Transfer
por: Chen, Yi, et al.
Publicado: (2025)
por: Chen, Yi, et al.
Publicado: (2025)
FengHuang: Next-Generation Memory Orchestration for AI Inferencing
por: Li, Jiamin, et al.
Publicado: (2025)
por: Li, Jiamin, et al.
Publicado: (2025)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
por: Meng, William, et al.
Publicado: (2025)
por: Meng, William, et al.
Publicado: (2025)
Execution-Centric Characterization of FP8 Matrix Cores, Asynchronous Execution, and Structured Sparsity on AMD MI300A
por: Jarmusch, Aaron, et al.
Publicado: (2026)
por: Jarmusch, Aaron, et al.
Publicado: (2026)
Automated Deep Neural Network Inference Partitioning for Distributed Embedded Systems
por: Kreß, Fabian, et al.
Publicado: (2024)
por: Kreß, Fabian, et al.
Publicado: (2024)
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
por: Liu, Yiqi, et al.
Publicado: (2026)
por: Liu, Yiqi, et al.
Publicado: (2026)
HgPCN: A Heterogeneous Architecture for E2E Embedded Point Cloud Inference
por: Gao, Yiming, et al.
Publicado: (2025)
por: Gao, Yiming, et al.
Publicado: (2025)
SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive Thresholding
por: Xu, Weihong, et al.
Publicado: (2025)
por: Xu, Weihong, et al.
Publicado: (2025)
LLaMCAT: Optimizing Large Language Model Inference with Cache Arbitration and Throttling
por: Zhou, Zhongchun, et al.
Publicado: (2025)
por: Zhou, Zhongchun, et al.
Publicado: (2025)
Adaptive KV Cache Reuse for Fast Long-Context LLM Serving
por: li, Fei, et al.
Publicado: (2026)
por: li, Fei, et al.
Publicado: (2026)
A Survey of Real-time Scheduling on Accelerator-based Heterogeneous Architecture for Time Critical Applications
por: Zou, An, et al.
Publicado: (2025)
por: Zou, An, et al.
Publicado: (2025)
Functionally-Complete Boolean Logic in Real DRAM Chips: Experimental Characterization and Analysis
por: Yuksel, Ismail Emir, et al.
Publicado: (2024)
por: Yuksel, Ismail Emir, et al.
Publicado: (2024)
PULSAR: Simultaneous Many-Row Activation for Reliable and High-Performance Computing in Off-the-Shelf DRAM Chips
por: Yuksel, Ismail Emir, et al.
Publicado: (2023)
por: Yuksel, Ismail Emir, et al.
Publicado: (2023)
Simultaneous Many-Row Activation in Off-the-Shelf DRAM Chips: Experimental Characterization and Analysis
por: Yuksel, Ismail Emir, et al.
Publicado: (2024)
por: Yuksel, Ismail Emir, et al.
Publicado: (2024)
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
por: Qararyah, Fareed, et al.
Publicado: (2024)
por: Qararyah, Fareed, et al.
Publicado: (2024)
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
por: Chakraborty, Abhinaba, et al.
Publicado: (2025)
por: Chakraborty, Abhinaba, et al.
Publicado: (2025)
PIUMA: Programmable Integrated Unified Memory Architecture
por: Aananthakrishnan, Sriram, et al.
Publicado: (2020)
por: Aananthakrishnan, Sriram, et al.
Publicado: (2020)
RUBICON: A Framework for Designing Efficient Deep Learning-Based Genomic Basecallers
por: Singh, Gagandeep, et al.
Publicado: (2022)
por: Singh, Gagandeep, et al.
Publicado: (2022)
NasZip: Software and Hardware Co-Design to Accelerate Approximate Nearest Neighbor Search with DIMM-Based Near-Data Processing
por: Zou, Cheng, et al.
Publicado: (2026)
por: Zou, Cheng, et al.
Publicado: (2026)
SAGe: A Lightweight Algorithm-Architecture Co-Design for Mitigating the Data Preparation Bottleneck in Large-Scale Genome Sequence Analysis
por: Ghiasi, Nika Mansouri, et al.
Publicado: (2025)
por: Ghiasi, Nika Mansouri, et al.
Publicado: (2025)
TT-Edge: A Hardware-Software Co-Design for Energy-Efficient Tensor-Train Decomposition on Edge AI
por: Kwak, Hyunseok, et al.
Publicado: (2025)
por: Kwak, Hyunseok, et al.
Publicado: (2025)
The DEEP-ER project: I/O and resiliency extensions for the Cluster-Booster architecture
por: Kreuzer, Anke, et al.
Publicado: (2019)
por: Kreuzer, Anke, et al.
Publicado: (2019)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
por: Qiu, Tong Dong, et al.
Publicado: (2023)
por: Qiu, Tong Dong, et al.
Publicado: (2023)
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
por: Negi, Shubham, et al.
Publicado: (2025)
por: Negi, Shubham, et al.
Publicado: (2025)
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
por: Kubo, Tatsuya, et al.
Publicado: (2025)
por: Kubo, Tatsuya, et al.
Publicado: (2025)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
por: Liu, Lian, et al.
Publicado: (2026)
por: Liu, Lian, et al.
Publicado: (2026)
RAPID-Graph: Recursive All-Pairs Shortest Paths Using Processing-in-Memory for Dynamic Programming on Graphs
por: Chen, Yanru, et al.
Publicado: (2025)
por: Chen, Yanru, et al.
Publicado: (2025)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
por: Kurzynski, Marco, et al.
Publicado: (2025)
por: Kurzynski, Marco, et al.
Publicado: (2025)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
por: Zhang, Chen, et al.
Publicado: (2026)
por: Zhang, Chen, et al.
Publicado: (2026)
Efficient deadlock avoidance for 2D mesh NoCs that use OQ or VOQ routers
por: Papaphilippou, Philippos, et al.
Publicado: (2023)
por: Papaphilippou, Philippos, et al.
Publicado: (2023)
DCRA: A Distributed Chiplet-based Reconfigurable Architecture for Irregular Applications
por: Orenes-Vera, Marcelo, et al.
Publicado: (2023)
por: Orenes-Vera, Marcelo, et al.
Publicado: (2023)
LFOC: A Lightweight Fairness-Oriented Cache Clustering Policy for Commodity Multicores
por: García-García, Adrián, et al.
Publicado: (2024)
por: García-García, Adrián, et al.
Publicado: (2024)
FlexVector: A SpMM Vector Processor with Flexible VRF for GCNs on Varying-Sparsity Graphs
por: Li, Bohan, et al.
Publicado: (2026)
por: Li, Bohan, et al.
Publicado: (2026)
Sequence-Aware Split Heuristic to Mitigate SM Underutilization in FlashAttention-3 Low-Head-Count Decoding
por: Font, Martí Llopart, et al.
Publicado: (2026)
por: Font, Martí Llopart, et al.
Publicado: (2026)
iHAC: A Hybrid Cluster Architecture for Enhanced Performance and Resilience
por: Muntaka, Siddique Abubakr, et al.
Publicado: (2026)
por: Muntaka, Siddique Abubakr, et al.
Publicado: (2026)
NetSmith: An Optimization Framework for Machine-Discovered Network Topologies
por: Green, Conor, et al.
Publicado: (2024)
por: Green, Conor, et al.
Publicado: (2024)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
por: Zhang, Zhekai, et al.
Publicado: (2020)
por: Zhang, Zhekai, et al.
Publicado: (2020)
Navigating the Landscape of Distributed File Systems: Architectures, Implementations, and Considerations
por: Pan, Xueting, et al.
Publicado: (2024)
por: Pan, Xueting, et al.
Publicado: (2024)
Ejemplares similares
-
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
por: Chung, Euijun, et al.
Publicado: (2026) -
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
por: Jarmusch, Aaron, et al.
Publicado: (2026) -
EDEA: Efficient Dual-Engine Accelerator for Depthwise Separable Convolution with Direct Data Transfer
por: Chen, Yi, et al.
Publicado: (2025) -
FengHuang: Next-Generation Memory Orchestration for AI Inferencing
por: Li, Jiamin, et al.
Publicado: (2025) -
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
por: Meng, William, et al.
Publicado: (2025)