Debunking the CUDA Myth Towards GPU-based AI Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Yunjae, Lim, Juntaek, Bang, Jehyeon, Cho, Eunyeong, Jeong, Huijong, Kim, Taesu, Kim, Hyungjun, Lee, Joonhyung, Im, Jinseop, Hwang, Ranggi, Kwon, Se Jung, Lee, Dongsoo, Rhu, Minsoo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
par: Cho, Eunyeong, et autres
Publié: (2026)
par: Cho, Eunyeong, et autres
Publié: (2026)
PreSto: An In-Storage Data Preprocessing System for Training Recommendation Models
par: Lee, Yunjae, et autres
Publié: (2024)
par: Lee, Yunjae, et autres
Publié: (2024)
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
par: Bang, Jehyeon, et autres
Publié: (2026)
par: Bang, Jehyeon, et autres
Publié: (2026)
vTrain: A Simulation Framework for Evaluating Cost-effective and Compute-optimal Large Language Model Training
par: Bang, Jehyeon, et autres
Publié: (2023)
par: Bang, Jehyeon, et autres
Publié: (2023)
Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
par: Yoon, Dongho, et autres
Publié: (2025)
par: Yoon, Dongho, et autres
Publié: (2025)
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
par: Lee, Dongjae, et autres
Publié: (2025)
par: Lee, Dongjae, et autres
Publié: (2025)
Pathfinding Future PIM Architectures by Demystifying a Commercial PIM Technology
par: Hyun, Bongjoon, et autres
Publié: (2023)
par: Hyun, Bongjoon, et autres
Publié: (2023)
PIM-MMU: A Memory Management Unit for Accelerating Data Transfers in Commercial PIM Systems
par: Lee, Dongjae, et autres
Publié: (2024)
par: Lee, Dongjae, et autres
Publié: (2024)
SwarmIO: Towards 100 Million IOPS SSD Emulation for Next-generation GPU-centric Storage Systems
par: Kim, Hyeseong, et autres
Publié: (2026)
par: Kim, Hyeseong, et autres
Publié: (2026)
PREBA: A Hardware/Software Co-Design for Multi-Instance GPU based AI Inference Servers
par: Yeo, Gwangoo, et autres
Publié: (2024)
par: Yeo, Gwangoo, et autres
Publié: (2024)
The Cost of Dynamic Reasoning: Demystifying AI Agents and Test-Time Scaling from an AI Infrastructure Perspective
par: Kim, Jiin, et autres
Publié: (2025)
par: Kim, Jiin, et autres
Publié: (2025)
Faster Inference of LLMs using FP8 on the Intel Gaudi
par: Lee, Joonhyung, et autres
Publié: (2025)
par: Lee, Joonhyung, et autres
Publié: (2025)
FIGLUT: An Energy-Efficient Accelerator Design for FP-INT GEMM Using Look-Up Tables
par: Park, Gunho, et autres
Publié: (2025)
par: Park, Gunho, et autres
Publié: (2025)
LazyDP: Co-Designing Algorithm-Software for Scalable Training of Differentially Private Recommendation Models
par: Lim, Juntaek, et autres
Publié: (2024)
par: Lim, Juntaek, et autres
Publié: (2024)
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
par: Gouk, Donghyun, et autres
Publié: (2025)
par: Gouk, Donghyun, et autres
Publié: (2025)
STAR: Improving Lifetime and Performance of High-Capacity Modern SSDs Using State-Aware Randomizer
par: Kwon, Omin, et autres
Publié: (2025)
par: Kwon, Omin, et autres
Publié: (2025)
Hardware-based Heterogeneous Memory Management for Large Language Model Inference
par: Hwang, Soojin, et autres
Publié: (2025)
par: Hwang, Soojin, et autres
Publié: (2025)
Flexible In-NAND Cryptographic Processing for Secure Flash Storage
par: Noh, Seock-Hwan, et autres
Publié: (2025)
par: Noh, Seock-Hwan, et autres
Publié: (2025)
Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
par: Kim, Dowon, et autres
Publié: (2025)
par: Kim, Dowon, et autres
Publié: (2025)
To FP8 and Back Again: Quantifying Reduced Precision Effects on LLM Training Stability
par: Lee, Joonhyung, et autres
Publié: (2024)
par: Lee, Joonhyung, et autres
Publié: (2024)
EnergAIzer: Fast and Accurate GPU Power Estimation Framework for AI Workloads
par: Lee, Kyungmi, et autres
Publié: (2026)
par: Lee, Kyungmi, et autres
Publié: (2026)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
par: Seo, Minseok, et autres
Publié: (2024)
par: Seo, Minseok, et autres
Publié: (2024)
Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
par: Hwang, Ranggi, et autres
Publié: (2023)
par: Hwang, Ranggi, et autres
Publié: (2023)
LOCALUT: Harnessing Capacity-Computation Tradeoffs for LUT-Based Inference in DRAM-PIM
par: Hong, Junguk, et autres
Publié: (2026)
par: Hong, Junguk, et autres
Publié: (2026)
Garibaldi: A Pairwise Instruction-Data Management for Enhancing Shared Last-Level Cache Performance in Server Workloads
par: Kwon, Jaewon, et autres
Publié: (2025)
par: Kwon, Jaewon, et autres
Publié: (2025)
DSAC: Low-Cost RowHammer Mitigation Using In-DRAM Stochastic and Approximate Counting Algorithm
par: Hong, Seungki, et autres
Publié: (2023)
par: Hong, Seungki, et autres
Publié: (2023)
MASQ: Accelerating Masked Diffusion via Stage-Wise Multi-Precision Quantization
par: Kim, Seeyeon, et autres
Publié: (2026)
par: Kim, Seeyeon, et autres
Publié: (2026)
AnalogToBi: Device-Level Analog Circuit Topology Generation via Bipartite Graph and Grammar Guided Decoding
par: Kim, Seungmin, et autres
Publié: (2026)
par: Kim, Seungmin, et autres
Publié: (2026)
Optimized Memory System Architecture for VESA VDC-M Decoder with Multi-Slice Support
par: Yang, Hannah, et autres
Publié: (2025)
par: Yang, Hannah, et autres
Publié: (2025)
Towards Performance-Aware Allocation for Accelerated Machine Learning on GPU-SSD Systems
par: Gundawar, Ayush, et autres
Publié: (2024)
par: Gundawar, Ayush, et autres
Publié: (2024)
Accelerating Mini-batch HGNN Training by Reducing CUDA Kernels
par: Wu, Meng, et autres
Publié: (2024)
par: Wu, Meng, et autres
Publié: (2024)
ZipFlow: a Compiler-based Framework to Unleash Compressed Data Movement for Modern GPUs
par: Yeo, Gwangoo, et autres
Publié: (2026)
par: Yeo, Gwangoo, et autres
Publié: (2026)
Dissecting and Re-architecting 3D NAND Flash PIM Arrays for Efficient Single-Batch Token Generation in LLMs
par: Jang, Yongjoo, et autres
Publié: (2025)
par: Jang, Yongjoo, et autres
Publié: (2025)
CuLifter: Lifting GPU Binaries to Typed IR
par: Zhao, Jisheng, et autres
Publié: (2026)
par: Zhao, Jisheng, et autres
Publié: (2026)
STRAW: A Stress-Aware WL-Based Read Reclaim Technique for High-Density NAND Flash-Based SSDs
par: Chun, Myoungjun, et autres
Publié: (2025)
par: Chun, Myoungjun, et autres
Publié: (2025)
An Inquiry into Datacenter TCO for LLM Inference with FP8
par: Kim, Jiwoo, et autres
Publié: (2025)
par: Kim, Jiwoo, et autres
Publié: (2025)
PIMphony: Overcoming Bandwidth and Capacity Inefficiency in PIM-based Long-Context LLM Inference System
par: Kwon, Hyucksung, et autres
Publié: (2024)
par: Kwon, Hyucksung, et autres
Publié: (2024)
Regular-Dead on Arrival: Characterizing and Protecting Against Dead-Entry TLB Misses in GPU Microarchitectures
par: Anik, Shafayat Mowla, et autres
Publié: (2026)
par: Anik, Shafayat Mowla, et autres
Publié: (2026)
Fastrack: Fast IO for Secure ML using GPU TEEs
par: Wang, Yongqin, et autres
Publié: (2024)
par: Wang, Yongqin, et autres
Publié: (2024)
DiSC: Resolution-Scalable Acceleration of Diffusion Models by Exploiting Sparsity and Cached Token Reuse with Hash-based Distribution
par: Yoon, Jieon, et autres
Publié: (2026)
par: Yoon, Jieon, et autres
Publié: (2026)
Documents similaires
-
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
par: Cho, Eunyeong, et autres
Publié: (2026) -
PreSto: An In-Storage Data Preprocessing System for Training Recommendation Models
par: Lee, Yunjae, et autres
Publié: (2024) -
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
par: Bang, Jehyeon, et autres
Publié: (2026) -
vTrain: A Simulation Framework for Evaluating Cost-effective and Compute-optimal Large Language Model Training
par: Bang, Jehyeon, et autres
Publié: (2023) -
Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
par: Yoon, Dongho, et autres
Publié: (2025)