GPU-Augmented OLAP Execution Engine: GPU Offloading
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Chang, Ilsun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Theseus: A Distributed and Scalable GPU-Accelerated Query Processing Platform Optimized for Efficient Data Movement
par: Aramburú, Felipe, et autres
Publié: (2025)
par: Aramburú, Felipe, et autres
Publié: (2025)
Optimizing ML Concurrent Computation and Communication with GPU DMA Engines
par: Agrawal, Anirudha, et autres
Publié: (2024)
par: Agrawal, Anirudha, et autres
Publié: (2024)
Rotary GPU: Exploring Local Execution Paths for Large Mixture-of-Experts Models Under Limited GPU Memory
par: Jo, Myeong Jun
Publié: (2026)
par: Jo, Myeong Jun
Publié: (2026)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
par: Wijeratne, Sasindu, et autres
Publié: (2024)
par: Wijeratne, Sasindu, et autres
Publié: (2024)
Fifty Years of Transaction Processing Research (extended)
par: Bernstein, Philip A.
Publié: (2026)
par: Bernstein, Philip A.
Publié: (2026)
dpBento: Benchmarking DPUs for Data Processing
par: Hu, Jiasheng, et autres
Publié: (2025)
par: Hu, Jiasheng, et autres
Publié: (2025)
HetGPU: The pursuit of making binary compatibility towards GPUs
par: Yang, Yiwei, et autres
Publié: (2025)
par: Yang, Yiwei, et autres
Publié: (2025)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
par: Chung, Euijun, et autres
Publié: (2026)
par: Chung, Euijun, et autres
Publié: (2026)
TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
par: Pan, Yudong, et autres
Publié: (2026)
par: Pan, Yudong, et autres
Publié: (2026)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
par: Elwasif, Wael, et autres
Publié: (2022)
par: Elwasif, Wael, et autres
Publié: (2022)
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
par: Jarmusch, Aaron, et autres
Publié: (2026)
par: Jarmusch, Aaron, et autres
Publié: (2026)
Exploring GPU-to-GPU Communication: Insights into Supercomputer Interconnects
par: De Sensi, Daniele, et autres
Publié: (2024)
par: De Sensi, Daniele, et autres
Publié: (2024)
GigaAPI for GPU Parallelization
par: Suvarna, M., et autres
Publié: (2025)
par: Suvarna, M., et autres
Publié: (2025)
Analyzing Reverse Address Translation Overheads in Multi-GPU Scale-Up Pods
par: Fatima, Amel, et autres
Publié: (2026)
par: Fatima, Amel, et autres
Publié: (2026)
FinGraV: Methodology for Fine-Grain GPU Power Visibility and Insights
par: Singhania, Varsha, et autres
Publié: (2024)
par: Singhania, Varsha, et autres
Publié: (2024)
PIMDAL: Mitigating the Memory Bottleneck in Data Analytics using a Real Processing-in-Memory System
par: Frouzakis, Manos, et autres
Publié: (2025)
par: Frouzakis, Manos, et autres
Publié: (2025)
Efficient Batch Search Algorithm for B+ Tree Index Structures with Level-Wise Traversal on FPGAs
par: Tzschoppe, Max, et autres
Publié: (2026)
par: Tzschoppe, Max, et autres
Publié: (2026)
NasZip: Software and Hardware Co-Design to Accelerate Approximate Nearest Neighbor Search with DIMM-Based Near-Data Processing
par: Zou, Cheng, et autres
Publié: (2026)
par: Zou, Cheng, et autres
Publié: (2026)
ZipFlow: a Compiler-based Framework to Unleash Compressed Data Movement for Modern GPUs
par: Yeo, Gwangoo, et autres
Publié: (2026)
par: Yeo, Gwangoo, et autres
Publié: (2026)
Parallelizing a modern GPU simulator
par: Huerta, Rodrigo, et autres
Publié: (2025)
par: Huerta, Rodrigo, et autres
Publié: (2025)
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
par: Qiu, Tong Dong, et autres
Publié: (2023)
par: Qiu, Tong Dong, et autres
Publié: (2023)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
Improving Multi-Instance GPU Efficiency via Sub-Entry Sharing TLB Design
par: Li, Bingyao, et autres
Publié: (2024)
par: Li, Bingyao, et autres
Publié: (2024)
Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes
par: McDaniel, Adam, et autres
Publié: (2026)
par: McDaniel, Adam, et autres
Publié: (2026)
Multi-Partner Project: Multi-GPU Performance Portability Analysis for CFD Simulations at Scale
par: Eleftherakis, Panagiotis-Eleftherios, et autres
Publié: (2026)
par: Eleftherakis, Panagiotis-Eleftherios, et autres
Publié: (2026)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
par: Kurzynski, Marco, et autres
Publié: (2025)
par: Kurzynski, Marco, et autres
Publié: (2025)
SwarmIO: Towards 100 Million IOPS SSD Emulation for Next-generation GPU-centric Storage Systems
par: Kim, Hyeseong, et autres
Publié: (2026)
par: Kim, Hyeseong, et autres
Publié: (2026)
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
par: Torres, L. A., et autres
Publié: (2024)
par: Torres, L. A., et autres
Publié: (2024)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
par: Zhou, Zhuoshan, et autres
Publié: (2026)
par: Zhou, Zhuoshan, et autres
Publié: (2026)
Heuristic Search Space Partitioning for Low-Latency Multi-Tenant Cloud Queries
par: Pathak, Prashant Kumar, et autres
Publié: (2026)
par: Pathak, Prashant Kumar, et autres
Publié: (2026)
Optimizing Offload Performance in Heterogeneous MPSoCs
par: Colagrande, Luca, et autres
Publié: (2024)
par: Colagrande, Luca, et autres
Publié: (2024)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
par: Meng, William, et autres
Publié: (2025)
par: Meng, William, et autres
Publié: (2025)
Vector-Centric Machine Learning Systems: A Cross-Stack Approach
par: Jiang, Wenqi
Publié: (2025)
par: Jiang, Wenqi
Publié: (2025)
Self-Adaptive Probabilistic Skyline Query Processing in Distributed Edge Computing via Deep Reinforcement Learning
par: Lai, Chuan-Chi
Publié: (2026)
par: Lai, Chuan-Chi
Publié: (2026)
Knowledge-Guided Attention-Inspired Learning for Task Offloading in Vehicle Edge Computing
par: Ma, Ke, et autres
Publié: (2025)
par: Ma, Ke, et autres
Publié: (2025)
DMA-Latte: Expanding the Reach of DMA Offloads to Latency-bound ML Communication
par: Pati, Suchita, et autres
Publié: (2025)
par: Pati, Suchita, et autres
Publié: (2025)
A Survey on Transactional Stream Processing
par: Zhang, Shuhao, et autres
Publié: (2022)
par: Zhang, Shuhao, et autres
Publié: (2022)
Risk-Aware GPU-Assisted Cardinality Estimation for Cost-Based Query Optimizers
par: Chang, Ilsun
Publié: (2025)
par: Chang, Ilsun
Publié: (2025)
T3: Transparent Tracking & Triggering for Fine-grained Overlap of Compute & Collectives
par: Pati, Suchita, et autres
Publié: (2024)
par: Pati, Suchita, et autres
Publié: (2024)
Documents similaires
-
Theseus: A Distributed and Scalable GPU-Accelerated Query Processing Platform Optimized for Efficient Data Movement
par: Aramburú, Felipe, et autres
Publié: (2025) -
Optimizing ML Concurrent Computation and Communication with GPU DMA Engines
par: Agrawal, Anirudha, et autres
Publié: (2024) -
Rotary GPU: Exploring Local Execution Paths for Large Mixture-of-Experts Models Under Limited GPU Memory
par: Jo, Myeong Jun
Publié: (2026) -
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
par: Wijeratne, Sasindu, et autres
Publié: (2024) -
Fifty Years of Transaction Processing Research (extended)
par: Bernstein, Philip A.
Publié: (2026)