PolyKAN: Efficient Fused GPU Operators for Polynomial Kolmogorov-Arnold Network Variants
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Mingkun, Zhong, Heming, Huang, Dan, Lu, Yutong, Jiang, Jiazhi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism
di: Wei, Jinhui, et al.
Pubblicazione: (2025)
di: Wei, Jinhui, et al.
Pubblicazione: (2025)
PipeMax: Enhancing Offline LLM Inference on Commodity GPU Servers
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
TurboFNO: High-Performance Fourier Neural Operator with Fused FFT-GEMM-iFFT on GPU
di: Wu, Shixun, et al.
Pubblicazione: (2025)
di: Wu, Shixun, et al.
Pubblicazione: (2025)
The Fused Kernel Library: A C++ API to Develop Highly-Efficient GPU Libraries
di: Amoros, Oscar, et al.
Pubblicazione: (2025)
di: Amoros, Oscar, et al.
Pubblicazione: (2025)
Fused Breadth-First Probabilistic Traversals on Distributed GPU Systems
di: Neff, Reece, et al.
Pubblicazione: (2023)
di: Neff, Reece, et al.
Pubblicazione: (2023)
Boosting LLM Serving through Spatial-Temporal GPU Resource Sharing
di: Lin, Zejia, et al.
Pubblicazione: (2025)
di: Lin, Zejia, et al.
Pubblicazione: (2025)
Enhancing Physics-Informed Neural Networks with a Hybrid Parallel Kolmogorov-Arnold and MLP Architecture
di: Xu, Zuyu, et al.
Pubblicazione: (2025)
di: Xu, Zuyu, et al.
Pubblicazione: (2025)
Optimizing the Variant Calling Pipeline Execution on Human Genomes Using GPU-Enabled Machines
di: Kumar, Ajay, et al.
Pubblicazione: (2025)
di: Kumar, Ajay, et al.
Pubblicazione: (2025)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
di: Yu, Minchen, et al.
Pubblicazione: (2023)
di: Yu, Minchen, et al.
Pubblicazione: (2023)
ParvaGPU: Efficient Spatial GPU Sharing for Large-Scale DNN Inference in Cloud Environments
di: Lee, Munkyu, et al.
Pubblicazione: (2024)
di: Lee, Munkyu, et al.
Pubblicazione: (2024)
Optimizing Allreduce Operations for Modern Heterogeneous Architectures with Multiple Processes per GPU
di: Adams, Michael, et al.
Pubblicazione: (2025)
di: Adams, Michael, et al.
Pubblicazione: (2025)
Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
di: Huang, En-Ming, et al.
Pubblicazione: (2025)
di: Huang, En-Ming, et al.
Pubblicazione: (2025)
AGILE: Lightweight and Efficient Asynchronous GPU-SSD Integration
di: Yang, Zhuoping, et al.
Pubblicazione: (2025)
di: Yang, Zhuoping, et al.
Pubblicazione: (2025)
Efficient Accelerated Graph Edit Distance Computation on GPU
di: Dabah, Adel, et al.
Pubblicazione: (2026)
di: Dabah, Adel, et al.
Pubblicazione: (2026)
Accelerating Biclique Counting on GPU
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
PICO: Accelerating All k-Core Paradigms on GPU
di: Zhao, Chen, et al.
Pubblicazione: (2024)
di: Zhao, Chen, et al.
Pubblicazione: (2024)
gZCCL: Compression-Accelerated Collective Communication Framework for GPU Clusters
di: Huang, Jiajun, et al.
Pubblicazione: (2023)
di: Huang, Jiajun, et al.
Pubblicazione: (2023)
GeoT: Tensor Centric Library for Graph Neural Network via Efficient Segment Reduction on GPU
di: Yu, Zhongming, et al.
Pubblicazione: (2024)
di: Yu, Zhongming, et al.
Pubblicazione: (2024)
Leveraging Mathematical Reasoning of LLMs for Efficient GPU Thread Mapping
di: Maureira, Jose, et al.
Pubblicazione: (2026)
di: Maureira, Jose, et al.
Pubblicazione: (2026)
Poplar: Efficient Scaling of Distributed DNN Training on Heterogeneous GPU Clusters
di: Zhang, WenZheng, et al.
Pubblicazione: (2024)
di: Zhang, WenZheng, et al.
Pubblicazione: (2024)
Efficient Graph Embedding at Scale: Optimizing CPU-GPU-SSD Integration
di: Li, Zhonggen, et al.
Pubblicazione: (2025)
di: Li, Zhonggen, et al.
Pubblicazione: (2025)
GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
GPU-Accelerated Batch-Dynamic Subgraph Matching
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
HarMoEny: Efficient Multi-GPU Inference of MoE Models
di: Doucet, Zachary, et al.
Pubblicazione: (2025)
di: Doucet, Zachary, et al.
Pubblicazione: (2025)
Heimdall++: Optimizing GPU Utilization and Pipeline Parallelism for Efficient Single-Pulse Detection
di: Xia, Bingzheng, et al.
Pubblicazione: (2025)
di: Xia, Bingzheng, et al.
Pubblicazione: (2025)
An AD based library for Efficient Hessian and Hessian-Vector Product Computation on GPU
di: Ranjan, Desh, et al.
Pubblicazione: (2024)
di: Ranjan, Desh, et al.
Pubblicazione: (2024)
Fantasy: Efficient Large-scale Vector Search on GPU Clusters with GPUDirect Async
di: Liu, Yi, et al.
Pubblicazione: (2025)
di: Liu, Yi, et al.
Pubblicazione: (2025)
ZEUS: An Efficient GPU Optimization Method Integrating PSO, BFGS, and Automatic Differentiation
di: Soos, Dominik, et al.
Pubblicazione: (2026)
di: Soos, Dominik, et al.
Pubblicazione: (2026)
Optimizing Bloom Filters for Modern GPU Architectures
di: Jünger, Daniel, et al.
Pubblicazione: (2025)
di: Jünger, Daniel, et al.
Pubblicazione: (2025)
FlexiWalker: Extensible GPU Framework for Efficient Dynamic Random Walks with Runtime Adaptation
di: Park, Seongyeon, et al.
Pubblicazione: (2025)
di: Park, Seongyeon, et al.
Pubblicazione: (2025)
An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
di: Zhang, Mingjun, et al.
Pubblicazione: (2025)
di: Zhang, Mingjun, et al.
Pubblicazione: (2025)
Efficient GPU Implementation of Particle Interactions with Cutoff Radius and Few Particles per Cell
di: Algis, David, et al.
Pubblicazione: (2024)
di: Algis, David, et al.
Pubblicazione: (2024)
Cronus: Efficient LLM inference on Heterogeneous GPU Clusters via Partially Disaggregated Prefill
di: Liu, Yunzhao, et al.
Pubblicazione: (2025)
di: Liu, Yunzhao, et al.
Pubblicazione: (2025)
MERBIT: A GPU-Based SpMV Method for Iterative Workloads
di: Zhang, Qi, et al.
Pubblicazione: (2026)
di: Zhang, Qi, et al.
Pubblicazione: (2026)
High-Performance Portable GPU Primitives for Arbitrary Types and Operators in Julia
di: Pilliat, Emmanuel
Pubblicazione: (2026)
di: Pilliat, Emmanuel
Pubblicazione: (2026)
GPZ: GPU-Accelerated Lossy Compressor for Particle Data
di: Li, Ruoyu, et al.
Pubblicazione: (2025)
di: Li, Ruoyu, et al.
Pubblicazione: (2025)
AQUA: Network-Accelerated Memory Offloading for LLMs in Scale-Up GPU Domains
di: Kumar, Abhishek Vijaya, et al.
Pubblicazione: (2024)
di: Kumar, Abhishek Vijaya, et al.
Pubblicazione: (2024)
SHARe-KAN: Post-Training Vector Quantization for Cache-Resident KAN Inference
di: Smith, Jeff
Pubblicazione: (2025)
di: Smith, Jeff
Pubblicazione: (2025)
Improving GPU Multi-Tenancy Through Dynamic Multi-Instance GPU Reconfiguration
di: Wang, Tianyu, et al.
Pubblicazione: (2024)
di: Wang, Tianyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism
di: Wei, Jinhui, et al.
Pubblicazione: (2025) -
PipeMax: Enhancing Offline LLM Inference on Commodity GPU Servers
di: Zhang, Hongbin, et al.
Pubblicazione: (2026) -
TurboFNO: High-Performance Fourier Neural Operator with Fused FFT-GEMM-iFFT on GPU
di: Wu, Shixun, et al.
Pubblicazione: (2025) -
The Fused Kernel Library: A C++ API to Develop Highly-Efficient GPU Libraries
di: Amoros, Oscar, et al.
Pubblicazione: (2025) -
Fused Breadth-First Probabilistic Traversals on Distributed GPU Systems
di: Neff, Reece, et al.
Pubblicazione: (2023)