Guardado en:
| Autores principales: | Lenadora, Damitha, Sathia, Vimarsh, Gerogiannis, Gerasimos, Yesil, Serif, Torrellas, Josep, Mendis, Charith |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2306.15155 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
COGNATE: Acceleration of Sparse Tensor Programs on Emerging Hardware using Transfer Learning
por: Sudusinghe, Chamika, et al.
Publicado: (2025)
por: Sudusinghe, Chamika, et al.
Publicado: (2025)
FLuRKA: Fast and accurate unified Low-Rank & Kernel Attention
por: Gupta, Ahan, et al.
Publicado: (2023)
por: Gupta, Ahan, et al.
Publicado: (2023)
Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants
por: You, Bozhi, et al.
Publicado: (2025)
por: You, Bozhi, et al.
Publicado: (2025)
oneDNN Graph Compiler: A Hybrid Approach for High-Performance Deep Learning Compilation
por: Li, Jianhui, et al.
Publicado: (2023)
por: Li, Jianhui, et al.
Publicado: (2023)
Efficient Graph Knowledge Distillation from GNNs to Kolmogorov--Arnold Networks via Self-Attention Dynamic Sampling
por: Cui, Can, et al.
Publicado: (2025)
por: Cui, Can, et al.
Publicado: (2025)
DECA: A Near-Core LLM Decompression Accelerator Grounded on a 3D Roofline Model
por: Gerogiannis, Gerasimos, et al.
Publicado: (2025)
por: Gerogiannis, Gerasimos, et al.
Publicado: (2025)
COMET: Neural Cost Model Explanation Framework
por: Chaudhary, Isha, et al.
Publicado: (2023)
por: Chaudhary, Isha, et al.
Publicado: (2023)
Automating Energy-Efficient GPU Kernel Generation: A Fast Search-Based Compilation Approach
por: Zhang, Yijia, et al.
Publicado: (2024)
por: Zhang, Yijia, et al.
Publicado: (2024)
The Next 700 ML-Enabled Compiler Optimizations
por: VenkataKeerthy, S., et al.
Publicado: (2023)
por: VenkataKeerthy, S., et al.
Publicado: (2023)
Priority Sampling of Large Language Models for Compilers
por: Grubisic, Dejan, et al.
Publicado: (2024)
por: Grubisic, Dejan, et al.
Publicado: (2024)
AutoSAGE: Input-Aware CUDA Scheduling for Sparse GNN Aggregation (SpMM/SDDMM) and CSR Attention
por: Stankovic, Aleksandar
Publicado: (2025)
por: Stankovic, Aleksandar
Publicado: (2025)
Accelerating Sparse Ternary GEMM for Quantized ML on Apple Silicon
por: Lipshitz, Baraq, et al.
Publicado: (2025)
por: Lipshitz, Baraq, et al.
Publicado: (2025)
LOOPerSet: A Large-Scale Dataset for Data-Driven Polyhedral Compiler Optimization
por: Merouani, Massinissa, et al.
Publicado: (2025)
por: Merouani, Massinissa, et al.
Publicado: (2025)
PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation
por: An, Zihao, et al.
Publicado: (2025)
por: An, Zihao, et al.
Publicado: (2025)
GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models
por: Taneja, Maanas, et al.
Publicado: (2026)
por: Taneja, Maanas, et al.
Publicado: (2026)
V-Seek: Accelerating LLM Reasoning on Open-hardware Server-class RISC-V Platforms
por: Rodrigo, Javier J. Poveda, et al.
Publicado: (2025)
por: Rodrigo, Javier J. Poveda, et al.
Publicado: (2025)
Efficient Solving of Large Single Input Superstate Decomposable Markovian Decision Process
por: Mahjoub, Youssef Ait El, et al.
Publicado: (2025)
por: Mahjoub, Youssef Ait El, et al.
Publicado: (2025)
ECCO: Evidence-Driven Causal Reasoning for Compiler Optimization
por: Pan, Haolin, et al.
Publicado: (2026)
por: Pan, Haolin, et al.
Publicado: (2026)
SAfEPaTh: A System-Level Approach for Efficient Power and Thermal Estimation of Convolutional Neural Network Accelerator
por: Chen, Yukai, et al.
Publicado: (2024)
por: Chen, Yukai, et al.
Publicado: (2024)
Library Liberation: Competitive Performance Matmul Through Compiler-composed Nanokernels
por: Thangamani, Arun, et al.
Publicado: (2025)
por: Thangamani, Arun, et al.
Publicado: (2025)
EXAQ: Exponent Aware Quantization For LLMs Acceleration
por: Shkolnik, Moran, et al.
Publicado: (2024)
por: Shkolnik, Moran, et al.
Publicado: (2024)
cedar: Optimized and Unified Machine Learning Input Data Pipelines
por: Zhao, Mark, et al.
Publicado: (2024)
por: Zhao, Mark, et al.
Publicado: (2024)
VecTrans: Enhancing Compiler Auto-Vectorization through LLM-Assisted Code Transformations
por: Zheng, Zhongchun, et al.
Publicado: (2025)
por: Zheng, Zhongchun, et al.
Publicado: (2025)
AutoSP: Unlocking Long-Context LLM Training Via Compiler-Based Sequence Parallelism
por: Gupta, Ahan, et al.
Publicado: (2026)
por: Gupta, Ahan, et al.
Publicado: (2026)
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
por: Saha, Rappy, et al.
Publicado: (2026)
por: Saha, Rappy, et al.
Publicado: (2026)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
por: Zhao, Youpeng, et al.
Publicado: (2024)
por: Zhao, Youpeng, et al.
Publicado: (2024)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
por: Yin, Yishu, et al.
Publicado: (2025)
por: Yin, Yishu, et al.
Publicado: (2025)
GPU Cluster Scheduling for Network-Sensitive Deep Learning
por: Sharma, Aakash, et al.
Publicado: (2024)
por: Sharma, Aakash, et al.
Publicado: (2024)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
por: Yang, Peiming, et al.
Publicado: (2025)
por: Yang, Peiming, et al.
Publicado: (2025)
Accelerating AI Performance using Anderson Extrapolation on GPUs
por: Dajani, Saleem Abdul Fattah Ahmed Al, et al.
Publicado: (2024)
por: Dajani, Saleem Abdul Fattah Ahmed Al, et al.
Publicado: (2024)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
por: Israel, Daniel, et al.
Publicado: (2025)
por: Israel, Daniel, et al.
Publicado: (2025)
Compiler-First State Space Duality and Portable $O(1)$ Autoregressive Caching for Inference
por: Santoni, Cosmo
Publicado: (2026)
por: Santoni, Cosmo
Publicado: (2026)
Accelerating Mobile Inference through Fine-Grained CPU-GPU Co-Execution
por: Li, Zhuojin, et al.
Publicado: (2025)
por: Li, Zhuojin, et al.
Publicado: (2025)
Automatic Generation of Fast and Accurate Performance Models for Deep Neural Network Accelerators
por: Lübeck, Konstantin, et al.
Publicado: (2024)
por: Lübeck, Konstantin, et al.
Publicado: (2024)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
por: AbouElhamayed, Ahmed F., et al.
Publicado: (2025)
por: AbouElhamayed, Ahmed F., et al.
Publicado: (2025)
It's all about PR -- Smart Benchmarking AI Accelerators using Performance Representatives
por: Jung, Alexander Louis-Ferdinand, et al.
Publicado: (2024)
por: Jung, Alexander Louis-Ferdinand, et al.
Publicado: (2024)
FlexiSAGA: A Flexible Systolic Array GEMM Accelerator for Sparse and Dense Processing
por: Müller, Mika Markus, et al.
Publicado: (2025)
por: Müller, Mika Markus, et al.
Publicado: (2025)
LiveTune: Dynamic Parameter Tuning for Feedback-Driven Optimization
por: Shabgahi, Soheil Zibakhsh, et al.
Publicado: (2023)
por: Shabgahi, Soheil Zibakhsh, et al.
Publicado: (2023)
BanditQ: Fair Bandits with Guaranteed Rewards
por: Sinha, Abhishek
Publicado: (2023)
por: Sinha, Abhishek
Publicado: (2023)
Towards Computational Performance Engineering for Unsupervised Concept Drift Detection -- Complexities, Benchmarking, Performance Analysis
por: Werner, Elias, et al.
Publicado: (2023)
por: Werner, Elias, et al.
Publicado: (2023)
Ejemplares similares
-
COGNATE: Acceleration of Sparse Tensor Programs on Emerging Hardware using Transfer Learning
por: Sudusinghe, Chamika, et al.
Publicado: (2025) -
FLuRKA: Fast and accurate unified Low-Rank & Kernel Attention
por: Gupta, Ahan, et al.
Publicado: (2023) -
Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants
por: You, Bozhi, et al.
Publicado: (2025) -
oneDNN Graph Compiler: A Hybrid Approach for High-Performance Deep Learning Compilation
por: Li, Jianhui, et al.
Publicado: (2023) -
Efficient Graph Knowledge Distillation from GNNs to Kolmogorov--Arnold Networks via Self-Attention Dynamic Sampling
por: Cui, Can, et al.
Publicado: (2025)