Syno: Structured Synthesis for Neural Operators
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhuo, Yongqi, Su, Zhengyuan, Zhao, Chenggang, Gao, Mingyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Canvas: End-to-End Kernel Architecture Search in Neural Networks
di: Zhao, Chenggang, et al.
Pubblicazione: (2023)
di: Zhao, Chenggang, et al.
Pubblicazione: (2023)
Lightweight Software Kernels and Hardware Extensions for Efficient Sparse Deep Neural Networks on Microcontrollers
di: Daghero, Francesco, et al.
Pubblicazione: (2025)
di: Daghero, Francesco, et al.
Pubblicazione: (2025)
Reliable Microservice Tail Latency Prediction via Decoupled Dual-Stream Learning and Gradient Modulation
di: Qian, Wenzhuo, et al.
Pubblicazione: (2025)
di: Qian, Wenzhuo, et al.
Pubblicazione: (2025)
TrainMover: An Interruption-Resilient Runtime for ML Training
di: Lao, ChonLam, et al.
Pubblicazione: (2024)
di: Lao, ChonLam, et al.
Pubblicazione: (2024)
ProTrain: Efficient LLM Training via Memory-Aware Techniques
di: Yang, Hanmei, et al.
Pubblicazione: (2024)
di: Yang, Hanmei, et al.
Pubblicazione: (2024)
FastPersist: Accelerating Model Checkpointing in Deep Learning
di: Wang, Guanhua, et al.
Pubblicazione: (2024)
di: Wang, Guanhua, et al.
Pubblicazione: (2024)
Mixture of Experts with Mixture of Precisions for Tuning Quality of Service
di: Imani, HamidReza, et al.
Pubblicazione: (2024)
di: Imani, HamidReza, et al.
Pubblicazione: (2024)
Optimizing the Deployment of Tiny Transformers on Low-Power MCUs
di: Jung, Victor J. B., et al.
Pubblicazione: (2024)
di: Jung, Victor J. B., et al.
Pubblicazione: (2024)
Compiler-First State Space Duality and Portable $O(1)$ Autoregressive Caching for Inference
di: Santoni, Cosmo
Pubblicazione: (2026)
di: Santoni, Cosmo
Pubblicazione: (2026)
Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems
di: Miao, Xupeng, et al.
Pubblicazione: (2023)
di: Miao, Xupeng, et al.
Pubblicazione: (2023)
Prompt-Aware Scheduling for Low-Latency LLM Serving
di: Tao, Yiheng, et al.
Pubblicazione: (2025)
di: Tao, Yiheng, et al.
Pubblicazione: (2025)
Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices
di: Sedlak, Boris, et al.
Pubblicazione: (2025)
di: Sedlak, Boris, et al.
Pubblicazione: (2025)
The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures
di: Ma, Bole, et al.
Pubblicazione: (2026)
di: Ma, Bole, et al.
Pubblicazione: (2026)
Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search
di: Nichols, Daniel, et al.
Pubblicazione: (2026)
di: Nichols, Daniel, et al.
Pubblicazione: (2026)
Low-Rank GEMM: Efficient Matrix Multiplication via Low-Rank Approximation with FP8 Acceleration
di: Metere, Alfredo
Pubblicazione: (2025)
di: Metere, Alfredo
Pubblicazione: (2025)
Longer Attention Span: Increasing Transformer Context Length with Sparse Graph Processing Techniques
di: Tomczak, Nathaniel, et al.
Pubblicazione: (2025)
di: Tomczak, Nathaniel, et al.
Pubblicazione: (2025)
Training Time Prediction for Mixed Precision-based Distributed Training
di: Kang, Minchul, et al.
Pubblicazione: (2026)
di: Kang, Minchul, et al.
Pubblicazione: (2026)
Prism: Unleashing GPU Sharing for Cost-Efficient Multi-LLM Serving
di: Yu, Shan, et al.
Pubblicazione: (2025)
di: Yu, Shan, et al.
Pubblicazione: (2025)
Sometimes Painful but Certainly Promising: Feasibility and Trade-offs of Language Model Inference at the Edge
di: Abstreiter, Maximilian, et al.
Pubblicazione: (2025)
di: Abstreiter, Maximilian, et al.
Pubblicazione: (2025)
GPU Kernel Optimization Beyond Full Builds: An LLM Framework with Minimal Executable Programs
di: Chu, Ruifan, et al.
Pubblicazione: (2025)
di: Chu, Ruifan, et al.
Pubblicazione: (2025)
QPART: Adaptive Model Quantization and Dynamic Workload Balancing for Accuracy-aware Edge Inference
di: Li, Xiangchen, et al.
Pubblicazione: (2025)
di: Li, Xiangchen, et al.
Pubblicazione: (2025)
A Comparative Study of OpenMP Scheduling Algorithm Selection Strategies
di: Korndörfer, Jonas H. Müller, et al.
Pubblicazione: (2025)
di: Korndörfer, Jonas H. Müller, et al.
Pubblicazione: (2025)
Democratizing AI: A Comparative Study in Deep Learning Efficiency and Future Trends in Computational Processing
di: Amin, Lisan Al, et al.
Pubblicazione: (2026)
di: Amin, Lisan Al, et al.
Pubblicazione: (2026)
MQ-GNN: A Multi-Queue Pipelined Architecture for Scalable and Efficient GNN Training
di: Ullah, Irfan, et al.
Pubblicazione: (2026)
di: Ullah, Irfan, et al.
Pubblicazione: (2026)
Cost-Efficient LLM Training with Lifetime-Aware Tensor Offloading via GPUDirect Storage
di: Yuan, Ziqi, et al.
Pubblicazione: (2025)
di: Yuan, Ziqi, et al.
Pubblicazione: (2025)
STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
A 4D Hybrid Algorithm to Scale Parallel Training to Thousands of GPUs
di: Singh, Siddharth, et al.
Pubblicazione: (2023)
di: Singh, Siddharth, et al.
Pubblicazione: (2023)
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
di: Zhou, Zhongzhu, et al.
Pubblicazione: (2026)
di: Zhou, Zhongzhu, et al.
Pubblicazione: (2026)
iSpLib: A Library for Accelerating Graph Neural Networks using Auto-tuned Sparse Operations
di: Anik, Md Saidul Hoque, et al.
Pubblicazione: (2024)
di: Anik, Md Saidul Hoque, et al.
Pubblicazione: (2024)
Efficient Chromosome Parallelization for Precision Medicine Genomic Workflows
di: Montserrat, Daniel Mas, et al.
Pubblicazione: (2025)
di: Montserrat, Daniel Mas, et al.
Pubblicazione: (2025)
CoServe: Efficient Collaboration-of-Experts (CoE) Model Inference with Limited Memory
di: Suo, Jiashun, et al.
Pubblicazione: (2025)
di: Suo, Jiashun, et al.
Pubblicazione: (2025)
Distributed Matrix-Based Sampling for Graph Neural Network Training
di: Tripathy, Alok, et al.
Pubblicazione: (2023)
di: Tripathy, Alok, et al.
Pubblicazione: (2023)
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
di: Yang, Shang, et al.
Pubblicazione: (2025)
di: Yang, Shang, et al.
Pubblicazione: (2025)
Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents
di: Zhang, Qizheng, et al.
Pubblicazione: (2025)
di: Zhang, Qizheng, et al.
Pubblicazione: (2025)
GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving
di: Jayakody, Shakya, et al.
Pubblicazione: (2026)
di: Jayakody, Shakya, et al.
Pubblicazione: (2026)
Ariel-ML: Computing Parallelization with Embedded Rust for Neural Networks on Heterogeneous Multi-core Microcontrollers
di: Huang, Zhaolan, et al.
Pubblicazione: (2025)
di: Huang, Zhaolan, et al.
Pubblicazione: (2025)
Phantora: Maximizing Code Reuse in Simulation-based Machine Learning System Performance Estimation
di: Qin, Jianxing, et al.
Pubblicazione: (2025)
di: Qin, Jianxing, et al.
Pubblicazione: (2025)
KVPR: Efficient LLM Inference with I/O-Aware KV Cache Partial Recomputation
di: Jiang, Chaoyi, et al.
Pubblicazione: (2024)
di: Jiang, Chaoyi, et al.
Pubblicazione: (2024)
cedar: Optimized and Unified Machine Learning Input Data Pipelines
di: Zhao, Mark, et al.
Pubblicazione: (2024)
di: Zhao, Mark, et al.
Pubblicazione: (2024)
Deep Optimizer States: Towards Scalable Training of Transformer Models Using Interleaved Offloading
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Canvas: End-to-End Kernel Architecture Search in Neural Networks
di: Zhao, Chenggang, et al.
Pubblicazione: (2023) -
Lightweight Software Kernels and Hardware Extensions for Efficient Sparse Deep Neural Networks on Microcontrollers
di: Daghero, Francesco, et al.
Pubblicazione: (2025) -
Reliable Microservice Tail Latency Prediction via Decoupled Dual-Stream Learning and Gradient Modulation
di: Qian, Wenzhuo, et al.
Pubblicazione: (2025) -
TrainMover: An Interruption-Resilient Runtime for ML Training
di: Lao, ChonLam, et al.
Pubblicazione: (2024) -
ProTrain: Efficient LLM Training via Memory-Aware Techniques
di: Yang, Hanmei, et al.
Pubblicazione: (2024)