From 8 Seconds to 370ms: Kernel-Fused SAR Imaging on Apple Silicon via Single-Dispatch FFT Pipelines
Fuente:
arXiv
Guardado en:
| Autor principal: | Bergach, Mohamed Amine |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Range, Not Precision: Block-Floating-Point Half-Precision FFT and SAR Imaging on Apple Silicon
por: Bergach, Mohamed Amine
Publicado: (2026)
por: Bergach, Mohamed Amine
Publicado: (2026)
Beating vDSP: A 138 GFLOPS Radix-8 Stockham FFT on Apple Silicon via Two-Tier Register-Threadgroup Memory Decomposition
por: Bergach, Mohamed Amine
Publicado: (2026)
por: Bergach, Mohamed Amine
Publicado: (2026)
Shortest-Path FFT: Optimal SIMD Instruction Scheduling via Graph Search
por: Bergach, Mohamed Amine
Publicado: (2026)
por: Bergach, Mohamed Amine
Publicado: (2026)
When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon
por: Bergach, Mohamed Amine
Publicado: (2026)
por: Bergach, Mohamed Amine
Publicado: (2026)
Dual-Select FMA Butterfly for FFT: Eliminating Twiddle Factor Singularities with Bounded Precomputed Ratios
por: Bergach, Mohamed Amine
Publicado: (2026)
por: Bergach, Mohamed Amine
Publicado: (2026)
Training Transformers in Cosine Coefficient Space
por: Bergach, Mohamed Amine
Publicado: (2026)
por: Bergach, Mohamed Amine
Publicado: (2026)
Profiling Apple Silicon Performance for ML Training
por: Feng, Dahua, et al.
Publicado: (2025)
por: Feng, Dahua, et al.
Publicado: (2025)
Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
por: Benazir, Afsara, et al.
Publicado: (2025)
por: Benazir, Afsara, et al.
Publicado: (2025)
Accelerating Sparse Ternary GEMM for Quantized ML on Apple Silicon
por: Lipshitz, Baraq, et al.
Publicado: (2025)
por: Lipshitz, Baraq, et al.
Publicado: (2025)
Evaluation of Domain-Specific Architectures for General-Purpose Applications in Apple Silicon
por: López, Álvaro Corrochano, et al.
Publicado: (2025)
por: López, Álvaro Corrochano, et al.
Publicado: (2025)
Size-Aware Dispatching to Fluid Queues
por: Xie, Runhan, et al.
Publicado: (2025)
por: Xie, Runhan, et al.
Publicado: (2025)
Heavy-Traffic Optimal Size- and State-Aware Dispatching
por: Xie, Runhan, et al.
Publicado: (2023)
por: Xie, Runhan, et al.
Publicado: (2023)
Execution time budget assignment for mixed criticality systems
por: Khelassi, Mohamed Amine, et al.
Publicado: (2023)
por: Khelassi, Mohamed Amine, et al.
Publicado: (2023)
AutoKernel: Autonomous GPU Kernel Optimization via Iterative Agent-Driven Search
por: Jaber, Jaber, et al.
Publicado: (2026)
por: Jaber, Jaber, et al.
Publicado: (2026)
"Two-Stagification": Job Dispatching in Large-Scale Clusters via a Two-Stage Architecture
por: Yildiz, Mert, et al.
Publicado: (2025)
por: Yildiz, Mert, et al.
Publicado: (2025)
DSO: A GPU Energy Efficiency Optimizer by Fusing Dynamic and Static Information
por: Wang, Qiang, et al.
Publicado: (2024)
por: Wang, Qiang, et al.
Publicado: (2024)
Cross-Platform Fused MoE Dispatch in Triton: Portable Expert Routing Without CUDA
por: Mitra, Subhadip
Publicado: (2026)
por: Mitra, Subhadip
Publicado: (2026)
V-Seek: Accelerating LLM Reasoning on Open-hardware Server-class RISC-V Platforms
por: Rodrigo, Javier J. Poveda, et al.
Publicado: (2025)
por: Rodrigo, Javier J. Poveda, et al.
Publicado: (2025)
Can Tensor Cores Benefit Memory-Bound Kernels? (No!)
por: Zhang, Lingqi, et al.
Publicado: (2025)
por: Zhang, Lingqi, et al.
Publicado: (2025)
Long-term Monitoring of Kernel and Hardware Events to Understand Latency Variance
por: Zhou, Fang, et al.
Publicado: (2026)
por: Zhou, Fang, et al.
Publicado: (2026)
Numerical Kernels on a Spatial Accelerator: A Study of Tenstorrent Wormhole
por: Taylor, Maya, et al.
Publicado: (2026)
por: Taylor, Maya, et al.
Publicado: (2026)
End-to-End Throughput Benchmarking of Portable Deterministic CNN-Based Signal Processing Pipelines
por: Boerkamp, Christiaan, et al.
Publicado: (2026)
por: Boerkamp, Christiaan, et al.
Publicado: (2026)
KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
Parsing Gigabytes of JSON per Second
por: Langdale, Geoff, et al.
Publicado: (2019)
por: Langdale, Geoff, et al.
Publicado: (2019)
Optimal Size-Aware Dispatching Rules via Value Iteration and Some Numerical Investigations
por: Hyytiä, Esa, et al.
Publicado: (2024)
por: Hyytiä, Esa, et al.
Publicado: (2024)
A Controlled Study of Memory Hierarchy Transitions in Quantum Circuit Simulation on Apple M4 Pro Unified Memory Architecture
por: Pratipat, Gyan
Publicado: (2026)
por: Pratipat, Gyan
Publicado: (2026)
CEBench: A Benchmarking Toolkit for the Cost-Effectiveness of LLM Pipelines
por: Sun, Wenbo, et al.
Publicado: (2024)
por: Sun, Wenbo, et al.
Publicado: (2024)
PPU: Design and Implementation of a Pipelined Full Posit Processing Unit
por: Rossi, Federico, et al.
Publicado: (2023)
por: Rossi, Federico, et al.
Publicado: (2023)
Reducing Compute Waste in LLMs through Kernel-Level DVFS
por: Spaan, Jeffrey, et al.
Publicado: (2026)
por: Spaan, Jeffrey, et al.
Publicado: (2026)
Insum: Sparse GPU Kernels Simplified and Optimized with Indirect Einsums
por: Won, Jaeyeon, et al.
Publicado: (2025)
por: Won, Jaeyeon, et al.
Publicado: (2025)
Revisiting Forest Proximities via Sparse Leaf-Incidence Kernels
por: Aumon, Adrien, et al.
Publicado: (2026)
por: Aumon, Adrien, et al.
Publicado: (2026)
MLKAPS: Machine Learning and Adaptive Sampling for HPC Kernel Auto-tuning
por: Jam, Mathys, et al.
Publicado: (2025)
por: Jam, Mathys, et al.
Publicado: (2025)
Optimizing Winograd Convolution on ARMv8 processors
por: Gui, Haoyuan, et al.
Publicado: (2024)
por: Gui, Haoyuan, et al.
Publicado: (2024)
Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes
por: Hendria, Willy Fitra
Publicado: (2026)
por: Hendria, Willy Fitra
Publicado: (2026)
GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning
por: Wang, Jiaqi, et al.
Publicado: (2026)
por: Wang, Jiaqi, et al.
Publicado: (2026)
Makinote: An FPGA-Based HW/SW Platform for Pre-Silicon Emulation of RISC-V Designs
por: Perdomo, Elias, et al.
Publicado: (2024)
por: Perdomo, Elias, et al.
Publicado: (2024)
WaveTune: Wave-aware Bilinear Modeling for Efficient GPU Kernel Auto-tuning
por: Zhang, Kaixuan, et al.
Publicado: (2026)
por: Zhang, Kaixuan, et al.
Publicado: (2026)
FlipFlop: A Static Analysis-based Energy Optimization Framework for GPU Kernels
por: Rajput, Saurabhsingh, et al.
Publicado: (2026)
por: Rajput, Saurabhsingh, et al.
Publicado: (2026)
A Kernel-Based Approach for Accurate Steady-State Detection in Performance Time Series
por: Beseda, Martin, et al.
Publicado: (2025)
por: Beseda, Martin, et al.
Publicado: (2025)
Automating Energy-Efficient GPU Kernel Generation: A Fast Search-Based Compilation Approach
por: Zhang, Yijia, et al.
Publicado: (2024)
por: Zhang, Yijia, et al.
Publicado: (2024)
Ejemplares similares
-
Range, Not Precision: Block-Floating-Point Half-Precision FFT and SAR Imaging on Apple Silicon
por: Bergach, Mohamed Amine
Publicado: (2026) -
Beating vDSP: A 138 GFLOPS Radix-8 Stockham FFT on Apple Silicon via Two-Tier Register-Threadgroup Memory Decomposition
por: Bergach, Mohamed Amine
Publicado: (2026) -
Shortest-Path FFT: Optimal SIMD Instruction Scheduling via Graph Search
por: Bergach, Mohamed Amine
Publicado: (2026) -
When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon
por: Bergach, Mohamed Amine
Publicado: (2026) -
Dual-Select FMA Butterfly for FFT: Eliminating Twiddle Factor Singularities with Bounded Precomputed Ratios
por: Bergach, Mohamed Amine
Publicado: (2026)