KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nie, Jiayi, Wu, Haoran, Lai, Yao, Cao, Zeyu, Zhang, Cheng, Lou, Binglei, Wang, Erwei, Cheng, Jianyi, Jones, Timothy M., Mullins, Robert, Antonova, Rika, Zhao, Yiren |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs
par: Wu, Haoran, et autres
Publié: (2026)
par: Wu, Haoran, et autres
Publié: (2026)
Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference
par: Wu, Haoran, et autres
Publié: (2025)
par: Wu, Haoran, et autres
Publié: (2025)
NPU Design for Diffusion Language Model Inference
par: Lou, Binglei, et autres
Publié: (2026)
par: Lou, Binglei, et autres
Publié: (2026)
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
par: Zhang, Zixi, et autres
Publié: (2023)
par: Zhang, Zixi, et autres
Publié: (2023)
Towards Closing the Performance Gap for Cryptographic Kernels Between CPUs and Specialized Hardware
par: Zhang, Naifeng, et autres
Publié: (2025)
par: Zhang, Naifeng, et autres
Publié: (2025)
HASS: Hardware-Aware Sparsity Search for Dataflow DNN Accelerator
par: Yu, Zhewen, et autres
Publié: (2024)
par: Yu, Zhewen, et autres
Publié: (2024)
A Dataflow Compiler for Efficient LLM Inference using Custom Microscaling Formats
par: Cheng, Jianyi, et autres
Publié: (2023)
par: Cheng, Jianyi, et autres
Publié: (2023)
Enhancing LUT-based Deep Neural Networks Inference through Architecture and Connectivity Optimization
par: Lou, Binglei, et autres
Publié: (2026)
par: Lou, Binglei, et autres
Publié: (2026)
SparseLUT: Sparse Connectivity Optimization for Lookup Table-based Deep Neural Networks
par: Lou, Binglei, et autres
Publié: (2025)
par: Lou, Binglei, et autres
Publié: (2025)
Hardware-Efficient CNNs: Interleaved Approximate FP32 Multipliers for Kernel Computation
par: Gowda, Bindu G, et autres
Publié: (2025)
par: Gowda, Bindu G, et autres
Publié: (2025)
Refining Datapath for Microscaling ViTs
par: Xiao, Can, et autres
Publié: (2025)
par: Xiao, Can, et autres
Publié: (2025)
KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta
par: Liao, Gang, et autres
Publié: (2025)
par: Liao, Gang, et autres
Publié: (2025)
fSEAD: a Composable FPGA-based Streaming Ensemble Anomaly Detection Library
par: Lou, Binglei, et autres
Publié: (2024)
par: Lou, Binglei, et autres
Publié: (2024)
WaveTune: Wave-aware Bilinear Modeling for Efficient GPU Kernel Auto-tuning
par: Zhang, Kaixuan, et autres
Publié: (2026)
par: Zhang, Kaixuan, et autres
Publié: (2026)
Closing the Gap Between Float and Posit Hardware Efficiency
par: Jonnalagadda, Aditya Anirudh, et autres
Publié: (2026)
par: Jonnalagadda, Aditya Anirudh, et autres
Publié: (2026)
LLM-Powered Code Analysis and Optimization for Gaussian Splatting Kernels
par: Hu, Yi, et autres
Publié: (2025)
par: Hu, Yi, et autres
Publié: (2025)
Accelerating Mini-batch HGNN Training by Reducing CUDA Kernels
par: Wu, Meng, et autres
Publié: (2024)
par: Wu, Meng, et autres
Publié: (2024)
RAG-Enhanced Kernel-Based Heuristic Synthesis (RKHS): A Structured Methodology Using Large Language Models for Hardware Design
par: Ahir, Shiva, et autres
Publié: (2026)
par: Ahir, Shiva, et autres
Publié: (2026)
PolyLUT-Add: FPGA-based LUT Inference with Wide Inputs
par: Lou, Binglei, et autres
Publié: (2024)
par: Lou, Binglei, et autres
Publié: (2024)
Design and Optimization of Mixed-Kernel Mixed-Signal SVMs for Flexible Electronics
par: Afentaki, Florentia, et autres
Publié: (2025)
par: Afentaki, Florentia, et autres
Publié: (2025)
ACS: Concurrent Kernel Execution on Irregular, Input-Dependent Computational Graphs
par: Durvasula, Sankeerth, et autres
Publié: (2024)
par: Durvasula, Sankeerth, et autres
Publié: (2024)
Understanding Inference-Time Token Allocation and Coverage Limits in Agentic Hardware Verification
par: Patel, Vihaan, et autres
Publié: (2026)
par: Patel, Vihaan, et autres
Publié: (2026)
Efficient Kernel Mapping and Comprehensive System Evaluation of LLM Acceleration on a CGLA
par: Ando, Takuto, et autres
Publié: (2025)
par: Ando, Takuto, et autres
Publié: (2025)
Kernel Approximation using Analog In-Memory Computing
par: Büchel, Julian, et autres
Publié: (2024)
par: Büchel, Julian, et autres
Publié: (2024)
Spec2Cov: An Agentic Framework for Code Coverage Closure of Digital Hardware Designs
par: Lowe, Sean, et autres
Publié: (2026)
par: Lowe, Sean, et autres
Publié: (2026)
FETTA: Flexible and Efficient Hardware Accelerator for Tensorized Neural Network Training
par: Lu, Jinming, et autres
Publié: (2025)
par: Lu, Jinming, et autres
Publié: (2025)
Hey AI, Generate Me a Hardware Code! Agentic AI-based Hardware Design & Verification
par: Gadde, Deepak Narayan, et autres
Publié: (2025)
par: Gadde, Deepak Narayan, et autres
Publié: (2025)
Squire: A General-Purpose Accelerator to Exploit Fine-Grain Parallelism on Dependency-Bound Kernels
par: Langarita, Rubén, et autres
Publié: (2025)
par: Langarita, Rubén, et autres
Publié: (2025)
DRCY: Agentic Hardware Design Reviews
par: Dumont, Kyle, et autres
Publié: (2026)
par: Dumont, Kyle, et autres
Publié: (2026)
TurboFuzz: FPGA Accelerated Hardware Fuzzing for Processor Agile Verification
par: Zhong, Yang, et autres
Publié: (2025)
par: Zhong, Yang, et autres
Publié: (2025)
Architect in the Loop Agentic Hardware Design and Verification
par: Mohammed, Mubarek
Publié: (2025)
par: Mohammed, Mubarek
Publié: (2025)
A Joint Learning Approach to Hardware Caching and Prefetching
par: Yuan, Samuel, et autres
Publié: (2025)
par: Yuan, Samuel, et autres
Publié: (2025)
An FPGA-Based Accelerator Enabling Efficient Support for CNNs with Arbitrary Kernel Sizes
par: Wang, Miaoxin, et autres
Publié: (2024)
par: Wang, Miaoxin, et autres
Publié: (2024)
vMCU: Coordinated Memory Management and Kernel Optimization for DNN Inference on MCUs
par: Zheng, Size, et autres
Publié: (2024)
par: Zheng, Size, et autres
Publié: (2024)
Finesse: An Agile Design Framework for Pairing-based Cryptography via Software/Hardware Co-Design
par: Pan, Tianwei, et autres
Publié: (2025)
par: Pan, Tianwei, et autres
Publié: (2025)
Gen-NeRF: Efficient and Generalizable Neural Radiance Fields via Algorithm-Hardware Co-Design
par: Fu, Yonggan, et autres
Publié: (2023)
par: Fu, Yonggan, et autres
Publié: (2023)
ASPO: Constraint-Aware Bayesian Optimization for FPGA-based Soft Processors
par: Wu, Haoran, et autres
Publié: (2025)
par: Wu, Haoran, et autres
Publié: (2025)
Comprehensive Design Space Exploration for Tensorized Neural Network Hardware Accelerators
par: Zhang, Jinsong, et autres
Publié: (2025)
par: Zhang, Jinsong, et autres
Publié: (2025)
Low-Latency FPGA Control System for Real-Time Neural Network Processing in CCD-Based Trapped-Ion Qubit Measurement
par: Lou, Binglei, et autres
Publié: (2025)
par: Lou, Binglei, et autres
Publié: (2025)
NeoMem: Hardware/Software Co-Design for CXL-Native Memory Tiering
par: Zhou, Zhe, et autres
Publié: (2024)
par: Zhou, Zhe, et autres
Publié: (2024)
Documents similaires
-
MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs
par: Wu, Haoran, et autres
Publié: (2026) -
Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference
par: Wu, Haoran, et autres
Publié: (2025) -
NPU Design for Diffusion Language Model Inference
par: Lou, Binglei, et autres
Publié: (2026) -
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
par: Zhang, Zixi, et autres
Publié: (2023) -
Towards Closing the Performance Gap for Cryptographic Kernels Between CPUs and Specialized Hardware
par: Zhang, Naifeng, et autres
Publié: (2025)