PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lei, Kelun, Yang, Hailong, Zhang, Huaitao, You, Xin, Zhang, Kaige, Luan, Zhongzhi, Liu, Yi, Qian, Depei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025)
par: Lei, Kelun, et autres
Publié: (2025)
FDLoRA: Personalized Federated Learning of Large Language Model via Dual LoRA Tuning
par: QI, Jiaxing, et autres
Publié: (2024)
par: QI, Jiaxing, et autres
Publié: (2024)
INSPIRIT: Optimizing Heterogeneous Task Scheduling through Adaptive Priority in Task-based Runtime Systems
par: Wang, Yiqing, et autres
Publié: (2024)
par: Wang, Yiqing, et autres
Publié: (2024)
Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers
par: Lu, Yao, et autres
Publié: (2026)
par: Lu, Yao, et autres
Publié: (2026)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
par: Wang, Siqi, et autres
Publié: (2024)
par: Wang, Siqi, et autres
Publié: (2024)
CB-SpMV:A Data Aggregating and Balance Algorithm for Cache-Friendly Block-Based SpMV on GPUs
par: Cong, Xing, et autres
Publié: (2026)
par: Cong, Xing, et autres
Publié: (2026)
ACC Saturator: Automatic Kernel Optimization for Directive-Based GPU Code
par: Matsumura, Kazuaki, et autres
Publié: (2023)
par: Matsumura, Kazuaki, et autres
Publié: (2023)
Syncopate: Efficient Multi-GPU AI Kernels via Automatic Chunk-Centric Compute-Communication Overlap
par: Qiang, Xinwei, et autres
Publié: (2026)
par: Qiang, Xinwei, et autres
Publié: (2026)
Parallelized Multi-Agent Bayesian Optimization in Lava
par: Snyder, Shay, et autres
Publié: (2024)
par: Snyder, Shay, et autres
Publié: (2024)
HyperParallel: A Supernode-Affinity AI Framework
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Scrutinizing Variables for Checkpoint Using Automatic Differentiation
par: Huang, Xin, et autres
Publié: (2026)
par: Huang, Xin, et autres
Publié: (2026)
AgentFlow: Resilient Adaptive Cloud-Edge Framework for Multi-Agent Coordination
par: Chen, Ching Han, et autres
Publié: (2025)
par: Chen, Ching Han, et autres
Publié: (2025)
Datacenter Energy Optimized Power Profiles
par: Narayanaswamy, Sreedhar, et autres
Publié: (2025)
par: Narayanaswamy, Sreedhar, et autres
Publié: (2025)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
par: Jangda, Abhinav, et autres
Publié: (2023)
par: Jangda, Abhinav, et autres
Publié: (2023)
Collaborative UAVs Multi-task Video Processing Optimization Based on Enhanced Distributed Actor-Critic Networks
par: Rong, Ziqi, et autres
Publié: (2024)
par: Rong, Ziqi, et autres
Publié: (2024)
KIS-S: A GPU-Aware Kubernetes Inference Simulator with RL-Based Auto-Scaling
par: Zhang, Guilin, et autres
Publié: (2025)
par: Zhang, Guilin, et autres
Publié: (2025)
Union: An Automatic Workload Manager for Accelerating Network Simulation
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
Reaching Agreement Among Reasoning LLM Agents
par: Ruan, Chaoyi, et autres
Publié: (2025)
par: Ruan, Chaoyi, et autres
Publié: (2025)
A Reinforcement Learning-Driven Task Scheduling Algorithm for Multi-Tenant Distributed Systems
par: Zhang, Xiaopei, et autres
Publié: (2025)
par: Zhang, Xiaopei, et autres
Publié: (2025)
ZEUS: An Efficient GPU Optimization Method Integrating PSO, BFGS, and Automatic Differentiation
par: Soos, Dominik, et autres
Publié: (2026)
par: Soos, Dominik, et autres
Publié: (2026)
A Digital Twin-based Multi-Agent Reinforcement Learning Framework for Vehicle-to-Grid Coordination
par: Hua, Zhengchang, et autres
Publié: (2025)
par: Hua, Zhengchang, et autres
Publié: (2025)
DawnPiper: A Memory-scablable Pipeline Parallel Training Framework
par: Peng, Xuan, et autres
Publié: (2025)
par: Peng, Xuan, et autres
Publié: (2025)
Plug & Offload: Transparently Offloading TCP Stack onto Off-path SmartNIC with PnO-TCP
par: Nan, Hailong, et autres
Publié: (2025)
par: Nan, Hailong, et autres
Publié: (2025)
Diagonal Scaling: A Multi-Dimensional Resource Model and Optimization Framework for Distributed Databases
par: Abdullah, Shahir, et autres
Publié: (2025)
par: Abdullah, Shahir, et autres
Publié: (2025)
SpComm3D: A Framework for Enabling Sparse Communication in 3D Sparse Kernels
par: Abubaker, Nabil, et autres
Publié: (2024)
par: Abubaker, Nabil, et autres
Publié: (2024)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
par: Davis, Joshua H., et autres
Publié: (2026)
par: Davis, Joshua H., et autres
Publié: (2026)
A Multi-Objective Framework for Optimizing GPU-Enabled VM Placement in Cloud Data Centers with Multi-Instance GPU Technology
par: Siavashi, Ahmad, et autres
Publié: (2025)
par: Siavashi, Ahmad, et autres
Publié: (2025)
Multi-level Memory-Centric Profiling on ARM Processors with ARM SPE
par: Miksits, Samuel, et autres
Publié: (2024)
par: Miksits, Samuel, et autres
Publié: (2024)
TokenDance: Scaling Multi-Agent LLM Serving via Collective KV Cache Sharing
par: Bian, Zhuohang, et autres
Publié: (2026)
par: Bian, Zhuohang, et autres
Publié: (2026)
Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
par: Nichols, Daniel, et autres
Publié: (2025)
par: Nichols, Daniel, et autres
Publié: (2025)
Fantasy: Efficient Large-scale Vector Search on GPU Clusters with GPUDirect Async
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
StableShard: Stable and Scalable Blockchain Sharding with High Concurrency via Collaborative Committees
par: Li, Mingzhe, et autres
Publié: (2024)
par: Li, Mingzhe, et autres
Publié: (2024)
ucTrace: A Multi-Layer Profiling Tool for UCX-driven Communication
par: Gencer, Emir, et autres
Publié: (2026)
par: Gencer, Emir, et autres
Publié: (2026)
SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference
par: Zhao, Yihao, et autres
Publié: (2025)
par: Zhao, Yihao, et autres
Publié: (2025)
Distributed Generative Inference of LLM at Internet Scales with Multi-Dimensional Communication Optimization
par: Chen, Jiu, et autres
Publié: (2026)
par: Chen, Jiu, et autres
Publié: (2026)
HPDR: High-Performance Portable Scientific Data Reduction Framework
par: Chen, Jieyang, et autres
Publié: (2025)
par: Chen, Jieyang, et autres
Publié: (2025)
tritonBLAS: Triton-based Analytical Approach for GEMM Kernel Parameter Selection
par: Swann, Ryan, et autres
Publié: (2025)
par: Swann, Ryan, et autres
Publié: (2025)
Distributed Consensus Network: A Modularized Communication Framework and Reliability Probabilistic Analysis
par: Li, Yuetai, et autres
Publié: (2025)
par: Li, Yuetai, et autres
Publié: (2025)
An Optimized Error-controlled MPI Collective Framework Integrated with Lossy Compression
par: Huang, Jiajun, et autres
Publié: (2023)
par: Huang, Jiajun, et autres
Publié: (2023)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
par: Spoczynski, Marcin, et autres
Publié: (2026)
par: Spoczynski, Marcin, et autres
Publié: (2026)
Documents similaires
-
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025) -
FDLoRA: Personalized Federated Learning of Large Language Model via Dual LoRA Tuning
par: QI, Jiaxing, et autres
Publié: (2024) -
INSPIRIT: Optimizing Heterogeneous Task Scheduling through Adaptive Priority in Task-based Runtime Systems
par: Wang, Yiqing, et autres
Publié: (2024) -
Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers
par: Lu, Yao, et autres
Publié: (2026) -
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
par: Wang, Siqi, et autres
Publié: (2024)