CuAsmRL: Optimizing GPU SASS Schedules via Deep Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Guoliang, Yoneki, Eiko |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SIP: Autotuning GPU Native Schedules via Stochastic Instruction Perturbation
par: He, Guoliang, et autres
Publié: (2024)
par: He, Guoliang, et autres
Publié: (2024)
RL-MUL 2.0: Multiplier Design Optimization with Parallel Deep Reinforcement Learning and Space Reduction
par: Zuo, Dongsheng, et autres
Publié: (2024)
par: Zuo, Dongsheng, et autres
Publié: (2024)
GauS: Differentiable Scheduling Optimization via Gaussian Reparameterization
par: Cai, Yaohui, et autres
Publié: (2026)
par: Cai, Yaohui, et autres
Publié: (2026)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
par: Liu, Mingju, et autres
Publié: (2026)
par: Liu, Mingju, et autres
Publié: (2026)
IR-Aware ECO Timing Optimization Using Reinforcement Learning
par: Jiang, Wenjing, et autres
Publié: (2024)
par: Jiang, Wenjing, et autres
Publié: (2024)
μRL: Discovering Transient Execution Vulnerabilities Using Reinforcement Learning
par: Tol, M. Caner, et autres
Publié: (2025)
par: Tol, M. Caner, et autres
Publié: (2025)
SwiftRL: Towards Efficient Reinforcement Learning on Real Processing-In-Memory Systems
par: Gogineni, Kailash, et autres
Publié: (2024)
par: Gogineni, Kailash, et autres
Publié: (2024)
GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning
par: Wang, Jiaqi, et autres
Publié: (2026)
par: Wang, Jiaqi, et autres
Publié: (2026)
AP-DRL: A Synergistic Algorithm-Hardware Framework for Automatic Task Partitioning of Deep Reinforcement Learning on Versal ACAP
par: Li, Enlai, et autres
Publié: (2026)
par: Li, Enlai, et autres
Publié: (2026)
Automated Design and Optimization of Distributed Filtering Circuits via Reinforcement Learning
par: Gao, Peng, et autres
Publié: (2024)
par: Gao, Peng, et autres
Publié: (2024)
DG-RePlAce: A Dataflow-Driven GPU-Accelerated Analytical Global Placement Framework for Machine Learning Accelerators
par: Kahng, Andrew B., et autres
Publié: (2024)
par: Kahng, Andrew B., et autres
Publié: (2024)
Context-Aware Mixture-of-Experts Inference on CXL-Enabled GPU-NDP Systems
par: Fan, Zehao, et autres
Publié: (2025)
par: Fan, Zehao, et autres
Publié: (2025)
TCL: Enabling Fast and Efficient Cross-Hardware Tensor Program Optimization via Continual Learning
par: Shen, Chaoyao, et autres
Publié: (2026)
par: Shen, Chaoyao, et autres
Publié: (2026)
AutoPPA: Automated Circuit PPA Optimization via Contrastive Code-based Rule Library Learning
par: Li, Chongxiao, et autres
Publié: (2026)
par: Li, Chongxiao, et autres
Publié: (2026)
From LLM to Silicon: RL-Driven ASIC Architecture Exploration for On-Device AI Inference
par: Ganti, Ravindra, et autres
Publié: (2026)
par: Ganti, Ravindra, et autres
Publié: (2026)
Onboard Optimization and Learning: A Survey
par: Pavel, Monirul Islam, et autres
Publié: (2025)
par: Pavel, Monirul Islam, et autres
Publié: (2025)
Energy-Aware Deep Learning on Resource-Constrained Hardware
par: Millar, Josh, et autres
Publié: (2025)
par: Millar, Josh, et autres
Publié: (2025)
RLPlanner: Reinforcement Learning based Floorplanning for Chiplets with Fast Thermal Analysis
par: Duan, Yuanyuan, et autres
Publié: (2023)
par: Duan, Yuanyuan, et autres
Publié: (2023)
Deep Reinforcement Learning based Online Scheduling Policy for Deep Neural Network Multi-Tenant Multi-Accelerator Systems
par: Blanco, Francesco G., et autres
Publié: (2024)
par: Blanco, Francesco G., et autres
Publié: (2024)
FPGA Divide-and-Conquer Placement using Deep Reinforcement Learning
par: Wang, Shang, et autres
Publié: (2024)
par: Wang, Shang, et autres
Publié: (2024)
Associative Memory Based Experience Replay for Deep Reinforcement Learning
par: Li, Mengyuan, et autres
Publié: (2022)
par: Li, Mengyuan, et autres
Publié: (2022)
A Data-Driven Approach to Dataflow-Aware Online Scheduling for Graph Neural Network Inference
par: Puigdemont, Pol, et autres
Publié: (2024)
par: Puigdemont, Pol, et autres
Publié: (2024)
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
par: Cho, Eunyeong, et autres
Publié: (2026)
par: Cho, Eunyeong, et autres
Publié: (2026)
BBS: Bi-directional Bit-level Sparsity for Deep Learning Acceleration
par: Chen, Yuzong, et autres
Publié: (2024)
par: Chen, Yuzong, et autres
Publié: (2024)
DeepSeq2: Enhanced Sequential Circuit Learning with Disentangled Representations
par: Khan, Sadaf, et autres
Publié: (2024)
par: Khan, Sadaf, et autres
Publié: (2024)
RTLSeek: Boosting the LLM-Based RTL Generation with Multi-Stage Diversity-Oriented Reinforcement Learning
par: Zhang, Xinyu, et autres
Publié: (2026)
par: Zhang, Xinyu, et autres
Publié: (2026)
RNM-TD3: N:M Semi-structured Sparse Reinforcement Learning From Scratch
par: Vrce, Isam, et autres
Publié: (2026)
par: Vrce, Isam, et autres
Publié: (2026)
EvolveGen: Algorithmic Level Hardware Model Checking Benchmark Generation through Reinforcement Learning
par: Hu, Guangyu, et autres
Publié: (2026)
par: Hu, Guangyu, et autres
Publié: (2026)
DeepGate4: Efficient and Effective Representation Learning for Circuit Design at Scale
par: Zheng, Ziyang, et autres
Publié: (2025)
par: Zheng, Ziyang, et autres
Publié: (2025)
Schrödinger's FP: Dynamic Adaptation of Floating-Point Containers for Deep Learning Training
par: Nikolić, Miloš, et autres
Publié: (2022)
par: Nikolić, Miloš, et autres
Publié: (2022)
Explainable Fuzzy Neural Network with Multi-Fidelity Reinforcement Learning for Micro-Architecture Design Space Exploration
par: Fan, Hanwei, et autres
Publié: (2024)
par: Fan, Hanwei, et autres
Publié: (2024)
Rescaling-Aware Training for Efficient Deployment of Deep Learning Models on Full-Integer Hardware
par: Mueller, Lion, et autres
Publié: (2025)
par: Mueller, Lion, et autres
Publié: (2025)
MetaML-Pro: Cross-Stage Design Flow Automation for Efficient Deep Learning Acceleration
par: Que, Zhiqiang, et autres
Publié: (2025)
par: Que, Zhiqiang, et autres
Publié: (2025)
SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators
par: Bhattacharya, Swastik, et autres
Publié: (2025)
par: Bhattacharya, Swastik, et autres
Publié: (2025)
NeuroScalar: A Deep Learning Framework for Fast, Accurate, and In-the-Wild Cycle-Level Performance Prediction
par: Wadle, Shayne, et autres
Publié: (2025)
par: Wadle, Shayne, et autres
Publié: (2025)
NAS-Cap: Deep-Learning Driven 3-D Capacitance Extraction with Neural Architecture Search and Data Augmentation
par: Li, Haoyuan, et autres
Publié: (2024)
par: Li, Haoyuan, et autres
Publié: (2024)
Beyond Tokens: Enhancing RTL Quality Estimation via Structural Graph Learning
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance
par: Palaniappan, Kathiravan
Publié: (2026)
par: Palaniappan, Kathiravan
Publié: (2026)
Deep Inverse Design for High-Level Synthesis
par: Chang, Ping, et autres
Publié: (2024)
par: Chang, Ping, et autres
Publié: (2024)
BDD2Seq: Enabling Scalable Reversible-Circuit Synthesis via Graph-to-Sequence Learning
par: Miao, Mingkai, et autres
Publié: (2025)
par: Miao, Mingkai, et autres
Publié: (2025)
Documents similaires
-
SIP: Autotuning GPU Native Schedules via Stochastic Instruction Perturbation
par: He, Guoliang, et autres
Publié: (2024) -
RL-MUL 2.0: Multiplier Design Optimization with Parallel Deep Reinforcement Learning and Space Reduction
par: Zuo, Dongsheng, et autres
Publié: (2024) -
GauS: Differentiable Scheduling Optimization via Gaussian Reparameterization
par: Cai, Yaohui, et autres
Publié: (2026) -
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
par: Liu, Mingju, et autres
Publié: (2026) -
IR-Aware ECO Timing Optimization Using Reinforcement Learning
par: Jiang, Wenjing, et autres
Publié: (2024)