CuAsmRL: Optimizing GPU SASS Schedules via Deep Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Guoliang, Yoneki, Eiko |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SIP: Autotuning GPU Native Schedules via Stochastic Instruction Perturbation
por: He, Guoliang, et al.
Publicado: (2024)
por: He, Guoliang, et al.
Publicado: (2024)
RL-MUL 2.0: Multiplier Design Optimization with Parallel Deep Reinforcement Learning and Space Reduction
por: Zuo, Dongsheng, et al.
Publicado: (2024)
por: Zuo, Dongsheng, et al.
Publicado: (2024)
GauS: Differentiable Scheduling Optimization via Gaussian Reparameterization
por: Cai, Yaohui, et al.
Publicado: (2026)
por: Cai, Yaohui, et al.
Publicado: (2026)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
por: Liu, Mingju, et al.
Publicado: (2026)
por: Liu, Mingju, et al.
Publicado: (2026)
IR-Aware ECO Timing Optimization Using Reinforcement Learning
por: Jiang, Wenjing, et al.
Publicado: (2024)
por: Jiang, Wenjing, et al.
Publicado: (2024)
μRL: Discovering Transient Execution Vulnerabilities Using Reinforcement Learning
por: Tol, M. Caner, et al.
Publicado: (2025)
por: Tol, M. Caner, et al.
Publicado: (2025)
SwiftRL: Towards Efficient Reinforcement Learning on Real Processing-In-Memory Systems
por: Gogineni, Kailash, et al.
Publicado: (2024)
por: Gogineni, Kailash, et al.
Publicado: (2024)
GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning
por: Wang, Jiaqi, et al.
Publicado: (2026)
por: Wang, Jiaqi, et al.
Publicado: (2026)
AP-DRL: A Synergistic Algorithm-Hardware Framework for Automatic Task Partitioning of Deep Reinforcement Learning on Versal ACAP
por: Li, Enlai, et al.
Publicado: (2026)
por: Li, Enlai, et al.
Publicado: (2026)
Automated Design and Optimization of Distributed Filtering Circuits via Reinforcement Learning
por: Gao, Peng, et al.
Publicado: (2024)
por: Gao, Peng, et al.
Publicado: (2024)
DG-RePlAce: A Dataflow-Driven GPU-Accelerated Analytical Global Placement Framework for Machine Learning Accelerators
por: Kahng, Andrew B., et al.
Publicado: (2024)
por: Kahng, Andrew B., et al.
Publicado: (2024)
Context-Aware Mixture-of-Experts Inference on CXL-Enabled GPU-NDP Systems
por: Fan, Zehao, et al.
Publicado: (2025)
por: Fan, Zehao, et al.
Publicado: (2025)
TCL: Enabling Fast and Efficient Cross-Hardware Tensor Program Optimization via Continual Learning
por: Shen, Chaoyao, et al.
Publicado: (2026)
por: Shen, Chaoyao, et al.
Publicado: (2026)
AutoPPA: Automated Circuit PPA Optimization via Contrastive Code-based Rule Library Learning
por: Li, Chongxiao, et al.
Publicado: (2026)
por: Li, Chongxiao, et al.
Publicado: (2026)
From LLM to Silicon: RL-Driven ASIC Architecture Exploration for On-Device AI Inference
por: Ganti, Ravindra, et al.
Publicado: (2026)
por: Ganti, Ravindra, et al.
Publicado: (2026)
Onboard Optimization and Learning: A Survey
por: Pavel, Monirul Islam, et al.
Publicado: (2025)
por: Pavel, Monirul Islam, et al.
Publicado: (2025)
Energy-Aware Deep Learning on Resource-Constrained Hardware
por: Millar, Josh, et al.
Publicado: (2025)
por: Millar, Josh, et al.
Publicado: (2025)
RLPlanner: Reinforcement Learning based Floorplanning for Chiplets with Fast Thermal Analysis
por: Duan, Yuanyuan, et al.
Publicado: (2023)
por: Duan, Yuanyuan, et al.
Publicado: (2023)
Deep Reinforcement Learning based Online Scheduling Policy for Deep Neural Network Multi-Tenant Multi-Accelerator Systems
por: Blanco, Francesco G., et al.
Publicado: (2024)
por: Blanco, Francesco G., et al.
Publicado: (2024)
FPGA Divide-and-Conquer Placement using Deep Reinforcement Learning
por: Wang, Shang, et al.
Publicado: (2024)
por: Wang, Shang, et al.
Publicado: (2024)
Associative Memory Based Experience Replay for Deep Reinforcement Learning
por: Li, Mengyuan, et al.
Publicado: (2022)
por: Li, Mengyuan, et al.
Publicado: (2022)
A Data-Driven Approach to Dataflow-Aware Online Scheduling for Graph Neural Network Inference
por: Puigdemont, Pol, et al.
Publicado: (2024)
por: Puigdemont, Pol, et al.
Publicado: (2024)
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
por: Cho, Eunyeong, et al.
Publicado: (2026)
por: Cho, Eunyeong, et al.
Publicado: (2026)
BBS: Bi-directional Bit-level Sparsity for Deep Learning Acceleration
por: Chen, Yuzong, et al.
Publicado: (2024)
por: Chen, Yuzong, et al.
Publicado: (2024)
DeepSeq2: Enhanced Sequential Circuit Learning with Disentangled Representations
por: Khan, Sadaf, et al.
Publicado: (2024)
por: Khan, Sadaf, et al.
Publicado: (2024)
RTLSeek: Boosting the LLM-Based RTL Generation with Multi-Stage Diversity-Oriented Reinforcement Learning
por: Zhang, Xinyu, et al.
Publicado: (2026)
por: Zhang, Xinyu, et al.
Publicado: (2026)
RNM-TD3: N:M Semi-structured Sparse Reinforcement Learning From Scratch
por: Vrce, Isam, et al.
Publicado: (2026)
por: Vrce, Isam, et al.
Publicado: (2026)
EvolveGen: Algorithmic Level Hardware Model Checking Benchmark Generation through Reinforcement Learning
por: Hu, Guangyu, et al.
Publicado: (2026)
por: Hu, Guangyu, et al.
Publicado: (2026)
DeepGate4: Efficient and Effective Representation Learning for Circuit Design at Scale
por: Zheng, Ziyang, et al.
Publicado: (2025)
por: Zheng, Ziyang, et al.
Publicado: (2025)
Schrödinger's FP: Dynamic Adaptation of Floating-Point Containers for Deep Learning Training
por: Nikolić, Miloš, et al.
Publicado: (2022)
por: Nikolić, Miloš, et al.
Publicado: (2022)
Explainable Fuzzy Neural Network with Multi-Fidelity Reinforcement Learning for Micro-Architecture Design Space Exploration
por: Fan, Hanwei, et al.
Publicado: (2024)
por: Fan, Hanwei, et al.
Publicado: (2024)
Rescaling-Aware Training for Efficient Deployment of Deep Learning Models on Full-Integer Hardware
por: Mueller, Lion, et al.
Publicado: (2025)
por: Mueller, Lion, et al.
Publicado: (2025)
MetaML-Pro: Cross-Stage Design Flow Automation for Efficient Deep Learning Acceleration
por: Que, Zhiqiang, et al.
Publicado: (2025)
por: Que, Zhiqiang, et al.
Publicado: (2025)
SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators
por: Bhattacharya, Swastik, et al.
Publicado: (2025)
por: Bhattacharya, Swastik, et al.
Publicado: (2025)
NeuroScalar: A Deep Learning Framework for Fast, Accurate, and In-the-Wild Cycle-Level Performance Prediction
por: Wadle, Shayne, et al.
Publicado: (2025)
por: Wadle, Shayne, et al.
Publicado: (2025)
NAS-Cap: Deep-Learning Driven 3-D Capacitance Extraction with Neural Architecture Search and Data Augmentation
por: Li, Haoyuan, et al.
Publicado: (2024)
por: Li, Haoyuan, et al.
Publicado: (2024)
Beyond Tokens: Enhancing RTL Quality Estimation via Structural Graph Learning
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance
por: Palaniappan, Kathiravan
Publicado: (2026)
por: Palaniappan, Kathiravan
Publicado: (2026)
Deep Inverse Design for High-Level Synthesis
por: Chang, Ping, et al.
Publicado: (2024)
por: Chang, Ping, et al.
Publicado: (2024)
BDD2Seq: Enabling Scalable Reversible-Circuit Synthesis via Graph-to-Sequence Learning
por: Miao, Mingkai, et al.
Publicado: (2025)
por: Miao, Mingkai, et al.
Publicado: (2025)
Ejemplares similares
-
SIP: Autotuning GPU Native Schedules via Stochastic Instruction Perturbation
por: He, Guoliang, et al.
Publicado: (2024) -
RL-MUL 2.0: Multiplier Design Optimization with Parallel Deep Reinforcement Learning and Space Reduction
por: Zuo, Dongsheng, et al.
Publicado: (2024) -
GauS: Differentiable Scheduling Optimization via Gaussian Reparameterization
por: Cai, Yaohui, et al.
Publicado: (2026) -
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
por: Liu, Mingju, et al.
Publicado: (2026) -
IR-Aware ECO Timing Optimization Using Reinforcement Learning
por: Jiang, Wenjing, et al.
Publicado: (2024)