VLSI Hypergraph Partitioning with Deep Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Khan, Muhammad Hadir, Onal, Bugra, Dogan, Eren, Guthaus, Matthew R. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GATMesh: Clock Mesh Timing Analysis using Graph Neural Networks
di: Khan, Muhammad Hadir, et al.
Pubblicazione: (2025)
di: Khan, Muhammad Hadir, et al.
Pubblicazione: (2025)
Hierarchical Resource Partitioning on Modern GPUs: A Reinforcement Learning Approach
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
Strict Partitioning for Sporadic Rigid Gang Tasks
di: Sun, Binqi, et al.
Pubblicazione: (2024)
di: Sun, Binqi, et al.
Pubblicazione: (2024)
ZettaLith: An Architectural Exploration of Extreme-Scale AI Inference Acceleration
di: Silverbrook, Kia
Pubblicazione: (2025)
di: Silverbrook, Kia
Pubblicazione: (2025)
Enabling Accelerators for Graph Computing
di: Shivdikar, Kaustubh
Pubblicazione: (2023)
di: Shivdikar, Kaustubh
Pubblicazione: (2023)
SLO-aware GPU Frequency Scaling for Energy Efficient LLM Inference Serving
di: Kakolyris, Andreas Kosmas, et al.
Pubblicazione: (2024)
di: Kakolyris, Andreas Kosmas, et al.
Pubblicazione: (2024)
Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
di: Yu, Zhongkai, et al.
Pubblicazione: (2025)
di: Yu, Zhongkai, et al.
Pubblicazione: (2025)
MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2025)
di: Bambhaniya, Abhimanyu Rajeshkumar, et al.
Pubblicazione: (2025)
Accelerating Sampling and Aggregation Operations in GNN Frameworks with GPU Initiated Direct Storage Accesses
di: Park, Jeongmin Brian, et al.
Pubblicazione: (2023)
di: Park, Jeongmin Brian, et al.
Pubblicazione: (2023)
Demystifying AI Platform Design for Distributed Inference of Next-Generation LLM models
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2024)
di: Bambhaniya, Abhimanyu, et al.
Pubblicazione: (2024)
Sustainable AI Training via Hardware-Software Co-Design on NVIDIA, AMD, and Emerging GPU Architectures
di: Makin, Yashasvi, et al.
Pubblicazione: (2025)
di: Makin, Yashasvi, et al.
Pubblicazione: (2025)
PREBA: A Hardware/Software Co-Design for Multi-Instance GPU based AI Inference Servers
di: Yeo, Gwangoo, et al.
Pubblicazione: (2024)
di: Yeo, Gwangoo, et al.
Pubblicazione: (2024)
AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving
di: Yu, Zhongkai, et al.
Pubblicazione: (2026)
di: Yu, Zhongkai, et al.
Pubblicazione: (2026)
Splitwiser: Efficient LM inference with constrained resources
di: Aali, Asad, et al.
Pubblicazione: (2025)
di: Aali, Asad, et al.
Pubblicazione: (2025)
CUTEv2: Unified and Configurable Matrix Extension for Diverse CPU Architectures with Minimal Design Overhead
di: Ye, Jinpeng, et al.
Pubblicazione: (2026)
di: Ye, Jinpeng, et al.
Pubblicazione: (2026)
PIM-Opt: Demystifying Distributed Optimization Algorithms on a Real-World Processing-In-Memory System
di: Rhyner, Steve, et al.
Pubblicazione: (2024)
di: Rhyner, Steve, et al.
Pubblicazione: (2024)
Sensitivity-Guided Framework for Pruned and Quantized Reservoir Computing Accelerators
di: Jafari, Atousa, et al.
Pubblicazione: (2026)
di: Jafari, Atousa, et al.
Pubblicazione: (2026)
PAPI: Exploiting Dynamic Parallelism in Large Language Model Decoding with a Processing-In-Memory-Enabled Computing System
di: He, Yintao, et al.
Pubblicazione: (2025)
di: He, Yintao, et al.
Pubblicazione: (2025)
Serving Large Language Models on Huawei CloudMatrix384
di: Zuo, Pengfei, et al.
Pubblicazione: (2025)
di: Zuo, Pengfei, et al.
Pubblicazione: (2025)
FlexLink: Boosting your NVLink Bandwidth by 27% without accuracy concern
di: Shen, Ao, et al.
Pubblicazione: (2025)
di: Shen, Ao, et al.
Pubblicazione: (2025)
Advancing AI-assisted Hardware Design with Hierarchical Decentralized Training and Personalized Inference-Time Optimization
di: Chen, Hao Mark, et al.
Pubblicazione: (2025)
di: Chen, Hao Mark, et al.
Pubblicazione: (2025)
ELMoE-3D: Leveraging Intrinsic Elasticity of MoE for Hybrid-Bonding-Enabled Self-Speculative Decoding in On-Premises Serving
di: Choi, Yuseon, et al.
Pubblicazione: (2026)
di: Choi, Yuseon, et al.
Pubblicazione: (2026)
Online GPU Energy Optimization with Switching-Aware Bandits
di: Xu, Xiongxiao, et al.
Pubblicazione: (2024)
di: Xu, Xiongxiao, et al.
Pubblicazione: (2024)
Hybrid Offline-online Scheduling Method for Large Language Model Inference Optimization
di: Pang, Bowen, et al.
Pubblicazione: (2025)
di: Pang, Bowen, et al.
Pubblicazione: (2025)
Deep Reinforcement Learning based Online Scheduling Policy for Deep Neural Network Multi-Tenant Multi-Accelerator Systems
di: Blanco, Francesco G., et al.
Pubblicazione: (2024)
di: Blanco, Francesco G., et al.
Pubblicazione: (2024)
ELK: Exploring the Efficiency of Inter-core Connected AI Chips with Deep Learning Compiler Techniques
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
Automated Deep Neural Network Inference Partitioning for Distributed Embedded Systems
di: Kreß, Fabian, et al.
Pubblicazione: (2024)
di: Kreß, Fabian, et al.
Pubblicazione: (2024)
PhD Thesis Summary: Methods for Reliability Assessment and Enhancement of Deep Neural Network Hardware Accelerators
di: Taheri, Mahdi
Pubblicazione: (2026)
di: Taheri, Mahdi
Pubblicazione: (2026)
BitFlipScope: Scalable Fault Localization and Recovery for Bit-Flip Corruptions in LLMs
di: Karamat, Muhammad Zeeshan, et al.
Pubblicazione: (2025)
di: Karamat, Muhammad Zeeshan, et al.
Pubblicazione: (2025)
A High Energy-Efficiency Multi-core Neuromorphic Architecture for Deep SNN Training
di: Li, Mingjing, et al.
Pubblicazione: (2024)
di: Li, Mingjing, et al.
Pubblicazione: (2024)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
di: Russo, Enrico, et al.
Pubblicazione: (2026)
di: Russo, Enrico, et al.
Pubblicazione: (2026)
SCAR: Scheduling Multi-Model AI Workloads on Heterogeneous Multi-Chiplet Module Accelerators
di: Odema, Mohanad, et al.
Pubblicazione: (2024)
di: Odema, Mohanad, et al.
Pubblicazione: (2024)
Performance and Power: Systematic Evaluation of AI Workloads on Accelerators with CARAML
di: John, Chelsea Maria, et al.
Pubblicazione: (2024)
di: John, Chelsea Maria, et al.
Pubblicazione: (2024)
The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
Systematic Characterization of LLM Quantization: A Performance, Energy, and Quality Perspective
di: Shi, Tianyao, et al.
Pubblicazione: (2025)
di: Shi, Tianyao, et al.
Pubblicazione: (2025)
Flex-TPU: A Flexible TPU with Runtime Reconfigurable Dataflow Architecture
di: Elbtity, Mohammed, et al.
Pubblicazione: (2024)
di: Elbtity, Mohammed, et al.
Pubblicazione: (2024)
Co-design of a novel CMOS highly parallel, low-power, multi-chip neural network accelerator
di: Hokenmaier, W, et al.
Pubblicazione: (2024)
di: Hokenmaier, W, et al.
Pubblicazione: (2024)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
Power Stabilization for AI Training Datacenters
di: Choukse, Esha, et al.
Pubblicazione: (2025)
di: Choukse, Esha, et al.
Pubblicazione: (2025)
FedUHD: Unsupervised Federated Learning using Hyperdimensional Computing
di: Lee, You Hak, et al.
Pubblicazione: (2025)
di: Lee, You Hak, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GATMesh: Clock Mesh Timing Analysis using Graph Neural Networks
di: Khan, Muhammad Hadir, et al.
Pubblicazione: (2025) -
Hierarchical Resource Partitioning on Modern GPUs: A Reinforcement Learning Approach
di: Saroliya, Urvij, et al.
Pubblicazione: (2024) -
Strict Partitioning for Sporadic Rigid Gang Tasks
di: Sun, Binqi, et al.
Pubblicazione: (2024) -
ZettaLith: An Architectural Exploration of Extreme-Scale AI Inference Acceleration
di: Silverbrook, Kia
Pubblicazione: (2025) -
Enabling Accelerators for Graph Computing
di: Shivdikar, Kaustubh
Pubblicazione: (2023)