Advancing AI-assisted Hardware Design with Hierarchical Decentralized Training and Personalized Inference-Time Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Hao Mark, Zhang, Zehuan, Zhao, Wanru, Lane, Nicholas, Fan, Hongxiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TT-Edge: A Hardware-Software Co-Design for Energy-Efficient Tensor-Train Decomposition on Edge AI
por: Kwak, Hyunseok, et al.
Publicado: (2025)
por: Kwak, Hyunseok, et al.
Publicado: (2025)
DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators
por: Mo, Zhiwen, et al.
Publicado: (2026)
por: Mo, Zhiwen, et al.
Publicado: (2026)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
por: Adnan, Muhammad, et al.
Publicado: (2024)
por: Adnan, Muhammad, et al.
Publicado: (2024)
MLDSE: Scaling Design Space Exploration Infrastructure for Multi-Level Hardware
por: Qu, Huanyu, et al.
Publicado: (2025)
por: Qu, Huanyu, et al.
Publicado: (2025)
FengHuang: Next-Generation Memory Orchestration for AI Inferencing
por: Li, Jiamin, et al.
Publicado: (2025)
por: Li, Jiamin, et al.
Publicado: (2025)
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
por: Liu, Yiqi, et al.
Publicado: (2026)
por: Liu, Yiqi, et al.
Publicado: (2026)
Tascade: Hardware Support for Atomic-free, Asynchronous and Efficient Reduction Trees
por: Orenes-Vera, Marcelo, et al.
Publicado: (2023)
por: Orenes-Vera, Marcelo, et al.
Publicado: (2023)
Switchboard: An Open-Source Framework for Modular Simulation of Large Hardware Systems
por: Herbst, Steven, et al.
Publicado: (2024)
por: Herbst, Steven, et al.
Publicado: (2024)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
por: Qiu, Tong Dong, et al.
Publicado: (2023)
por: Qiu, Tong Dong, et al.
Publicado: (2023)
CCSS: Hardware-Accelerated RTL Simulation with Fast Combinational Logic Computing and Sequential Logic Synchronization
por: Feng, Weigang, et al.
Publicado: (2025)
por: Feng, Weigang, et al.
Publicado: (2025)
Next-generation Probabilistic Computing Hardware with 3D MOSAICs, Illusion Scale-up, and Co-design
por: Srimani, Tathagata, et al.
Publicado: (2024)
por: Srimani, Tathagata, et al.
Publicado: (2024)
A Reliable, Time-Predictable Heterogeneous SoC for AI-Enhanced Mixed-Criticality Edge Applications
por: Garofalo, Angelo, et al.
Publicado: (2025)
por: Garofalo, Angelo, et al.
Publicado: (2025)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
por: Zhou, Zhuoshan, et al.
Publicado: (2026)
por: Zhou, Zhuoshan, et al.
Publicado: (2026)
SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference
por: Zhang, Hengrui, et al.
Publicado: (2025)
por: Zhang, Hengrui, et al.
Publicado: (2025)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
por: Wang, Haoxuan, et al.
Publicado: (2026)
por: Wang, Haoxuan, et al.
Publicado: (2026)
HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
por: Garg, Raveesh, et al.
Publicado: (2025)
por: Garg, Raveesh, et al.
Publicado: (2025)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
por: Chung, Euijun, et al.
Publicado: (2026)
por: Chung, Euijun, et al.
Publicado: (2026)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
por: Meng, William, et al.
Publicado: (2025)
por: Meng, William, et al.
Publicado: (2025)
Automated Deep Neural Network Inference Partitioning for Distributed Embedded Systems
por: Kreß, Fabian, et al.
Publicado: (2024)
por: Kreß, Fabian, et al.
Publicado: (2024)
NasZip: Software and Hardware Co-Design to Accelerate Approximate Nearest Neighbor Search with DIMM-Based Near-Data Processing
por: Zou, Cheng, et al.
Publicado: (2026)
por: Zou, Cheng, et al.
Publicado: (2026)
Memory-Centric Computing: Recent Advances in Processing-in-DRAM
por: Mutlu, Onur, et al.
Publicado: (2024)
por: Mutlu, Onur, et al.
Publicado: (2024)
HgPCN: A Heterogeneous Architecture for E2E Embedded Point Cloud Inference
por: Gao, Yiming, et al.
Publicado: (2025)
por: Gao, Yiming, et al.
Publicado: (2025)
SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive Thresholding
por: Xu, Weihong, et al.
Publicado: (2025)
por: Xu, Weihong, et al.
Publicado: (2025)
Optimizing Offload Performance in Heterogeneous MPSoCs
por: Colagrande, Luca, et al.
Publicado: (2024)
por: Colagrande, Luca, et al.
Publicado: (2024)
Enabling Mixed criticality applications for the Versal AI-Engines
por: Sprave, Vincent, et al.
Publicado: (2026)
por: Sprave, Vincent, et al.
Publicado: (2026)
Achieving Dependability of AI Execution with Radiation Hardened Processors
por: Taquichiri, Carlos Rafael Tordoya, et al.
Publicado: (2025)
por: Taquichiri, Carlos Rafael Tordoya, et al.
Publicado: (2025)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
por: Kurzynski, Marco, et al.
Publicado: (2025)
por: Kurzynski, Marco, et al.
Publicado: (2025)
Optimizing Task Scheduling in Fog Computing with Deadline Awareness
por: Sirjani, Mohammad Sadegh, et al.
Publicado: (2025)
por: Sirjani, Mohammad Sadegh, et al.
Publicado: (2025)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
por: Prakriya, Neha, et al.
Publicado: (2023)
por: Prakriya, Neha, et al.
Publicado: (2023)
Simopt-Power: Leveraging Simulation Metadata for Low-Power Design Synthesis
por: Wadhwa, Eashan, et al.
Publicado: (2025)
por: Wadhwa, Eashan, et al.
Publicado: (2025)
NetSmith: An Optimization Framework for Machine-Discovered Network Topologies
por: Green, Conor, et al.
Publicado: (2024)
por: Green, Conor, et al.
Publicado: (2024)
Optimizing Distributed ML Communication with Fused Computation-Collective Operations
por: Punniyamurthy, Kishore, et al.
Publicado: (2023)
por: Punniyamurthy, Kishore, et al.
Publicado: (2023)
Optimizing ML Concurrent Computation and Communication with GPU DMA Engines
por: Agrawal, Anirudha, et al.
Publicado: (2024)
por: Agrawal, Anirudha, et al.
Publicado: (2024)
TeraPool: A Physical Design Aware, 1024 RISC-V Cores Shared-L1-Memory Scaled-up Cluster Design with High Bandwidth Main Memory Link
por: Zhang, Yichao, et al.
Publicado: (2026)
por: Zhang, Yichao, et al.
Publicado: (2026)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
por: Shen, Aofeng, et al.
Publicado: (2025)
por: Shen, Aofeng, et al.
Publicado: (2025)
Muchisim: A Simulation Framework for Design Exploration of Multi-Chip Manycore Systems
por: Orenes-Vera, Marcelo, et al.
Publicado: (2023)
por: Orenes-Vera, Marcelo, et al.
Publicado: (2023)
PREBA: A Hardware/Software Co-Design for Multi-Instance GPU based AI Inference Servers
por: Yeo, Gwangoo, et al.
Publicado: (2024)
por: Yeo, Gwangoo, et al.
Publicado: (2024)
Improving Multi-Instance GPU Efficiency via Sub-Entry Sharing TLB Design
por: Li, Bingyao, et al.
Publicado: (2024)
por: Li, Bingyao, et al.
Publicado: (2024)
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
por: Majeed, Ashiyana Abdul, et al.
Publicado: (2025)
por: Majeed, Ashiyana Abdul, et al.
Publicado: (2025)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
por: Fan, Ruibo, et al.
Publicado: (2026)
por: Fan, Ruibo, et al.
Publicado: (2026)
Ejemplares similares
-
TT-Edge: A Hardware-Software Co-Design for Energy-Efficient Tensor-Train Decomposition on Edge AI
por: Kwak, Hyunseok, et al.
Publicado: (2025) -
DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators
por: Mo, Zhiwen, et al.
Publicado: (2026) -
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
por: Adnan, Muhammad, et al.
Publicado: (2024) -
MLDSE: Scaling Design Space Exploration Infrastructure for Multi-Level Hardware
por: Qu, Huanyu, et al.
Publicado: (2025) -
FengHuang: Next-Generation Memory Orchestration for AI Inferencing
por: Li, Jiamin, et al.
Publicado: (2025)