SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Zhican, He, Guanghui, Fan, Hongxiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator
por: Wang, Zhican, et al.
Publicado: (2025)
por: Wang, Zhican, et al.
Publicado: (2025)
DEFA: Efficient Deformable Attention Acceleration via Pruning-Assisted Grid-Sampling and Multi-Scale Parallel Processing
por: Xu, Yansong, et al.
Publicado: (2024)
por: Xu, Yansong, et al.
Publicado: (2024)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
por: Liang, Yanbiao, et al.
Publicado: (2025)
por: Liang, Yanbiao, et al.
Publicado: (2025)
Exploring Code Language Models for Automated HLS-based Hardware Generation: Benchmark, Infrastructure and Analysis
por: Gai, Jiahao, et al.
Publicado: (2025)
por: Gai, Jiahao, et al.
Publicado: (2025)
Accelerating GNN Training through Locality-aware Dropout and Merge
por: Sun, Gongjian, et al.
Publicado: (2025)
por: Sun, Gongjian, et al.
Publicado: (2025)
METRO: A Software-Hardware Co-Design of Interconnections for Spatial DNN Accelerators
por: Wang, Zhao, et al.
Publicado: (2021)
por: Wang, Zhao, et al.
Publicado: (2021)
CIM-Tuner: Balancing the Compute and Storage Capacity of SRAM-CIM Accelerator via Hardware-mapping Co-exploration
por: Chen, Jinwu, et al.
Publicado: (2026)
por: Chen, Jinwu, et al.
Publicado: (2026)
Aquas: Enhancing Domain Specialization through Holistic Hardware-Software Co-Optimization based on MLIR
por: Zou, Yuyang, et al.
Publicado: (2025)
por: Zou, Yuyang, et al.
Publicado: (2025)
Accelerating 3D Gaussian Splatting with Neural Sorting and Axis-Oriented Rasterization
por: Wang, Zhican, et al.
Publicado: (2025)
por: Wang, Zhican, et al.
Publicado: (2025)
Hardware-Software Co-design for 3D-DRAM-based LLM Serving Accelerator
por: Li, Cong, et al.
Publicado: (2026)
por: Li, Cong, et al.
Publicado: (2026)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
por: Kim, Dong Eun, et al.
Publicado: (2025)
por: Kim, Dong Eun, et al.
Publicado: (2025)
FireBridge: Cycle-Accurate Hardware + Firmware Co-Verification for Modern Accelerators
por: Abarajithan, G, et al.
Publicado: (2026)
por: Abarajithan, G, et al.
Publicado: (2026)
Inclusive-PIM: Hardware-Software Co-design for Broad Acceleration on Commercial PIM Architectures
por: Alsop, Johnathan, et al.
Publicado: (2023)
por: Alsop, Johnathan, et al.
Publicado: (2023)
Towards the Certification of Hybrid Architectures: Analysing Interference on Hardware Accelerators through PML
por: Lesage, Benjamin, et al.
Publicado: (2024)
por: Lesage, Benjamin, et al.
Publicado: (2024)
DiffAxE: Diffusion-driven Hardware Accelerator Generation and Design Space Exploration
por: Ghosh, Arkapravo, et al.
Publicado: (2025)
por: Ghosh, Arkapravo, et al.
Publicado: (2025)
Multi-Objective Hardware-Mapping Co-Optimisation for Multi-DNN Workloads on Chiplet-based Accelerators
por: Das, Abhijit, et al.
Publicado: (2022)
por: Das, Abhijit, et al.
Publicado: (2022)
FPGA-Optimized Hardware Accelerator for Fast Fourier Transform and Singular Value Decomposition in AI
por: Ding, Hong, et al.
Publicado: (2025)
por: Ding, Hong, et al.
Publicado: (2025)
An Efficient Sparse Hardware Accelerator for Spike-Driven Transformer
por: Li, Zhengke, et al.
Publicado: (2025)
por: Li, Zhengke, et al.
Publicado: (2025)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) in Large-Scale Systems
por: Huang, Wei-Hsing, et al.
Publicado: (2025)
por: Huang, Wei-Hsing, et al.
Publicado: (2025)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) for Lightweight Edge Inference
por: Huang, Wei-Hsing, et al.
Publicado: (2024)
por: Huang, Wei-Hsing, et al.
Publicado: (2024)
Cocco: Hardware-Mapping Co-Exploration towards Memory Capacity-Communication Optimization
por: Tan, Zhanhong, et al.
Publicado: (2024)
por: Tan, Zhanhong, et al.
Publicado: (2024)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
por: Wang, Xinyu, et al.
Publicado: (2026)
por: Wang, Xinyu, et al.
Publicado: (2026)
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
por: Zhao, Shixin, et al.
Publicado: (2025)
por: Zhao, Shixin, et al.
Publicado: (2025)
Hardware-Aware Neural Network Compilation with Learned Optimization: A RISC-V Accelerator Approach
por: Ganti, Ravindra, et al.
Publicado: (2025)
por: Ganti, Ravindra, et al.
Publicado: (2025)
Hardware-Aware Neural Dropout Search for Reliable Uncertainty Prediction on FPGA
por: Zhang, Zehuan, et al.
Publicado: (2024)
por: Zhang, Zehuan, et al.
Publicado: (2024)
MCMComm: Hardware-Software Co-Optimization for End-to-End Communication in Multi-Chip-Modules
por: Raj, Ritik, et al.
Publicado: (2025)
por: Raj, Ritik, et al.
Publicado: (2025)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
por: Wang, Chuanzhen, et al.
Publicado: (2026)
por: Wang, Chuanzhen, et al.
Publicado: (2026)
STI-SNN: A 0.14 GOPS/W/PE Single-Timestep Inference FPGA-based SNN Accelerator with Algorithm and Hardware Co-Design
por: Wang, Kainan, et al.
Publicado: (2025)
por: Wang, Kainan, et al.
Publicado: (2025)
Implementation and Evaluation of Stable Diffusion on a General-Purpose CGLA Accelerator
por: Ando, Takuto, et al.
Publicado: (2025)
por: Ando, Takuto, et al.
Publicado: (2025)
ARMOR: Robust and Efficient CNN-Based SAR ATR through Model-Hardware Co-Design
por: Wickramasinghe, Sachini, et al.
Publicado: (2026)
por: Wickramasinghe, Sachini, et al.
Publicado: (2026)
Bombyx: OpenCilk Compilation for FPGA Hardware Acceleration
por: Shahawy, Mohamed, et al.
Publicado: (2025)
por: Shahawy, Mohamed, et al.
Publicado: (2025)
Implementing and Optimizing an Open-Source SD-card Host Controller for RISC-V SoCs
por: Vanoni, Axel, et al.
Publicado: (2026)
por: Vanoni, Axel, et al.
Publicado: (2026)
TurboFuzz: FPGA Accelerated Hardware Fuzzing for Processor Agile Verification
por: Zhong, Yang, et al.
Publicado: (2025)
por: Zhong, Yang, et al.
Publicado: (2025)
SeDA: Secure and Efficient DNN Accelerators with Hardware/Software Synergy
por: Xuan, Wei, et al.
Publicado: (2025)
por: Xuan, Wei, et al.
Publicado: (2025)
A Novel FPGA-based CNN Hardware Accelerator: Optimization for Convolutional Layers using Karatsuba Ofman Multiplier
por: Sarkar, Amit
Publicado: (2024)
por: Sarkar, Amit
Publicado: (2024)
Cross-Layer Design of Vector-Symbolic Computing: Bridging Cognition and Brain-Inspired Hardware Acceleration
por: Du, Shuting, et al.
Publicado: (2025)
por: Du, Shuting, et al.
Publicado: (2025)
Energy-Efficient Hardware Acceleration of Whisper ASR on a CGLA
por: Ando, Takuto, et al.
Publicado: (2025)
por: Ando, Takuto, et al.
Publicado: (2025)
Hardware Acceleration in Portable MRIs: State of the Art and Future Prospects
por: Habsi, Omar Al, et al.
Publicado: (2025)
por: Habsi, Omar Al, et al.
Publicado: (2025)
HyDRA: Deadline and Reuse-Aware Cacheability for Hardware Accelerators
por: Agarwal, Ayushi, et al.
Publicado: (2026)
por: Agarwal, Ayushi, et al.
Publicado: (2026)
Xpikeformer: Hybrid Analog-Digital Hardware Acceleration for Spiking Transformers
por: Song, Zihang, et al.
Publicado: (2024)
por: Song, Zihang, et al.
Publicado: (2024)
Ejemplares similares
-
VEDA: Efficient LLM Generation Through Voting-based KV Cache Eviction and Dataflow-flexible Accelerator
por: Wang, Zhican, et al.
Publicado: (2025) -
DEFA: Efficient Deformable Attention Acceleration via Pruning-Assisted Grid-Sampling and Multi-Scale Parallel Processing
por: Xu, Yansong, et al.
Publicado: (2024) -
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
por: Liang, Yanbiao, et al.
Publicado: (2025) -
Exploring Code Language Models for Automated HLS-based Hardware Generation: Benchmark, Infrastructure and Analysis
por: Gai, Jiahao, et al.
Publicado: (2025) -
Accelerating GNN Training through Locality-aware Dropout and Merge
por: Sun, Gongjian, et al.
Publicado: (2025)