EXION: Exploiting Inter- and Intra-Iteration Output Sparsity for Diffusion Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Heo, Jaehoon, Putra, Adiwena, Yoon, Jieon, Yune, Sungwoong, Lee, Hangyeol, Kim, Ji-Hoon, Kim, Joo-Young |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DiSC: Resolution-Scalable Acceleration of Diffusion Models by Exploiting Sparsity and Cached Token Reuse with Hash-based Distribution
von: Yoon, Jieon, et al.
Veröffentlicht: (2026)
von: Yoon, Jieon, et al.
Veröffentlicht: (2026)
ABC-FHE : A Resource-Efficient Accelerator Enabling Bootstrappable Parameters for Client-Side Fully Homomorphic Encryption
von: Yune, Sungwoong, et al.
Veröffentlicht: (2025)
von: Yune, Sungwoong, et al.
Veröffentlicht: (2025)
ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration
von: Lee, Hangyeol, et al.
Veröffentlicht: (2026)
von: Lee, Hangyeol, et al.
Veröffentlicht: (2026)
APINT: A Full-Stack Framework for Acceleration of Privacy-Preserving Inference of Transformers based on Garbled Circuits
von: Cho, Hyunjun, et al.
Veröffentlicht: (2025)
von: Cho, Hyunjun, et al.
Veröffentlicht: (2025)
SCRec: A Scalable Computational Storage System with Statistical Sharding and Tensor-train Decomposition for Recommendation Models
von: Yang, Jinho, et al.
Veröffentlicht: (2025)
von: Yang, Jinho, et al.
Veröffentlicht: (2025)
MASQ: Accelerating Masked Diffusion via Stage-Wise Multi-Precision Quantization
von: Kim, Seeyeon, et al.
Veröffentlicht: (2026)
von: Kim, Seeyeon, et al.
Veröffentlicht: (2026)
HURRY: Highly Utilized, Reconfigurable ReRAM-based In-situ Accelerator with Multifunctionality
von: Shin, Hery, et al.
Veröffentlicht: (2024)
von: Shin, Hery, et al.
Veröffentlicht: (2024)
SAL-PIM: A Subarray-level Processing-in-Memory Architecture with LUT-based Linear Interpolation for Transformer-based Text Generation
von: Han, Wontak, et al.
Veröffentlicht: (2024)
von: Han, Wontak, et al.
Veröffentlicht: (2024)
Optimized Memory System Architecture for VESA VDC-M Decoder with Multi-Slice Support
von: Yang, Hannah, et al.
Veröffentlicht: (2025)
von: Yang, Hannah, et al.
Veröffentlicht: (2025)
RED: Energy Optimization Framework for eDRAM-based PIM with Reconfigurable Voltage Swing and Retention-aware Scheduling
von: Kim, Jae-Young, et al.
Veröffentlicht: (2025)
von: Kim, Jae-Young, et al.
Veröffentlicht: (2025)
ADOR: A Design Exploration Framework for LLM Serving with Enhanced Latency and Throughput
von: Kim, Junsoo, et al.
Veröffentlicht: (2025)
von: Kim, Junsoo, et al.
Veröffentlicht: (2025)
Towards Efficient SRAM-PIM Architecture Design by Exploiting Unstructured Bit-Level Sparsity
von: Duan, Cenlin, et al.
Veröffentlicht: (2024)
von: Duan, Cenlin, et al.
Veröffentlicht: (2024)
Sparsity-Aware Streaming SNN Accelerator with Output-Channel Dataflow for Automatic Modulation Classification
von: Yang, Kuilian, et al.
Veröffentlicht: (2026)
von: Yang, Kuilian, et al.
Veröffentlicht: (2026)
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
von: Moon, Seungjae, et al.
Veröffentlicht: (2024)
von: Moon, Seungjae, et al.
Veröffentlicht: (2024)
FireFly-S: Exploiting Dual-Side Sparsity for Spiking Neural Networks Acceleration with Reconfigurable Spatial Architecture
von: Li, Tenglong, et al.
Veröffentlicht: (2024)
von: Li, Tenglong, et al.
Veröffentlicht: (2024)
Scalable and Efficient Intra- and Inter-node Interconnection Networks for Post-Exascale Supercomputers and Data centers
von: Tarraga-Moreno, Joaquin, et al.
Veröffentlicht: (2025)
von: Tarraga-Moreno, Joaquin, et al.
Veröffentlicht: (2025)
Hardware-Efficient Softmax and Layer Normalization with Guaranteed Normalization for Edge Devices
von: Choi, Dawon, et al.
Veröffentlicht: (2026)
von: Choi, Dawon, et al.
Veröffentlicht: (2026)
FlexNeRFer: A Multi-Dataflow, Adaptive Sparsity-Aware Accelerator for On-Device NeRF Rendering
von: Noh, Seock-Hwan, et al.
Veröffentlicht: (2025)
von: Noh, Seock-Hwan, et al.
Veröffentlicht: (2025)
Securing DRAM at Scale: ARFM-Driven Row Hammer Defense with Unveiling the Threat of Short tRC Patterns
von: Joo, Nogeun, et al.
Veröffentlicht: (2025)
von: Joo, Nogeun, et al.
Veröffentlicht: (2025)
Pointer: An Energy-Efficient ReRAM-based Point Cloud Recognition Accelerator with Inter-layer and Intra-layer Optimizations
von: Zhang, Qijun, et al.
Veröffentlicht: (2024)
von: Zhang, Qijun, et al.
Veröffentlicht: (2024)
QUADOL: A Quality-Driven Approximate Logic Synthesis Method Exploiting Dual-Output LUTs for Modern FPGAs
von: Shi, Jian, et al.
Veröffentlicht: (2024)
von: Shi, Jian, et al.
Veröffentlicht: (2024)
Oaken: Fast and Efficient LLM Serving with Online-Offline Hybrid KV Cache Quantization
von: Kim, Minsu, et al.
Veröffentlicht: (2025)
von: Kim, Minsu, et al.
Veröffentlicht: (2025)
Sparse-on-Dense: Area and Energy-Efficient Computing of Sparse Neural Networks on Dense Matrix Multiplication Accelerators
von: Yoon, Hyunsung, et al.
Veröffentlicht: (2026)
von: Yoon, Hyunsung, et al.
Veröffentlicht: (2026)
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
von: Heo, Guseul, et al.
Veröffentlicht: (2024)
von: Heo, Guseul, et al.
Veröffentlicht: (2024)
LLC Intra-set Write Balancing
von: Krishna, Keshav, et al.
Veröffentlicht: (2024)
von: Krishna, Keshav, et al.
Veröffentlicht: (2024)
Delay Time Characterization on FPGA: A Low Nonlinearity, Picosecond Resolution Time-to-Digital Converter on 16-nm FPGA using Bin Sequence Calibration
von: Park, Sunwoo, et al.
Veröffentlicht: (2025)
von: Park, Sunwoo, et al.
Veröffentlicht: (2025)
SATA: Sparsity-Aware Scheduling for Selective Token Attention
von: Fan, Zhenkun, et al.
Veröffentlicht: (2026)
von: Fan, Zhenkun, et al.
Veröffentlicht: (2026)
PVAC: A RowHammer Mitigation Architecture Exploiting Per-victim-row Counting
von: Kim, Jumin, et al.
Veröffentlicht: (2026)
von: Kim, Jumin, et al.
Veröffentlicht: (2026)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
von: Wu, Haibin, et al.
Veröffentlicht: (2024)
von: Wu, Haibin, et al.
Veröffentlicht: (2024)
Prosperity: Accelerating Spiking Neural Networks via Product Sparsity
von: Wei, Chiyue, et al.
Veröffentlicht: (2025)
von: Wei, Chiyue, et al.
Veröffentlicht: (2025)
STAR: Improving Lifetime and Performance of High-Capacity Modern SSDs Using State-Aware Randomizer
von: Kwon, Omin, et al.
Veröffentlicht: (2025)
von: Kwon, Omin, et al.
Veröffentlicht: (2025)
Hardware-based Heterogeneous Memory Management for Large Language Model Inference
von: Hwang, Soojin, et al.
Veröffentlicht: (2025)
von: Hwang, Soojin, et al.
Veröffentlicht: (2025)
ONNXim: A Fast, Cycle-level Multi-core NPU Simulator
von: Ham, Hyungkyu, et al.
Veröffentlicht: (2024)
von: Ham, Hyungkyu, et al.
Veröffentlicht: (2024)
A 28.6 mJ/iter Stable Diffusion Processor for Text-to-Image Generation with Patch Similarity-based Sparsity Augmentation and Text-based Mixed-Precision
von: Choi, Jiwon, et al.
Veröffentlicht: (2024)
von: Choi, Jiwon, et al.
Veröffentlicht: (2024)
STRAW: A Stress-Aware WL-Based Read Reclaim Technique for High-Density NAND Flash-Based SSDs
von: Chun, Myoungjun, et al.
Veröffentlicht: (2025)
von: Chun, Myoungjun, et al.
Veröffentlicht: (2025)
PULSE: Parametric Hardware Units for Low-power Sparsity-Aware Convolution Engine
von: Aliyev, Ilkin, et al.
Veröffentlicht: (2024)
von: Aliyev, Ilkin, et al.
Veröffentlicht: (2024)
VIKIN: A Reconfigurable Accelerator for KANs and MLPs with Two-Stage Sparsity Support
von: Ou, Wenhui, et al.
Veröffentlicht: (2026)
von: Ou, Wenhui, et al.
Veröffentlicht: (2026)
Kratos: An FPGA Benchmark for Unrolled DNNs with Fine-Grained Sparsity and Mixed Precision
von: Dai, Xilai, et al.
Veröffentlicht: (2024)
von: Dai, Xilai, et al.
Veröffentlicht: (2024)
Design and Analysis of Approximate Hardware Accelerators for VVC Intra Angular Prediction
von: de Fraga, Lucas M. Leipnitz, et al.
Veröffentlicht: (2025)
von: de Fraga, Lucas M. Leipnitz, et al.
Veröffentlicht: (2025)
Jack Unit: An Area- and Energy-Efficient Multiply-Accumulate (MAC) Unit Supporting Diverse Data Formats
von: Noh, Seock-Hwan, et al.
Veröffentlicht: (2025)
von: Noh, Seock-Hwan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DiSC: Resolution-Scalable Acceleration of Diffusion Models by Exploiting Sparsity and Cached Token Reuse with Hash-based Distribution
von: Yoon, Jieon, et al.
Veröffentlicht: (2026) -
ABC-FHE : A Resource-Efficient Accelerator Enabling Bootstrappable Parameters for Client-Side Fully Homomorphic Encryption
von: Yune, Sungwoong, et al.
Veröffentlicht: (2025) -
ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration
von: Lee, Hangyeol, et al.
Veröffentlicht: (2026) -
APINT: A Full-Stack Framework for Acceleration of Privacy-Preserving Inference of Transformers based on Garbled Circuits
von: Cho, Hyunjun, et al.
Veröffentlicht: (2025) -
SCRec: A Scalable Computational Storage System with Statistical Sharding and Tensor-train Decomposition for Recommendation Models
von: Yang, Jinho, et al.
Veröffentlicht: (2025)