BlockDance: Reuse Structurally Similar Spatio-Temporal Features to Accelerate Diffusion Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Hui, Gao, Tingwei, Shao, Jie, Wu, Zuxuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DanceFusion: A Spatio-Temporal Skeleton Diffusion Transformer for Audio-Driven Dance Motion Reconstruction
por: Zhao, Li, et al.
Publicado: (2024)
por: Zhao, Li, et al.
Publicado: (2024)
Sortblock: Similarity-Aware Feature Reuse for Diffusion Model
por: Chen, Hanqi, et al.
Publicado: (2025)
por: Chen, Hanqi, et al.
Publicado: (2025)
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
por: Zhang, Hui, et al.
Publicado: (2024)
por: Zhang, Hui, et al.
Publicado: (2024)
AdaDiff: Adaptive Step Selection for Fast Diffusion Models
por: Zhang, Hui, et al.
Publicado: (2023)
por: Zhang, Hui, et al.
Publicado: (2023)
CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design
por: Zhang, Hui, et al.
Publicado: (2025)
por: Zhang, Hui, et al.
Publicado: (2025)
FRDiff : Feature Reuse for Universal Training-free Acceleration of Diffusion Models
por: So, Junhyuk, et al.
Publicado: (2023)
por: So, Junhyuk, et al.
Publicado: (2023)
DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection
por: Zhang, Hui, et al.
Publicado: (2023)
por: Zhang, Hui, et al.
Publicado: (2023)
Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?
por: Sun, Lingchen, et al.
Publicado: (2026)
por: Sun, Lingchen, et al.
Publicado: (2026)
Open-Vocabulary Spatio-Temporal Action Detection
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition
por: So, Yerim, et al.
Publicado: (2026)
por: So, Yerim, et al.
Publicado: (2026)
Beyond Few-Step Inference: Accelerating Video Diffusion Transformer Model Serving with Inter-Request Caching Reuse
por: Liu, Hao, et al.
Publicado: (2026)
por: Liu, Hao, et al.
Publicado: (2026)
DVFace: Spatio-Temporal Dual-Prior Diffusion for Video Face Restoration
por: Chen, Zheng, et al.
Publicado: (2026)
por: Chen, Zheng, et al.
Publicado: (2026)
STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution
por: Chen, Junyang, et al.
Publicado: (2025)
por: Chen, Junyang, et al.
Publicado: (2025)
Autoregressive Queries for Adaptive Tracking with Spatio-TemporalTransformers
por: Xie, Jinxia, et al.
Publicado: (2024)
por: Xie, Jinxia, et al.
Publicado: (2024)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
por: Fei, Hao, et al.
Publicado: (2024)
por: Fei, Hao, et al.
Publicado: (2024)
Video-Language Alignment via Spatio-Temporal Graph Transformer
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
From Reusing to Forecasting: Accelerating Diffusion Models with TaylorSeers
por: Liu, Jiacheng, et al.
Publicado: (2025)
por: Liu, Jiacheng, et al.
Publicado: (2025)
Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models
por: Ma, Xuran, et al.
Publicado: (2025)
por: Ma, Xuran, et al.
Publicado: (2025)
Transformer RGBT Tracking with Spatio-Temporal Multimodal Tokens
por: Sun, Dengdi, et al.
Publicado: (2024)
por: Sun, Dengdi, et al.
Publicado: (2024)
HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration
por: Huang, Yushi, et al.
Publicado: (2024)
por: Huang, Yushi, et al.
Publicado: (2024)
Compact Attention: Exploiting Structured Spatio-Temporal Sparsity for Fast Video Generation
por: Li, Qirui, et al.
Publicado: (2025)
por: Li, Qirui, et al.
Publicado: (2025)
Causal Deciphering and Inpainting in Spatio-Temporal Dynamics via Diffusion Model
por: Duan, Yifan, et al.
Publicado: (2024)
por: Duan, Yifan, et al.
Publicado: (2024)
Relational Feature Caching for Accelerating Diffusion Transformers
por: Son, Byunggwan, et al.
Publicado: (2026)
por: Son, Byunggwan, et al.
Publicado: (2026)
SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer
por: Shao, Tong, et al.
Publicado: (2026)
por: Shao, Tong, et al.
Publicado: (2026)
Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval
por: Zou, Zichen, et al.
Publicado: (2026)
por: Zou, Zichen, et al.
Publicado: (2026)
Diffusion Product Quantization
por: Shao, Jie, et al.
Publicado: (2024)
por: Shao, Jie, et al.
Publicado: (2024)
Ditto: Accelerating Diffusion Model via Temporal Value Similarity
por: Kim, Sungbin, et al.
Publicado: (2025)
por: Kim, Sungbin, et al.
Publicado: (2025)
ST-ColoNet: Spatio-Temporal Colon Segment Recognition via Hybrid Attention and Edge-Guided Feature Learning
por: Cai, Crystal, et al.
Publicado: (2026)
por: Cai, Crystal, et al.
Publicado: (2026)
BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching
por: Cui, Hanshuai, et al.
Publicado: (2025)
por: Cui, Hanshuai, et al.
Publicado: (2025)
Efficient Spatio-Temporal Vegetation Pixel Classification with Vision Transformers
por: Gomes, Alan, et al.
Publicado: (2026)
por: Gomes, Alan, et al.
Publicado: (2026)
Dual-view Spatio-Temporal Feature Fusion with CNN-Transformer Hybrid Network for Chinese Isolated Sign Language Recognition
por: Jing, Siyuan, et al.
Publicado: (2025)
por: Jing, Siyuan, et al.
Publicado: (2025)
CorGi: Contribution-Guided Block-Wise Interval Caching for Training-Free Acceleration of Diffusion Transformers
por: Son, Yonglak, et al.
Publicado: (2025)
por: Son, Yonglak, et al.
Publicado: (2025)
EraserDiT: Fast Video Inpainting with Diffusion Transformer Model
por: Liu, Jie, et al.
Publicado: (2025)
por: Liu, Jie, et al.
Publicado: (2025)
RewardDance: Reward Scaling in Visual Generation
por: Wu, Jie, et al.
Publicado: (2025)
por: Wu, Jie, et al.
Publicado: (2025)
Dynamic Subframe Splitting and Spatio-Temporal Motion Entangled Sparse Attention for RGB-E Tracking
por: Shao, Pengcheng, et al.
Publicado: (2024)
por: Shao, Pengcheng, et al.
Publicado: (2024)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
por: Gao, Shida, et al.
Publicado: (2025)
por: Gao, Shida, et al.
Publicado: (2025)
UniSTFormer: Unified Spatio-Temporal Lightweight Transformer for Efficient Skeleton-Based Action Recognition
por: Wu, Wenhan, et al.
Publicado: (2025)
por: Wu, Wenhan, et al.
Publicado: (2025)
Seg-R1: Segmentation Can Be Surprisingly Simple with Reinforcement Learning
por: You, Zuyao, et al.
Publicado: (2025)
por: You, Zuyao, et al.
Publicado: (2025)
Cache Me if You Can: Accelerating Diffusion Models through Block Caching
por: Wimbauer, Felix, et al.
Publicado: (2023)
por: Wimbauer, Felix, et al.
Publicado: (2023)
Ejemplares similares
-
DanceFusion: A Spatio-Temporal Skeleton Diffusion Transformer for Audio-Driven Dance Motion Reconstruction
por: Zhao, Li, et al.
Publicado: (2024) -
Sortblock: Similarity-Aware Feature Reuse for Diffusion Model
por: Chen, Hanqi, et al.
Publicado: (2025) -
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
por: Zhang, Hui, et al.
Publicado: (2024) -
AdaDiff: Adaptive Step Selection for Fast Diffusion Models
por: Zhang, Hui, et al.
Publicado: (2023) -
CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design
por: Zhang, Hui, et al.
Publicado: (2025)