Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Haipeng, Tang, Sheng, Cao, Juan, Zhang, Enshuo, Tang, Fan, Lee, Tong-Yee |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads
par: Xu, Yu, et autres
Publié: (2024)
par: Xu, Yu, et autres
Publié: (2024)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
par: Wu, Junyi, et autres
Publié: (2024)
par: Wu, Junyi, et autres
Publié: (2024)
Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
par: Chen, Ruoyu, et autres
Publié: (2025)
par: Chen, Ruoyu, et autres
Publié: (2025)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
Reasoning to Attend: Try to Understand How <SEG> Token Works
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
Locality-Attending Vision Transformer
par: Hajimiri, Sina, et autres
Publié: (2026)
par: Hajimiri, Sina, et autres
Publié: (2026)
$Δ$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
par: Chen, Pengtao, et autres
Publié: (2024)
par: Chen, Pengtao, et autres
Publié: (2024)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
par: Sun, Ruitong, et autres
Publié: (2025)
par: Sun, Ruitong, et autres
Publié: (2025)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
par: Tian, Yuchuan, et autres
Publié: (2024)
par: Tian, Yuchuan, et autres
Publié: (2024)
DiVE: DiT-based Video Generation with Enhanced Control
par: Jiang, Junpeng, et autres
Publié: (2024)
par: Jiang, Junpeng, et autres
Publié: (2024)
YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
par: Wu, Chenyang, et autres
Publié: (2026)
par: Wu, Chenyang, et autres
Publié: (2026)
HyperMotionX: The Dataset and Benchmark with DiT-Based Pose-Guided Human Image Animation of Complex Motions
par: Xu, Shuolin, et autres
Publié: (2025)
par: Xu, Shuolin, et autres
Publié: (2025)
Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution
par: Zhang, Xun, et autres
Publié: (2026)
par: Zhang, Xun, et autres
Publié: (2026)
FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
par: Tang, Jian, et autres
Publié: (2026)
par: Tang, Jian, et autres
Publié: (2026)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
par: Wang, Xiang, et autres
Publié: (2025)
par: Wang, Xiang, et autres
Publié: (2025)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
par: Yang, Zhuoyi, et autres
Publié: (2024)
par: Yang, Zhuoyi, et autres
Publié: (2024)
Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning
par: Liu, Man, et autres
Publié: (2024)
par: Liu, Man, et autres
Publié: (2024)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
par: Yang, Lianwei, et autres
Publié: (2025)
par: Yang, Lianwei, et autres
Publié: (2025)
SparseDiT: Token Sparsification for Efficient Diffusion Transformer
par: Chang, Shuning, et autres
Publié: (2024)
par: Chang, Shuning, et autres
Publié: (2024)
GATS: Gather-Attend-Scatter
par: Zolna, Konrad, et autres
Publié: (2024)
par: Zolna, Konrad, et autres
Publié: (2024)
Attend to what I say: Highlighting relevant content on slides
par: M, Megha Mariam K, et autres
Publié: (2026)
par: M, Megha Mariam K, et autres
Publié: (2026)
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
par: Feng, He, et autres
Publié: (2025)
par: Feng, He, et autres
Publié: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024)
par: Feng, Kunyu, et autres
Publié: (2024)
LaVin-DiT: Large Vision Diffusion Transformer
par: Wang, Zhaoqing, et autres
Publié: (2024)
par: Wang, Zhaoqing, et autres
Publié: (2024)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study
par: Sun, Xibo, et autres
Publié: (2024)
par: Sun, Xibo, et autres
Publié: (2024)
GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features
par: Sträter, Luc P. J., et autres
Publié: (2024)
par: Sträter, Luc P. J., et autres
Publié: (2024)
Perturb, Attend, Detect and Localize (PADL): Robust Proactive Image Defense
par: Bartolucci, Filippo, et autres
Publié: (2024)
par: Bartolucci, Filippo, et autres
Publié: (2024)
RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
par: Zhou, Jingkai, et autres
Publié: (2025)
par: Zhou, Jingkai, et autres
Publié: (2025)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
par: Yang, Yuhuan, et autres
Publié: (2026)
par: Yang, Yuhuan, et autres
Publié: (2026)
MaterialPicker: Multi-Modal DiT-Based Material Generation
par: Ma, Xiaohe, et autres
Publié: (2024)
par: Ma, Xiaohe, et autres
Publié: (2024)
Insert Anything: Image Insertion via In-Context Editing in DiT
par: Song, Wensong, et autres
Publié: (2025)
par: Song, Wensong, et autres
Publié: (2025)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
par: Shi, Yangming, et autres
Publié: (2026)
par: Shi, Yangming, et autres
Publié: (2026)
ADP-DiT: Text-Guided Diffusion Transformer for Brain Image Generation in Alzheimer's Disease Progression
par: Lee, Juneyong, et autres
Publié: (2026)
par: Lee, Juneyong, et autres
Publié: (2026)
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
par: Liu, Dongyang, et autres
Publié: (2025)
par: Liu, Dongyang, et autres
Publié: (2025)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
par: Feng, Haoran, et autres
Publié: (2025)
par: Feng, Haoran, et autres
Publié: (2025)
Make-Your-Anchor: A Diffusion-based 2D Avatar Generation Framework
par: Huang, Ziyao, et autres
Publié: (2024)
par: Huang, Ziyao, et autres
Publié: (2024)
DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training
par: Tan, Xin, et autres
Publié: (2025)
par: Tan, Xin, et autres
Publié: (2025)
Documents similaires
-
HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads
par: Xu, Yu, et autres
Publié: (2024) -
PTQ4DiT: Post-training Quantization for Diffusion Transformers
par: Wu, Junyi, et autres
Publié: (2024) -
Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
par: Chen, Ruoyu, et autres
Publié: (2025) -
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
par: Chen, Lei, et autres
Publié: (2024) -
Reasoning to Attend: Try to Understand How <SEG> Token Works
par: Qian, Rui, et autres
Publié: (2024)