Analysis of Attention in Video Diffusion Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Wen, Yuxin, Wu, Jim, Jain, Ajay, Goldstein, Tom, Panda, Ashwinee |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
di: Hayes, Kevin David, et al.
Pubblicazione: (2025)
di: Hayes, Kevin David, et al.
Pubblicazione: (2025)
Attention Sinks in Diffusion Transformers: A Causal Analysis
di: Wu, Fangzheng, et al.
Pubblicazione: (2026)
di: Wu, Fangzheng, et al.
Pubblicazione: (2026)
Bidirectional Sparse Attention for Faster Video Diffusion Training
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers
di: Ghafoorian, Mohsen, et al.
Pubblicazione: (2026)
di: Ghafoorian, Mohsen, et al.
Pubblicazione: (2026)
VMonarch: Efficient Video Diffusion Transformers with Structured Attention
di: Liang, Cheng, et al.
Pubblicazione: (2026)
di: Liang, Cheng, et al.
Pubblicazione: (2026)
Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer
di: Ghafoorian, Mohsen, et al.
Pubblicazione: (2025)
di: Ghafoorian, Mohsen, et al.
Pubblicazione: (2025)
Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
di: Le, Minh Khoa, et al.
Pubblicazione: (2026)
di: Le, Minh Khoa, et al.
Pubblicazione: (2026)
QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification
di: Feng, Weilun, et al.
Pubblicazione: (2025)
di: Feng, Weilun, et al.
Pubblicazione: (2025)
EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM
di: Nguyen, Quang, et al.
Pubblicazione: (2024)
di: Nguyen, Quang, et al.
Pubblicazione: (2024)
SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
di: Fang, Tongcheng, et al.
Pubblicazione: (2026)
di: Fang, Tongcheng, et al.
Pubblicazione: (2026)
One-Shot Learning Meets Depth Diffusion in Multi-Object Videos
di: Jain, Anisha
Pubblicazione: (2024)
di: Jain, Anisha
Pubblicazione: (2024)
ARGUS: Hallucination and Omission Evaluation in Video-LLMs
di: Rawal, Ruchit, et al.
Pubblicazione: (2025)
di: Rawal, Ruchit, et al.
Pubblicazione: (2025)
DiTPainter: Efficient Video Inpainting with Diffusion Transformers
di: Wu, Xian, et al.
Pubblicazione: (2025)
di: Wu, Xian, et al.
Pubblicazione: (2025)
Quantifying Cross-Modality Memorization in Vision-Language Models
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
VMoBA: Mixture-of-Block Attention for Video Diffusion Models
di: Wu, Jianzong, et al.
Pubblicazione: (2025)
di: Wu, Jianzong, et al.
Pubblicazione: (2025)
Understanding Attention Mechanism in Video Diffusion Models
di: Liu, Bingyan, et al.
Pubblicazione: (2025)
di: Liu, Bingyan, et al.
Pubblicazione: (2025)
CustomVideoX: 3D Reference Attention Driven Dynamic Adaptation for Zero-Shot Customized Video Diffusion Transformers
di: She, D., et al.
Pubblicazione: (2025)
di: She, D., et al.
Pubblicazione: (2025)
Blended Latent Diffusion under Attention Control for Real-World Video Editing
di: Liu, Deyin, et al.
Pubblicazione: (2024)
di: Liu, Deyin, et al.
Pubblicazione: (2024)
LiteAttention: A Temporal Sparse Attention for Diffusion Transformers
di: Shmilovich, Dor, et al.
Pubblicazione: (2025)
di: Shmilovich, Dor, et al.
Pubblicazione: (2025)
DiTVR: Zero-Shot Diffusion Transformer for Video Restoration
di: Gao, Sicheng, et al.
Pubblicazione: (2025)
di: Gao, Sicheng, et al.
Pubblicazione: (2025)
Video Interpolation with Diffusion Models
di: Jain, Siddhant, et al.
Pubblicazione: (2024)
di: Jain, Siddhant, et al.
Pubblicazione: (2024)
BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers
di: Xiao, Chaodong, et al.
Pubblicazione: (2026)
di: Xiao, Chaodong, et al.
Pubblicazione: (2026)
AttentionBender: Manipulating Cross-Attention in Video Diffusion Transformers as a Creative Probe
di: Cole, Adam, et al.
Pubblicazione: (2026)
di: Cole, Adam, et al.
Pubblicazione: (2026)
Perceiving Longer Sequences With Bi-Directional Cross-Attention Transformers
di: Hiller, Markus, et al.
Pubblicazione: (2024)
di: Hiller, Markus, et al.
Pubblicazione: (2024)
Video Diffusion Transformers are In-Context Learners
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
VSA: Faster Video Diffusion with Trainable Sparse Attention
di: Zhang, Peiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Peiyuan, et al.
Pubblicazione: (2025)
Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation
di: Wang, Wenjing, et al.
Pubblicazione: (2023)
di: Wang, Wenjing, et al.
Pubblicazione: (2023)
Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers
di: Liu, Yuxi, et al.
Pubblicazione: (2026)
di: Liu, Yuxi, et al.
Pubblicazione: (2026)
DVD-Quant: Data-free Video Diffusion Transformers Quantization
di: Li, Zhiteng, et al.
Pubblicazione: (2025)
di: Li, Zhiteng, et al.
Pubblicazione: (2025)
SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers
di: Qiu, Di, et al.
Pubblicazione: (2025)
di: Qiu, Di, et al.
Pubblicazione: (2025)
In-Context Audio Control of Video Diffusion Transformers
di: Liu, Wenze, et al.
Pubblicazione: (2025)
di: Liu, Wenze, et al.
Pubblicazione: (2025)
Latte: Latent Diffusion Transformer for Video Generation
di: Ma, Xin, et al.
Pubblicazione: (2024)
di: Ma, Xin, et al.
Pubblicazione: (2024)
Steering Video Diffusion Transformers with Massive Activations
di: Cheng, Xianhang, et al.
Pubblicazione: (2026)
di: Cheng, Xianhang, et al.
Pubblicazione: (2026)
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
VORTA: Efficient Video Diffusion via Routing Sparse Attention
di: Sun, Wenhao, et al.
Pubblicazione: (2025)
di: Sun, Wenhao, et al.
Pubblicazione: (2025)
Veda: Scalable Video Diffusion via Distilled Sparse Attention
di: Han, Shihao, et al.
Pubblicazione: (2026)
di: Han, Shihao, et al.
Pubblicazione: (2026)
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
Detecting, Explaining, and Mitigating Memorization in Diffusion Models
di: Wen, Yuxin, et al.
Pubblicazione: (2024)
di: Wen, Yuxin, et al.
Pubblicazione: (2024)
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
di: Hayes, Kevin David, et al.
Pubblicazione: (2025) -
Attention Sinks in Diffusion Transformers: A Causal Analysis
di: Wu, Fangzheng, et al.
Pubblicazione: (2026) -
Bidirectional Sparse Attention for Faster Video Diffusion Training
di: Zhan, Chenlu, et al.
Pubblicazione: (2025) -
ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers
di: Ghafoorian, Mohsen, et al.
Pubblicazione: (2026) -
VMonarch: Efficient Video Diffusion Transformers with Structured Attention
di: Liang, Cheng, et al.
Pubblicazione: (2026)