ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghafoorian, Mohsen, Habibian, Amirhossein |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer
di: Ghafoorian, Mohsen, et al.
Pubblicazione: (2025)
di: Ghafoorian, Mohsen, et al.
Pubblicazione: (2025)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference
di: Korzhenkov, Denis, et al.
Pubblicazione: (2026)
di: Korzhenkov, Denis, et al.
Pubblicazione: (2026)
Neodragon: Mobile Video Generation using Diffusion Transformer
di: Karnewar, Animesh, et al.
Pubblicazione: (2025)
di: Karnewar, Animesh, et al.
Pubblicazione: (2025)
Enhancing Novel View Synthesis via Geometry Grounded Set Diffusion
di: Zanjani, Farhad G., et al.
Pubblicazione: (2026)
di: Zanjani, Farhad G., et al.
Pubblicazione: (2026)
Mobile Video Diffusion
di: Yahia, Haitam Ben, et al.
Pubblicazione: (2024)
di: Yahia, Haitam Ben, et al.
Pubblicazione: (2024)
MoViE: Mobile Diffusion for Video Editing
di: Karjauv, Adil, et al.
Pubblicazione: (2024)
di: Karjauv, Adil, et al.
Pubblicazione: (2024)
FastCAD: Real-Time CAD Retrieval and Alignment from Scans and Videos
di: Langer, Florian, et al.
Pubblicazione: (2024)
di: Langer, Florian, et al.
Pubblicazione: (2024)
Multi-Scale Local Speculative Decoding for Image Generation
di: Peruzzo, Elia, et al.
Pubblicazione: (2026)
di: Peruzzo, Elia, et al.
Pubblicazione: (2026)
Hybrid Gaussian Splatting for Novel Urban View Synthesis
di: Omran, Mohamed, et al.
Pubblicazione: (2025)
di: Omran, Mohamed, et al.
Pubblicazione: (2025)
Object-Centric Diffusion for Efficient Video Editing
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
Controllable 3D Placement of Objects with Scene-Aware Diffusion Models
di: Omran, Mohamed, et al.
Pubblicazione: (2025)
di: Omran, Mohamed, et al.
Pubblicazione: (2025)
Scene-Aware Location Modeling for Data Augmentation in Automotive Object Detection
di: Petersen, Jens, et al.
Pubblicazione: (2025)
di: Petersen, Jens, et al.
Pubblicazione: (2025)
Clockwork Diffusion: Efficient Generation With Model-Step Distillation
di: Habibian, Amirhossein, et al.
Pubblicazione: (2023)
di: Habibian, Amirhossein, et al.
Pubblicazione: (2023)
Analysis of Attention in Video Diffusion Transformers
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs
di: Chen, Yanlong, et al.
Pubblicazione: (2026)
di: Chen, Yanlong, et al.
Pubblicazione: (2026)
Re-Attentional Controllable Video Diffusion Editing
di: Wang, Yuanzhi, et al.
Pubblicazione: (2024)
di: Wang, Yuanzhi, et al.
Pubblicazione: (2024)
Imagining the Unseen: Generative Location Modeling for Object Placement
di: Yun, Jooyeol, et al.
Pubblicazione: (2024)
di: Yun, Jooyeol, et al.
Pubblicazione: (2024)
HyCoVAD: A Hybrid SSL-LLM Model for Complex Video Anomaly Detection
di: Hemmatyar, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Hemmatyar, Mohammad Mahdi, et al.
Pubblicazione: (2025)
HyCTAS: Multi-Objective Hybrid Convolution-Transformer Architecture Search for Real-Time Image Segmentation
di: Yu, Hongyuan, et al.
Pubblicazione: (2024)
di: Yu, Hongyuan, et al.
Pubblicazione: (2024)
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
di: Le, Minh Khoa, et al.
Pubblicazione: (2026)
di: Le, Minh Khoa, et al.
Pubblicazione: (2026)
Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
Video Prediction Transformers without Recurrence or Convolution
di: Tang, Yujin, et al.
Pubblicazione: (2024)
di: Tang, Yujin, et al.
Pubblicazione: (2024)
Recurrence over Video Frames (RoVF) for the Re-identification of Meerkats
di: Rogers, Mitchell, et al.
Pubblicazione: (2024)
di: Rogers, Mitchell, et al.
Pubblicazione: (2024)
HLA: Hadamard Linear Attention
di: Ackermann, Hanno, et al.
Pubblicazione: (2026)
di: Ackermann, Hanno, et al.
Pubblicazione: (2026)
Hadamard Attention Recurrent Transformer: A Strong Baseline for Stereo Matching Transformer
di: Chen, Ziyang, et al.
Pubblicazione: (2025)
di: Chen, Ziyang, et al.
Pubblicazione: (2025)
SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
di: Fang, Tongcheng, et al.
Pubblicazione: (2026)
di: Fang, Tongcheng, et al.
Pubblicazione: (2026)
HyPCV-Former: Hyperbolic Spatio-Temporal Transformer for 3D Point Cloud Video Anomaly Detection
di: Cao, Jiaping, et al.
Pubblicazione: (2025)
di: Cao, Jiaping, et al.
Pubblicazione: (2025)
Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
Gaussian Splatting is an Effective Data Generator for 3D Object Detection
di: Zanjani, Farhad G., et al.
Pubblicazione: (2025)
di: Zanjani, Farhad G., et al.
Pubblicazione: (2025)
VMonarch: Efficient Video Diffusion Transformers with Structured Attention
di: Liang, Cheng, et al.
Pubblicazione: (2026)
di: Liang, Cheng, et al.
Pubblicazione: (2026)
QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification
di: Feng, Weilun, et al.
Pubblicazione: (2025)
di: Feng, Weilun, et al.
Pubblicazione: (2025)
HyGE-Occ: Hybrid View-Transformation with 3D Gaussian and Edge Priors for 3D Panoptic Occupancy Prediction
di: Kim, Jong Wook, et al.
Pubblicazione: (2025)
di: Kim, Jong Wook, et al.
Pubblicazione: (2025)
HyDRA: Hybrid Domain-Aware Robust Architecture for Heterogeneous Collaborative Perception
di: Song, Minwoo, et al.
Pubblicazione: (2026)
di: Song, Minwoo, et al.
Pubblicazione: (2026)
HySim: An Efficient Hybrid Similarity Measure for Patch Matching in Image Inpainting
di: Noufel, Saad, et al.
Pubblicazione: (2024)
di: Noufel, Saad, et al.
Pubblicazione: (2024)
HyLiFormer: Hyperbolic Linear Attention for Skeleton-based Human Action Recognition
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
HAT: Hybrid Attention Transformer for Image Restoration
di: Chen, Xiangyu, et al.
Pubblicazione: (2023)
di: Chen, Xiangyu, et al.
Pubblicazione: (2023)
Multi-Scale Deep Learning for Colon Histopathology: A Hybrid Graph-Transformer Approach
di: Saremi, Sadra, et al.
Pubblicazione: (2025)
di: Saremi, Sadra, et al.
Pubblicazione: (2025)
HyTAS: A Hyperspectral Image Transformer Architecture Search Benchmark and Analysis
di: Zhou, Fangqin, et al.
Pubblicazione: (2024)
di: Zhou, Fangqin, et al.
Pubblicazione: (2024)
Understanding Attention Mechanism in Video Diffusion Models
di: Liu, Bingyan, et al.
Pubblicazione: (2025)
di: Liu, Bingyan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer
di: Ghafoorian, Mohsen, et al.
Pubblicazione: (2025) -
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025) -
PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference
di: Korzhenkov, Denis, et al.
Pubblicazione: (2026) -
Neodragon: Mobile Video Generation using Diffusion Transformer
di: Karnewar, Animesh, et al.
Pubblicazione: (2025) -
Enhancing Novel View Synthesis via Geometry Grounded Set Diffusion
di: Zanjani, Farhad G., et al.
Pubblicazione: (2026)