UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Min, Zhu, Hongzhou, Wang, Yingze, Yan, Bokai, Zhang, Jintao, He, Guande, Yang, Ling, Li, Chongxuan, Zhu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025)
di: Zhao, Min, et al.
Pubblicazione: (2025)
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025)
di: Zhao, Min, et al.
Pubblicazione: (2025)
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
di: Zhao, Min, et al.
Pubblicazione: (2026)
di: Zhao, Min, et al.
Pubblicazione: (2026)
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
di: Zhao, Min, et al.
Pubblicazione: (2026)
di: Zhao, Min, et al.
Pubblicazione: (2026)
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
di: Zhao, Min, et al.
Pubblicazione: (2024)
di: Zhao, Min, et al.
Pubblicazione: (2024)
Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
di: Bao, Fan, et al.
Pubblicazione: (2024)
di: Bao, Fan, et al.
Pubblicazione: (2024)
Consistency Diffusion Bridge Models
di: He, Guande, et al.
Pubblicazione: (2024)
di: He, Guande, et al.
Pubblicazione: (2024)
ViViD: Video Virtual Try-on using Diffusion Models
di: Fang, Zixun, et al.
Pubblicazione: (2024)
di: Fang, Zixun, et al.
Pubblicazione: (2024)
Novel View Extrapolation with Video Diffusion Priors
di: Liu, Kunhao, et al.
Pubblicazione: (2024)
di: Liu, Kunhao, et al.
Pubblicazione: (2024)
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
di: Zhao, Tianchen, et al.
Pubblicazione: (2024)
di: Zhao, Tianchen, et al.
Pubblicazione: (2024)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
di: Huang, Xun, et al.
Pubblicazione: (2025)
di: Huang, Xun, et al.
Pubblicazione: (2025)
Causality in Video Diffusers is Separable from Denoising
di: Bai, Xingjian, et al.
Pubblicazione: (2026)
di: Bai, Xingjian, et al.
Pubblicazione: (2026)
6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models
di: Su, Rundong, et al.
Pubblicazione: (2026)
di: Su, Rundong, et al.
Pubblicazione: (2026)
Elucidating the Preconditioning in Consistency Distillation
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
Scaling Diffusion Transformers Efficiently via $μ$P
di: Zheng, Chenyu, et al.
Pubblicazione: (2025)
di: Zheng, Chenyu, et al.
Pubblicazione: (2025)
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
di: Yu, Ruonan, et al.
Pubblicazione: (2026)
di: Yu, Ruonan, et al.
Pubblicazione: (2026)
DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
di: Lu, Cheng, et al.
Pubblicazione: (2022)
di: Lu, Cheng, et al.
Pubblicazione: (2022)
Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models
di: Cui, Peng, et al.
Pubblicazione: (2024)
di: Cui, Peng, et al.
Pubblicazione: (2024)
ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images
di: Wu, Yunfeng, et al.
Pubblicazione: (2026)
di: Wu, Yunfeng, et al.
Pubblicazione: (2026)
TRecViT: A Recurrent Video Transformer
di: Pătrăucean, Viorica, et al.
Pubblicazione: (2024)
di: Pătrăucean, Viorica, et al.
Pubblicazione: (2024)
CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos
di: Zhao, Chengfeng, et al.
Pubblicazione: (2026)
di: Zhao, Chengfeng, et al.
Pubblicazione: (2026)
PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
di: Du, Shian, et al.
Pubblicazione: (2025)
di: Du, Shian, et al.
Pubblicazione: (2025)
DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion
di: Issachar, Noam, et al.
Pubblicazione: (2025)
di: Issachar, Noam, et al.
Pubblicazione: (2025)
Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation
di: Cao, Yang, et al.
Pubblicazione: (2025)
di: Cao, Yang, et al.
Pubblicazione: (2025)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
ViTMAlis: Towards Latency-Critical Mobile Video Analytics with Vision Transformers
di: Zhang, Miao, et al.
Pubblicazione: (2026)
di: Zhang, Miao, et al.
Pubblicazione: (2026)
LoopViT: Scaling Visual ARC with Looped Transformers
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
di: Zhu, Chen, et al.
Pubblicazione: (2025)
di: Zhu, Chen, et al.
Pubblicazione: (2025)
Pose-Aware Diffusion for 3D Generation
di: Zhou, Zihan, et al.
Pubblicazione: (2026)
di: Zhou, Zihan, et al.
Pubblicazione: (2026)
TPC-ViT: Token Propagation Controller for Efficient Vision Transformer
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
PoseCrafter: One-Shot Personalized Video Synthesis Following Flexible Pose Control
di: Zhong, Yong, et al.
Pubblicazione: (2024)
di: Zhong, Yong, et al.
Pubblicazione: (2024)
Input-Aware Sparse Attention for Real-Time Co-Speech Video Generation
di: Lu, Beijia, et al.
Pubblicazione: (2025)
di: Lu, Beijia, et al.
Pubblicazione: (2025)
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)
MoViE: Mobile Diffusion for Video Editing
di: Karjauv, Adil, et al.
Pubblicazione: (2024)
di: Karjauv, Adil, et al.
Pubblicazione: (2024)
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers
di: Rajabi, Javad, et al.
Pubblicazione: (2026)
di: Rajabi, Javad, et al.
Pubblicazione: (2026)
ViSE: A Systematic Approach to Vision-Only Street-View Extrapolation
di: Tan, Kaiyuan, et al.
Pubblicazione: (2025)
di: Tan, Kaiyuan, et al.
Pubblicazione: (2025)
LoViT: Long Video Transformer for Surgical Phase Recognition
di: Liu, Yang, et al.
Pubblicazione: (2023)
di: Liu, Yang, et al.
Pubblicazione: (2023)
Improved Video VAE for Latent Video Diffusion Model
di: Wu, Pingyu, et al.
Pubblicazione: (2024)
di: Wu, Pingyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025) -
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025) -
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
di: Zhao, Min, et al.
Pubblicazione: (2026) -
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
di: Zhao, Min, et al.
Pubblicazione: (2026) -
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
di: Zhao, Min, et al.
Pubblicazione: (2024)