UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Min, Zhu, Hongzhou, Wang, Yingze, Yan, Bokai, Zhang, Jintao, He, Guande, Yang, Ling, Li, Chongxuan, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
par: Zhao, Min, et autres
Publié: (2025)
par: Zhao, Min, et autres
Publié: (2025)
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
par: Zhao, Min, et autres
Publié: (2025)
par: Zhao, Min, et autres
Publié: (2025)
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
par: Zhao, Min, et autres
Publié: (2026)
par: Zhao, Min, et autres
Publié: (2026)
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
par: Zhao, Min, et autres
Publié: (2026)
par: Zhao, Min, et autres
Publié: (2026)
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
par: Zhao, Min, et autres
Publié: (2024)
par: Zhao, Min, et autres
Publié: (2024)
Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
par: Bao, Fan, et autres
Publié: (2024)
par: Bao, Fan, et autres
Publié: (2024)
Consistency Diffusion Bridge Models
par: He, Guande, et autres
Publié: (2024)
par: He, Guande, et autres
Publié: (2024)
ViViD: Video Virtual Try-on using Diffusion Models
par: Fang, Zixun, et autres
Publié: (2024)
par: Fang, Zixun, et autres
Publié: (2024)
Novel View Extrapolation with Video Diffusion Priors
par: Liu, Kunhao, et autres
Publié: (2024)
par: Liu, Kunhao, et autres
Publié: (2024)
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
par: Zhang, Jintao, et autres
Publié: (2025)
par: Zhang, Jintao, et autres
Publié: (2025)
ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
par: Zhao, Tianchen, et autres
Publié: (2024)
par: Zhao, Tianchen, et autres
Publié: (2024)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
par: Huang, Xun, et autres
Publié: (2025)
par: Huang, Xun, et autres
Publié: (2025)
Causality in Video Diffusers is Separable from Denoising
par: Bai, Xingjian, et autres
Publié: (2026)
par: Bai, Xingjian, et autres
Publié: (2026)
6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models
par: Su, Rundong, et autres
Publié: (2026)
par: Su, Rundong, et autres
Publié: (2026)
Elucidating the Preconditioning in Consistency Distillation
par: Zheng, Kaiwen, et autres
Publié: (2025)
par: Zheng, Kaiwen, et autres
Publié: (2025)
Scaling Diffusion Transformers Efficiently via $μ$P
par: Zheng, Chenyu, et autres
Publié: (2025)
par: Zheng, Chenyu, et autres
Publié: (2025)
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
par: Yu, Ruonan, et autres
Publié: (2026)
par: Yu, Ruonan, et autres
Publié: (2026)
DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
par: Lu, Cheng, et autres
Publié: (2022)
par: Lu, Cheng, et autres
Publié: (2022)
Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models
par: Cui, Peng, et autres
Publié: (2024)
par: Cui, Peng, et autres
Publié: (2024)
ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images
par: Wu, Yunfeng, et autres
Publié: (2026)
par: Wu, Yunfeng, et autres
Publié: (2026)
TRecViT: A Recurrent Video Transformer
par: Pătrăucean, Viorica, et autres
Publié: (2024)
par: Pătrăucean, Viorica, et autres
Publié: (2024)
CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos
par: Zhao, Chengfeng, et autres
Publié: (2026)
par: Zhao, Chengfeng, et autres
Publié: (2026)
PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
par: Du, Shian, et autres
Publié: (2025)
par: Du, Shian, et autres
Publié: (2025)
DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion
par: Issachar, Noam, et autres
Publié: (2025)
par: Issachar, Noam, et autres
Publié: (2025)
Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation
par: Cao, Yang, et autres
Publié: (2025)
par: Cao, Yang, et autres
Publié: (2025)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
par: Zhang, Jintao, et autres
Publié: (2025)
par: Zhang, Jintao, et autres
Publié: (2025)
ViTMAlis: Towards Latency-Critical Mobile Video Analytics with Vision Transformers
par: Zhang, Miao, et autres
Publié: (2026)
par: Zhang, Miao, et autres
Publié: (2026)
LoopViT: Scaling Visual ARC with Looped Transformers
par: Shu, Wen-Jie, et autres
Publié: (2026)
par: Shu, Wen-Jie, et autres
Publié: (2026)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
par: Zhu, Chen, et autres
Publié: (2025)
par: Zhu, Chen, et autres
Publié: (2025)
Pose-Aware Diffusion for 3D Generation
par: Zhou, Zihan, et autres
Publié: (2026)
par: Zhou, Zihan, et autres
Publié: (2026)
TPC-ViT: Token Propagation Controller for Efficient Vision Transformer
par: Zhu, Wentao
Publié: (2024)
par: Zhu, Wentao
Publié: (2024)
PoseCrafter: One-Shot Personalized Video Synthesis Following Flexible Pose Control
par: Zhong, Yong, et autres
Publié: (2024)
par: Zhong, Yong, et autres
Publié: (2024)
Input-Aware Sparse Attention for Real-Time Co-Speech Video Generation
par: Lu, Beijia, et autres
Publié: (2025)
par: Lu, Beijia, et autres
Publié: (2025)
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
par: Gao, Kaifeng, et autres
Publié: (2024)
par: Gao, Kaifeng, et autres
Publié: (2024)
MoViE: Mobile Diffusion for Video Editing
par: Karjauv, Adil, et autres
Publié: (2024)
par: Karjauv, Adil, et autres
Publié: (2024)
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
par: Xi, Haocheng, et autres
Publié: (2025)
par: Xi, Haocheng, et autres
Publié: (2025)
SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers
par: Rajabi, Javad, et autres
Publié: (2026)
par: Rajabi, Javad, et autres
Publié: (2026)
ViSE: A Systematic Approach to Vision-Only Street-View Extrapolation
par: Tan, Kaiyuan, et autres
Publié: (2025)
par: Tan, Kaiyuan, et autres
Publié: (2025)
LoViT: Long Video Transformer for Surgical Phase Recognition
par: Liu, Yang, et autres
Publié: (2023)
par: Liu, Yang, et autres
Publié: (2023)
Improved Video VAE for Latent Video Diffusion Model
par: Wu, Pingyu, et autres
Publié: (2024)
par: Wu, Pingyu, et autres
Publié: (2024)
Documents similaires
-
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
par: Zhao, Min, et autres
Publié: (2025) -
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
par: Zhao, Min, et autres
Publié: (2025) -
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
par: Zhao, Min, et autres
Publié: (2026) -
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
par: Zhao, Min, et autres
Publié: (2026) -
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
par: Zhao, Min, et autres
Publié: (2024)