Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Bao, Fan, Xiang, Chendong, Yue, Gang, He, Guande, Zhu, Hongzhou, Zheng, Kaiwen, Zhao, Min, Liu, Shilong, Wang, Yaole, Zhu, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Consistency Diffusion Bridge Models
por: He, Guande, et al.
Publicado: (2024)
por: He, Guande, et al.
Publicado: (2024)
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
por: Zhao, Min, et al.
Publicado: (2024)
por: Zhao, Min, et al.
Publicado: (2024)
Elucidating the Preconditioning in Consistency Distillation
por: Zheng, Kaiwen, et al.
Publicado: (2025)
por: Zheng, Kaiwen, et al.
Publicado: (2025)
Diffusion Bridge Implicit Models
por: Zheng, Kaiwen, et al.
Publicado: (2024)
por: Zheng, Kaiwen, et al.
Publicado: (2024)
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
por: Zhao, Min, et al.
Publicado: (2025)
por: Zhao, Min, et al.
Publicado: (2025)
Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis
por: Chen, Zehua, et al.
Publicado: (2023)
por: Chen, Zehua, et al.
Publicado: (2023)
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
por: Zhao, Min, et al.
Publicado: (2026)
por: Zhao, Min, et al.
Publicado: (2026)
UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
por: Zhao, Min, et al.
Publicado: (2025)
por: Zhao, Min, et al.
Publicado: (2025)
Vidu4D: Single Generated Video to High-Fidelity 4D Reconstruction with Dynamic Gaussian Surfels
por: Wang, Yikai, et al.
Publicado: (2024)
por: Wang, Yikai, et al.
Publicado: (2024)
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
por: Zhao, Min, et al.
Publicado: (2026)
por: Zhao, Min, et al.
Publicado: (2026)
Vidarc: Embodied Video Diffusion Model for Closed-loop Control
por: Feng, Yao, et al.
Publicado: (2025)
por: Feng, Yao, et al.
Publicado: (2025)
Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator
por: Zheng, Kaiwen, et al.
Publicado: (2025)
por: Zheng, Kaiwen, et al.
Publicado: (2025)
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
por: Zhao, Min, et al.
Publicado: (2025)
por: Zhao, Min, et al.
Publicado: (2025)
Vidar: Embodied Video Diffusion Model for Generalist Manipulation
por: Feng, Yao, et al.
Publicado: (2025)
por: Feng, Yao, et al.
Publicado: (2025)
Geometry-Aware Rotary Position Embedding for Consistent Video World Model
por: Xiang, Chendong, et al.
Publicado: (2026)
por: Xiang, Chendong, et al.
Publicado: (2026)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
por: Huang, Xun, et al.
Publicado: (2025)
por: Huang, Xun, et al.
Publicado: (2025)
Causality in Video Diffusers is Separable from Denoising
por: Bai, Xingjian, et al.
Publicado: (2026)
por: Bai, Xingjian, et al.
Publicado: (2026)
Improved Techniques for Maximum Likelihood Estimation for Diffusion ODEs
por: Zheng, Kaiwen, et al.
Publicado: (2023)
por: Zheng, Kaiwen, et al.
Publicado: (2023)
Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control
por: Chen, Huayu, et al.
Publicado: (2024)
por: Chen, Huayu, et al.
Publicado: (2024)
BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation
por: Zhang, Zeyu, et al.
Publicado: (2025)
por: Zhang, Zeyu, et al.
Publicado: (2025)
Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation
por: Wang, Wenjing, et al.
Publicado: (2023)
por: Wang, Wenjing, et al.
Publicado: (2023)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
por: Zhang, Jintao, et al.
Publicado: (2025)
por: Zhang, Jintao, et al.
Publicado: (2025)
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
por: Zhang, Jintao, et al.
Publicado: (2025)
por: Zhang, Jintao, et al.
Publicado: (2025)
High‐Temperature Tribological Performance of Short Bamboo Fiber‐Reinforced Polymer Composite
por: Geng Hou, et al.
Publicado: (2025)
por: Geng Hou, et al.
Publicado: (2025)
Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation
por: Zhu, Zixin, et al.
Publicado: (2024)
por: Zhu, Zixin, et al.
Publicado: (2024)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models
por: Cui, Peng, et al.
Publicado: (2024)
por: Cui, Peng, et al.
Publicado: (2024)
Noise Contrastive Alignment of Language Models with Explicit Rewards
por: Chen, Huayu, et al.
Publicado: (2024)
por: Chen, Huayu, et al.
Publicado: (2024)
Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
por: Zheng, Kaiwen, et al.
Publicado: (2025)
por: Zheng, Kaiwen, et al.
Publicado: (2025)
ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation
por: Mai, Ziyang, et al.
Publicado: (2025)
por: Mai, Ziyang, et al.
Publicado: (2025)
A Survey: Spatiotemporal Consistency in Video Generation
por: Yin, Zhiyu, et al.
Publicado: (2025)
por: Yin, Zhiyu, et al.
Publicado: (2025)
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
por: Liu, Lingyu, et al.
Publicado: (2026)
por: Liu, Lingyu, et al.
Publicado: (2026)
AnchorDS: Anchoring Dynamic Sources for Semantically Consistent Text-to-3D Generation
por: Zhu, Jiayin, et al.
Publicado: (2025)
por: Zhu, Jiayin, et al.
Publicado: (2025)
RoboTransfer: Controllable Geometry-Consistent Video Diffusion for Manipulation Policy Transfer
por: Liu, Liu, et al.
Publicado: (2025)
por: Liu, Liu, et al.
Publicado: (2025)
ROIC-DM: Robust Text Inference and Classification via Diffusion Model
por: Yuan, Shilong, et al.
Publicado: (2024)
por: Yuan, Shilong, et al.
Publicado: (2024)
DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation
por: Zhao, Haoyu, et al.
Publicado: (2026)
por: Zhao, Haoyu, et al.
Publicado: (2026)
Ultrasound Image-to-Video Synthesis via Latent Dynamic Diffusion Models
por: Chen, Tingxiu, et al.
Publicado: (2025)
por: Chen, Tingxiu, et al.
Publicado: (2025)
T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models
por: Miao, Yibo, et al.
Publicado: (2024)
por: Miao, Yibo, et al.
Publicado: (2024)
AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency
por: Patel, Piyushkumar
Publicado: (2025)
por: Patel, Piyushkumar
Publicado: (2025)
Consistent Human Image and Video Generation with Spatially Conditioned Diffusion
por: Cao, Mingdeng, et al.
Publicado: (2024)
por: Cao, Mingdeng, et al.
Publicado: (2024)
Ejemplares similares
-
Consistency Diffusion Bridge Models
por: He, Guande, et al.
Publicado: (2024) -
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
por: Zhao, Min, et al.
Publicado: (2024) -
Elucidating the Preconditioning in Consistency Distillation
por: Zheng, Kaiwen, et al.
Publicado: (2025) -
Diffusion Bridge Implicit Models
por: Zheng, Kaiwen, et al.
Publicado: (2024) -
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
por: Zhao, Min, et al.
Publicado: (2025)