From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Tianwei, Zhang, Qiang, Zhang, Richard, Freeman, William T., Durand, Fredo, Shechtman, Eli, Huang, Xun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improved Distribution Matching Distillation for Fast Image Synthesis
di: Yin, Tianwei, et al.
Pubblicazione: (2024)
di: Yin, Tianwei, et al.
Pubblicazione: (2024)
One-step Diffusion with Distribution Matching Distillation
di: Yin, Tianwei, et al.
Pubblicazione: (2023)
di: Yin, Tianwei, et al.
Pubblicazione: (2023)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
di: Huang, Xun, et al.
Pubblicazione: (2025)
di: Huang, Xun, et al.
Pubblicazione: (2025)
Long-Context State-Space Video World Models
di: Po, Ryan, et al.
Pubblicazione: (2025)
di: Po, Ryan, et al.
Pubblicazione: (2025)
MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
di: Xue, Haotian, et al.
Pubblicazione: (2025)
di: Xue, Haotian, et al.
Pubblicazione: (2025)
Image Neural Field Diffusion Models
di: Chen, Yinbo, et al.
Pubblicazione: (2024)
di: Chen, Yinbo, et al.
Pubblicazione: (2024)
Causality in Video Diffusers is Separable from Denoising
di: Bai, Xingjian, et al.
Pubblicazione: (2026)
di: Bai, Xingjian, et al.
Pubblicazione: (2026)
MotionStream: Real-Time Video Generation with Interactive Motion Controls
di: Shin, Joonghyuk, et al.
Pubblicazione: (2025)
di: Shin, Joonghyuk, et al.
Pubblicazione: (2025)
Customizing Text-to-Image Diffusion with Object Viewpoint Control
di: Kumari, Nupur, et al.
Pubblicazione: (2024)
di: Kumari, Nupur, et al.
Pubblicazione: (2024)
VideoGigaGAN: Towards Detail-rich Video Super-Resolution
di: Xu, Yiran, et al.
Pubblicazione: (2024)
di: Xu, Yiran, et al.
Pubblicazione: (2024)
SliderSpace: Decomposing the Visual Capabilities of Diffusion Models
di: Gandikota, Rohit, et al.
Pubblicazione: (2025)
di: Gandikota, Rohit, et al.
Pubblicazione: (2025)
Magic Fixup: Streamlining Photo Editing by Watching Dynamic Videos
di: Alzayer, Hadi, et al.
Pubblicazione: (2024)
di: Alzayer, Hadi, et al.
Pubblicazione: (2024)
Bidirectional Autoregressive Diffusion Model for Dance Generation
di: Zhang, Canyu, et al.
Pubblicazione: (2024)
di: Zhang, Canyu, et al.
Pubblicazione: (2024)
Epona: Autoregressive Diffusion World Model for Autonomous Driving
di: Zhang, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhang, Kaiwen, et al.
Pubblicazione: (2025)
Jump Cut Smoothing for Talking Heads
di: Wang, Xiaojuan, et al.
Pubblicazione: (2024)
di: Wang, Xiaojuan, et al.
Pubblicazione: (2024)
Content-Aware Texturing for Gaussian Splatting
di: Papantonakis, Panagiotis, et al.
Pubblicazione: (2025)
di: Papantonakis, Panagiotis, et al.
Pubblicazione: (2025)
Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
di: Cheng, Tianle, et al.
Pubblicazione: (2025)
di: Cheng, Tianle, et al.
Pubblicazione: (2025)
Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences
di: Bahng, Hyojin, et al.
Pubblicazione: (2025)
di: Bahng, Hyojin, et al.
Pubblicazione: (2025)
ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation
di: Li, Zongyi, et al.
Pubblicazione: (2024)
di: Li, Zongyi, et al.
Pubblicazione: (2024)
BAMM: Bidirectional Autoregressive Motion Model
di: Pinyoanuntapong, Ekkasit, et al.
Pubblicazione: (2024)
di: Pinyoanuntapong, Ekkasit, et al.
Pubblicazione: (2024)
NewMove: Customizing text-to-video models with novel motions
di: Materzynska, Joanna, et al.
Pubblicazione: (2023)
di: Materzynska, Joanna, et al.
Pubblicazione: (2023)
An evaluation of SVBRDF Prediction from Generative Image Models for Appearance Modeling of 3D Scenes
di: Gauthier, Alban, et al.
Pubblicazione: (2025)
di: Gauthier, Alban, et al.
Pubblicazione: (2025)
Bidirectional Sparse Attention for Faster Video Diffusion Training
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
VideoShield: Regulating Diffusion-based Video Generation Models via Watermarking
di: Hu, Runyi, et al.
Pubblicazione: (2025)
di: Hu, Runyi, et al.
Pubblicazione: (2025)
TurboEdit: Instant text-based image editing
di: Wu, Zongze, et al.
Pubblicazione: (2024)
di: Wu, Zongze, et al.
Pubblicazione: (2024)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
di: Xiong, Tianwei, et al.
Pubblicazione: (2026)
di: Xiong, Tianwei, et al.
Pubblicazione: (2026)
Slot-VLM: SlowFast Slots for Video-Language Modeling
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
Lazy Diffusion Transformer for Interactive Image Editing
di: Nitzan, Yotam, et al.
Pubblicazione: (2024)
di: Nitzan, Yotam, et al.
Pubblicazione: (2024)
Generative Video Motion Editing with 3D Point Tracks
di: Lee, Yao-Chih, et al.
Pubblicazione: (2025)
di: Lee, Yao-Chih, et al.
Pubblicazione: (2025)
End-to-End Training for Unified Tokenization and Latent Denoising
di: Duggal, Shivam, et al.
Pubblicazione: (2026)
di: Duggal, Shivam, et al.
Pubblicazione: (2026)
Creo: From One-Shot Image Generation to Progressive, Co-Creative Ideation
di: De Simone, Zoe, et al.
Pubblicazione: (2026)
di: De Simone, Zoe, et al.
Pubblicazione: (2026)
Fine-grained Defocus Blur Control for Generative Image Models
di: Shrivastava, Ayush, et al.
Pubblicazione: (2025)
di: Shrivastava, Ayush, et al.
Pubblicazione: (2025)
Loong: Generating Minute-level Long Videos with Autoregressive Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
di: Shi, Min, et al.
Pubblicazione: (2025)
di: Shi, Min, et al.
Pubblicazione: (2025)
Distilling Diffusion Models into Conditional GANs
di: Kang, Minguk, et al.
Pubblicazione: (2024)
di: Kang, Minguk, et al.
Pubblicazione: (2024)
Identifying Prompted Artist Names from Generated Images
di: Su, Grace, et al.
Pubblicazione: (2025)
di: Su, Grace, et al.
Pubblicazione: (2025)
Editable Image Elements for Controllable Synthesis
di: Mu, Jiteng, et al.
Pubblicazione: (2024)
di: Mu, Jiteng, et al.
Pubblicazione: (2024)
SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging
di: Zeng, Haijin, et al.
Pubblicazione: (2025)
di: Zeng, Haijin, et al.
Pubblicazione: (2025)
Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression
di: Zhen, Dingcheng, et al.
Pubblicazione: (2025)
di: Zhen, Dingcheng, et al.
Pubblicazione: (2025)
Q-ARVD: Quantizing Autoregressive Video Diffusion Models
di: Tang, Siao, et al.
Pubblicazione: (2026)
di: Tang, Siao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Improved Distribution Matching Distillation for Fast Image Synthesis
di: Yin, Tianwei, et al.
Pubblicazione: (2024) -
One-step Diffusion with Distribution Matching Distillation
di: Yin, Tianwei, et al.
Pubblicazione: (2023) -
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
di: Huang, Xun, et al.
Pubblicazione: (2025) -
Long-Context State-Space Video World Models
di: Po, Ryan, et al.
Pubblicazione: (2025) -
MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
di: Xue, Haotian, et al.
Pubblicazione: (2025)