SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Junsong, Zhao, Yuyang, Yu, Jincheng, Chu, Ruihang, Chen, Junyu, Yang, Shuai, Wang, Xianbang, Pan, Yicheng, Zhou, Daquan, Ling, Huan, Liu, Haozhe, Yi, Hongwei, Zhang, Hao, Li, Muyang, Chen, Yukang, Cai, Han, Fidler, Sanja, Luo, Ping, Han, Song, Xie, Enze |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
LongLive: Real-time Interactive Long Video Generation
di: Yang, Shuai, et al.
Pubblicazione: (2025)
di: Yang, Shuai, et al.
Pubblicazione: (2025)
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
di: Xie, Enze, et al.
Pubblicazione: (2025)
di: Xie, Enze, et al.
Pubblicazione: (2025)
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
di: Zhu, Haoyi, et al.
Pubblicazione: (2026)
di: Zhu, Haoyi, et al.
Pubblicazione: (2026)
SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency Distillation
di: Chen, Junsong, et al.
Pubblicazione: (2025)
di: Chen, Junsong, et al.
Pubblicazione: (2025)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
di: Xie, Enze, et al.
Pubblicazione: (2024)
di: Xie, Enze, et al.
Pubblicazione: (2024)
DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head
di: Zhang, Kewei, et al.
Pubblicazione: (2026)
di: Zhang, Kewei, et al.
Pubblicazione: (2026)
LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
di: Chen, Yukang, et al.
Pubblicazione: (2026)
di: Chen, Yukang, et al.
Pubblicazione: (2026)
Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models
di: Chen, Junyu, et al.
Pubblicazione: (2024)
di: Chen, Junyu, et al.
Pubblicazione: (2024)
DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
di: He, Wenkun, et al.
Pubblicazione: (2025)
di: He, Wenkun, et al.
Pubblicazione: (2025)
DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving
di: Wang, Tianqi, et al.
Pubblicazione: (2024)
di: Wang, Tianqi, et al.
Pubblicazione: (2024)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
di: Tang, Haotian, et al.
Pubblicazione: (2024)
di: Tang, Haotian, et al.
Pubblicazione: (2024)
VideoPanda: Video Panoramic Diffusion with Multi-view Attention
di: Xie, Kevin, et al.
Pubblicazione: (2025)
di: Xie, Kevin, et al.
Pubblicazione: (2025)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
di: Ding, Yang, et al.
Pubblicazione: (2025)
di: Ding, Yang, et al.
Pubblicazione: (2025)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation
di: Chen, Zhekai, et al.
Pubblicazione: (2025)
di: Chen, Zhekai, et al.
Pubblicazione: (2025)
Magic 1-For-1: Generating One Minute Video Clips within One Minute
di: Yi, Hongwei, et al.
Pubblicazione: (2025)
di: Yi, Hongwei, et al.
Pubblicazione: (2025)
LuxDiT: Lighting Estimation with Video Diffusion Transformer
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
Video-Zero: Self-Evolution Video Understanding
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
Motion Attribution for Video Generation
di: Wu, Xindi, et al.
Pubblicazione: (2026)
di: Wu, Xindi, et al.
Pubblicazione: (2026)
Controllable Weather Synthesis and Removal with Video Diffusion Models
di: Lin, Chih-Hao, et al.
Pubblicazione: (2025)
di: Lin, Chih-Hao, et al.
Pubblicazione: (2025)
Towards Improving Unit Commitment Economics: An Add-On Tailor for Renewable Energy and Reserve Predictions
di: Chen, Xianbang, et al.
Pubblicazione: (2022)
di: Chen, Xianbang, et al.
Pubblicazione: (2022)
HumanNet: Scaling Human-centric Video Learning to One Million Hours
di: Deng, Yufan, et al.
Pubblicazione: (2026)
di: Deng, Yufan, et al.
Pubblicazione: (2026)
Towards Geometry-Aware and Motion-Guided Video Human Mesh Recovery
di: Chen, Hongjun, et al.
Pubblicazione: (2026)
di: Chen, Hongjun, et al.
Pubblicazione: (2026)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding
di: Liu, Zibo, et al.
Pubblicazione: (2026)
di: Liu, Zibo, et al.
Pubblicazione: (2026)
Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts
di: Zhao, Yuyang, et al.
Pubblicazione: (2023)
di: Zhao, Yuyang, et al.
Pubblicazione: (2023)
Align Your Flow: Scaling Continuous-Time Flow Map Distillation
di: Sabour, Amirmojtaba, et al.
Pubblicazione: (2025)
di: Sabour, Amirmojtaba, et al.
Pubblicazione: (2025)
Align Your Steps: Optimizing Sampling Schedules in Diffusion Models
di: Sabour, Amirmojtaba, et al.
Pubblicazione: (2024)
di: Sabour, Amirmojtaba, et al.
Pubblicazione: (2024)
InfiniCube: Unbounded and Controllable Dynamic 3D Driving Scene Generation with World-Guided Video Models
di: Lu, Yifan, et al.
Pubblicazione: (2024)
di: Lu, Yifan, et al.
Pubblicazione: (2024)
Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation
di: Zhu, Zixin, et al.
Pubblicazione: (2024)
di: Zhu, Zixin, et al.
Pubblicazione: (2024)
Real-time One-Step Diffusion-based Expressive Portrait Videos Generation
di: Guo, Hanzhong, et al.
Pubblicazione: (2024)
di: Guo, Hanzhong, et al.
Pubblicazione: (2024)
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
Feed-Forward Bullet-Time Reconstruction of Dynamic Scenes from Monocular Videos
di: Liang, Hanxue, et al.
Pubblicazione: (2024)
di: Liang, Hanxue, et al.
Pubblicazione: (2024)
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
DiffusionRenderer: Neural Inverse and Forward Rendering with Video Diffusion Models
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control
di: Ren, Xuanchi, et al.
Pubblicazione: (2025)
di: Ren, Xuanchi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
di: Zhao, Yuyang, et al.
Pubblicazione: (2026) -
LongLive: Real-time Interactive Long Video Generation
di: Yang, Shuai, et al.
Pubblicazione: (2025) -
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
di: Xie, Enze, et al.
Pubblicazione: (2025) -
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
di: Zhu, Haoyi, et al.
Pubblicazione: (2026) -
SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency Distillation
di: Chen, Junsong, et al.
Pubblicazione: (2025)