Adaptive 1D Video Diffusion Autoencoder
Fuente:
arXiv
Salvato in:
| Autori principali: | Teng, Yao, Lin, Minxuan, Liu, Xian, Wang, Shuai, Yang, Xiao, Liu, Xihui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Personalized Text-to-Image Generation with Auto-Regressive Models
di: Sun, Kaiyue, et al.
Pubblicazione: (2025)
di: Sun, Kaiyue, et al.
Pubblicazione: (2025)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
di: Zhang, Haiyu, et al.
Pubblicazione: (2024)
di: Zhang, Haiyu, et al.
Pubblicazione: (2024)
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
di: Wang, Yuqing, et al.
Pubblicazione: (2026)
di: Wang, Yuqing, et al.
Pubblicazione: (2026)
AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset
di: Zhang, Haiyu, et al.
Pubblicazione: (2025)
di: Zhang, Haiyu, et al.
Pubblicazione: (2025)
Self-NPO: Data-Free Diffusion Model Enhancement via Truncated Diffusion Fine-Tuning
di: Wang, Fu-Yun, et al.
Pubblicazione: (2025)
di: Wang, Fu-Yun, et al.
Pubblicazione: (2025)
Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi Decoding
di: Teng, Yao, et al.
Pubblicazione: (2024)
di: Teng, Yao, et al.
Pubblicazione: (2024)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
di: Xiong, Tianwei, et al.
Pubblicazione: (2026)
di: Xiong, Tianwei, et al.
Pubblicazione: (2026)
DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis
di: Teng, Yao, et al.
Pubblicazione: (2024)
di: Teng, Yao, et al.
Pubblicazione: (2024)
SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation
di: Teng, Yao, et al.
Pubblicazione: (2025)
di: Teng, Yao, et al.
Pubblicazione: (2025)
Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
di: Teng, Yao, et al.
Pubblicazione: (2025)
di: Teng, Yao, et al.
Pubblicazione: (2025)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion
di: Liu, Xian, et al.
Pubblicazione: (2023)
di: Liu, Xian, et al.
Pubblicazione: (2023)
DiTPainter: Efficient Video Inpainting with Diffusion Transformers
di: Wu, Xian, et al.
Pubblicazione: (2025)
di: Wu, Xian, et al.
Pubblicazione: (2025)
HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting
di: Liu, Xian, et al.
Pubblicazione: (2023)
di: Liu, Xian, et al.
Pubblicazione: (2023)
Geometric Autoencoder for Diffusion Models
di: Liu, Hangyu, et al.
Pubblicazione: (2026)
di: Liu, Hangyu, et al.
Pubblicazione: (2026)
Text-Guided Video Masked Autoencoder
di: Fan, David, et al.
Pubblicazione: (2024)
di: Fan, David, et al.
Pubblicazione: (2024)
VideoMAC: Video Masked Autoencoders Meet ConvNets
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration
di: Huang, Kaiyi, et al.
Pubblicazione: (2024)
di: Huang, Kaiyi, et al.
Pubblicazione: (2024)
T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
di: Sun, Kaiyue, et al.
Pubblicazione: (2025)
di: Sun, Kaiyue, et al.
Pubblicazione: (2025)
Video Diffusion Models are Training-free Motion Interpreter and Controller
di: Xiao, Zeqi, et al.
Pubblicazione: (2024)
di: Xiao, Zeqi, et al.
Pubblicazione: (2024)
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
di: Wu, Haoyu, et al.
Pubblicazione: (2026)
di: Wu, Haoyu, et al.
Pubblicazione: (2026)
FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space
di: FSVideo Team, et al.
Pubblicazione: (2026)
di: FSVideo Team, et al.
Pubblicazione: (2026)
Loong: Generating Minute-level Long Videos with Autoregressive Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
di: Cheng, Tianle, et al.
Pubblicazione: (2025)
di: Cheng, Tianle, et al.
Pubblicazione: (2025)
Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
di: Liu, Shizhan, et al.
Pubblicazione: (2025)
di: Liu, Shizhan, et al.
Pubblicazione: (2025)
Adaptive Caching for Faster Video Generation with Diffusion Transformers
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation
di: Huang, Kaiyi, et al.
Pubblicazione: (2026)
di: Huang, Kaiyi, et al.
Pubblicazione: (2026)
LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
GameFactory: Creating New Games with Generative Interactive Videos
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
Plenoptic Video Generation
di: Fu, Xiao, et al.
Pubblicazione: (2026)
di: Fu, Xiao, et al.
Pubblicazione: (2026)
Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence
di: Yuan, Tianyu, et al.
Pubblicazione: (2025)
di: Yuan, Tianyu, et al.
Pubblicazione: (2025)
V3D: Video Diffusion Models are Effective 3D Generators
di: Chen, Zilong, et al.
Pubblicazione: (2024)
di: Chen, Zilong, et al.
Pubblicazione: (2024)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
di: Lin, Xinying, et al.
Pubblicazione: (2026)
di: Lin, Xinying, et al.
Pubblicazione: (2026)
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
di: Wang, Mengmeng, et al.
Pubblicazione: (2026)
di: Wang, Mengmeng, et al.
Pubblicazione: (2026)
Recurrent Video Masked Autoencoders
di: Zoran, Daniel, et al.
Pubblicazione: (2025)
di: Zoran, Daniel, et al.
Pubblicazione: (2025)
Position: Interactive Generative Video as Next-Generation Game Engine
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation
di: Chao, Brian, et al.
Pubblicazione: (2026)
di: Chao, Brian, et al.
Pubblicazione: (2026)
TopoDiT-3D: Topology-Aware Diffusion Transformer with Bottleneck Structure for 3D Point Cloud Generation
di: Guan, Zechao, et al.
Pubblicazione: (2025)
di: Guan, Zechao, et al.
Pubblicazione: (2025)
FiT: Flexible Vision Transformer for Diffusion Model
di: Lu, Zeyu, et al.
Pubblicazione: (2024)
di: Lu, Zeyu, et al.
Pubblicazione: (2024)
Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context
di: Shen, Cuifeng, et al.
Pubblicazione: (2025)
di: Shen, Cuifeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Personalized Text-to-Image Generation with Auto-Regressive Models
di: Sun, Kaiyue, et al.
Pubblicazione: (2025) -
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
di: Zhang, Haiyu, et al.
Pubblicazione: (2024) -
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
di: Wang, Yuqing, et al.
Pubblicazione: (2026) -
AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset
di: Zhang, Haiyu, et al.
Pubblicazione: (2025) -
Self-NPO: Data-Free Diffusion Model Enhancement via Truncated Diffusion Fine-Tuning
di: Wang, Fu-Yun, et al.
Pubblicazione: (2025)