VideoTetris: Towards Compositional Text-to-Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Tian, Ye, Yang, Ling, Yang, Haotian, Gao, Yuan, Deng, Yufan, Chen, Jingmin, Wang, Xintao, Yu, Zhaochen, Tao, Xin, Wan, Pengfei, Zhang, Di, Cui, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VMoBA: Mixture-of-Block Attention for Video Diffusion Models
di: Wu, Jianzong, et al.
Pubblicazione: (2025)
di: Wu, Jianzong, et al.
Pubblicazione: (2025)
Contextualized Diffusion Models for Text-Guided Image and Video Generation
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
SketchVideo: Sketch-based Video Generation and Editing
di: Liu, Feng-Lin, et al.
Pubblicazione: (2025)
di: Liu, Feng-Lin, et al.
Pubblicazione: (2025)
StyleMaster: Stylize Your Video with Artistic Generation and Translation
di: Ye, Zixuan, et al.
Pubblicazione: (2024)
di: Ye, Zixuan, et al.
Pubblicazione: (2024)
Scaling Image and Video Generation via Test-Time Evolutionary Search
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
RealCompo: Balancing Realism and Compositionality Improves Text-to-Image Diffusion Models
di: Zhang, Xinchen, et al.
Pubblicazione: (2024)
di: Zhang, Xinchen, et al.
Pubblicazione: (2024)
BadVideo: Stealthy Backdoor Attack against Text-to-Video Generation
di: Wang, Ruotong, et al.
Pubblicazione: (2025)
di: Wang, Ruotong, et al.
Pubblicazione: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
di: Wei, Cong, et al.
Pubblicazione: (2025)
di: Wei, Cong, et al.
Pubblicazione: (2025)
GameFactory: Creating New Games with Generative Interactive Videos
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
di: Guo, Xun, et al.
Pubblicazione: (2023)
di: Guo, Xun, et al.
Pubblicazione: (2023)
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
di: Yang, Ling, et al.
Pubblicazione: (2025)
di: Yang, Ling, et al.
Pubblicazione: (2025)
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
di: Du, Shian, et al.
Pubblicazione: (2025)
di: Du, Shian, et al.
Pubblicazione: (2025)
Manipulating a Tetris-Inspired 3D Video Representation
di: Godbole, Mihir
Pubblicazione: (2024)
di: Godbole, Mihir
Pubblicazione: (2024)
Owl-1: Omni World Model for Consistent Long Video Generation
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
di: Yuan, Shenghai, et al.
Pubblicazione: (2025)
di: Yuan, Shenghai, et al.
Pubblicazione: (2025)
UNIC: Unified In-Context Video Editing
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content
di: Wang, Qiuheng, et al.
Pubblicazione: (2024)
di: Wang, Qiuheng, et al.
Pubblicazione: (2024)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
di: Huang, Jiehui, et al.
Pubblicazione: (2025)
di: Huang, Jiehui, et al.
Pubblicazione: (2025)
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
di: He, Xuanhua, et al.
Pubblicazione: (2025)
di: He, Xuanhua, et al.
Pubblicazione: (2025)
CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation
di: Wang, Qinghe, et al.
Pubblicazione: (2025)
di: Wang, Qinghe, et al.
Pubblicazione: (2025)
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
di: Cai, Minghong, et al.
Pubblicazione: (2025)
di: Cai, Minghong, et al.
Pubblicazione: (2025)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
di: Ju, Xuan, et al.
Pubblicazione: (2025)
di: Ju, Xuan, et al.
Pubblicazione: (2025)
Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control
di: Fu, Xiao, et al.
Pubblicazione: (2025)
di: Fu, Xiao, et al.
Pubblicazione: (2025)
Position: Interactive Generative Video as Next-Generation Game Engine
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
Bitboard version of Tetris AI
di: Chen, Xingguo, et al.
Pubblicazione: (2026)
di: Chen, Xingguo, et al.
Pubblicazione: (2026)
SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives
di: Ji, Sihui, et al.
Pubblicazione: (2025)
di: Ji, Sihui, et al.
Pubblicazione: (2025)
Tetris: Tile-level Sampling for Efficient and High-Fidelity Video Object Tracking
di: Kittivorawong, Chanwut, et al.
Pubblicazione: (2026)
di: Kittivorawong, Chanwut, et al.
Pubblicazione: (2026)
MTV-Inpaint: Multi-Task Long Video Inpainting
di: Yang, Shiyuan, et al.
Pubblicazione: (2025)
di: Yang, Shiyuan, et al.
Pubblicazione: (2025)
Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
Simulation and Optimization of Bus Interior Noise Based on Hybrid Method for Engine Vibration Load Identification
di: Xintao Cui, et al.
Pubblicazione: (2024)
di: Xintao Cui, et al.
Pubblicazione: (2024)
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
di: Huang, Yuzhou, et al.
Pubblicazione: (2025)
di: Huang, Yuzhou, et al.
Pubblicazione: (2025)
A Survey of Interactive Generative Video
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
Comp-Attn: Present-and-Align Attention for Compositional Video Generation
di: Zhang, Hongyu, et al.
Pubblicazione: (2025)
di: Zhang, Hongyu, et al.
Pubblicazione: (2025)
Towards Fine-grained Interactive Segmentation in Images and Videos
di: Yao, Yuan, et al.
Pubblicazione: (2025)
di: Yao, Yuan, et al.
Pubblicazione: (2025)
Motion Inversion for Video Customization
di: Wang, Luozhou, et al.
Pubblicazione: (2024)
di: Wang, Luozhou, et al.
Pubblicazione: (2024)
Improving Video Generation with Human Feedback
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation
di: Fu, Xiao, et al.
Pubblicazione: (2024)
di: Fu, Xiao, et al.
Pubblicazione: (2024)
HumanNet: Scaling Human-centric Video Learning to One Million Hours
di: Deng, Yufan, et al.
Pubblicazione: (2026)
di: Deng, Yufan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VMoBA: Mixture-of-Block Attention for Video Diffusion Models
di: Wu, Jianzong, et al.
Pubblicazione: (2025) -
Contextualized Diffusion Models for Text-Guided Image and Video Generation
di: Yang, Ling, et al.
Pubblicazione: (2024) -
SketchVideo: Sketch-based Video Generation and Editing
di: Liu, Feng-Lin, et al.
Pubblicazione: (2025) -
StyleMaster: Stylize Your Video with Artistic Generation and Translation
di: Ye, Zixuan, et al.
Pubblicazione: (2024) -
Scaling Image and Video Generation via Test-Time Evolutionary Search
di: He, Haoran, et al.
Pubblicazione: (2025)