A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Shengqiong, Ye, Weicai, Zhang, Yuanxing, Wang, Jiahao, Liu, Quande, Wang, Xintao, Wan, Pengfei, Gai, Kun, Fei, Hao, Chua, Tat-Seng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
Universal Scene Graph Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
par: Ju, Xuan, et autres
Publié: (2025)
par: Ju, Xuan, et autres
Publié: (2025)
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
par: Cai, Minghong, et autres
Publié: (2025)
par: Cai, Minghong, et autres
Publié: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
par: Wei, Cong, et autres
Publié: (2025)
par: Wei, Cong, et autres
Publié: (2025)
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
par: He, Xuanhua, et autres
Publié: (2025)
par: He, Xuanhua, et autres
Publié: (2025)
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
par: Ye, Zixuan, et autres
Publié: (2025)
par: Ye, Zixuan, et autres
Publié: (2025)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
par: Fei, Hao, et autres
Publié: (2023)
par: Fei, Hao, et autres
Publié: (2023)
In-Context Audio Control of Video Diffusion Transformers
par: Liu, Wenze, et autres
Publié: (2025)
par: Liu, Wenze, et autres
Publié: (2025)
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
par: Wu, Shengqiong, et autres
Publié: (2024)
par: Wu, Shengqiong, et autres
Publié: (2024)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
par: Wang, Qinghe, et autres
Publié: (2025)
par: Wang, Qinghe, et autres
Publié: (2025)
NExT-GPT: Any-to-Any Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2023)
par: Wu, Shengqiong, et autres
Publié: (2023)
A Survey of Interactive Generative Video
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
UNIC: Unified In-Context Video Editing
par: Ye, Zixuan, et autres
Publié: (2025)
par: Ye, Zixuan, et autres
Publié: (2025)
SketchVideo: Sketch-based Video Generation and Editing
par: Liu, Feng-Lin, et autres
Publié: (2025)
par: Liu, Feng-Lin, et autres
Publié: (2025)
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
par: Huang, Yuzhou, et autres
Publié: (2025)
par: Huang, Yuzhou, et autres
Publié: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
par: Liu, Kai, et autres
Publié: (2026)
par: Liu, Kai, et autres
Publié: (2026)
SemanticGen: Video Generation in Semantic Space
par: Bai, Jianhong, et autres
Publié: (2025)
par: Bai, Jianhong, et autres
Publié: (2025)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
par: Chen, Junyi, et autres
Publié: (2026)
par: Chen, Junyi, et autres
Publié: (2026)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2024)
par: Wu, Shengqiong, et autres
Publié: (2024)
Scaling Image and Video Generation via Test-Time Evolutionary Search
par: He, Haoran, et autres
Publié: (2025)
par: He, Haoran, et autres
Publié: (2025)
Position: Interactive Generative Video as Next-Generation Game Engine
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023)
par: Qin, Bosheng, et autres
Publié: (2023)
CamCloneMaster: Enabling Reference-based Camera Control for Video Generation
par: Luo, Yawen, et autres
Publié: (2025)
par: Luo, Yawen, et autres
Publié: (2025)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
par: Qian, Long, et autres
Publié: (2024)
par: Qian, Long, et autres
Publié: (2024)
Modeling Cross-vision Synergy for Unified Large Vision Model
par: Wu, Shengqiong, et autres
Publié: (2026)
par: Wu, Shengqiong, et autres
Publié: (2026)
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
par: Luo, Yawen, et autres
Publié: (2026)
par: Luo, Yawen, et autres
Publié: (2026)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
par: Wang, Qixun, et autres
Publié: (2025)
par: Wang, Qixun, et autres
Publié: (2025)
Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation
par: Jin, Kaiming, et autres
Publié: (2026)
par: Jin, Kaiming, et autres
Publié: (2026)
Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation
par: Wang, Qinghe, et autres
Publié: (2025)
par: Wang, Qinghe, et autres
Publié: (2025)
UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
par: Du, Shian, et autres
Publié: (2025)
par: Du, Shian, et autres
Publié: (2025)
Grammar Induction from Visual, Speech and Text
par: Zhao, Yu, et autres
Publié: (2024)
par: Zhao, Yu, et autres
Publié: (2024)
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
Extending Visual Dynamics for Video-to-Music Generation
par: Liu, Xiaohao, et autres
Publié: (2025)
par: Liu, Xiaohao, et autres
Publié: (2025)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
par: Zhang, An, et autres
Publié: (2024)
par: Zhang, An, et autres
Publié: (2024)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
par: Wang, Qunzhong, et autres
Publié: (2025)
par: Wang, Qunzhong, et autres
Publié: (2025)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
Documents similaires
-
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
par: Wu, Shengqiong, et autres
Publié: (2025) -
Universal Scene Graph Generation
par: Wu, Shengqiong, et autres
Publié: (2025) -
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
par: Ju, Xuan, et autres
Publié: (2025) -
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
par: Cai, Minghong, et autres
Publié: (2025) -
UniVideo: Unified Understanding, Generation, and Editing for Videos
par: Wei, Cong, et autres
Publié: (2025)