Ctrl-VI: Controllable Video Synthesis via Variational Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Duan, Haoyi, Zhang, Yunzhi, Du, Yilun, Wu, Jiajun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Product of Experts for Visual Generation
por: Zhang, Yunzhi, et al.
Publicado: (2025)
por: Zhang, Yunzhi, et al.
Publicado: (2025)
CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning
por: Cao, Qingqing, et al.
Publicado: (2024)
por: Cao, Qingqing, et al.
Publicado: (2024)
The Scene Language: Representing Scenes with Programs, Words, and Embeddings
por: Zhang, Yunzhi, et al.
Publicado: (2024)
por: Zhang, Yunzhi, et al.
Publicado: (2024)
CtrlNeRF: The Generative Neural Radiation Fields for the Controllable Synthesis of High-fidelity 3D-Aware Images
por: Liu, Jian, et al.
Publicado: (2024)
por: Liu, Jian, et al.
Publicado: (2024)
Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
por: Alzayer, Hadi, et al.
Publicado: (2025)
por: Alzayer, Hadi, et al.
Publicado: (2025)
Ctrl-Crash: Controllable Diffusion for Realistic Car Crashes
por: Gosselin, Anthony, et al.
Publicado: (2025)
por: Gosselin, Anthony, et al.
Publicado: (2025)
MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
por: Wang, Zhouxia, et al.
Publicado: (2023)
por: Wang, Zhouxia, et al.
Publicado: (2023)
WorldScore: A Unified Evaluation Benchmark for World Generation
por: Duan, Haoyi, et al.
Publicado: (2025)
por: Duan, Haoyi, et al.
Publicado: (2025)
BlobCtrl: Taming Controllable Blob for Element-level Image Editing
por: Li, Yaowei, et al.
Publicado: (2025)
por: Li, Yaowei, et al.
Publicado: (2025)
IV-Mixed Sampler: Leveraging Image Diffusion Models for Enhanced Video Synthesis
por: Shao, Shitong, et al.
Publicado: (2024)
por: Shao, Shitong, et al.
Publicado: (2024)
Long-Text-to-Image Generation via Compositional Prompt Decomposition
por: Huang, Jen-Yuan, et al.
Publicado: (2026)
por: Huang, Jen-Yuan, et al.
Publicado: (2026)
CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models
por: Xu, Shuhan, et al.
Publicado: (2026)
por: Xu, Shuhan, et al.
Publicado: (2026)
Grounding Video Models to Actions through Goal Conditioned Exploration
por: Luo, Yunhao, et al.
Publicado: (2024)
por: Luo, Yunhao, et al.
Publicado: (2024)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
Ctrl-GenAug: Controllable Generative Augmentation for Medical Sequence Classification
por: Zhou, Xinrui, et al.
Publicado: (2024)
por: Zhou, Xinrui, et al.
Publicado: (2024)
SIAVC: Semi-Supervised Framework for Industrial Accident Video Classification
por: Li, Zuoyong, et al.
Publicado: (2024)
por: Li, Zuoyong, et al.
Publicado: (2024)
Boximator: Generating Rich and Controllable Motions for Video Synthesis
por: Wang, Jiawei, et al.
Publicado: (2024)
por: Wang, Jiawei, et al.
Publicado: (2024)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
por: Lv, Qitan, et al.
Publicado: (2026)
por: Lv, Qitan, et al.
Publicado: (2026)
PhysDreamer: Physics-Based Interaction with 3D Objects via Video Generation
por: Zhang, Tianyuan, et al.
Publicado: (2024)
por: Zhang, Tianyuan, et al.
Publicado: (2024)
Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model
por: Lin, Han, et al.
Publicado: (2024)
por: Lin, Han, et al.
Publicado: (2024)
Ctrl-A: Control-Driven Online Data Augmentation
por: Christensen, Jesper B., et al.
Publicado: (2026)
por: Christensen, Jesper B., et al.
Publicado: (2026)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
por: Xiong, Haomiao, et al.
Publicado: (2025)
por: Xiong, Haomiao, et al.
Publicado: (2025)
Video as the New Language for Real-World Decision Making
por: Yang, Sherry, et al.
Publicado: (2024)
por: Yang, Sherry, et al.
Publicado: (2024)
Diffusion Self-Distillation for Zero-Shot Customized Image Generation
por: Cai, Shengqu, et al.
Publicado: (2024)
por: Cai, Shengqu, et al.
Publicado: (2024)
SRDiffusion: Accelerate Video Diffusion Inference via Sketching-Rendering Cooperation
por: Cheng, Shenggan, et al.
Publicado: (2025)
por: Cheng, Shenggan, et al.
Publicado: (2025)
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions
por: Zhang, Kecheng, et al.
Publicado: (2026)
por: Zhang, Kecheng, et al.
Publicado: (2026)
PoseCrafter: One-Shot Personalized Video Synthesis Following Flexible Pose Control
por: Zhong, Yong, et al.
Publicado: (2024)
por: Zhong, Yong, et al.
Publicado: (2024)
Equilibrium Matching: Generative Modeling with Implicit Energy-Based Models
por: Wang, Runqian, et al.
Publicado: (2025)
por: Wang, Runqian, et al.
Publicado: (2025)
Image Conductor: Precision Control for Interactive Video Synthesis
por: Li, Yaowei, et al.
Publicado: (2024)
por: Li, Yaowei, et al.
Publicado: (2024)
GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment
por: He, Haoyang, et al.
Publicado: (2025)
por: He, Haoyang, et al.
Publicado: (2025)
Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization
por: Wu, Yuanli, et al.
Publicado: (2025)
por: Wu, Yuanli, et al.
Publicado: (2025)
BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion Models
por: Shi, Fengyuan, et al.
Publicado: (2023)
por: Shi, Fengyuan, et al.
Publicado: (2023)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
por: Fei, Jiajun, et al.
Publicado: (2024)
por: Fei, Jiajun, et al.
Publicado: (2024)
ALPS: An Auto-Labeling and Pre-training Scheme for Remote Sensing Segmentation With Segment Anything Model
por: Zhang, Song, et al.
Publicado: (2024)
por: Zhang, Song, et al.
Publicado: (2024)
Inference-based GAN Video Generation
por: Yang, Jingbo, et al.
Publicado: (2025)
por: Yang, Jingbo, et al.
Publicado: (2025)
LightCtrl: Training-free Controllable Video Relighting
por: Peng, Yizuo, et al.
Publicado: (2026)
por: Peng, Yizuo, et al.
Publicado: (2026)
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
por: Zhan, Zheng, et al.
Publicado: (2024)
por: Zhan, Zheng, et al.
Publicado: (2024)
Video-T1: Test-Time Scaling for Video Generation
por: Liu, Fangfu, et al.
Publicado: (2025)
por: Liu, Fangfu, et al.
Publicado: (2025)
MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation
por: Chen, Ming, et al.
Publicado: (2025)
por: Chen, Ming, et al.
Publicado: (2025)
Controllable Video Object Insertion via Multiview Priors
por: Qi, Xia, et al.
Publicado: (2026)
por: Qi, Xia, et al.
Publicado: (2026)
Ejemplares similares
-
Product of Experts for Visual Generation
por: Zhang, Yunzhi, et al.
Publicado: (2025) -
CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning
por: Cao, Qingqing, et al.
Publicado: (2024) -
The Scene Language: Representing Scenes with Programs, Words, and Embeddings
por: Zhang, Yunzhi, et al.
Publicado: (2024) -
CtrlNeRF: The Generative Neural Radiation Fields for the Controllable Synthesis of High-fidelity 3D-Aware Images
por: Liu, Jian, et al.
Publicado: (2024) -
Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
por: Alzayer, Hadi, et al.
Publicado: (2025)