Video-As-Prompt: Unified Semantic Control for Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bian, Yuxuan, Chen, Xin, Li, Zenan, Zhi, Tiancheng, Sang, Shen, Luo, Linjie, Xu, Qiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Plan-X: Instruct Video Generation via Semantic Planning
par: Huang, Lun, et autres
Publié: (2025)
par: Huang, Lun, et autres
Publié: (2025)
Lynx: Towards High-Fidelity Personalized Video Generation
par: Sang, Shen, et autres
Publié: (2025)
par: Sang, Shen, et autres
Publié: (2025)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
par: Bian, Yuxuan, et autres
Publié: (2025)
par: Bian, Yuxuan, et autres
Publié: (2025)
X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents
par: Song, Guoxian, et autres
Publié: (2025)
par: Song, Guoxian, et autres
Publié: (2025)
Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals
par: Gillman, Nate, et autres
Publié: (2025)
par: Gillman, Nate, et autres
Publié: (2025)
OmniCam: Unified Multimodal Video Generation via Camera Control
par: Yang, Xiaoda, et autres
Publié: (2025)
par: Yang, Xiaoda, et autres
Publié: (2025)
Bridging Your Imagination with Audio-Video Generation via a Unified Director
par: Zhang, Jiaxu, et autres
Publié: (2025)
par: Zhang, Jiaxu, et autres
Publié: (2025)
GenDDS: Generating Diverse Driving Video Scenarios with Prompt-to-Video Generative Model
par: Fu, Yongjie, et autres
Publié: (2024)
par: Fu, Yongjie, et autres
Publié: (2024)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
par: Guo, Jiangyuan, et autres
Publié: (2024)
par: Guo, Jiangyuan, et autres
Publié: (2024)
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
par: Qin, Luozheng, et autres
Publié: (2026)
par: Qin, Luozheng, et autres
Publié: (2026)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
par: Li, Chenglin, et autres
Publié: (2024)
par: Li, Chenglin, et autres
Publié: (2024)
PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation
par: Wu, Shang, et autres
Publié: (2026)
par: Wu, Shang, et autres
Publié: (2026)
MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
par: Wang, Zhouxia, et autres
Publié: (2023)
par: Wang, Zhouxia, et autres
Publié: (2023)
COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection
par: Xiao, Jinqi, et autres
Publié: (2024)
par: Xiao, Jinqi, et autres
Publié: (2024)
Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation
par: Zhang, Jihai, et autres
Publié: (2025)
par: Zhang, Jihai, et autres
Publié: (2025)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
par: Yan, Xin, et autres
Publié: (2024)
par: Yan, Xin, et autres
Publié: (2024)
DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation
par: Fu, Junhu, et autres
Publié: (2026)
par: Fu, Junhu, et autres
Publié: (2026)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
Controllable Video Generation with Provable Disentanglement
par: Shen, Yifan, et autres
Publié: (2025)
par: Shen, Yifan, et autres
Publié: (2025)
S2DM: Sector-Shaped Diffusion Models for Video Generation
par: Lang, Haoran, et autres
Publié: (2024)
par: Lang, Haoran, et autres
Publié: (2024)
MemCam: Memory-Augmented Camera Control for Consistent Video Generation
par: Gao, Xinhang, et autres
Publié: (2026)
par: Gao, Xinhang, et autres
Publié: (2026)
EVC-MF: End-to-end Video Captioning Network with Multi-scale Features
par: Niu, Tian-Zi, et autres
Publié: (2024)
par: Niu, Tian-Zi, et autres
Publié: (2024)
Conditional Video Generation for High-Efficiency Video Compression
par: Yi, Fangqiu, et autres
Publié: (2025)
par: Yi, Fangqiu, et autres
Publié: (2025)
Causality Model for Semantic Understanding on Videos
par: Yicong, Li
Publié: (2025)
par: Yicong, Li
Publié: (2025)
Learning Feature-Preserving Portrait Editing from Generated Pairs
par: Chen, Bowei, et autres
Publié: (2024)
par: Chen, Bowei, et autres
Publié: (2024)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
Space-time Reinforcement Network for Video Object Segmentation
par: Chen, Yadang, et autres
Publié: (2024)
par: Chen, Yadang, et autres
Publié: (2024)
Domain Adaptation of VLM for Soccer Video Understanding
par: Jiang, Tiancheng, et autres
Publié: (2025)
par: Jiang, Tiancheng, et autres
Publié: (2025)
SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation
par: Tan, Shanwen, et autres
Publié: (2026)
par: Tan, Shanwen, et autres
Publié: (2026)
BadVideo: Stealthy Backdoor Attack against Text-to-Video Generation
par: Wang, Ruotong, et autres
Publié: (2025)
par: Wang, Ruotong, et autres
Publié: (2025)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Learning Spatial-Semantic Features for Robust Video Object Segmentation
par: Li, Xin, et autres
Publié: (2024)
par: Li, Xin, et autres
Publié: (2024)
A Mechanistic View on Video Generation as World Models: State and Dynamics
par: Wang, Luozhou, et autres
Publié: (2026)
par: Wang, Luozhou, et autres
Publié: (2026)
Semantic Generative Tuning for Unified Multimodal Models
par: Yu, Songsong, et autres
Publié: (2026)
par: Yu, Songsong, et autres
Publié: (2026)
Visual Prompting for One-shot Controllable Video Editing without Inversion
par: Zhang, Zhengbo, et autres
Publié: (2025)
par: Zhang, Zhengbo, et autres
Publié: (2025)
Video-Bench: Human-Aligned Video Generation Benchmark
par: Han, Hui, et autres
Publié: (2025)
par: Han, Hui, et autres
Publié: (2025)
UBiSS: A Unified Framework for Bimodal Semantic Summarization of Videos
par: Mei, Yuting, et autres
Publié: (2024)
par: Mei, Yuting, et autres
Publié: (2024)
Accurate and Fast Compressed Video Captioning
par: Shen, Yaojie, et autres
Publié: (2023)
par: Shen, Yaojie, et autres
Publié: (2023)
Fast Autoregressive Video Generation with Diagonal Decoding
par: Ye, Yang, et autres
Publié: (2025)
par: Ye, Yang, et autres
Publié: (2025)
Documents similaires
-
Plan-X: Instruct Video Generation via Semantic Planning
par: Huang, Lun, et autres
Publié: (2025) -
Lynx: Towards High-Fidelity Personalized Video Generation
par: Sang, Shen, et autres
Publié: (2025) -
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
par: Bian, Yuxuan, et autres
Publié: (2025) -
X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents
par: Song, Guoxian, et autres
Publié: (2025) -
Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals
par: Gillman, Nate, et autres
Publié: (2025)