OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Sen, Yu, Zhentao, Zhou, Zhengguang, Hu, Teng, Wang, Hongmei, Chen, Yi, Lin, Qin, Zhou, Yuan, Li, Xin, Lu, Qinglin, Chen, Zhibo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
por: Hu, Teng, et al.
Publicado: (2025)
por: Hu, Teng, et al.
Publicado: (2025)
PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement
por: Hu, Teng, et al.
Publicado: (2025)
por: Hu, Teng, et al.
Publicado: (2025)
Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
por: Hu, Teng, et al.
Publicado: (2025)
por: Hu, Teng, et al.
Publicado: (2025)
OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding
por: Jiang, Songtao, et al.
Publicado: (2025)
por: Jiang, Songtao, et al.
Publicado: (2025)
SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing
por: Liang, Sen, et al.
Publicado: (2026)
por: Liang, Sen, et al.
Publicado: (2026)
Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars
por: Zhang, Youliang, et al.
Publicado: (2026)
por: Zhang, Youliang, et al.
Publicado: (2026)
USV: Unified Sparsification for Accelerating Video Diffusion Models
por: Wu, Xinjian, et al.
Publicado: (2025)
por: Wu, Xinjian, et al.
Publicado: (2025)
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
por: Chen, Yi, et al.
Publicado: (2025)
por: Chen, Yi, et al.
Publicado: (2025)
Versatile Editing of Video Content, Actions, and Dynamics without Training
por: Kulikov, Vladimir, et al.
Publicado: (2026)
por: Kulikov, Vladimir, et al.
Publicado: (2026)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
por: Tian, Zeyue, et al.
Publicado: (2026)
por: Tian, Zeyue, et al.
Publicado: (2026)
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
por: Zhang, Guozhen, et al.
Publicado: (2025)
por: Zhang, Guozhen, et al.
Publicado: (2025)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
Video Quality Assessment Based on Swin TransformerV2 and Coarse to Fine Strategy
por: Yu, Zihao, et al.
Publicado: (2024)
por: Yu, Zihao, et al.
Publicado: (2024)
Omni-3DEdit: Generalized Versatile 3D Editing in One-Pass
por: Liyi, Chen, et al.
Publicado: (2026)
por: Liyi, Chen, et al.
Publicado: (2026)
Enabling Versatile Controls for Video Diffusion Models
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation
por: Huang, Ziyao, et al.
Publicado: (2025)
por: Huang, Ziyao, et al.
Publicado: (2025)
InstanceV: Instance-Level Video Generation
por: Chen, Yuheng, et al.
Publicado: (2025)
por: Chen, Yuheng, et al.
Publicado: (2025)
Dynamic Motion Blending for Versatile Motion Editing
por: Jiang, Nan, et al.
Publicado: (2025)
por: Jiang, Nan, et al.
Publicado: (2025)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
por: Yang, Qize, et al.
Publicado: (2025)
por: Yang, Qize, et al.
Publicado: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance
por: Lin, Yiqi, et al.
Publicado: (2026)
por: Lin, Yiqi, et al.
Publicado: (2026)
OmniGuard: Hybrid Manipulation Localization via Augmented Versatile Deep Image Watermarking
por: Zhang, Xuanyu, et al.
Publicado: (2024)
por: Zhang, Xuanyu, et al.
Publicado: (2024)
V2V: Scaling Event-Based Vision through Efficient Video-to-Voxel Simulation
por: Lou, Hanyue, et al.
Publicado: (2025)
por: Lou, Hanyue, et al.
Publicado: (2025)
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
por: Sun, Zhiyao, et al.
Publicado: (2025)
por: Sun, Zhiyao, et al.
Publicado: (2025)
Double-bosonization and Majid's conjecture (V): grafting of quantum groups
por: Hu, Hongmei, et al.
Publicado: (2026)
por: Hu, Hongmei, et al.
Publicado: (2026)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
por: Chan, Nolan, et al.
Publicado: (2026)
por: Chan, Nolan, et al.
Publicado: (2026)
AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks
por: Ku, Max, et al.
Publicado: (2024)
por: Ku, Max, et al.
Publicado: (2024)
Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics
por: Zhong, Ruizhe, et al.
Publicado: (2026)
por: Zhong, Ruizhe, et al.
Publicado: (2026)
V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes
por: Zhang, Yanming, et al.
Publicado: (2025)
por: Zhang, Yanming, et al.
Publicado: (2025)
Owl-1: Omni World Model for Consistent Long Video Generation
por: Huang, Yuanhui, et al.
Publicado: (2024)
por: Huang, Yuanhui, et al.
Publicado: (2024)
Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing
por: Lee, Dohun, et al.
Publicado: (2026)
por: Lee, Dohun, et al.
Publicado: (2026)
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
por: Wang, Weicheng, et al.
Publicado: (2026)
por: Wang, Weicheng, et al.
Publicado: (2026)
OmniFD: A Unified Model for Versatile Face Forgery Detection
por: Liu, Haotian, et al.
Publicado: (2025)
por: Liu, Haotian, et al.
Publicado: (2025)
V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
por: Fang, Ye, et al.
Publicado: (2025)
por: Fang, Ye, et al.
Publicado: (2025)
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
por: Chen, Zhangquan, et al.
Publicado: (2026)
por: Chen, Zhangquan, et al.
Publicado: (2026)
StableV2V: Stablizing Shape Consistency in Video-to-Video Editing
por: Liu, Chang, et al.
Publicado: (2024)
por: Liu, Chang, et al.
Publicado: (2024)
MotionV2V: Editing Motion in a Video
por: Burgert, Ryan, et al.
Publicado: (2025)
por: Burgert, Ryan, et al.
Publicado: (2025)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
por: Liu, Jialun, et al.
Publicado: (2026)
por: Liu, Jialun, et al.
Publicado: (2026)
OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model
por: Chen, Liuhan, et al.
Publicado: (2024)
por: Chen, Liuhan, et al.
Publicado: (2024)
ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars
por: Peng, Ziqiao, et al.
Publicado: (2025)
por: Peng, Ziqiao, et al.
Publicado: (2025)
Ejemplares similares
-
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
por: Hu, Teng, et al.
Publicado: (2025) -
PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement
por: Hu, Teng, et al.
Publicado: (2025) -
Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
por: Hu, Teng, et al.
Publicado: (2025) -
OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding
por: Jiang, Songtao, et al.
Publicado: (2025) -
SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing
por: Liang, Sen, et al.
Publicado: (2026)