MultiCOIN: Multi-Modal COntrollable Video INbetweening
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tanveer, Maham, Zhou, Yang, Niklaus, Simon, Amiri, Ali Mahdavi, Zhang, Hao, Singh, Krishna Kumar, Zhao, Nanxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MotionBridge: Dynamic Video Inbetweening with Flexible Controls
par: Tanveer, Maham, et autres
Publié: (2024)
par: Tanveer, Maham, et autres
Publié: (2024)
AnaMoDiff: 2D Analogical Motion Diffusion via Disentangled Denoising
par: Tanveer, Maham, et autres
Publié: (2024)
par: Tanveer, Maham, et autres
Publié: (2024)
CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration
par: Meric, Adil, et autres
Publié: (2026)
par: Meric, Adil, et autres
Publié: (2026)
BRICS: Bi-level feature Representation of Image CollectionS
par: Yang, Dingdong, et autres
Publié: (2023)
par: Yang, Dingdong, et autres
Publié: (2023)
CREward: A Type-Specific Creativity Reward Model
par: Han, Jiyeon, et autres
Publié: (2025)
par: Han, Jiyeon, et autres
Publié: (2025)
In-Context Sync-LoRA for Portrait Video Editing
par: Polaczek, Sagi, et autres
Publié: (2025)
par: Polaczek, Sagi, et autres
Publié: (2025)
Video Analysis and Generation via a Semantic Progress Function
par: Metzer, Gal, et autres
Publié: (2026)
par: Metzer, Gal, et autres
Publié: (2026)
Survey on Modeling of Human-made Articulated Objects
par: Liu, Jiayi, et autres
Publié: (2024)
par: Liu, Jiayi, et autres
Publié: (2024)
GALA: Geometry-Aware Local Adaptive Grids for Detailed 3D Generation
par: Yang, Dingdong, et autres
Publié: (2024)
par: Yang, Dingdong, et autres
Publié: (2024)
In-2-4D: Inbetweening from Two Single-View Images to 4D Generation
par: Nag, Sauradip, et autres
Publié: (2025)
par: Nag, Sauradip, et autres
Publié: (2025)
Advances in Neural 3D Mesh Texturing: A Survey
par: Perla, Sai Raj Kishore, et autres
Publié: (2026)
par: Perla, Sai Raj Kishore, et autres
Publié: (2026)
FiGO: Fine-Grained Object Counting without Annotations
par: D'Alessandro, Adriano, et autres
Publié: (2025)
par: D'Alessandro, Adriano, et autres
Publié: (2025)
AFreeCA: Annotation-Free Counting for All
par: D'Alessandro, Adriano, et autres
Publié: (2024)
par: D'Alessandro, Adriano, et autres
Publié: (2024)
Benchmarking Video Frame Interpolation
par: Kiefhaber, Simon, et autres
Publié: (2024)
par: Kiefhaber, Simon, et autres
Publié: (2024)
EASI-Tex: Edge-Aware Mesh Texturing from Single Image
par: Perla, Sai Raj Kishore, et autres
Publié: (2024)
par: Perla, Sai Raj Kishore, et autres
Publié: (2024)
GroupDiff: Diffusion-based Group Portrait Editing
par: Jiang, Yuming, et autres
Publié: (2024)
par: Jiang, Yuming, et autres
Publié: (2024)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
par: Li, Liyang, et autres
Publié: (2026)
par: Li, Liyang, et autres
Publié: (2026)
pOps: Photo-Inspired Diffusion Operators
par: Richardson, Elad, et autres
Publié: (2024)
par: Richardson, Elad, et autres
Publié: (2024)
Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing
par: Yeh, Chun-Hsiao, et autres
Publié: (2025)
par: Yeh, Chun-Hsiao, et autres
Publié: (2025)
CAGE: Controllable Articulation GEneration
par: Liu, Jiayi, et autres
Publié: (2023)
par: Liu, Jiayi, et autres
Publié: (2023)
SweepNet: Unsupervised Learning Shape Abstraction via Neural Sweepers
par: Zhao, Mingrui, et autres
Publié: (2024)
par: Zhao, Mingrui, et autres
Publié: (2024)
SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner
par: Zhou, Yufan, et autres
Publié: (2024)
par: Zhou, Yufan, et autres
Publié: (2024)
ASIA: Adaptive 3D Segmentation using Few Image Annotations
par: Perla, Sai Raj Kishore, et autres
Publié: (2025)
par: Perla, Sai Raj Kishore, et autres
Publié: (2025)
ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models
par: Kara, Ozgur, et autres
Publié: (2025)
par: Kara, Ozgur, et autres
Publié: (2025)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
par: Zhao, Zixu, et autres
Publié: (2025)
par: Zhao, Zixu, et autres
Publié: (2025)
Griffin: Generative Reference and Layout Guided Image Composition
par: Mikaeili, Aryan, et autres
Publié: (2025)
par: Mikaeili, Aryan, et autres
Publié: (2025)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
par: Huang, Jiehui, et autres
Publié: (2025)
par: Huang, Jiehui, et autres
Publié: (2025)
Untwisting RoPE: Frequency Control for Shared Attention in DiTs
par: Mikaeili, Aryan, et autres
Publié: (2026)
par: Mikaeili, Aryan, et autres
Publié: (2026)
Sound Sparks Motion: Audio and Text Tuning for Video Editing
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026)
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026)
Linear Image Generation by Synthesizing Exposure Brackets
par: Dai, Yuekun, et autres
Publié: (2026)
par: Dai, Yuekun, et autres
Publié: (2026)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
par: Bai, Purui, et autres
Publié: (2026)
par: Bai, Purui, et autres
Publié: (2026)
Advances in 4D Representation: Geometry, Motion, and Interaction
par: Zhao, Mingrui, et autres
Publié: (2025)
par: Zhao, Mingrui, et autres
Publié: (2025)
MultiModal Action Conditioned Video Generation
par: Li, Yichen, et autres
Publié: (2025)
par: Li, Yichen, et autres
Publié: (2025)
LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
par: Dalva, Yusuf, et autres
Publié: (2024)
par: Dalva, Yusuf, et autres
Publié: (2024)
3D-Fixup: Advancing Photo Editing with 3D Priors
par: Cheng, Yen-Chi, et autres
Publié: (2025)
par: Cheng, Yen-Chi, et autres
Publié: (2025)
SINGAPO: Single Image Controlled Generation of Articulated Parts in Objects
par: Liu, Jiayi, et autres
Publié: (2024)
par: Liu, Jiayi, et autres
Publié: (2024)
ActAnywhere: Subject-Aware Video Background Generation
par: Pan, Boxiao, et autres
Publié: (2024)
par: Pan, Boxiao, et autres
Publié: (2024)
COIN: Confidence Score-Guided Distillation for Annotation-Free Cell Segmentation
par: Jo, Sanghyun, et autres
Publié: (2025)
par: Jo, Sanghyun, et autres
Publié: (2025)
Bezier Splatting for Fast and Differentiable Vector Graphics Rendering
par: Liu, Xi, et autres
Publié: (2025)
par: Liu, Xi, et autres
Publié: (2025)
SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
par: Zhou, Xingcheng, et autres
Publié: (2026)
par: Zhou, Xingcheng, et autres
Publié: (2026)
Documents similaires
-
MotionBridge: Dynamic Video Inbetweening with Flexible Controls
par: Tanveer, Maham, et autres
Publié: (2024) -
AnaMoDiff: 2D Analogical Motion Diffusion via Disentangled Denoising
par: Tanveer, Maham, et autres
Publié: (2024) -
CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration
par: Meric, Adil, et autres
Publié: (2026) -
BRICS: Bi-level feature Representation of Image CollectionS
par: Yang, Dingdong, et autres
Publié: (2023) -
CREward: A Type-Specific Creativity Reward Model
par: Han, Jiyeon, et autres
Publié: (2025)