Towards Language-Driven Video Inpainting via Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Jianzong, Li, Xiangtai, Si, Chenyang, Zhou, Shangchen, Yang, Jingkang, Zhang, Jiangning, Li, Yining, Chen, Kai, Tong, Yunhai, Liu, Ziwei, Loy, Chen Change |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MotionBooth: Motion-Aware Customized Text-to-Video Generation
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
par: Dai, Yuekun, et autres
Publié: (2025)
par: Dai, Yuekun, et autres
Publié: (2025)
Explore In-Context Segmentation via Latent Diffusion Models
par: Wang, Chaoyang, et autres
Publié: (2024)
par: Wang, Chaoyang, et autres
Publié: (2024)
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
par: Yuan, Haobo, et autres
Publié: (2024)
par: Yuan, Haobo, et autres
Publié: (2024)
Control Color: Multimodal Diffusion-based Interactive Image Colorization
par: Liang, Zhexin, et autres
Publié: (2024)
par: Liang, Zhexin, et autres
Publié: (2024)
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
par: Shi, Qingyu, et autres
Publié: (2025)
par: Shi, Qingyu, et autres
Publié: (2025)
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
par: Xu, Shilin, et autres
Publié: (2023)
par: Xu, Shilin, et autres
Publié: (2023)
Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language
par: Chen, Yicheng, et autres
Publié: (2024)
par: Chen, Yicheng, et autres
Publié: (2024)
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023)
par: Zang, Yuhang, et autres
Publié: (2023)
MatAnyone: Stable Video Matting with Consistent Memory Propagation
par: Yang, Peiqing, et autres
Publié: (2025)
par: Yang, Peiqing, et autres
Publié: (2025)
ObjCtrl-2.5D: Training-free Object Control with Camera Poses
par: Wang, Zhouxia, et autres
Publié: (2024)
par: Wang, Zhouxia, et autres
Publié: (2024)
EdgeSAM: Prompt-In-the-Loop Distillation for SAM
par: Zhou, Chong, et autres
Publié: (2023)
par: Zhou, Chong, et autres
Publié: (2023)
Learning Inclusion Matching for Animation Paint Bucket Colorization
par: Dai, Yuekun, et autres
Publié: (2024)
par: Dai, Yuekun, et autres
Publié: (2024)
MVIP-NeRF: Multi-view 3D Inpainting on NeRF Scenes via Diffusion Prior
par: Chen, Honghua, et autres
Publié: (2024)
par: Chen, Honghua, et autres
Publié: (2024)
MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
par: Xie, Jiahao, et autres
Publié: (2023)
par: Xie, Jiahao, et autres
Publié: (2023)
4RC: 4D Reconstruction via Conditional Querying Anytime and Anywhere
par: Luo, Yihang, et autres
Publié: (2026)
par: Luo, Yihang, et autres
Publié: (2026)
FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation
par: Yang, Shuai, et autres
Publié: (2024)
par: Yang, Shuai, et autres
Publié: (2024)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
par: Xu, Shilin, et autres
Publié: (2024)
par: Xu, Shilin, et autres
Publié: (2024)
Towards Customized Multimodal Role-Play
par: Tang, Chao, et autres
Publié: (2026)
par: Tang, Chao, et autres
Publié: (2026)
Paint Bucket Colorization Using Anime Character Color Design Sheets
par: Dai, Yuekun, et autres
Publié: (2024)
par: Dai, Yuekun, et autres
Publié: (2024)
3DEnhancer: Consistent Multi-View Diffusion for 3D Enhancement
par: Luo, Yihang, et autres
Publié: (2024)
par: Luo, Yihang, et autres
Publié: (2024)
OMG-Seg: Is One Model Good Enough For All Segmentation?
par: Li, Xiangtai, et autres
Publié: (2024)
par: Li, Xiangtai, et autres
Publié: (2024)
Generalizable Implicit Motion Modeling for Video Frame Interpolation
par: Guo, Zujin, et autres
Publié: (2024)
par: Guo, Zujin, et autres
Publié: (2024)
Kalman-Inspired Feature Propagation for Video Face Super-Resolution
par: Feng, Ruicheng, et autres
Publié: (2024)
par: Feng, Ruicheng, et autres
Publié: (2024)
Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
par: Yang, Shuai, et autres
Publié: (2025)
par: Yang, Shuai, et autres
Publié: (2025)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
VG4D: Vision-Language Model Goes 4D Video Recognition
par: Deng, Zhichao, et autres
Publié: (2024)
par: Deng, Zhichao, et autres
Publié: (2024)
Exploiting Diffusion Prior for Real-World Image Super-Resolution
par: Wang, Jianyi, et autres
Publié: (2023)
par: Wang, Jianyi, et autres
Publié: (2023)
Towards Open Vocabulary Learning: A Survey
par: Wu, Jianzong, et autres
Publié: (2023)
par: Wu, Jianzong, et autres
Publié: (2023)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
par: Zhou, Yikang, et autres
Publié: (2025)
par: Zhou, Yikang, et autres
Publié: (2025)
Transformer-Based Visual Segmentation: A Survey
par: Li, Xiangtai, et autres
Publié: (2023)
par: Li, Xiangtai, et autres
Publié: (2023)
Point-In-Context: Understanding Point Cloud via In-Context Learning
par: Liu, Mengyuan, et autres
Publié: (2024)
par: Liu, Mengyuan, et autres
Publié: (2024)
DreamRelation: Bridging Customization and Relation Generation
par: Shi, Qingyu, et autres
Publié: (2024)
par: Shi, Qingyu, et autres
Publié: (2024)
DifFace: Blind Face Restoration with Diffused Error Contraction
par: Yue, Zongsheng, et autres
Publié: (2022)
par: Yue, Zongsheng, et autres
Publié: (2022)
FileGram: Grounding Agent Personalization in File-System Behavioral Traces
par: Liu, Shuai, et autres
Publié: (2026)
par: Liu, Shuai, et autres
Publié: (2026)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
par: Li, Xiaoming, et autres
Publié: (2025)
par: Li, Xiaoming, et autres
Publié: (2025)
AITTI: Learning Adaptive Inclusive Token for Text-to-Image Generation
par: Hou, Xinyu, et autres
Publié: (2024)
par: Hou, Xinyu, et autres
Publié: (2024)
Arbitrary-steps Image Super-resolution via Diffusion Inversion
par: Yue, Zongsheng, et autres
Publié: (2024)
par: Yue, Zongsheng, et autres
Publié: (2024)
F-LMM: Grounding Frozen Large Multimodal Models
par: Wu, Size, et autres
Publié: (2024)
par: Wu, Size, et autres
Publié: (2024)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
par: Xu, Shilin, et autres
Publié: (2025)
par: Xu, Shilin, et autres
Publié: (2025)
Documents similaires
-
MotionBooth: Motion-Aware Customized Text-to-Video Generation
par: Wu, Jianzong, et autres
Publié: (2024) -
Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
par: Dai, Yuekun, et autres
Publié: (2025) -
Explore In-Context Segmentation via Latent Diffusion Models
par: Wang, Chaoyang, et autres
Publié: (2024) -
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
par: Yuan, Haobo, et autres
Publié: (2024) -
Control Color: Multimodal Diffusion-based Interactive Image Colorization
par: Liang, Zhexin, et autres
Publié: (2024)