MVOC: a training-free multiple video object composition method with diffusion models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Wei, Chen, Yaosen, Liu, Yuegen, Yuan, Qi, Yang, Shubin, Zhang, Yanru |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TVG: A Training-free Transition Video Generation Method with Diffusion Models
par: Zhang, Rui, et autres
Publié: (2024)
par: Zhang, Rui, et autres
Publié: (2024)
ESA: Energy-Based Shot Assembly Optimization for Automatic Video Editing
par: Chen, Yaosen, et autres
Publié: (2025)
par: Chen, Yaosen, et autres
Publié: (2025)
DiTraj: training-free trajectory control for video diffusion transformer
par: Lei, Cheng, et autres
Publié: (2025)
par: Lei, Cheng, et autres
Publié: (2025)
ETC: training-free diffusion models acceleration with Error-aware Trend Consistency
par: Xie, Jiajian, et autres
Publié: (2025)
par: Xie, Jiajian, et autres
Publié: (2025)
Autoregression-free video prediction using diffusion model for mitigating error propagation
par: Ko, Woonho, et autres
Publié: (2025)
par: Ko, Woonho, et autres
Publié: (2025)
GeoMVD: Geometry-Enhanced Multi-View Generation Model Based on Geometric Information Extraction
par: Wu, Jiaqi, et autres
Publié: (2025)
par: Wu, Jiaqi, et autres
Publié: (2025)
Towards motion from video diffusion models
par: Janson, Paul, et autres
Publié: (2024)
par: Janson, Paul, et autres
Publié: (2024)
Training-free image inversion for one-step diffusion models
par: Wu, Tao, et autres
Publié: (2026)
par: Wu, Tao, et autres
Publié: (2026)
A training-free framework for high-fidelity appearance transfer via diffusion transformers
par: Gu, Shengrong, et autres
Publié: (2026)
par: Gu, Shengrong, et autres
Publié: (2026)
AI killed the video star. Audio-driven diffusion model for expressive talking head generation
par: Chopin, Baptiste, et autres
Publié: (2025)
par: Chopin, Baptiste, et autres
Publié: (2025)
Learning dissection trajectories from expert surgical videos via imitation learning with equivariant diffusion
par: Wang, Hongyu, et autres
Publié: (2025)
par: Wang, Hongyu, et autres
Publié: (2025)
NCST: Neural-based Color Style Transfer for Video Retouching
par: Jiang, Xintao, et autres
Publié: (2024)
par: Jiang, Xintao, et autres
Publié: (2024)
GS: Generative Segmentation via Label Diffusion
par: Chen, Yuhao, et autres
Publié: (2025)
par: Chen, Yuhao, et autres
Publié: (2025)
De-confounded Data-free Knowledge Distillation for Handling Distribution Shifts
par: Wang, Yuzheng, et autres
Publié: (2024)
par: Wang, Yuzheng, et autres
Publié: (2024)
Cross-video Identity Correlating for Person Re-identification Pre-training
par: Zuo, Jialong, et autres
Publié: (2024)
par: Zuo, Jialong, et autres
Publié: (2024)
Training-free Video Temporal Grounding using Large-scale Pre-trained Models
par: Zheng, Minghang, et autres
Publié: (2024)
par: Zheng, Minghang, et autres
Publié: (2024)
Online pre-training with long-form videos
par: Kato, Itsuki, et autres
Publié: (2024)
par: Kato, Itsuki, et autres
Publié: (2024)
HFI: A unified framework for training-free detection and implicit watermarking of latent diffusion model generated images
par: Choi, Sungik, et autres
Publié: (2024)
par: Choi, Sungik, et autres
Publié: (2024)
RobustFormer: Noise-Robust Pre-training for images and videos
par: Bastola, Ashish, et autres
Publié: (2024)
par: Bastola, Ashish, et autres
Publié: (2024)
Do text-free diffusion models learn discriminative visual representations?
par: Mukhopadhyay, Soumik, et autres
Publié: (2023)
par: Mukhopadhyay, Soumik, et autres
Publié: (2023)
DiffLoss: unleashing diffusion model as constraint for training image restoration network
par: Tan, Jiangtong, et autres
Publié: (2024)
par: Tan, Jiangtong, et autres
Publié: (2024)
Fast constrained sampling in pre-trained diffusion models
par: Graikos, Alexandros, et autres
Publié: (2024)
par: Graikos, Alexandros, et autres
Publié: (2024)
VFM-SDM: A vision foundation model-based framework for training-free, marker-free, and calibration-free structural displacement measurement
par: Xian, Qingyu, et autres
Publié: (2026)
par: Xian, Qingyu, et autres
Publié: (2026)
ColorEdit: Training-free Image-Guided Color editing with diffusion model
par: Yin, Xingxi, et autres
Publié: (2024)
par: Yin, Xingxi, et autres
Publié: (2024)
A$^{2}$-MAE: A spatial-temporal-spectral unified remote sensing pre-training method based on anchor-aware masked autoencoder
par: Zhang, Lixian, et autres
Publié: (2024)
par: Zhang, Lixian, et autres
Publié: (2024)
Submodular video object proposal selection for semantic object segmentation
par: Wang, Tinghuai
Publié: (2024)
par: Wang, Tinghuai
Publié: (2024)
An analysis of HOI: using a training-free method with multimodal visual foundation models when only the test set is available, without the training set
par: Ai, Chaoyi
Publié: (2024)
par: Ai, Chaoyi
Publié: (2024)
Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train
par: Wang, Zhao, et autres
Publié: (2023)
par: Wang, Zhao, et autres
Publié: (2023)
DM-FNet: Unified multimodal medical image fusion via diffusion process-trained encoder-decoder
par: He, Dan, et autres
Publié: (2025)
par: He, Dan, et autres
Publié: (2025)
A multi-modal vision-language model for generalizable annotation-free pathology localization
par: Yang, Hao, et autres
Publié: (2024)
par: Yang, Hao, et autres
Publié: (2024)
Physics-Guided Null-Space Diffusion with Sparse Masking for Corrective Sparse-View CT Reconstruction
par: Zhou, Zekun, et autres
Publié: (2025)
par: Zhou, Zekun, et autres
Publié: (2025)
ReLAPSe: Reinforcement-Learning-trained Adversarial Prompt Search for Erased concepts in unlearned diffusion models
par: Kolton, Ignacy, et autres
Publié: (2026)
par: Kolton, Ignacy, et autres
Publié: (2026)
Selective Focus: Investigating Semantics Sensitivity in Post-training Quantization for Lane Detection
par: Fan, Yunqian, et autres
Publié: (2024)
par: Fan, Yunqian, et autres
Publié: (2024)
Improving Generalizability and Undetectability for Targeted Adversarial Attacks on Multimodal Pre-trained Models
par: Zhang, Zhifang, et autres
Publié: (2025)
par: Zhang, Zhifang, et autres
Publié: (2025)
HARP: HARmonizing in-vivo diffusion MRI using Phantom-only training
par: Jeong, Hwihun, et autres
Publié: (2026)
par: Jeong, Hwihun, et autres
Publié: (2026)
Self-supervised transformer-based pre-training method with General Plant Infection dataset
par: Wang, Zhengle, et autres
Publié: (2024)
par: Wang, Zhengle, et autres
Publié: (2024)
Generic Knowledge Boosted Pre-training For Remote Sensing Images
par: Huang, Ziyue, et autres
Publié: (2024)
par: Huang, Ziyue, et autres
Publié: (2024)
VR-based generation of photorealistic synthetic data for training hand-object tracking models
par: Zhang, Chengyan, et autres
Publié: (2024)
par: Zhang, Chengyan, et autres
Publié: (2024)
Efficient Multi-modal Long Context Learning for Training-free Adaptation
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
A ground-based dataset and a diffusion model for on-orbit low-light image enhancement
par: Zhu, Yiman, et autres
Publié: (2023)
par: Zhu, Yiman, et autres
Publié: (2023)
Documents similaires
-
TVG: A Training-free Transition Video Generation Method with Diffusion Models
par: Zhang, Rui, et autres
Publié: (2024) -
ESA: Energy-Based Shot Assembly Optimization for Automatic Video Editing
par: Chen, Yaosen, et autres
Publié: (2025) -
DiTraj: training-free trajectory control for video diffusion transformer
par: Lei, Cheng, et autres
Publié: (2025) -
ETC: training-free diffusion models acceleration with Error-aware Trend Consistency
par: Xie, Jiajian, et autres
Publié: (2025) -
Autoregression-free video prediction using diffusion model for mitigating error propagation
par: Ko, Woonho, et autres
Publié: (2025)