DIVE: Taming DINO for Subject-Driven Video Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Yi, Xiong, Wei, Zhang, He, Chen, Chaoqi, Liu, Jianzhuang, Yan, Mingfu, Chen, Shifeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diffusion Model-Based Image Editing: A Survey
di: Huang, Yi, et al.
Pubblicazione: (2024)
di: Huang, Yi, et al.
Pubblicazione: (2024)
Contrast-Prior Enhanced Duality for Mask-Free Shadow Removal
di: Wu, Jiyu, et al.
Pubblicazione: (2025)
di: Wu, Jiyu, et al.
Pubblicazione: (2025)
WaveDM: Wavelet-Based Diffusion Models for Image Restoration
di: Huang, Yi, et al.
Pubblicazione: (2023)
di: Huang, Yi, et al.
Pubblicazione: (2023)
GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning
di: Lv, Jiaxi, et al.
Pubblicazione: (2023)
di: Lv, Jiaxi, et al.
Pubblicazione: (2023)
MagicFight: Personalized Martial Arts Combat Video Generation
di: Huang, Jiancheng, et al.
Pubblicazione: (2026)
di: Huang, Jiancheng, et al.
Pubblicazione: (2026)
TARA: Token-Aware LoRA for Composable Personalization in Diffusion Models
di: Peng, Yuqi, et al.
Pubblicazione: (2025)
di: Peng, Yuqi, et al.
Pubblicazione: (2025)
OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance
di: Zeng, Haoxi, et al.
Pubblicazione: (2026)
di: Zeng, Haoxi, et al.
Pubblicazione: (2026)
Language-Driven Visual Consensus for Zero-Shot Semantic Segmentation
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
Seal2Real: Prompt Prior Learning on Diffusion Model for Unsupervised Document Seal Data Generation and Realisation
di: Yan, Mingfu, et al.
Pubblicazione: (2023)
di: Yan, Mingfu, et al.
Pubblicazione: (2023)
Dual-Schedule Inversion: Training- and Tuning-Free Inversion for Real Image Editing
di: Huang, Jiancheng, et al.
Pubblicazione: (2024)
di: Huang, Jiancheng, et al.
Pubblicazione: (2024)
DIVE: Towards Descriptive and Diverse Visual Commonsense Generation
di: Park, Jun-Hyung, et al.
Pubblicazione: (2024)
di: Park, Jun-Hyung, et al.
Pubblicazione: (2024)
ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
Consistent Video Editing as Flow-Driven Image-to-Video Generation
di: Wang, Ge, et al.
Pubblicazione: (2025)
di: Wang, Ge, et al.
Pubblicazione: (2025)
Simplifying DINO via Coding Rate Regularization
di: Wu, Ziyang, et al.
Pubblicazione: (2025)
di: Wu, Ziyang, et al.
Pubblicazione: (2025)
Component Adaptive Clustering for Generalized Category Discovery
di: Yan, Mingfu, et al.
Pubblicazione: (2025)
di: Yan, Mingfu, et al.
Pubblicazione: (2025)
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
di: Pan, Chenbin, et al.
Pubblicazione: (2025)
di: Pan, Chenbin, et al.
Pubblicazione: (2025)
Divide and Conquer: Object Co-occurrence Helps Mitigate Simplicity Bias in OOD Detection
di: Dai, Boyang, et al.
Pubblicazione: (2026)
di: Dai, Boyang, et al.
Pubblicazione: (2026)
ESA: Energy-Based Shot Assembly Optimization for Automatic Video Editing
di: Chen, Yaosen, et al.
Pubblicazione: (2025)
di: Chen, Yaosen, et al.
Pubblicazione: (2025)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
di: Huang, Zhe, et al.
Pubblicazione: (2025)
di: Huang, Zhe, et al.
Pubblicazione: (2025)
Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model
di: Yang, Yang, et al.
Pubblicazione: (2025)
di: Yang, Yang, et al.
Pubblicazione: (2025)
Leveraging Contrast Information for Efficient Document Shadow Removal
di: Liu, Yifan, et al.
Pubblicazione: (2025)
di: Liu, Yifan, et al.
Pubblicazione: (2025)
BlobCtrl: Taming Controllable Blob for Element-level Image Editing
di: Li, Yaowei, et al.
Pubblicazione: (2025)
di: Li, Yaowei, et al.
Pubblicazione: (2025)
OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation
di: Lin, Bingqian, et al.
Pubblicazione: (2023)
di: Lin, Bingqian, et al.
Pubblicazione: (2023)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
A Generic Shared Attention Mechanism for Various Backbone Neural Networks
di: Huang, Zhongzhan, et al.
Pubblicazione: (2022)
di: Huang, Zhongzhan, et al.
Pubblicazione: (2022)
Taming Diffusion Probabilistic Models for Character Control
di: Chen, Rui, et al.
Pubblicazione: (2024)
di: Chen, Rui, et al.
Pubblicazione: (2024)
MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance
di: Bai, Xuehai, et al.
Pubblicazione: (2026)
di: Bai, Xuehai, et al.
Pubblicazione: (2026)
RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video Editing
di: Pan, Tianrui, et al.
Pubblicazione: (2025)
di: Pan, Tianrui, et al.
Pubblicazione: (2025)
Re-Attentional Controllable Video Diffusion Editing
di: Wang, Yuanzhi, et al.
Pubblicazione: (2024)
di: Wang, Yuanzhi, et al.
Pubblicazione: (2024)
Tuning-free Instruction-based Video Editing Via Structural Noise Initialization and Guidance
di: Wu, Song, et al.
Pubblicazione: (2026)
di: Wu, Song, et al.
Pubblicazione: (2026)
LatentEditor: Text Driven Local Editing of 3D Scenes
di: Khalid, Umar, et al.
Pubblicazione: (2023)
di: Khalid, Umar, et al.
Pubblicazione: (2023)
Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
Text-Driven Image Editing via Learnable Regions
di: Lin, Yuanze, et al.
Pubblicazione: (2023)
di: Lin, Yuanze, et al.
Pubblicazione: (2023)
DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video
di: Tumanyan, Narek, et al.
Pubblicazione: (2024)
di: Tumanyan, Narek, et al.
Pubblicazione: (2024)
Single Image Iterative Subject-driven Generation and Editing
di: Shpitzer, Yair, et al.
Pubblicazione: (2025)
di: Shpitzer, Yair, et al.
Pubblicazione: (2025)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation
di: Hu, Zhenyu, et al.
Pubblicazione: (2026)
di: Hu, Zhenyu, et al.
Pubblicazione: (2026)
ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search
di: Yu, Tao, et al.
Pubblicazione: (2026)
di: Yu, Tao, et al.
Pubblicazione: (2026)
SwapAnything: Enabling Arbitrary Object Swapping in Personalized Visual Editing
di: Gu, Jing, et al.
Pubblicazione: (2024)
di: Gu, Jing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Diffusion Model-Based Image Editing: A Survey
di: Huang, Yi, et al.
Pubblicazione: (2024) -
Contrast-Prior Enhanced Duality for Mask-Free Shadow Removal
di: Wu, Jiyu, et al.
Pubblicazione: (2025) -
WaveDM: Wavelet-Based Diffusion Models for Image Restoration
di: Huang, Yi, et al.
Pubblicazione: (2023) -
GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning
di: Lv, Jiaxi, et al.
Pubblicazione: (2023) -
MagicFight: Personalized Martial Arts Combat Video Generation
di: Huang, Jiancheng, et al.
Pubblicazione: (2026)