MiVE: Multiscale Vision-language features for reference-guided video Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Tong, Zou, Meng, Wu, Chengjing, Qu, Xiaochao, Liu, Luoqi, Hu, Xiaolin, Liu, Ting |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
por: Wang, Tong, et al.
Publicado: (2025)
por: Wang, Tong, et al.
Publicado: (2025)
SAM-REF: Introducing Image-Prompt Synergy during Interaction for Detail Enhancement in the Segment Anything Model
por: Yu, Chongkai, et al.
Publicado: (2024)
por: Yu, Chongkai, et al.
Publicado: (2024)
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
por: Li, Hongxi, et al.
Publicado: (2026)
por: Li, Hongxi, et al.
Publicado: (2026)
MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
por: Huang, Jun, et al.
Publicado: (2025)
por: Huang, Jun, et al.
Publicado: (2025)
TextMastero: Mastering High-Quality Scene Text Editing in Diverse Languages and Styles
por: Wang, Tong, et al.
Publicado: (2024)
por: Wang, Tong, et al.
Publicado: (2024)
DCEdit: Dual-Level Controlled Image Editing via Precisely Localized Semantics
por: Hu, Yihan, et al.
Publicado: (2025)
por: Hu, Yihan, et al.
Publicado: (2025)
Rethinking Video Segmentation with Masked Video Consistency: Did the Model Learn as Intended?
por: Liang, Chen, et al.
Publicado: (2024)
por: Liang, Chen, et al.
Publicado: (2024)
2nd Place Solution for MOSE Track in CVPR 2024 PVUW workshop: Complex Video Object Segmentation
por: Xu, Zhensong, et al.
Publicado: (2024)
por: Xu, Zhensong, et al.
Publicado: (2024)
Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation
por: Lou, Zijie, et al.
Publicado: (2026)
por: Lou, Zijie, et al.
Publicado: (2026)
3rd Place Solution for PVUW Challenge 2024: Video Panoptic Segmentation
por: Wu, Ruipu, et al.
Publicado: (2024)
por: Wu, Ruipu, et al.
Publicado: (2024)
Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching
por: Liu, Minghao, et al.
Publicado: (2024)
por: Liu, Minghao, et al.
Publicado: (2024)
On Exact Editing of Flow-Based Diffusion Models
por: Li, Zixiang, et al.
Publicado: (2025)
por: Li, Zixiang, et al.
Publicado: (2025)
Semantic Segmentation on VSPW Dataset through Masked Video Consistency
por: Liang, Chen, et al.
Publicado: (2024)
por: Liang, Chen, et al.
Publicado: (2024)
AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
por: Lin, Yiheng, et al.
Publicado: (2025)
por: Lin, Yiheng, et al.
Publicado: (2025)
Memory Efficient Matting with Adaptive Token Routing
por: Lin, Yiheng, et al.
Publicado: (2024)
por: Lin, Yiheng, et al.
Publicado: (2024)
PortraitCraft: A Benchmark for Portrait Composition Understanding and Generation
por: Sha, Yuyang, et al.
Publicado: (2026)
por: Sha, Yuyang, et al.
Publicado: (2026)
EVPGS: Enhanced View Prior Guidance for Splatting-based Extrapolated View Synthesis
por: Li, Jiahe, et al.
Publicado: (2025)
por: Li, Jiahe, et al.
Publicado: (2025)
FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation
por: Zhang, Zekang, et al.
Publicado: (2026)
por: Zhang, Zekang, et al.
Publicado: (2026)
DreamVE: Unified Instruction-based Image and Video Editing
por: Xia, Bin, et al.
Publicado: (2025)
por: Xia, Bin, et al.
Publicado: (2025)
Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing
por: Wang, Kejie, et al.
Publicado: (2024)
por: Wang, Kejie, et al.
Publicado: (2024)
MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing
por: Lin, Zihao, et al.
Publicado: (2026)
por: Lin, Zihao, et al.
Publicado: (2026)
FSMDet: Vision-guided feature diffusion for fully sparse 3D detector
por: Liu, Tianran, et al.
Publicado: (2024)
por: Liu, Tianran, et al.
Publicado: (2024)
Can video generation replace cinematographers? Research on the cinematic language of generated video
por: Li, Xiaozhe, et al.
Publicado: (2024)
por: Li, Xiaozhe, et al.
Publicado: (2024)
ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
por: Wu, Yuanchen, et al.
Publicado: (2025)
por: Wu, Yuanchen, et al.
Publicado: (2025)
FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing
por: Cai, Mingshu, et al.
Publicado: (2025)
por: Cai, Mingshu, et al.
Publicado: (2025)
GLaVE-Cap: Global-Local Aligned Video Captioning with Vision Expert Integration
por: Xu, Wan, et al.
Publicado: (2025)
por: Xu, Wan, et al.
Publicado: (2025)
FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models
por: Li, Minghan, et al.
Publicado: (2025)
por: Li, Minghan, et al.
Publicado: (2025)
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
por: Qu, Tianyuan, et al.
Publicado: (2025)
por: Qu, Tianyuan, et al.
Publicado: (2025)
VE-Bench: Subjective-Aligned Benchmark Suite for Text-Driven Video Editing Quality Assessment
por: Sun, Shangkun, et al.
Publicado: (2024)
por: Sun, Shangkun, et al.
Publicado: (2024)
DepthSSC: Monocular 3D Semantic Scene Completion via Depth-Spatial Alignment and Voxel Adaptation
por: Yao, Jiawei, et al.
Publicado: (2023)
por: Yao, Jiawei, et al.
Publicado: (2023)
HarmonicNeRF: Geometry-Informed Synthetic View Augmentation for 3D Scene Reconstruction in Driving Scenarios
por: Pan, Xiaochao, et al.
Publicado: (2023)
por: Pan, Xiaochao, et al.
Publicado: (2023)
Static Key Attention in Vision
por: Hu, Zizhao, et al.
Publicado: (2024)
por: Hu, Zizhao, et al.
Publicado: (2024)
Bench2ADVLM: A Closed-Loop Benchmark for Vision-language Models in Autonomous Driving
por: Zhang, Tianyuan, et al.
Publicado: (2025)
por: Zhang, Tianyuan, et al.
Publicado: (2025)
Ada-VE: Training-Free Consistent Video Editing Using Adaptive Motion Prior
por: Mahmud, Tanvir, et al.
Publicado: (2024)
por: Mahmud, Tanvir, et al.
Publicado: (2024)
Causality-guided Prompt Learning for Vision-language Models via Visual Granulation
por: Gao, Mengyu, et al.
Publicado: (2025)
por: Gao, Mengyu, et al.
Publicado: (2025)
Uncertainty-aware sign language video retrieval with probability distribution modeling
por: Wu, Xuan, et al.
Publicado: (2024)
por: Wu, Xuan, et al.
Publicado: (2024)
TV-LiVE: Training-Free, Text-Guided Video Editing via Layer Informed Vitality Exploitation
por: Kim, Min-Jung, et al.
Publicado: (2025)
por: Kim, Min-Jung, et al.
Publicado: (2025)
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
por: He, Haoyang, et al.
Publicado: (2025)
por: He, Haoyang, et al.
Publicado: (2025)
DiVE: DiT-based Video Generation with Enhanced Control
por: Jiang, Junpeng, et al.
Publicado: (2024)
por: Jiang, Junpeng, et al.
Publicado: (2024)
Borrowing from anything: A generalizable framework for reference-guided instance editing
por: Zhou, Shengxiao, et al.
Publicado: (2025)
por: Zhou, Shengxiao, et al.
Publicado: (2025)
Ejemplares similares
-
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
por: Wang, Tong, et al.
Publicado: (2025) -
SAM-REF: Introducing Image-Prompt Synergy during Interaction for Detail Enhancement in the Segment Anything Model
por: Yu, Chongkai, et al.
Publicado: (2024) -
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
por: Li, Hongxi, et al.
Publicado: (2026) -
MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
por: Huang, Jun, et al.
Publicado: (2025) -
TextMastero: Mastering High-Quality Scene Text Editing in Diverse Languages and Styles
por: Wang, Tong, et al.
Publicado: (2024)