FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cai, Lingling, Zhao, Kang, Yuan, Hangjie, Zhang, Yingya, Zhang, Shiwei, Huang, Kejie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing
par: Cai, Lingling, et autres
Publié: (2025)
par: Cai, Lingling, et autres
Publié: (2025)
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
par: Sun, Qianqian, et autres
Publié: (2025)
par: Sun, Qianqian, et autres
Publié: (2025)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
par: Wang, Xiang, et autres
Publié: (2025)
par: Wang, Xiang, et autres
Publié: (2025)
SMC++: Masked Learning of Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024)
par: Tian, Yuan, et autres
Publié: (2024)
Probabilistic Temporal Masked Attention for Cross-view Online Action Detection
par: Xie, Liping, et autres
Publié: (2025)
par: Xie, Liping, et autres
Publié: (2025)
SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
par: Xiong, Lingyu, et autres
Publié: (2024)
par: Xiong, Lingyu, et autres
Publié: (2024)
MU-MAE: Multimodal Masked Autoencoders-Based One-Shot Learning
par: Liu, Rex, et autres
Publié: (2024)
par: Liu, Rex, et autres
Publié: (2024)
MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
Scaling and Masking: A New Paradigm of Data Sampling for Image and Video Quality Assessment
par: Liu, Yongxu, et autres
Publié: (2024)
par: Liu, Yongxu, et autres
Publié: (2024)
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
par: Zheng, Guangting, et autres
Publié: (2025)
par: Zheng, Guangting, et autres
Publié: (2025)
InteractEdit: Zero-Shot Editing of Human-Object Interactions in Images
par: Hoe, Jiun Tian, et autres
Publié: (2025)
par: Hoe, Jiun Tian, et autres
Publié: (2025)
QPT V2: Masked Image Modeling Advances Visual Scoring
par: Xie, Qizhi, et autres
Publié: (2024)
par: Xie, Qizhi, et autres
Publié: (2024)
PAME: Self-Supervised Masked Autoencoder for No-Reference Point Cloud Quality Assessment
par: Shan, Ziyu, et autres
Publié: (2024)
par: Shan, Ziyu, et autres
Publié: (2024)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
par: Wen, Haokun, et autres
Publié: (2026)
par: Wen, Haokun, et autres
Publié: (2026)
Generalizable Deepfake Detection Based on Forgery-aware Layer Masking and Multi-artifact Subspace Decomposition
par: Zhang, Xiang, et autres
Publié: (2026)
par: Zhang, Xiang, et autres
Publié: (2026)
Modality-Aware Shot Relating and Comparing for Video Scene Detection
par: Tan, Jiawei, et autres
Publié: (2024)
par: Tan, Jiawei, et autres
Publié: (2024)
Region-Constraint In-Context Generation for Instructional Video Editing
par: Zhang, Zhongwei, et autres
Publié: (2025)
par: Zhang, Zhongwei, et autres
Publié: (2025)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
par: Tang, Yolo Yunlong, et autres
Publié: (2022)
par: Tang, Yolo Yunlong, et autres
Publié: (2022)
Multi-layer Learnable Attention Mask for Multimodal Tasks
par: Barrios, Wayner, et autres
Publié: (2024)
par: Barrios, Wayner, et autres
Publié: (2024)
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control
par: Wei, Yujie, et autres
Publié: (2024)
par: Wei, Yujie, et autres
Publié: (2024)
COutfitGAN: Learning to Synthesize Compatible Outfits Supervised by Silhouette Masks and Fashion Styles
par: Zhou, Dongliang, et autres
Publié: (2025)
par: Zhou, Dongliang, et autres
Publié: (2025)
Diffusion Models as Masked Audio-Video Learners
par: Nunez, Elvis, et autres
Publié: (2023)
par: Nunez, Elvis, et autres
Publié: (2023)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
par: Yan, Xin, et autres
Publié: (2024)
par: Yan, Xin, et autres
Publié: (2024)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
EntroAD: Structural Entropy-Guided Prompt Adaptation for Zero-Shot Anomaly Detection
par: Zhao, Xinyu, et autres
Publié: (2026)
par: Zhao, Xinyu, et autres
Publié: (2026)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
Taming Flow-based I2V Models for Creative Video Editing
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
D-FCGS: Feedforward Compression of Dynamic Gaussian Splatting for Free-Viewpoint Videos
par: Zhang, Wenkang, et autres
Publié: (2025)
par: Zhang, Wenkang, et autres
Publié: (2025)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
par: Cai, Minghong, et autres
Publié: (2024)
par: Cai, Minghong, et autres
Publié: (2024)
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023)
par: Yao, Linli, et autres
Publié: (2023)
XY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark
par: Liu, Shuai, et autres
Publié: (2025)
par: Liu, Shuai, et autres
Publié: (2025)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
par: Shi, Haoyuan, et autres
Publié: (2026)
par: Shi, Haoyuan, et autres
Publié: (2026)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
par: Meng, Jiahao, et autres
Publié: (2026)
par: Meng, Jiahao, et autres
Publié: (2026)
Rethinking Video with a Universal Event-Based Representation
par: Freeman, Andrew
Publié: (2024)
par: Freeman, Andrew
Publié: (2024)
Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation
par: Yang, Sicheng, et autres
Publié: (2025)
par: Yang, Sicheng, et autres
Publié: (2025)
VCoME: Verbal Video Composition with Multimodal Editing Effects
par: Gong, Weibo, et autres
Publié: (2024)
par: Gong, Weibo, et autres
Publié: (2024)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
par: Liao, Liwei, et autres
Publié: (2025)
par: Liao, Liwei, et autres
Publié: (2025)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
par: Lin, Haoqiang, et autres
Publié: (2025)
par: Lin, Haoqiang, et autres
Publié: (2025)
Documents similaires
-
DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing
par: Cai, Lingling, et autres
Publié: (2025) -
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
par: Sun, Qianqian, et autres
Publié: (2025) -
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
par: Wang, Xiang, et autres
Publié: (2025) -
SMC++: Masked Learning of Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024) -
Probabilistic Temporal Masked Attention for Cross-view Online Action Detection
par: Xie, Liping, et autres
Publié: (2025)