ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Jiayang, Zhuo, Fan, Zhang, Majun, Pan, Changhao, Wang, Zehan, Chen, Siyu, Yang, Xiaoda, Jin, Tao, Zhao, Zhou |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark
by: Lin, Wang, et al.
Published: (2026)
by: Lin, Wang, et al.
Published: (2026)
TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation
by: Yang, Xiaoda, et al.
Published: (2026)
by: Yang, Xiaoda, et al.
Published: (2026)
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
by: Ju, Xuan, et al.
Published: (2025)
by: Ju, Xuan, et al.
Published: (2025)
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
by: Pan, Kaihang, et al.
Published: (2025)
by: Pan, Kaihang, et al.
Published: (2025)
Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
by: Li, Xiaofan, et al.
Published: (2025)
by: Li, Xiaofan, et al.
Published: (2025)
GenSpace: Benchmarking Spatially-Aware Image Generation
by: Wang, Zehan, et al.
Published: (2025)
by: Wang, Zehan, et al.
Published: (2025)
VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing
by: Couairon, Paul, et al.
Published: (2023)
by: Couairon, Paul, et al.
Published: (2023)
Edit as You See: Image-guided Video Editing via Masked Motion Modeling
by: Huang, Zhi-Lin, et al.
Published: (2025)
by: Huang, Zhi-Lin, et al.
Published: (2025)
ImViD: Immersive Volumetric Videos for Enhanced VR Engagement
by: Yang, Zhengxian, et al.
Published: (2025)
by: Yang, Zhengxian, et al.
Published: (2025)
Edit3K: Universal Representation Learning for Video Editing Components
by: Gu, Xin, et al.
Published: (2024)
by: Gu, Xin, et al.
Published: (2024)
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
by: Xiao, Yicheng, et al.
Published: (2026)
by: Xiao, Yicheng, et al.
Published: (2026)
ExpressEdit: Video Editing with Natural Language and Sketching
by: Tilekbay, Bekzat, et al.
Published: (2024)
by: Tilekbay, Bekzat, et al.
Published: (2024)
FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing
by: Zhang, Youyuan, et al.
Published: (2024)
by: Zhang, Youyuan, et al.
Published: (2024)
AlbedoEdit: Unified Instance-Level Video Editing with Albedo Guidance
by: Zhou, Xilong, et al.
Published: (2026)
by: Zhou, Xilong, et al.
Published: (2026)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
by: Yao, Linli, et al.
Published: (2023)
by: Yao, Linli, et al.
Published: (2023)
Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning
by: Rahimi, Nasrin, et al.
Published: (2026)
by: Rahimi, Nasrin, et al.
Published: (2026)
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
by: Yang, Xiangpeng, et al.
Published: (2025)
by: Yang, Xiangpeng, et al.
Published: (2025)
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
by: Zhang, Yu, et al.
Published: (2025)
by: Zhang, Yu, et al.
Published: (2025)
S$^2$Edit: Text-Guided Image Editing with Precise Semantic and Spatial Control
by: Liu, Xudong, et al.
Published: (2025)
by: Liu, Xudong, et al.
Published: (2025)
FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing
by: Li, Maomao, et al.
Published: (2026)
by: Li, Maomao, et al.
Published: (2026)
FAME: Fairness-aware Attention-modulated Video Editing
by: Wu, Zhangkai, et al.
Published: (2025)
by: Wu, Zhangkai, et al.
Published: (2025)
Consistent Video Editing as Flow-Driven Image-to-Video Generation
by: Wang, Ge, et al.
Published: (2025)
by: Wang, Ge, et al.
Published: (2025)
Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance
by: Lin, Yiqi, et al.
Published: (2026)
by: Lin, Yiqi, et al.
Published: (2026)
EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing
by: Litman, Yehonathan, et al.
Published: (2026)
by: Litman, Yehonathan, et al.
Published: (2026)
EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection
by: Qu, Huaizhi, et al.
Published: (2025)
by: Qu, Huaizhi, et al.
Published: (2025)
OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos
by: Jangir, Ritul, et al.
Published: (2026)
by: Jangir, Ritul, et al.
Published: (2026)
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
by: Somayazulu, Arjun, et al.
Published: (2026)
by: Somayazulu, Arjun, et al.
Published: (2026)
EditDuet: A Multi-Agent System for Video Non-Linear Editing
by: Sandoval-Castaneda, Marcelo, et al.
Published: (2025)
by: Sandoval-Castaneda, Marcelo, et al.
Published: (2025)
MLV-Edit: Towards Consistent and Highly Efficient Editing for Minute-Level Videos
by: Cao, Yangyi, et al.
Published: (2026)
by: Cao, Yangyi, et al.
Published: (2026)
VMoBA: Mixture-of-Block Attention for Video Diffusion Models
by: Wu, Jianzong, et al.
Published: (2025)
by: Wu, Jianzong, et al.
Published: (2025)
Vid-CamEdit: Video Camera Trajectory Editing with Generative Rendering from Estimated Geometry
by: Seo, Junyoung, et al.
Published: (2025)
by: Seo, Junyoung, et al.
Published: (2025)
FusionEdit: Semantic Fusion and Attention Modulation for Training-Free Image Editing
by: Lai, Yongwen, et al.
Published: (2026)
by: Lai, Yongwen, et al.
Published: (2026)
Predictive Temporal Attention on Event-based Video Stream for Energy-efficient Situation Awareness
by: Bu, Yiming, et al.
Published: (2024)
by: Bu, Yiming, et al.
Published: (2024)
UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs
by: Jiang, Lifan, et al.
Published: (2026)
by: Jiang, Lifan, et al.
Published: (2026)
Re-Attentional Controllable Video Diffusion Editing
by: Wang, Yuanzhi, et al.
Published: (2024)
by: Wang, Yuanzhi, et al.
Published: (2024)
InsightEdit: Towards Better Instruction Following for Image Editing
by: Xu, Yingjing, et al.
Published: (2024)
by: Xu, Yingjing, et al.
Published: (2024)
Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks
by: Zou, Siyu, et al.
Published: (2024)
by: Zou, Siyu, et al.
Published: (2024)
Edit Temporal-Consistent Videos with Image Diffusion Model
by: Wang, Yuanzhi, et al.
Published: (2023)
by: Wang, Yuanzhi, et al.
Published: (2023)
EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
by: Li, Runjia, et al.
Published: (2025)
by: Li, Runjia, et al.
Published: (2025)
Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
by: Zuo, Yi, et al.
Published: (2025)
by: Zuo, Yi, et al.
Published: (2025)
Similar Items
-
WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark
by: Lin, Wang, et al.
Published: (2026) -
TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation
by: Yang, Xiaoda, et al.
Published: (2026) -
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
by: Ju, Xuan, et al.
Published: (2025) -
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
by: Pan, Kaihang, et al.
Published: (2025) -
Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
by: Li, Xiaofan, et al.
Published: (2025)