InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rao, Zhefan, Zou, Bin, Che, Haoxuan, He, Xuanhua, Choi, Chong Hou, Li, Yanheng, Liu, Rui, Chen, Qifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LDM-ISP: Enhancing Neural ISP for Low Light with Latent Diffusion Models
par: Wen, Qiang, et autres
Publié: (2023)
par: Wen, Qiang, et autres
Publié: (2023)
GameGen-X: Interactive Open-world Game Video Generation
par: Che, Haoxuan, et autres
Publié: (2024)
par: Che, Haoxuan, et autres
Publié: (2024)
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024)
par: Feng, Kunyu, et autres
Publié: (2024)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
par: He, Qingdong, et autres
Publié: (2025)
par: He, Qingdong, et autres
Publié: (2025)
UNIC: Unified In-Context Video Editing
par: Ye, Zixuan, et autres
Publié: (2025)
par: Ye, Zixuan, et autres
Publié: (2025)
InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction
par: Wu, Yuhui, et autres
Publié: (2025)
par: Wu, Yuhui, et autres
Publié: (2025)
ENTED: Enhanced Neural Texture Extraction and Distribution for Reference-based Blind Face Restoration
par: Lau, Yuen-Fui, et autres
Publié: (2024)
par: Lau, Yuen-Fui, et autres
Publié: (2024)
Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing
par: Liu, Hui, et autres
Publié: (2025)
par: Liu, Hui, et autres
Publié: (2025)
InsightEdit: Towards Better Instruction Following for Image Editing
par: Xu, Yingjing, et autres
Publié: (2024)
par: Xu, Yingjing, et autres
Publié: (2024)
UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion
par: Li, Zhaoqing, et autres
Publié: (2026)
par: Li, Zhaoqing, et autres
Publié: (2026)
MLV-Edit: Towards Consistent and Highly Efficient Editing for Minute-Level Videos
par: Cao, Yangyi, et autres
Publié: (2026)
par: Cao, Yangyi, et autres
Publié: (2026)
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
par: He, Xuanhua, et autres
Publié: (2025)
par: He, Xuanhua, et autres
Publié: (2025)
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
par: Chen, Lan, et autres
Publié: (2026)
par: Chen, Lan, et autres
Publié: (2026)
Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance
par: Lin, Yiqi, et autres
Publié: (2026)
par: Lin, Yiqi, et autres
Publié: (2026)
RemEdit: Efficient Diffusion Editing with Riemannian Geometry
par: Adhikarla, Eashan, et autres
Publié: (2026)
par: Adhikarla, Eashan, et autres
Publié: (2026)
EditScribe: Non-Visual Image Editing with Natural Language Verification Loops
par: Chang, Ruei-Che, et autres
Publié: (2024)
par: Chang, Ruei-Che, et autres
Publié: (2024)
ContextFlow: Training-Free Video Object Editing via Adaptive Context Enrichment
par: Chen, Yiyang, et autres
Publié: (2025)
par: Chen, Yiyang, et autres
Publié: (2025)
EditShield: Protecting Unauthorized Image Editing by Instruction-guided Diffusion Models
par: Chen, Ruoxi, et autres
Publié: (2023)
par: Chen, Ruoxi, et autres
Publié: (2023)
ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement
par: Rao, Zhefan, et autres
Publié: (2024)
par: Rao, Zhefan, et autres
Publié: (2024)
FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing
par: Zhang, Youyuan, et autres
Publié: (2024)
par: Zhang, Youyuan, et autres
Publié: (2024)
ImgEdit: A Unified Image Editing Dataset and Benchmark
par: Ye, Yang, et autres
Publié: (2025)
par: Ye, Yang, et autres
Publié: (2025)
Instruction-based Image Editing with Planning, Reasoning, and Generation
par: Ji, Liya, et autres
Publié: (2026)
par: Ji, Liya, et autres
Publié: (2026)
Good Noise Makes Good Edits: A Training-Free Diffusion-Based Video Editing with Image and Text Prompts
par: Choi, Saemee, et autres
Publié: (2025)
par: Choi, Saemee, et autres
Publié: (2025)
MMMamba: A Versatile Cross-Modal In Context Fusion Framework for Pan-Sharpening and Zero-Shot Image Enhancement
par: Wang, Yingying, et autres
Publié: (2025)
par: Wang, Yingying, et autres
Publié: (2025)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
par: Li, Bin, et autres
Publié: (2022)
par: Li, Bin, et autres
Publié: (2022)
Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing
par: He, Jingxuan, et autres
Publié: (2026)
par: He, Jingxuan, et autres
Publié: (2026)
In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
par: Zhang, Zechuan, et autres
Publié: (2025)
par: Zhang, Zechuan, et autres
Publié: (2025)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
par: Shen, Yuxiang, et autres
Publié: (2026)
par: Shen, Yuxiang, et autres
Publié: (2026)
Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks
par: Zou, Siyu, et autres
Publié: (2024)
par: Zou, Siyu, et autres
Publié: (2024)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
par: Ishii, Masato, et autres
Publié: (2025)
par: Ishii, Masato, et autres
Publié: (2025)
InsBank: Evolving Instruction Subset for Ongoing Alignment
par: Shi, Jiayi, et autres
Publié: (2025)
par: Shi, Jiayi, et autres
Publié: (2025)
HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing
par: Zhang, Yuyao, et autres
Publié: (2026)
par: Zhang, Yuyao, et autres
Publié: (2026)
Edit-Your-Motion: Space-Time Diffusion Decoupling Learning for Video Motion Editing
par: Zuo, Yi, et autres
Publié: (2024)
par: Zuo, Yi, et autres
Publié: (2024)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023)
par: Yao, Linli, et autres
Publié: (2023)
Efficient Agent Training for Computer Use
par: He, Yanheng, et autres
Publié: (2025)
par: He, Yanheng, et autres
Publié: (2025)
Group Editing: Edit Multiple Images in One Go
par: Ma, Yue, et autres
Publié: (2026)
par: Ma, Yue, et autres
Publié: (2026)
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
par: Yin, Fukun, et autres
Publié: (2025)
par: Yin, Fukun, et autres
Publié: (2025)
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction
par: He, Runze, et autres
Publié: (2024)
par: He, Runze, et autres
Publié: (2024)
ExpressEdit: Video Editing with Natural Language and Sketching
par: Tilekbay, Bekzat, et autres
Publié: (2024)
par: Tilekbay, Bekzat, et autres
Publié: (2024)
Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
par: Zuo, Yi, et autres
Publié: (2025)
par: Zuo, Yi, et autres
Publié: (2025)
Documents similaires
-
LDM-ISP: Enhancing Neural ISP for Low Light with Latent Diffusion Models
par: Wen, Qiang, et autres
Publié: (2023) -
GameGen-X: Interactive Open-world Game Video Generation
par: Che, Haoxuan, et autres
Publié: (2024) -
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024) -
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
par: He, Qingdong, et autres
Publié: (2025) -
UNIC: Unified In-Context Video Editing
par: Ye, Zixuan, et autres
Publié: (2025)