Insert Anything: Image Insertion via In-Context Editing in DiT
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Wensong, Jiang, Hong, Yang, Zongxing, Quan, Ruijie, Yang, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models
par: Jiang, Hong, et autres
Publié: (2026)
par: Jiang, Hong, et autres
Publié: (2026)
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024)
par: Feng, Kunyu, et autres
Publié: (2024)
Point2Insert: Video Object Insertion via Sparse Point Guidance
par: Zhou, Yu, et autres
Publié: (2026)
par: Zhou, Yu, et autres
Publié: (2026)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
par: Yang, Zhuoyi, et autres
Publié: (2024)
par: Yang, Zhuoyi, et autres
Publié: (2024)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
par: Li, Shufan, et autres
Publié: (2025)
par: Li, Shufan, et autres
Publié: (2025)
3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering
par: Zhou, Dewei, et autres
Publié: (2025)
par: Zhou, Dewei, et autres
Publié: (2025)
DiVE: DiT-based Video Generation with Enhanced Control
par: Jiang, Junpeng, et autres
Publié: (2024)
par: Jiang, Junpeng, et autres
Publié: (2024)
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
par: Lin, Hangyu, et autres
Publié: (2026)
par: Lin, Hangyu, et autres
Publié: (2026)
FreeInsert: Personalized Object Insertion with Geometric and Style Control
par: Zhang, Yuhong, et autres
Publié: (2025)
par: Zhang, Yuhong, et autres
Publié: (2025)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
par: Yang, Yuhuan, et autres
Publié: (2026)
par: Yang, Yuhuan, et autres
Publié: (2026)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
par: Feng, Haoran, et autres
Publié: (2025)
par: Feng, Haoran, et autres
Publié: (2025)
OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
par: Sun, Ruitong, et autres
Publié: (2025)
par: Sun, Ruitong, et autres
Publié: (2025)
TarPro: Targeted Protection against Malicious Image Editing
par: Shen, Kaixin, et autres
Publié: (2025)
par: Shen, Kaixin, et autres
Publié: (2025)
SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion
par: Chen, Xinyu, et autres
Publié: (2026)
par: Chen, Xinyu, et autres
Publié: (2026)
AudioScenic: Audio-Driven Video Scene Editing
par: Shen, Kaixin, et autres
Publié: (2024)
par: Shen, Kaixin, et autres
Publié: (2024)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
DreamInsert: Zero-Shot Image-to-Video Object Insertion from A Single Image
par: Zhao, Qi, et autres
Publié: (2025)
par: Zhao, Qi, et autres
Publié: (2025)
LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
par: Yang, Lianwei, et autres
Publié: (2025)
par: Yang, Lianwei, et autres
Publié: (2025)
RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization
par: Yang, Kaicheng, et autres
Publié: (2025)
par: Yang, Kaicheng, et autres
Publié: (2025)
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
par: Kong, Lingshun, et autres
Publié: (2026)
par: Kong, Lingshun, et autres
Publié: (2026)
HiMat: DiT-based Ultra-High Resolution SVBRDF Generation
par: Wang, Zixiong, et autres
Publié: (2025)
par: Wang, Zixiong, et autres
Publié: (2025)
LaVin-DiT: Large Vision Diffusion Transformer
par: Wang, Zhaoqing, et autres
Publié: (2024)
par: Wang, Zhaoqing, et autres
Publié: (2024)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
par: Lyu, Hengye, et autres
Publié: (2026)
par: Lyu, Hengye, et autres
Publié: (2026)
DiT4SR: Taming Diffusion Transformer for Real-World Image Super-Resolution
par: Duan, Zheng-Peng, et autres
Publié: (2025)
par: Duan, Zheng-Peng, et autres
Publié: (2025)
HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads
par: Xu, Yu, et autres
Publié: (2024)
par: Xu, Yu, et autres
Publié: (2024)
Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution
par: Zhang, Xun, et autres
Publié: (2026)
par: Zhang, Xun, et autres
Publié: (2026)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
par: Chen, Jinshu, et autres
Publié: (2025)
par: Chen, Jinshu, et autres
Publié: (2025)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
par: Sun, Yasheng, et autres
Publié: (2025)
par: Sun, Yasheng, et autres
Publié: (2025)
DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing
par: Zhou, Zihan, et autres
Publié: (2025)
par: Zhou, Zihan, et autres
Publié: (2025)
MaterialPicker: Multi-Modal DiT-Based Material Generation
par: Ma, Xiaohe, et autres
Publié: (2024)
par: Ma, Xiaohe, et autres
Publié: (2024)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
par: Wu, Junyi, et autres
Publié: (2024)
par: Wu, Junyi, et autres
Publié: (2024)
DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training
par: Tan, Xin, et autres
Publié: (2025)
par: Tan, Xin, et autres
Publié: (2025)
Anything in Any Scene: Photorealistic Video Object Insertion
par: Bai, Chen, et autres
Publié: (2024)
par: Bai, Chen, et autres
Publié: (2024)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
par: Shi, Junqi, et autres
Publié: (2026)
par: Shi, Junqi, et autres
Publié: (2026)
XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation
par: Chen, Bowen, et autres
Publié: (2025)
par: Chen, Bowen, et autres
Publié: (2025)
HyperMotionX: The Dataset and Benchmark with DiT-Based Pose-Guided Human Image Animation of Complex Motions
par: Xu, Shuolin, et autres
Publié: (2025)
par: Xu, Shuolin, et autres
Publié: (2025)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
par: Shi, Yangming, et autres
Publié: (2026)
par: Shi, Yangming, et autres
Publié: (2026)
DiT-VTON: Diffusion Transformer Framework for Unified Multi-Category Virtual Try-On and Virtual Try-All with Integrated Image Editing
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
ADP-DiT: Text-Guided Diffusion Transformer for Brain Image Generation in Alzheimer's Disease Progression
par: Lee, Juneyong, et autres
Publié: (2026)
par: Lee, Juneyong, et autres
Publié: (2026)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
Documents similaires
-
UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models
par: Jiang, Hong, et autres
Publié: (2026) -
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024) -
Point2Insert: Video Object Insertion via Sparse Point Guidance
par: Zhou, Yu, et autres
Publié: (2026) -
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
par: Yang, Zhuoyi, et autres
Publié: (2024) -
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
par: Li, Shufan, et autres
Publié: (2025)