Textualize Visual Prompt for Image Editing via Diffusion Bridge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Pengcheng, Fan, Qingnan, Kou, Fei, Qin, Shuai, Gu, Hong, Zhao, Ruoyu, Ling, Charles, Wang, Boyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InstructBrush: Learning Attention-based Instruction Optimization for Image Editing
par: Zhao, Ruoyu, et autres
Publié: (2024)
par: Zhao, Ruoyu, et autres
Publié: (2024)
FreeDiff: Progressive Frequency Truncation for Image Editing with Diffusion Models
par: Wu, Wei, et autres
Publié: (2024)
par: Wu, Wei, et autres
Publié: (2024)
LIPE: Learning Personalized Identity Prior for Non-rigid Image Editing
par: Liu, Aoyang, et autres
Publié: (2024)
par: Liu, Aoyang, et autres
Publié: (2024)
Textual and Visual Prompt Fusion for Image Editing via Step-Wise Alignment
par: Feng, Zhanbo, et autres
Publié: (2023)
par: Feng, Zhanbo, et autres
Publié: (2023)
Class Overwhelms: Mutual Conditional Blended-Target Domain Adaptation
par: Xu, Pengcheng, et autres
Publié: (2023)
par: Xu, Pengcheng, et autres
Publié: (2023)
Visual Textualization for Image Prompted Object Detection
par: Wu, Yongjian, et autres
Publié: (2025)
par: Wu, Yongjian, et autres
Publié: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
RAP-SR: RestorAtion Prior Enhancement in Diffusion Models for Realistic Image Super-Resolution
par: Wang, Jiangang, et autres
Publié: (2024)
par: Wang, Jiangang, et autres
Publié: (2024)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
par: Xu, Pengcheng, et autres
Publié: (2024)
par: Xu, Pengcheng, et autres
Publié: (2024)
CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion Models
par: Zhang, Gaoyang, et autres
Publié: (2024)
par: Zhang, Gaoyang, et autres
Publié: (2024)
Text-Aware Real-World Image Super-Resolution via Diffusion Model with Joint Segmentation Decoders
par: Hu, Qiming, et autres
Publié: (2025)
par: Hu, Qiming, et autres
Publié: (2025)
AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior
par: Liang, Guoqiang, et autres
Publié: (2024)
par: Liang, Guoqiang, et autres
Publié: (2024)
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
par: Chen, Lan, et autres
Publié: (2026)
par: Chen, Lan, et autres
Publié: (2026)
Medal S: Spatio-Textual Prompt Model for Medical Segmentation
par: Shi, Pengcheng, et autres
Publié: (2025)
par: Shi, Pengcheng, et autres
Publié: (2025)
PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling
par: Ruan, Bo-Kai, et autres
Publié: (2025)
par: Ruan, Bo-Kai, et autres
Publié: (2025)
TIE: Revolutionizing Text-based Image Editing for Complex-Prompt Following and High-Fidelity Editing
par: Zhang, Xinyu, et autres
Publié: (2024)
par: Zhang, Xinyu, et autres
Publié: (2024)
Tuning-Free Adaptive Style Incorporation for Structure-Consistent Text-Driven Style Transfer
par: Ge, Yanqi, et autres
Publié: (2024)
par: Ge, Yanqi, et autres
Publié: (2024)
How Do Optical Flow and Textual Prompts Collaborate to Assist in Audio-Visual Semantic Segmentation?
par: Lee, Yujian, et autres
Publié: (2026)
par: Lee, Yujian, et autres
Publié: (2026)
TCP:Textual-based Class-aware Prompt tuning for Visual-Language Model
par: Yao, Hantao, et autres
Publié: (2023)
par: Yao, Hantao, et autres
Publié: (2023)
Visual and Textual Prompts in VLLMs for Enhancing Emotion Recognition
par: Wang, Zhifeng, et autres
Publié: (2025)
par: Wang, Zhifeng, et autres
Publié: (2025)
ULF-Loc: Unbiased Landmark Feature for Robust Visual Localization with 3D Gaussian Splatting
par: Gu, Yingdong, et autres
Publié: (2026)
par: Gu, Yingdong, et autres
Publié: (2026)
APE: Agentic Prompt Enhancer for Image Generation and Editing
par: Huang, Zijian, et autres
Publié: (2026)
par: Huang, Zijian, et autres
Publié: (2026)
CCEdit: Creative and Controllable Video Editing via Diffusion Models
par: Feng, Ruoyu, et autres
Publié: (2023)
par: Feng, Ruoyu, et autres
Publié: (2023)
Relational Diffusion Distillation for Efficient Image Generation
par: Feng, Weilun, et autres
Publié: (2024)
par: Feng, Weilun, et autres
Publié: (2024)
Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
par: Shin, Joonghyuk, et autres
Publié: (2025)
par: Shin, Joonghyuk, et autres
Publié: (2025)
TinySR: Pruning Diffusion for Real-World Image Super-Resolution
par: Dong, Linwei, et autres
Publié: (2025)
par: Dong, Linwei, et autres
Publié: (2025)
Generating Attribute-Aware Human Motions from Textual Prompt
par: Wang, Xinghan, et autres
Publié: (2025)
par: Wang, Xinghan, et autres
Publié: (2025)
RORPCap: Retrieval-based Objects and Relations Prompt for Image Captioning
par: Gu, Jinjing, et autres
Publié: (2025)
par: Gu, Jinjing, et autres
Publié: (2025)
Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing
par: Zou, Zhentao, et autres
Publié: (2025)
par: Zou, Zhentao, et autres
Publié: (2025)
Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models
par: Xu, Ganxi, et autres
Publié: (2025)
par: Xu, Ganxi, et autres
Publié: (2025)
Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs
par: Wu, Daiqing, et autres
Publié: (2025)
par: Wu, Daiqing, et autres
Publié: (2025)
Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models
par: El-Ghoussani, Amir, et autres
Publié: (2026)
par: El-Ghoussani, Amir, et autres
Publié: (2026)
VP-Hype: A Hybrid Mamba-Transformer Framework with Visual-Textual Prompting for Hyperspectral Image Classification
par: Sellam, Abdellah Zakaria, et autres
Publié: (2026)
par: Sellam, Abdellah Zakaria, et autres
Publié: (2026)
Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model
par: Mao, Qi, et autres
Publié: (2025)
par: Mao, Qi, et autres
Publié: (2025)
Forgedit: Text Guided Image Editing via Learning and Forgetting
par: Zhang, Shiwen, et autres
Publié: (2023)
par: Zhang, Shiwen, et autres
Publié: (2023)
A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models
par: Shuai, Xincheng, et autres
Publié: (2024)
par: Shuai, Xincheng, et autres
Publié: (2024)
DragNeXt: Rethinking Drag-Based Image Editing
par: Zhou, Yuan, et autres
Publié: (2025)
par: Zhou, Yuan, et autres
Publié: (2025)
PromptCIR: Blind Compressed Image Restoration with Prompt Learning
par: Li, Bingchen, et autres
Publié: (2024)
par: Li, Bingchen, et autres
Publié: (2024)
Show or Tell? A Benchmark To Evaluate Visual and Textual Prompts in Semantic Segmentation
par: Rosi, Gabriele, et autres
Publié: (2025)
par: Rosi, Gabriele, et autres
Publié: (2025)
BokehDiff: Neural Lens Blur with One-Step Diffusion
par: Zhu, Chengxuan, et autres
Publié: (2025)
par: Zhu, Chengxuan, et autres
Publié: (2025)
Documents similaires
-
InstructBrush: Learning Attention-based Instruction Optimization for Image Editing
par: Zhao, Ruoyu, et autres
Publié: (2024) -
FreeDiff: Progressive Frequency Truncation for Image Editing with Diffusion Models
par: Wu, Wei, et autres
Publié: (2024) -
LIPE: Learning Personalized Identity Prior for Non-rigid Image Editing
par: Liu, Aoyang, et autres
Publié: (2024) -
Textual and Visual Prompt Fusion for Image Editing via Step-Wise Alignment
par: Feng, Zhanbo, et autres
Publié: (2023) -
Class Overwhelms: Mutual Conditional Blended-Target Domain Adaptation
par: Xu, Pengcheng, et autres
Publié: (2023)