Text-DiFuse: An Interactive Multi-Modal Image Fusion Framework based on Text-modulated Diffusion Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Hao, Cao, Lei, Ma, Jiayi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion
par: Yi, Xunpeng, et autres
Publié: (2024)
par: Yi, Xunpeng, et autres
Publié: (2024)
AWM-Fuse: Multi-Modality Image Fusion for Adverse Weather via Global and Local Text Perception
par: Li, Xilai, et autres
Publié: (2025)
par: Li, Xilai, et autres
Publié: (2025)
MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion Models
par: Nair, Nithin Gopalakrishnan, et autres
Publié: (2024)
par: Nair, Nithin Gopalakrishnan, et autres
Publié: (2024)
MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement
par: Zhang, Hao, et autres
Publié: (2026)
par: Zhang, Hao, et autres
Publié: (2026)
DiFuse-Net: RGB and Dual-Pixel Depth Estimation using Window Bi-directional Parallax Attention and Cross-modal Transfer Learning
par: Swami, Kunal, et autres
Publié: (2025)
par: Swami, Kunal, et autres
Publié: (2025)
Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation
par: Xia, Ruihao, et autres
Publié: (2024)
par: Xia, Ruihao, et autres
Publié: (2024)
ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval
par: Zhang, Zhuocheng, et autres
Publié: (2026)
par: Zhang, Zhuocheng, et autres
Publié: (2026)
EMMA: Your Text-to-Image Diffusion Model Can Secretly Accept Multi-Modal Prompts
par: Han, Yucheng, et autres
Publié: (2024)
par: Han, Yucheng, et autres
Publié: (2024)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
par: Yang, Danni, et autres
Publié: (2024)
par: Yang, Danni, et autres
Publié: (2024)
Diffusion-based Blind Text Image Super-Resolution
par: Zhang, Yuzhe, et autres
Publié: (2023)
par: Zhang, Yuzhe, et autres
Publié: (2023)
UniFuse: A Unified All-in-One Framework for Multi-Modal Medical Image Fusion Under Diverse Degradations and Misalignments
par: Su, Dayong, et autres
Publié: (2025)
par: Su, Dayong, et autres
Publié: (2025)
Text-Guided Channel Perturbation and Pretrained Knowledge Integration for Unified Multi-Modality Image Fusion
par: Li, Xilai, et autres
Publié: (2025)
par: Li, Xilai, et autres
Publié: (2025)
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
par: Xin, Yi, et autres
Publié: (2025)
par: Xin, Yi, et autres
Publié: (2025)
InteractDiffusion: Interaction Control in Text-to-Image Diffusion Models
par: Hoe, Jiun Tian, et autres
Publié: (2023)
par: Hoe, Jiun Tian, et autres
Publié: (2023)
JeDi: Joint-Image Diffusion Models for Finetuning-Free Personalized Text-to-Image Generation
par: Zeng, Yu, et autres
Publié: (2024)
par: Zeng, Yu, et autres
Publié: (2024)
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
par: Cheng, Hao, et autres
Publié: (2024)
par: Cheng, Hao, et autres
Publié: (2024)
Uncovering the Text Embedding in Text-to-Image Diffusion Models
par: Yu, Hu, et autres
Publié: (2024)
par: Yu, Hu, et autres
Publié: (2024)
DAE-Fuse: An Adaptive Discriminative Autoencoder for Multi-Modality Image Fusion
par: Guo, Yuchen, et autres
Publié: (2024)
par: Guo, Yuchen, et autres
Publié: (2024)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
par: Zhu, Yixin, et autres
Publié: (2026)
par: Zhu, Yixin, et autres
Publié: (2026)
Text Modality Oriented Image Feature Extraction for Detecting Diffusion-based DeepFake
par: Yang, Di, et autres
Publié: (2024)
par: Yang, Di, et autres
Publié: (2024)
Debiasing Text-to-Image Diffusion Models
par: He, Ruifei, et autres
Publié: (2024)
par: He, Ruifei, et autres
Publié: (2024)
DreamFuse: Adaptive Image Fusion with Diffusion Transformer
par: Huang, Junjia, et autres
Publié: (2025)
par: Huang, Junjia, et autres
Publié: (2025)
Dif-Fusion: Towards High Color Fidelity in Infrared and Visible Image Fusion with Diffusion Models
par: Yue, Jun, et autres
Publié: (2023)
par: Yue, Jun, et autres
Publié: (2023)
Conti-Fuse: A Novel Continuous Decomposition-based Fusion Framework for Infrared and Visible Images
par: Li, Hui, et autres
Publié: (2024)
par: Li, Hui, et autres
Publié: (2024)
Text-Driven Diffusion Model for Sign Language Production
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
Controllable Generation with Text-to-Image Diffusion Models: A Survey
par: Cao, Pu, et autres
Publié: (2024)
par: Cao, Pu, et autres
Publié: (2024)
TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models
par: Xiang, Qianlong, et autres
Publié: (2026)
par: Xiang, Qianlong, et autres
Publié: (2026)
Equivariant Multi-Modality Image Fusion
par: Zhao, Zixiang, et autres
Publié: (2023)
par: Zhao, Zixiang, et autres
Publié: (2023)
Fuse4Seg: Image Fusion for Multi-Modal Medical Segmentation via Bi-level Optimization
par: Guo, Yuchen, et autres
Publié: (2024)
par: Guo, Yuchen, et autres
Publié: (2024)
Scaling Down Text Encoders of Text-to-Image Diffusion Models
par: Wang, Lifu, et autres
Publié: (2025)
par: Wang, Lifu, et autres
Publié: (2025)
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
par: Tang, Bingda, et autres
Publié: (2025)
par: Tang, Bingda, et autres
Publié: (2025)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
LUT-Fuse: Towards Extremely Fast Infrared and Visible Image Fusion via Distillation to Learnable Look-Up Tables
par: Yi, Xunpeng, et autres
Publié: (2025)
par: Yi, Xunpeng, et autres
Publié: (2025)
ADP-DiT: Text-Guided Diffusion Transformer for Brain Image Generation in Alzheimer's Disease Progression
par: Lee, Juneyong, et autres
Publié: (2026)
par: Lee, Juneyong, et autres
Publié: (2026)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
par: Li, Shufan, et autres
Publié: (2025)
par: Li, Shufan, et autres
Publié: (2025)
Shuffle Mamba: State Space Models with Random Shuffle for Multi-Modal Image Fusion
par: Cao, Ke, et autres
Publié: (2024)
par: Cao, Ke, et autres
Publié: (2024)
Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
par: Yin, Zixin, et autres
Publié: (2025)
par: Yin, Zixin, et autres
Publié: (2025)
Contrastive Learning-Driven Traffic Sign Perception: Multi-Modal Fusion of Text and Vision
par: Lu, Qiang, et autres
Publié: (2025)
par: Lu, Qiang, et autres
Publié: (2025)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
par: Zheng, Jinzhi, et autres
Publié: (2024)
par: Zheng, Jinzhi, et autres
Publié: (2024)
Documents similaires
-
Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion
par: Yi, Xunpeng, et autres
Publié: (2024) -
AWM-Fuse: Multi-Modality Image Fusion for Adverse Weather via Global and Local Text Perception
par: Li, Xilai, et autres
Publié: (2025) -
MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion Models
par: Nair, Nithin Gopalakrishnan, et autres
Publié: (2024) -
MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement
par: Zhang, Hao, et autres
Publié: (2026) -
DiFuse-Net: RGB and Dual-Pixel Depth Estimation using Window Bi-directional Parallax Attention and Cross-modal Transfer Learning
par: Swami, Kunal, et autres
Publié: (2025)