Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Jiayang, Jiang, Chengjie, Jiang, Junjun, Liang, Pengwei, Ma, Jiayi, Nie, Liqiang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MaeFuse: Transferring Omni Features with Pretrained Masked Autoencoders for Infrared and Visible Image Fusion via Guided Training
by: Li, Jiayang, et al.
Published: (2024)
by: Li, Jiayang, et al.
Published: (2024)
Fusion from Decomposition: A Self-Supervised Approach for Image Fusion and Beyond
by: Liang, Pengwei, et al.
Published: (2024)
by: Liang, Pengwei, et al.
Published: (2024)
Image Deblurring by Exploring In-depth Properties of Transformer
by: Liang, Pengwei, et al.
Published: (2023)
by: Liang, Pengwei, et al.
Published: (2023)
TextSplat: Text-Guided Semantic Fusion for Generalizable Gaussian Splatting
by: Wu, Zhicong, et al.
Published: (2025)
by: Wu, Zhicong, et al.
Published: (2025)
ControlFusion: A Controllable Image Fusion Framework with Language-Vision Degradation Prompts
by: Tang, Linfeng, et al.
Published: (2025)
by: Tang, Linfeng, et al.
Published: (2025)
FineCIR: Explicit Parsing of Fine-Grained Modification Semantics for Composed Image Retrieval
by: Li, Zixu, et al.
Published: (2025)
by: Li, Zixu, et al.
Published: (2025)
Balancing Task-invariant Interaction and Task-specific Adaptation for Unified Image Fusion
by: Hu, Xingyu, et al.
Published: (2025)
by: Hu, Xingyu, et al.
Published: (2025)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
by: Li, Zaijing, et al.
Published: (2026)
by: Li, Zaijing, et al.
Published: (2026)
UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation
by: Li, Xingyuan, et al.
Published: (2026)
by: Li, Xingyuan, et al.
Published: (2026)
Fully $1\times1$ Convolutional Network for Lightweight Image Super-Resolution
by: Wu, Gang, et al.
Published: (2023)
by: Wu, Gang, et al.
Published: (2023)
Playing with Transformer at 30+ FPS via Next-Frame Diffusion
by: Cheng, Xinle, et al.
Published: (2025)
by: Cheng, Xinle, et al.
Published: (2025)
Diffusion Facial Forgery Detection
by: Cheng, Harry, et al.
Published: (2024)
by: Cheng, Harry, et al.
Published: (2024)
Image-Conditional Diffusion Transformer for Underwater Image Enhancement
by: Nie, Xingyang, et al.
Published: (2024)
by: Nie, Xingyang, et al.
Published: (2024)
WithAnyone: Towards Controllable and ID Consistent Image Generation
by: Xu, Hengyuan, et al.
Published: (2025)
by: Xu, Hengyuan, et al.
Published: (2025)
MIRAGE: Towards AI-Generated Image Detection in the Wild
by: Xia, Cheng, et al.
Published: (2025)
by: Xia, Cheng, et al.
Published: (2025)
Generative Pre-trained Autoregressive Diffusion Transformer
by: Zhang, Yuan, et al.
Published: (2025)
by: Zhang, Yuan, et al.
Published: (2025)
RealignDiff: Boosting Text-to-Image Diffusion Model with Coarse-to-fine Semantic Re-alignment
by: Jiang, Zutao, et al.
Published: (2023)
by: Jiang, Zutao, et al.
Published: (2023)
TinyFusion: Diffusion Transformers Learned Shallow
by: Fang, Gongfan, et al.
Published: (2024)
by: Fang, Gongfan, et al.
Published: (2024)
DSwinIR: Rethinking Window-based Attention for Image Restoration
by: Wu, Gang, et al.
Published: (2025)
by: Wu, Gang, et al.
Published: (2025)
Adaptive Stereo Depth Estimation with Multi-Spectral Images Across All Lighting Conditions
by: Qin, Zihan, et al.
Published: (2024)
by: Qin, Zihan, et al.
Published: (2024)
Beyond Degradation Redundancy: Contrastive Prompt Learning for All-in-One Image Restoration
by: Wu, Gang, et al.
Published: (2025)
by: Wu, Gang, et al.
Published: (2025)
Heatmap Guided Query Transformers for Robust Astrocyte Detection across Immunostains and Resolutions
by: Zhang, Xizhe, et al.
Published: (2025)
by: Zhang, Xizhe, et al.
Published: (2025)
Visual Self-paced Iterative Learning for Unsupervised Temporal Action Localization
by: Hu, Yupeng, et al.
Published: (2023)
by: Hu, Yupeng, et al.
Published: (2023)
Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers
by: Li, Guandong
Published: (2026)
by: Li, Guandong
Published: (2026)
Video-As-Prompt: Unified Semantic Control for Video Generation
by: Bian, Yuxuan, et al.
Published: (2025)
by: Bian, Yuxuan, et al.
Published: (2025)
TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models
by: Chen, Ruidong, et al.
Published: (2025)
by: Chen, Ruidong, et al.
Published: (2025)
DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution
by: Niu, Axi, et al.
Published: (2026)
by: Niu, Axi, et al.
Published: (2026)
Progressive Feature Fusion Network for Enhancing Image Quality Assessment
by: Wu, Kaiqun, et al.
Published: (2024)
by: Wu, Kaiqun, et al.
Published: (2024)
Realism Control One-step Diffusion for Real-World Image Super-Resolution
by: Wu, Zongliang, et al.
Published: (2025)
by: Wu, Zongliang, et al.
Published: (2025)
Enhancing Multimodal Understanding with CLIP-Based Image-to-Text Transformation
by: Che, Chang, et al.
Published: (2024)
by: Che, Chang, et al.
Published: (2024)
Always Clear Depth: Robust Monocular Depth Estimation under Adverse Weather
by: Jiang, Kui, et al.
Published: (2025)
by: Jiang, Kui, et al.
Published: (2025)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
by: Wang, Yi, et al.
Published: (2025)
by: Wang, Yi, et al.
Published: (2025)
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation
by: Fan, Zehua, et al.
Published: (2026)
by: Fan, Zehua, et al.
Published: (2026)
OmniCam: Unified Multimodal Video Generation via Camera Control
by: Yang, Xiaoda, et al.
Published: (2025)
by: Yang, Xiaoda, et al.
Published: (2025)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
by: Zheng, Yuze, et al.
Published: (2024)
by: Zheng, Yuze, et al.
Published: (2024)
VISTA: Technical Report for the Ego4D Short-Term Object Interaction Anticipation at EgoVis 2026
by: Chu, Qiaohui, et al.
Published: (2026)
by: Chu, Qiaohui, et al.
Published: (2026)
Depth-guided Texture Diffusion for Image Semantic Segmentation
by: Sun, Wei, et al.
Published: (2024)
by: Sun, Wei, et al.
Published: (2024)
Dual Prompting Image Restoration with Diffusion Transformers
by: Kong, Dehong, et al.
Published: (2025)
by: Kong, Dehong, et al.
Published: (2025)
WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
by: Jiang, Haoran, et al.
Published: (2025)
by: Jiang, Haoran, et al.
Published: (2025)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
by: Chen, Lei, et al.
Published: (2024)
by: Chen, Lei, et al.
Published: (2024)
Similar Items
-
MaeFuse: Transferring Omni Features with Pretrained Masked Autoencoders for Infrared and Visible Image Fusion via Guided Training
by: Li, Jiayang, et al.
Published: (2024) -
Fusion from Decomposition: A Self-Supervised Approach for Image Fusion and Beyond
by: Liang, Pengwei, et al.
Published: (2024) -
Image Deblurring by Exploring In-depth Properties of Transformer
by: Liang, Pengwei, et al.
Published: (2023) -
TextSplat: Text-Guided Semantic Fusion for Generalizable Gaussian Splatting
by: Wu, Zhicong, et al.
Published: (2025) -
ControlFusion: A Controllable Image Fusion Framework with Language-Vision Degradation Prompts
by: Tang, Linfeng, et al.
Published: (2025)