MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Yushen, Li, Xiaosong, Kuang, Zhenyu, Cheng, Xiaoqi, Tan, Haishu, Li, Huafeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlexiD-Fuse: Flexible number of inputs multi-modal medical image fusion based on diffusion model
par: Xu, Yushen, et autres
Publié: (2025)
par: Xu, Yushen, et autres
Publié: (2025)
TSJNet: A Multi-modality Target and Semantic Awareness Joint-driven Image Fusion Network
par: Jie, Yuchan, et autres
Publié: (2024)
par: Jie, Yuchan, et autres
Publié: (2024)
Simultaneous Tri-Modal Medical Image Fusion and Super-Resolution using Conditional Diffusion Model
par: Xu, Yushen, et autres
Publié: (2024)
par: Xu, Yushen, et autres
Publié: (2024)
A Luminance-Aware Multi-Scale Network for Polarization Image Fusion with a Multi-Scene Dataset
par: Huang, Zhuangfan, et autres
Publié: (2025)
par: Huang, Zhuangfan, et autres
Publié: (2025)
Bridging the Gap between Multi-focus and Multi-modal: A Focused Integration Framework for Multi-modal Image Fusion
par: Li, Xilai, et autres
Publié: (2023)
par: Li, Xilai, et autres
Publié: (2023)
SAMF: Small-Area-Aware Multi-focus Image Fusion for Object Detection
par: Li, Xilai, et autres
Publié: (2024)
par: Li, Xilai, et autres
Publié: (2024)
AWM-Fuse: Multi-Modality Image Fusion for Adverse Weather via Global and Local Text Perception
par: Li, Xilai, et autres
Publié: (2025)
par: Li, Xilai, et autres
Publié: (2025)
OccluDentNet : Self‐Supervised 3D Tooth Segmentation via MambaTrans Architecture
par: Hong‐an Li, et autres
Publié: (2026)
par: Hong‐an Li, et autres
Publié: (2026)
NDLPNet: A Location-Aware Nighttime Deraining Network and a Real-World Benchmark Dataset
par: Liu, Huichun, et autres
Publié: (2025)
par: Liu, Huichun, et autres
Publié: (2025)
MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction
par: Li, Xilai, et autres
Publié: (2026)
par: Li, Xilai, et autres
Publié: (2026)
Instruction-Driven Fusion of Infrared-Visible Images: Tailoring for Diverse Downstream Tasks
par: Yang, Zengyi, et autres
Publié: (2024)
par: Yang, Zengyi, et autres
Publié: (2024)
UMCFuse: A Unified Multiple Complex Scenes Infrared and Visible Image Fusion Framework
par: Li, Xilai, et autres
Publié: (2024)
par: Li, Xilai, et autres
Publié: (2024)
CAWM-Mamba: A unified model for infrared-visible image fusion and compound adverse weather restoration
par: Liu, Huichun, et autres
Publié: (2026)
par: Liu, Huichun, et autres
Publié: (2026)
FS-Diff: Semantic guidance and clarity-aware simultaneous multimodal image fusion and super-resolution
par: Jie, Yuchan, et autres
Publié: (2025)
par: Jie, Yuchan, et autres
Publié: (2025)
FusionMamba: Dynamic Feature Enhancement for Multimodal Image Fusion with Mamba
par: Xie, Xinyu, et autres
Publié: (2024)
par: Xie, Xinyu, et autres
Publié: (2024)
Adaptive Dynamic Dehazing via Instruction-Driven and Task-Feedback Closed-Loop Optimization for Diverse Downstream Task Adaptation
par: Zhang, Yafei, et autres
Publié: (2026)
par: Zhang, Yafei, et autres
Publié: (2026)
All-weather Multi-Modality Image Fusion: Unified Framework and 100k Benchmark
par: Li, Xilai, et autres
Publié: (2024)
par: Li, Xilai, et autres
Publié: (2024)
Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios
par: Shi, Yu, et autres
Publié: (2026)
par: Shi, Yu, et autres
Publié: (2026)
PIF-Net: Ill-Posed Prior Guided Multispectral and Hyperspectral Image Fusion via Invertible Mamba and Fusion-Aware LoRA
par: Li, Baisong, et autres
Publié: (2025)
par: Li, Baisong, et autres
Publié: (2025)
UAVD-Mamba: Deformable Token Fusion Vision Mamba for Multimodal UAV Detection
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion
par: Yang, Zengyi, et autres
Publié: (2026)
par: Yang, Zengyi, et autres
Publié: (2026)
TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language Model
par: Li, Yixing, et autres
Publié: (2025)
par: Li, Yixing, et autres
Publié: (2025)
TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
Task-Generalized Adaptive Cross-Domain Learning for Multimodal Image Fusion
par: Wang, Mengyu, et autres
Publié: (2025)
par: Wang, Mengyu, et autres
Publié: (2025)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
par: Dong, Xinpeng, et autres
Publié: (2026)
par: Dong, Xinpeng, et autres
Publié: (2026)
Laplace-Mamba: Laplace Frequency Prior-Guided Mamba-CNN Fusion Network for Image Dehazing
par: Wang, Yongzhen, et autres
Publié: (2025)
par: Wang, Yongzhen, et autres
Publié: (2025)
Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model
par: Huang, Wenke, et autres
Publié: (2025)
par: Huang, Wenke, et autres
Publié: (2025)
Task Priors: Enhancing Model Evaluation by Considering the Entire Space of Downstream Tasks
par: Patel, Niket, et autres
Publié: (2025)
par: Patel, Niket, et autres
Publié: (2025)
MMA-UNet: A Multi-Modal Asymmetric UNet Architecture for Infrared and Visible Image Fusion
par: Huang, Jingxue, et autres
Publié: (2024)
par: Huang, Jingxue, et autres
Publié: (2024)
Beyond Visual Fidelity: Benchmarking Super-Resolution Models for Large-Scale Remote Sensing Imagery via Downstream Task Integration
par: Li, Zhili, et autres
Publié: (2026)
par: Li, Zhili, et autres
Publié: (2026)
Scaling Laws for Downstream Task Performance of Large Language Models
par: Isik, Berivan, et autres
Publié: (2024)
par: Isik, Berivan, et autres
Publié: (2024)
AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
Learn from Downstream and Be Yourself in Multimodal Large Language Model Fine-Tuning
par: Huang, Wenke, et autres
Publié: (2024)
par: Huang, Wenke, et autres
Publié: (2024)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
par: Liu, Xinqi, et autres
Publié: (2024)
par: Liu, Xinqi, et autres
Publié: (2024)
Why mamba is effective? Exploit Linear Transformer-Mamba Network for Multi-Modality Image Fusion
par: Zhu, Chenguang, et autres
Publié: (2024)
par: Zhu, Chenguang, et autres
Publié: (2024)
Password Strength Detection via Machine Learning: Analysis, Modeling, and Evaluation
par: Mo, Jiazhi, et autres
Publié: (2025)
par: Mo, Jiazhi, et autres
Publié: (2025)
SpineMamba: Enhancing 3D Spinal Segmentation in Clinical Imaging through Residual Visual Mamba Layers and Shape Priors
par: Zhang, Zhiqing, et autres
Publié: (2024)
par: Zhang, Zhiqing, et autres
Publié: (2024)
RGBT Tracking via All-layer Multimodal Interactions with Progressive Fusion Mamba
par: Lu, Andong, et autres
Publié: (2024)
par: Lu, Andong, et autres
Publié: (2024)
Text-Guided Channel Perturbation and Pretrained Knowledge Integration for Unified Multi-Modality Image Fusion
par: Li, Xilai, et autres
Publié: (2025)
par: Li, Xilai, et autres
Publié: (2025)
Revisiting Disentanglement in Downstream Tasks: A Study on Its Necessity for Abstract Visual Reasoning
par: Nai, Ruiqian, et autres
Publié: (2024)
par: Nai, Ruiqian, et autres
Publié: (2024)
Documents similaires
-
FlexiD-Fuse: Flexible number of inputs multi-modal medical image fusion based on diffusion model
par: Xu, Yushen, et autres
Publié: (2025) -
TSJNet: A Multi-modality Target and Semantic Awareness Joint-driven Image Fusion Network
par: Jie, Yuchan, et autres
Publié: (2024) -
Simultaneous Tri-Modal Medical Image Fusion and Super-Resolution using Conditional Diffusion Model
par: Xu, Yushen, et autres
Publié: (2024) -
A Luminance-Aware Multi-Scale Network for Polarization Image Fusion with a Multi-Scene Dataset
par: Huang, Zhuangfan, et autres
Publié: (2025) -
Bridging the Gap between Multi-focus and Multi-modal: A Focused Integration Framework for Multi-modal Image Fusion
par: Li, Xilai, et autres
Publié: (2023)