Multimodal Fusion via Self-Consistent Task-Gradient Fields
Fuente:
arXiv
Saved in:
| Main Authors: | Xiong, Jiayu, Wang, Jing, Xue, Jun, Wang, Wanlong, Kwan, Jianlong, Lyu, Xiaosen, Jiang, Zhouqiang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization
by: Xiong, Jiayu, et al.
Published: (2026)
by: Xiong, Jiayu, et al.
Published: (2026)
ReLayout: Towards Real-World Document Understanding via Layout-enhanced Pre-training
by: Jiang, Zhouqiang, et al.
Published: (2024)
by: Jiang, Zhouqiang, et al.
Published: (2024)
Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency
by: Li, Zihan, et al.
Published: (2025)
by: Li, Zihan, et al.
Published: (2025)
Self-supervised Event-based Monocular Depth Estimation using Cross-modal Consistency
by: Zhu, Junyu, et al.
Published: (2024)
by: Zhu, Junyu, et al.
Published: (2024)
Boosting the Local Invariance for Better Adversarial Transferability
by: Liu, Bohan, et al.
Published: (2025)
by: Liu, Bohan, et al.
Published: (2025)
CSFMamba: Cross State Fusion Mamba Operator for Multimodal Remote Sensing Image Classification
by: Wang, Qingyu, et al.
Published: (2025)
by: Wang, Qingyu, et al.
Published: (2025)
Enhancing Feature Fusion of U-like Networks with Dynamic Skip Connections
by: Cao, Yue, et al.
Published: (2025)
by: Cao, Yue, et al.
Published: (2025)
Task-Generalized Adaptive Cross-Domain Learning for Multimodal Image Fusion
by: Wang, Mengyu, et al.
Published: (2025)
by: Wang, Mengyu, et al.
Published: (2025)
Exploring Visual Prompting: Robustness Inheritance and Beyond
by: Li, Qi, et al.
Published: (2025)
by: Li, Qi, et al.
Published: (2025)
Interactive Multimodal Fusion with Temporal Modeling
by: Yu, Jun, et al.
Published: (2025)
by: Yu, Jun, et al.
Published: (2025)
Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection
by: Wang, Shan, et al.
Published: (2025)
by: Wang, Shan, et al.
Published: (2025)
CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
by: Fang, Xiang, et al.
Published: (2026)
by: Fang, Xiang, et al.
Published: (2026)
Balancing Task-invariant Interaction and Task-specific Adaptation for Unified Image Fusion
by: Hu, Xingyu, et al.
Published: (2025)
by: Hu, Xingyu, et al.
Published: (2025)
Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models
by: Wang, Weixing, et al.
Published: (2026)
by: Wang, Weixing, et al.
Published: (2026)
ViCA-NeRF: View-Consistency-Aware 3D Editing of Neural Radiance Fields
by: Dong, Jiahua, et al.
Published: (2024)
by: Dong, Jiahua, et al.
Published: (2024)
IHC Matters: Incorporating IHC analysis to H&E Whole Slide Image Analysis for Improved Cancer Grading via Two-stage Multimodal Bilinear Pooling Fusion
by: Wang, Jun, et al.
Published: (2024)
by: Wang, Jun, et al.
Published: (2024)
Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
by: Fang, Xiang, et al.
Published: (2026)
by: Fang, Xiang, et al.
Published: (2026)
From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data
by: Yu, Yue, et al.
Published: (2026)
by: Yu, Yue, et al.
Published: (2026)
SpaCRD: Multimodal Deep Fusion of Histology and Spatial Transcriptomics for Cancer Region Detection
by: Xue, Shuailin, et al.
Published: (2026)
by: Xue, Shuailin, et al.
Published: (2026)
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
by: Chen, Jiacheng, et al.
Published: (2024)
by: Chen, Jiacheng, et al.
Published: (2024)
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
by: Fang, Xiang, et al.
Published: (2026)
by: Fang, Xiang, et al.
Published: (2026)
Multiagent Multitraversal Multimodal Self-Driving: Open MARS Dataset
by: Li, Yiming, et al.
Published: (2024)
by: Li, Yiming, et al.
Published: (2024)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
by: Fang, Xiang, et al.
Published: (2026)
by: Fang, Xiang, et al.
Published: (2026)
Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors
by: Wang, Rong, et al.
Published: (2026)
by: Wang, Rong, et al.
Published: (2026)
Rethinking Early-Fusion Strategies for Improved Multimodal Image Segmentation
by: Shen, Zhengwen, et al.
Published: (2025)
by: Shen, Zhengwen, et al.
Published: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
by: Fang, Xiang, et al.
Published: (2026)
by: Fang, Xiang, et al.
Published: (2026)
Disrupting Semantic and Abstract Features for Better Adversarial Transferability
by: Luo, Yuyang, et al.
Published: (2025)
by: Luo, Yuyang, et al.
Published: (2025)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
by: Wang, Jiayu, et al.
Published: (2025)
by: Wang, Jiayu, et al.
Published: (2025)
Continual Action Assessment via Task-Consistent Score-Discriminative Feature Distribution Modeling
by: Li, Yuan-Ming, et al.
Published: (2023)
by: Li, Yuan-Ming, et al.
Published: (2023)
Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition
by: Cong, Kaixuan, et al.
Published: (2025)
by: Cong, Kaixuan, et al.
Published: (2025)
MSA2-Net: Utilizing Self-Adaptive Convolution Module to Extract Multi-Scale Information in Medical Image Segmentation
by: Deng, Chao, et al.
Published: (2025)
by: Deng, Chao, et al.
Published: (2025)
Attention! Your Vision Language Model Could Be Maliciously Manipulated
by: Wang, Xiaosen, et al.
Published: (2025)
by: Wang, Xiaosen, et al.
Published: (2025)
Bag of Tricks to Boost Adversarial Transferability
by: Zhang, Zeliang, et al.
Published: (2024)
by: Zhang, Zeliang, et al.
Published: (2024)
Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction
by: Yan, Shannan, et al.
Published: (2026)
by: Yan, Shannan, et al.
Published: (2026)
AMFD: Distillation via Adaptive Multimodal Fusion for Multispectral Pedestrian Detection
by: Chen, Zizhao, et al.
Published: (2024)
by: Chen, Zizhao, et al.
Published: (2024)
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
by: Ge, Haonan, et al.
Published: (2025)
by: Ge, Haonan, et al.
Published: (2025)
DeFusion: An Effective Decoupling Fusion Network for Multi-Modal Pregnancy Prediction
by: Ouyang, Xueqiang, et al.
Published: (2025)
by: Ouyang, Xueqiang, et al.
Published: (2025)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
by: Zhu, Zhiyu, et al.
Published: (2025)
by: Zhu, Zhiyu, et al.
Published: (2025)
Zero-Reference Low-Light Enhancement via Physical Quadruple Priors
by: Wang, Wenjing, et al.
Published: (2024)
by: Wang, Wenjing, et al.
Published: (2024)
Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks
by: Wang, Lehan, et al.
Published: (2024)
by: Wang, Lehan, et al.
Published: (2024)
Similar Items
-
Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization
by: Xiong, Jiayu, et al.
Published: (2026) -
ReLayout: Towards Real-World Document Understanding via Layout-enhanced Pre-training
by: Jiang, Zhouqiang, et al.
Published: (2024) -
Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency
by: Li, Zihan, et al.
Published: (2025) -
Self-supervised Event-based Monocular Depth Estimation using Cross-modal Consistency
by: Zhu, Junyu, et al.
Published: (2024) -
Boosting the Local Invariance for Better Adversarial Transferability
by: Liu, Bohan, et al.
Published: (2025)