Quantifying and Enhancing Multi-modal Robustness with Modality Preference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Zequn, Wei, Yake, Liang, Ce, Hu, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing multimodal cooperation via sample-level modality valuation
par: Wei, Yake, et autres
Publié: (2023)
par: Wei, Yake, et autres
Publié: (2023)
MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance
par: Wei, Yake, et autres
Publié: (2024)
par: Wei, Yake, et autres
Publié: (2024)
Diagnosing and Re-learning for Balanced Multimodal Learning
par: Wei, Yake, et autres
Publié: (2024)
par: Wei, Yake, et autres
Publié: (2024)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Towards Robust and Realible Multimodal Misinformation Recognition with Incomplete Modality
par: Zhou, Hengyang, et autres
Publié: (2025)
par: Zhou, Hengyang, et autres
Publié: (2025)
On-the-fly Modulation for Balanced Multimodal Learning
par: Wei, Yake, et autres
Publié: (2024)
par: Wei, Yake, et autres
Publié: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
par: Lan, Xiaohan, et autres
Publié: (2024)
par: Lan, Xiaohan, et autres
Publié: (2024)
ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
par: Qian, Xinyuan, et autres
Publié: (2026)
par: Qian, Xinyuan, et autres
Publié: (2026)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
par: Chow, Wei, et autres
Publié: (2024)
par: Chow, Wei, et autres
Publié: (2024)
Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality Selection
par: Fan, Yunfeng, et autres
Publié: (2023)
par: Fan, Yunfeng, et autres
Publié: (2023)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
par: Hu, Xiaowan, et autres
Publié: (2024)
par: Hu, Xiaowan, et autres
Publié: (2024)
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
par: Fan, Yunfeng, et autres
Publié: (2023)
par: Fan, Yunfeng, et autres
Publié: (2023)
M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System
par: Kong, Chenqi, et autres
Publié: (2023)
par: Kong, Chenqi, et autres
Publié: (2023)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
par: Miao, Bingchen, et autres
Publié: (2024)
par: Miao, Bingchen, et autres
Publié: (2024)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
par: Li, Huilai, et autres
Publié: (2026)
par: Li, Huilai, et autres
Publié: (2026)
Visual Grounding with Multi-modal Conditional Adaptation
par: Yao, Ruilin, et autres
Publié: (2024)
par: Yao, Ruilin, et autres
Publié: (2024)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
par: Pu, Ruitao, et autres
Publié: (2025)
par: Pu, Ruitao, et autres
Publié: (2025)
GTPBD-MM: A Global Terraced Parcel and Boundary Dataset with Multi-Modality
par: Zhang, Zhiwei, et autres
Publié: (2026)
par: Zhang, Zhiwei, et autres
Publié: (2026)
Anisotropic Modality Align
par: Yu, Xiaomin, et autres
Publié: (2026)
par: Yu, Xiaomin, et autres
Publié: (2026)
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
par: Zhang, Zhihao, et autres
Publié: (2023)
par: Zhang, Zhihao, et autres
Publié: (2023)
MCIHN: A Hybrid Network Model Based on Multi-path Cross-modal Interaction for Multimodal Emotion Recognition
par: Zhang, Haoyang, et autres
Publié: (2025)
par: Zhang, Haoyang, et autres
Publié: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
par: Li, Shaokai, et autres
Publié: (2024)
par: Li, Shaokai, et autres
Publié: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
par: Sun, Yanpeng, et autres
Publié: (2024)
par: Sun, Yanpeng, et autres
Publié: (2024)
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
par: Dai, Guangyu, et autres
Publié: (2025)
par: Dai, Guangyu, et autres
Publié: (2025)
Find the Cliffhanger: Multi-Modal Trailerness in Soap Operas
par: Bretti, Carlo, et autres
Publié: (2024)
par: Bretti, Carlo, et autres
Publié: (2024)
MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt
par: Wang, Yuhao, et autres
Publié: (2024)
par: Wang, Yuhao, et autres
Publié: (2024)
Hypergraph Tversky-Aware Domain Incremental Learning for Brain Tumor Segmentation with Missing Modalities
par: Wang, Junze, et autres
Publié: (2025)
par: Wang, Junze, et autres
Publié: (2025)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
par: Zhang, Long, et autres
Publié: (2025)
par: Zhang, Long, et autres
Publié: (2025)
Continual Panoptic Perception: Towards Multi-modal Incremental Interpretation of Remote Sensing Images
par: Yuan, Bo, et autres
Publié: (2024)
par: Yuan, Bo, et autres
Publié: (2024)
IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-Identification
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
Deep Reversible Consistency Learning for Cross-modal Retrieval
par: Pu, Ruitao, et autres
Publié: (2025)
par: Pu, Ruitao, et autres
Publié: (2025)
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
par: Li, Yuxuan, et autres
Publié: (2024)
par: Li, Yuxuan, et autres
Publié: (2024)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
par: Ding, Peng, et autres
Publié: (2024)
par: Ding, Peng, et autres
Publié: (2024)
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
par: Wang, Xue, et autres
Publié: (2026)
par: Wang, Xue, et autres
Publié: (2026)
Documents similaires
-
Enhancing multimodal cooperation via sample-level modality valuation
par: Wei, Yake, et autres
Publié: (2023) -
MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance
par: Wei, Yake, et autres
Publié: (2024) -
Diagnosing and Re-learning for Balanced Multimodal Learning
par: Wei, Yake, et autres
Publié: (2024) -
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025) -
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
par: Wang, Hao, et autres
Publié: (2024)