Diagnosing and Re-learning for Balanced Multimodal Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Yake, Li, Siwei, Feng, Ruoxuan, Hu, Di |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing multimodal cooperation via sample-level modality valuation
di: Wei, Yake, et al.
Pubblicazione: (2023)
di: Wei, Yake, et al.
Pubblicazione: (2023)
On-the-fly Modulation for Balanced Multimodal Learning
di: Wei, Yake, et al.
Pubblicazione: (2024)
di: Wei, Yake, et al.
Pubblicazione: (2024)
MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance
di: Wei, Yake, et al.
Pubblicazione: (2024)
di: Wei, Yake, et al.
Pubblicazione: (2024)
Quantifying and Enhancing Multi-modal Robustness with Modality Preference
di: Yang, Zequn, et al.
Pubblicazione: (2024)
di: Yang, Zequn, et al.
Pubblicazione: (2024)
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval
di: Zhao, Ruixiang, et al.
Pubblicazione: (2024)
di: Zhao, Ruixiang, et al.
Pubblicazione: (2024)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
di: Li, Guangyao, et al.
Pubblicazione: (2024)
di: Li, Guangyao, et al.
Pubblicazione: (2024)
Enhancing Visible-Infrared Person Re-identification with Modality- and Instance-aware Visual Prompt Learning
di: Wu, Ruiqi, et al.
Pubblicazione: (2024)
di: Wu, Ruiqi, et al.
Pubblicazione: (2024)
URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection
di: Wang, Zhenyu, et al.
Pubblicazione: (2026)
di: Wang, Zhenyu, et al.
Pubblicazione: (2026)
CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning
di: Meng, Chunlei, et al.
Pubblicazione: (2026)
di: Meng, Chunlei, et al.
Pubblicazione: (2026)
Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
di: Li, Jie, et al.
Pubblicazione: (2025)
di: Li, Jie, et al.
Pubblicazione: (2025)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
ReCorD: Reasoning and Correcting Diffusion for HOI Generation
di: Jiang-Lin, Jian-Yu, et al.
Pubblicazione: (2024)
di: Jiang-Lin, Jian-Yu, et al.
Pubblicazione: (2024)
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
di: Liu, Junzhang, et al.
Pubblicazione: (2024)
di: Liu, Junzhang, et al.
Pubblicazione: (2024)
D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance
di: Liu, Renyang, et al.
Pubblicazione: (2024)
di: Liu, Renyang, et al.
Pubblicazione: (2024)
Balancing Privacy and Action Performance: A Penalty-Driven Approach to Image Anonymization
di: Aslam, Nazia, et al.
Pubblicazione: (2025)
di: Aslam, Nazia, et al.
Pubblicazione: (2025)
Official-NV: An LLM-Generated News Video Dataset for Multimodal Fake News Detection
di: Wang, Yihao, et al.
Pubblicazione: (2024)
di: Wang, Yihao, et al.
Pubblicazione: (2024)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
di: Wu, Yi, et al.
Pubblicazione: (2025)
di: Wu, Yi, et al.
Pubblicazione: (2025)
Deep ReLU Networks Have Surprisingly Simple Polytopes
di: Fan, Feng-Lei, et al.
Pubblicazione: (2023)
di: Fan, Feng-Lei, et al.
Pubblicazione: (2023)
Multimodal Markup Document Models for Graphic Design Completion
di: Kikuchi, Kotaro, et al.
Pubblicazione: (2024)
di: Kikuchi, Kotaro, et al.
Pubblicazione: (2024)
Multimodal Chaptering for Long-Form TV Newscast Video
di: Guetari, Khalil, et al.
Pubblicazione: (2024)
di: Guetari, Khalil, et al.
Pubblicazione: (2024)
Veagle: Advancements in Multimodal Representation Learning
di: Chawla, Rajat, et al.
Pubblicazione: (2024)
di: Chawla, Rajat, et al.
Pubblicazione: (2024)
Federated Prompt-Tuning with Heterogeneous and Incomplete Multimodal Client Data
di: Phung, Thu Hang, et al.
Pubblicazione: (2026)
di: Phung, Thu Hang, et al.
Pubblicazione: (2026)
Robust Fuzzy Multi-view Learning under View Conflict
di: Duan, Siyuan, et al.
Pubblicazione: (2026)
di: Duan, Siyuan, et al.
Pubblicazione: (2026)
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
CrypticBio: A Large Multimodal Dataset for Visually Confusing Biodiversity
di: Manolache, Georgiana, et al.
Pubblicazione: (2025)
di: Manolache, Georgiana, et al.
Pubblicazione: (2025)
Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images
di: Amoroso, Roberto, et al.
Pubblicazione: (2023)
di: Amoroso, Roberto, et al.
Pubblicazione: (2023)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
Omni-Dish: Photorealistic and Faithful Image Generation and Editing for Arbitrary Chinese Dishes
di: Liu, Huijie, et al.
Pubblicazione: (2025)
di: Liu, Huijie, et al.
Pubblicazione: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
di: Lai, Zhengzhao, et al.
Pubblicazione: (2025)
di: Lai, Zhengzhao, et al.
Pubblicazione: (2025)
LMVD: A Large-Scale Multimodal Vlog Dataset for Depression Detection in the Wild
di: He, Lang, et al.
Pubblicazione: (2024)
di: He, Lang, et al.
Pubblicazione: (2024)
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
di: Sanguigni, Fulvio, et al.
Pubblicazione: (2025)
di: Sanguigni, Fulvio, et al.
Pubblicazione: (2025)
XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning
di: Zhang, Hanwen, et al.
Pubblicazione: (2026)
di: Zhang, Hanwen, et al.
Pubblicazione: (2026)
Handling Missing Modalities in Multimodal Survival Prediction for Non-Small Cell Lung Cancer
di: Ruffini, Filippo, et al.
Pubblicazione: (2026)
di: Ruffini, Filippo, et al.
Pubblicazione: (2026)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
di: Zhang, Yinghui, et al.
Pubblicazione: (2025)
di: Zhang, Yinghui, et al.
Pubblicazione: (2025)
Concept Conductor: Orchestrating Multiple Personalized Concepts in Text-to-Image Synthesis
di: Yao, Zebin, et al.
Pubblicazione: (2024)
di: Yao, Zebin, et al.
Pubblicazione: (2024)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Learning Segment Similarity and Alignment in Large-Scale Content Based Video Retrieval
di: Jiang, Chen, et al.
Pubblicazione: (2023)
di: Jiang, Chen, et al.
Pubblicazione: (2023)
Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Enhancing multimodal cooperation via sample-level modality valuation
di: Wei, Yake, et al.
Pubblicazione: (2023) -
On-the-fly Modulation for Balanced Multimodal Learning
di: Wei, Yake, et al.
Pubblicazione: (2024) -
MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance
di: Wei, Yake, et al.
Pubblicazione: (2024) -
Quantifying and Enhancing Multi-modal Robustness with Modality Preference
di: Yang, Zequn, et al.
Pubblicazione: (2024) -
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval
di: Zhao, Ruixiang, et al.
Pubblicazione: (2024)