Can Text-to-image Model Assist Multi-modal Learning for Visual Recognition with Visual Modality Missing?
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Tiantian, Yang, Daniel, Bose, Digbalay, Narayanan, Shrikanth |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition
di: Zhao, Shu, et al.
Pubblicazione: (2025)
di: Zhao, Shu, et al.
Pubblicazione: (2025)
Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models
di: Tsaprazlis, Efthymios, et al.
Pubblicazione: (2025)
di: Tsaprazlis, Efthymios, et al.
Pubblicazione: (2025)
Towards Child-Inclusive Clinical Video Understanding for Autism Spectrum Disorder
di: Kommineni, Aditya, et al.
Pubblicazione: (2024)
di: Kommineni, Aditya, et al.
Pubblicazione: (2024)
Deep Correlated Prompting for Visual Recognition with Missing Modalities
di: Hu, Lianyu, et al.
Pubblicazione: (2024)
di: Hu, Lianyu, et al.
Pubblicazione: (2024)
Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs
di: Tsaprazlis, Efthymios, et al.
Pubblicazione: (2026)
di: Tsaprazlis, Efthymios, et al.
Pubblicazione: (2026)
Synergistic Prompting for Robust Visual Recognition with Missing Modalities
di: Zhang, Zhihui, et al.
Pubblicazione: (2025)
di: Zhang, Zhihui, et al.
Pubblicazione: (2025)
Multi-modal Learning with Missing Modality via Shared-Specific Feature Modelling
di: Wang, Hu, et al.
Pubblicazione: (2023)
di: Wang, Hu, et al.
Pubblicazione: (2023)
LVLM-empowered Multi-modal Representation Learning for Visual Place Recognition
di: Wang, Teng, et al.
Pubblicazione: (2024)
di: Wang, Teng, et al.
Pubblicazione: (2024)
SimMLM: A Simple Framework for Multi-modal Learning with Missing Modality
di: Li, Sijie, et al.
Pubblicazione: (2025)
di: Li, Sijie, et al.
Pubblicazione: (2025)
Learnable Cross-modal Knowledge Distillation for Multi-modal Learning with Missing Modality
di: Wang, Hu, et al.
Pubblicazione: (2023)
di: Wang, Hu, et al.
Pubblicazione: (2023)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
Efficient Large Multi-modal Models via Visual Context Compression
di: Chen, Jieneng, et al.
Pubblicazione: (2024)
di: Chen, Jieneng, et al.
Pubblicazione: (2024)
Learning Sequence Descriptor based on Spatio-Temporal Attention for Visual Place Recognition
di: Zhao, Junqiao, et al.
Pubblicazione: (2023)
di: Zhao, Junqiao, et al.
Pubblicazione: (2023)
Multi-modal Learning with Missing Modality in Predicting Axillary Lymph Node Metastasis
di: Zhang, Shichuan, et al.
Pubblicazione: (2024)
di: Zhang, Shichuan, et al.
Pubblicazione: (2024)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
di: Liu, Xuyang, et al.
Pubblicazione: (2023)
di: Liu, Xuyang, et al.
Pubblicazione: (2023)
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models
di: Dong, Sibo, et al.
Pubblicazione: (2025)
di: Dong, Sibo, et al.
Pubblicazione: (2025)
MSSPlace: Multi-Sensor Place Recognition with Visual and Text Semantics
di: Melekhin, Alexander, et al.
Pubblicazione: (2024)
di: Melekhin, Alexander, et al.
Pubblicazione: (2024)
Multi-Teacher Knowledge Distillation with Reinforcement Learning for Visual Recognition
di: Yang, Chuanguang, et al.
Pubblicazione: (2025)
di: Yang, Chuanguang, et al.
Pubblicazione: (2025)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
di: Li, Xuchen, et al.
Pubblicazione: (2024)
di: Li, Xuchen, et al.
Pubblicazione: (2024)
Sequential Visual and Semantic Consistency for Semi-supervised Text Recognition
di: Yang, Mingkun, et al.
Pubblicazione: (2024)
di: Yang, Mingkun, et al.
Pubblicazione: (2024)
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
LSVG: Language-Guided Scene Graphs with 2D-Assisted Multi-Modal Encoding for 3D Visual Grounding
di: Xiao, Feng, et al.
Pubblicazione: (2025)
di: Xiao, Feng, et al.
Pubblicazione: (2025)
Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
di: Park, Kyu Ri, et al.
Pubblicazione: (2024)
di: Park, Kyu Ri, et al.
Pubblicazione: (2024)
Text-Region Matching for Multi-Label Image Recognition with Missing Labels
di: Ma, Leilei, et al.
Pubblicazione: (2024)
di: Ma, Leilei, et al.
Pubblicazione: (2024)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
di: Ma, Lichen, et al.
Pubblicazione: (2024)
di: Ma, Lichen, et al.
Pubblicazione: (2024)
Visual Object Tracking on Multi-modal RGB-D Videos: A Review
di: Zhu, Xue-Feng, et al.
Pubblicazione: (2022)
di: Zhu, Xue-Feng, et al.
Pubblicazione: (2022)
ToFu: Visual Tokens Reduction via Fusion for Multi-modal, Multi-patch, Multi-image Task
di: Pippi, Vittorio, et al.
Pubblicazione: (2025)
di: Pippi, Vittorio, et al.
Pubblicazione: (2025)
Adaptive Perception for Unified Visual Multi-modal Object Tracking
di: Hu, Xiantao, et al.
Pubblicazione: (2025)
di: Hu, Xiantao, et al.
Pubblicazione: (2025)
M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning
di: Yang, Bangji, et al.
Pubblicazione: (2026)
di: Yang, Bangji, et al.
Pubblicazione: (2026)
Multi-modal Contrastive Learning for Tumor-specific Missing Modality Synthesis
di: Lim, Minjoo, et al.
Pubblicazione: (2025)
di: Lim, Minjoo, et al.
Pubblicazione: (2025)
FusionSAM: Visual Multi-Modal Learning with Segment Anything
di: Li, Daixun, et al.
Pubblicazione: (2024)
di: Li, Daixun, et al.
Pubblicazione: (2024)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
di: Guo, Zirun, et al.
Pubblicazione: (2024)
di: Guo, Zirun, et al.
Pubblicazione: (2024)
Learning Semantic-Aware Representation in Visual-Language Models for Multi-Label Recognition with Partial Labels
di: Ruan, Haoxian, et al.
Pubblicazione: (2024)
di: Ruan, Haoxian, et al.
Pubblicazione: (2024)
Detail-Enhanced Intra- and Inter-modal Interaction for Audio-Visual Emotion Recognition
di: Shi, Tong, et al.
Pubblicazione: (2024)
di: Shi, Tong, et al.
Pubblicazione: (2024)
Meta-Learned Modality-Weighted Knowledge Distillation for Robust Multi-Modal Learning with Missing Data
di: Wang, Hu, et al.
Pubblicazione: (2024)
di: Wang, Hu, et al.
Pubblicazione: (2024)
CricaVPR: Cross-image Correlation-aware Representation Learning for Visual Place Recognition
di: Lu, Feng, et al.
Pubblicazione: (2024)
di: Lu, Feng, et al.
Pubblicazione: (2024)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Visual Grounding with Multi-modal Conditional Adaptation
di: Yao, Ruilin, et al.
Pubblicazione: (2024)
di: Yao, Ruilin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition
di: Zhao, Shu, et al.
Pubblicazione: (2025) -
Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models
di: Tsaprazlis, Efthymios, et al.
Pubblicazione: (2025) -
Towards Child-Inclusive Clinical Video Understanding for Autism Spectrum Disorder
di: Kommineni, Aditya, et al.
Pubblicazione: (2024) -
Deep Correlated Prompting for Visual Recognition with Missing Modalities
di: Hu, Lianyu, et al.
Pubblicazione: (2024) -
Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs
di: Tsaprazlis, Efthymios, et al.
Pubblicazione: (2026)