Bridging Modalities and Transferring Knowledge: Enhanced Multimodal Understanding and Recognition
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Radevski, Gorjan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Eff-GRot: Efficient and Generalizable Rotation Estimation with Transformers
par: Mathioulakis, Fanis, et autres
Publié: (2025)
par: Mathioulakis, Fanis, et autres
Publié: (2025)
DAVE: Diagnostic benchmark for Audio Visual Evaluation
par: Radevski, Gorjan, et autres
Publié: (2025)
par: Radevski, Gorjan, et autres
Publié: (2025)
Classifying Novel 3D-Printed Objects without Retraining: Towards Post-Production Automation in Additive Manufacturing
par: Mathioulakis, Fanis, et autres
Publié: (2026)
par: Mathioulakis, Fanis, et autres
Publié: (2026)
Multimodal Knowledge Distillation for Egocentric Action Recognition Robust to Missing Modalities
par: Santos-Villafranca, Maria, et autres
Publié: (2025)
par: Santos-Villafranca, Maria, et autres
Publié: (2025)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
par: Ma, Wenxuan, et autres
Publié: (2024)
par: Ma, Wenxuan, et autres
Publié: (2024)
Enhancing Zero-Shot Facial Expression Recognition by LLM Knowledge Transfer
par: Zhao, Zengqun, et autres
Publié: (2024)
par: Zhao, Zengqun, et autres
Publié: (2024)
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
par: Huang, Shunyu, et autres
Publié: (2026)
par: Huang, Shunyu, et autres
Publié: (2026)
Cross-Modality Gait Recognition: Bridging LiDAR and Camera Modalities for Human Identification
par: Wang, Rui, et autres
Publié: (2024)
par: Wang, Rui, et autres
Publié: (2024)
Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
par: Sun, Kaiser, et autres
Publié: (2026)
par: Sun, Kaiser, et autres
Publié: (2026)
Asymmetric Cross-Modal Knowledge Distillation: Bridging Modalities with Weak Semantic Consistency
par: Wei, Riling, et autres
Publié: (2025)
par: Wei, Riling, et autres
Publié: (2025)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
par: Chen, Boyu, et autres
Publié: (2024)
par: Chen, Boyu, et autres
Publié: (2024)
Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition
par: Do, Jeonghyeok, et autres
Publié: (2024)
par: Do, Jeonghyeok, et autres
Publié: (2024)
Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff)
par: Sanjyal, Ankit
Publié: (2026)
par: Sanjyal, Ankit
Publié: (2026)
Robust Brain Tumor Segmentation with Incomplete MRI Modalities Using Hölder Divergence and Mutual Information-Enhanced Knowledge Transfer
par: Cheng, Runze, et autres
Publié: (2025)
par: Cheng, Runze, et autres
Publié: (2025)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
par: Li, Jinyuan, et autres
Publié: (2024)
par: Li, Jinyuan, et autres
Publié: (2024)
Towards Robust and Realible Multimodal Misinformation Recognition with Incomplete Modality
par: Zhou, Hengyang, et autres
Publié: (2025)
par: Zhou, Hengyang, et autres
Publié: (2025)
Correlation-Decoupled Knowledge Distillation for Multimodal Sentiment Analysis with Incomplete Modalities
par: Li, Mingcheng, et autres
Publié: (2024)
par: Li, Mingcheng, et autres
Publié: (2024)
Multi Teacher Privileged Knowledge Distillation for Multimodal Expression Recognition
par: Aslam, Muhammad Haseeb, et autres
Publié: (2024)
par: Aslam, Muhammad Haseeb, et autres
Publié: (2024)
Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals
par: Wu, Te-Lin, et autres
Publié: (2021)
par: Wu, Te-Lin, et autres
Publié: (2021)
Bridging the Intent Gap: Knowledge-Enhanced Visual Generation
par: Cheng, Yi, et autres
Publié: (2024)
par: Cheng, Yi, et autres
Publié: (2024)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge
par: Hu, Juewen, et autres
Publié: (2025)
par: Hu, Juewen, et autres
Publié: (2025)
Semantic-Enhanced Cross-Modal Place Recognition for Robust Robot Localization
par: Lin, Yujia, et autres
Publié: (2025)
par: Lin, Yujia, et autres
Publié: (2025)
HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
par: Wang, Xiang, et autres
Publié: (2025)
par: Wang, Xiang, et autres
Publié: (2025)
Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition
par: Liu, Haijing, et autres
Publié: (2024)
par: Liu, Haijing, et autres
Publié: (2024)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
par: Li, Qifei, et autres
Publié: (2024)
par: Li, Qifei, et autres
Publié: (2024)
Bridging the Gap in Missing Modalities: Leveraging Knowledge Distillation and Style Matching for Brain Tumor Segmentation
par: Zhu, Shenghao, et autres
Publié: (2025)
par: Zhu, Shenghao, et autres
Publié: (2025)
VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
par: Jiang, Tianxiang, et autres
Publié: (2025)
par: Jiang, Tianxiang, et autres
Publié: (2025)
Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding
par: Zhang, Le, et autres
Publié: (2023)
par: Zhang, Le, et autres
Publié: (2023)
IMUGPT 2.0: Language-Based Cross Modality Transfer for Sensor-Based Human Activity Recognition
par: Leng, Zikang, et autres
Publié: (2024)
par: Leng, Zikang, et autres
Publié: (2024)
Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis
par: Samanta, Argha Kamal, et autres
Publié: (2025)
par: Samanta, Argha Kamal, et autres
Publié: (2025)
Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout
par: QI, Anbin, et autres
Publié: (2024)
par: QI, Anbin, et autres
Publié: (2024)
NocPlace: Nocturnal Visual Place Recognition via Generative and Inherited Knowledge Transfer
par: Liu, Bingxi, et autres
Publié: (2024)
par: Liu, Bingxi, et autres
Publié: (2024)
Knowledge-Enhanced Facial Expression Recognition with Emotional-to-Neutral Transformation
par: Li, Hangyu, et autres
Publié: (2024)
par: Li, Hangyu, et autres
Publié: (2024)
Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
Enhancing Knowledge Transfer in Hyperspectral Image Classification via Cross-scene Knowledge Integration
par: Huo, Lu, et autres
Publié: (2025)
par: Huo, Lu, et autres
Publié: (2025)
Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
par: Hu, Jinpeng, et autres
Publié: (2025)
par: Hu, Jinpeng, et autres
Publié: (2025)
Non-target Divergence Hypothesis: Toward Understanding Domain Gaps in Cross-Modal Knowledge Distillation
par: Chen, Yilong, et autres
Publié: (2024)
par: Chen, Yilong, et autres
Publié: (2024)
DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding
par: Patle, Shubham, et autres
Publié: (2026)
par: Patle, Shubham, et autres
Publié: (2026)
Documents similaires
-
Eff-GRot: Efficient and Generalizable Rotation Estimation with Transformers
par: Mathioulakis, Fanis, et autres
Publié: (2025) -
DAVE: Diagnostic benchmark for Audio Visual Evaluation
par: Radevski, Gorjan, et autres
Publié: (2025) -
Classifying Novel 3D-Printed Objects without Retraining: Towards Post-Production Automation in Additive Manufacturing
par: Mathioulakis, Fanis, et autres
Publié: (2026) -
Multimodal Knowledge Distillation for Egocentric Action Recognition Robust to Missing Modalities
par: Santos-Villafranca, Maria, et autres
Publié: (2025) -
Learning Modality Knowledge Alignment for Cross-Modality Transfer
par: Ma, Wenxuan, et autres
Publié: (2024)