Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Yuting, You, Chenyu, Li, Shuo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Homeomorphism Prior for False Positive and Negative Problem in Medical Image Dense Contrastive Representation Learning
por: He, Yuting, et al.
Publicado: (2025)
por: He, Yuting, et al.
Publicado: (2025)
ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts
por: Choi, Sangbum, et al.
Publicado: (2025)
por: Choi, Sangbum, et al.
Publicado: (2025)
Adaptation of Multi-modal Representation Models for Multi-task Surgical Computer Vision
por: Walimbe, Soham, et al.
Publicado: (2025)
por: Walimbe, Soham, et al.
Publicado: (2025)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
Complementarity-driven Representation Learning for Multi-modal Knowledge Graph Completion
por: Li, Lijian
Publicado: (2025)
por: Li, Lijian
Publicado: (2025)
Vector Contrastive Learning For Pixel-Wise Pretraining In Medical Vision
por: He, Yuting, et al.
Publicado: (2025)
por: He, Yuting, et al.
Publicado: (2025)
Towards a Universal 3D Medical Multi-modality Generalization via Learning Personalized Invariant Representation
por: Tan, Zhaorui, et al.
Publicado: (2024)
por: Tan, Zhaorui, et al.
Publicado: (2024)
Exploring Efficient Foundational Multi-modal Models for Video Summarization
por: Samel, Karan, et al.
Publicado: (2024)
por: Samel, Karan, et al.
Publicado: (2024)
Multi-modal Relation Distillation for Unified 3D Representation Learning
por: Wang, Huiqun, et al.
Publicado: (2024)
por: Wang, Huiqun, et al.
Publicado: (2024)
Towards Scalable Foundation Model for Multi-modal and Hyperspectral Geospatial Data
por: Si, Haozhe, et al.
Publicado: (2025)
por: Si, Haozhe, et al.
Publicado: (2025)
Multi-modal Vision Pre-training for Medical Image Analysis
por: Rui, Shaohao, et al.
Publicado: (2024)
por: Rui, Shaohao, et al.
Publicado: (2024)
Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures
por: Yuan, Kun, et al.
Publicado: (2023)
por: Yuan, Kun, et al.
Publicado: (2023)
Advancing Stroke Risk Prediction Using a Multi-modal Foundation Model
por: Delgrange, Camille, et al.
Publicado: (2024)
por: Delgrange, Camille, et al.
Publicado: (2024)
Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation
por: Zhu, Chunzheng, et al.
Publicado: (2026)
por: Zhu, Chunzheng, et al.
Publicado: (2026)
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
por: Giulivi, Loris, et al.
Publicado: (2024)
por: Giulivi, Loris, et al.
Publicado: (2024)
Focus on Focus: Focus-oriented Representation Learning and Multi-view Cross-modal Alignment for Glioma Grading
por: Pan, Li, et al.
Publicado: (2024)
por: Pan, Li, et al.
Publicado: (2024)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
por: Lian, Chenyu, et al.
Publicado: (2025)
por: Lian, Chenyu, et al.
Publicado: (2025)
Beyond Boundaries: Leveraging Vision Foundation Models for Source-Free Object Detection
por: Yao, Huizai, et al.
Publicado: (2025)
por: Yao, Huizai, et al.
Publicado: (2025)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
por: Li, Yanwei, et al.
Publicado: (2024)
por: Li, Yanwei, et al.
Publicado: (2024)
Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke
por: Chen, Liren, et al.
Publicado: (2026)
por: Chen, Liren, et al.
Publicado: (2026)
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)
por: Yang, Xikai, et al.
Publicado: (2025)
M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding
por: Liu, Shenxi, et al.
Publicado: (2025)
por: Liu, Shenxi, et al.
Publicado: (2025)
LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance
por: Li, Zhang, et al.
Publicado: (2025)
por: Li, Zhang, et al.
Publicado: (2025)
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
por: Li, Nanxi, et al.
Publicado: (2026)
por: Li, Nanxi, et al.
Publicado: (2026)
CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
por: Cheng, Zihui, et al.
Publicado: (2024)
por: Cheng, Zihui, et al.
Publicado: (2024)
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
por: Ohi, Masanari, et al.
Publicado: (2024)
por: Ohi, Masanari, et al.
Publicado: (2024)
REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction
por: Leem, Seowung, et al.
Publicado: (2026)
por: Leem, Seowung, et al.
Publicado: (2026)
A World Model of Radiologist Reading for Medical Image Representation Learning
por: Li, Yiwei, et al.
Publicado: (2026)
por: Li, Yiwei, et al.
Publicado: (2026)
Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition
por: Baby, Britty, et al.
Publicado: (2025)
por: Baby, Britty, et al.
Publicado: (2025)
Img2Loc: Revisiting Image Geolocalization using Multi-modality Foundation Models and Image-based Retrieval-Augmented Generation
por: Zhou, Zhongliang, et al.
Publicado: (2024)
por: Zhou, Zhongliang, et al.
Publicado: (2024)
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
por: Pan, Chenbin, et al.
Publicado: (2025)
por: Pan, Chenbin, et al.
Publicado: (2025)
DCG ReID: Disentangling Collaboration and Guidance Fusion Representations for Multi-modal Vehicle Re-Identification
por: Zheng, Aihua, et al.
Publicado: (2026)
por: Zheng, Aihua, et al.
Publicado: (2026)
Skill-Conditioned Visual Geolocation for Vision-Language Models
por: Yang, Chenjie, et al.
Publicado: (2026)
por: Yang, Chenjie, et al.
Publicado: (2026)
Multi-modality Anomaly Segmentation on the Road
por: Gao, Heng, et al.
Publicado: (2025)
por: Gao, Heng, et al.
Publicado: (2025)
Multivariate Gaussian Representation Learning for Medical Action Evaluation
por: Yang, Luming, et al.
Publicado: (2025)
por: Yang, Luming, et al.
Publicado: (2025)
Emergent Open-Vocabulary Semantic Segmentation from Off-the-shelf Vision-Language Models
por: Luo, Jiayun, et al.
Publicado: (2023)
por: Luo, Jiayun, et al.
Publicado: (2023)
OmniRad: A Radiological Foundation Model for Multi-Task Medical Image Analysis
por: Zedda, Luca, et al.
Publicado: (2026)
por: Zedda, Luca, et al.
Publicado: (2026)
Unleashing Foundation Vision Models: Adaptive Transfer for Diverse Data-Limited Scientific Domains
por: Li, Qiankun, et al.
Publicado: (2025)
por: Li, Qiankun, et al.
Publicado: (2025)
Multimodal Medical Image Classification via Synergistic Learning Pre-training
por: Lin, Qinghua, et al.
Publicado: (2025)
por: Lin, Qinghua, et al.
Publicado: (2025)
Ejemplares similares
-
Homeomorphism Prior for False Positive and Negative Problem in Medical Image Dense Contrastive Representation Learning
por: He, Yuting, et al.
Publicado: (2025) -
ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts
por: Choi, Sangbum, et al.
Publicado: (2025) -
Adaptation of Multi-modal Representation Models for Multi-task Surgical Computer Vision
por: Walimbe, Soham, et al.
Publicado: (2025) -
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
por: Jang, Young Kyun, et al.
Publicado: (2024) -
Complementarity-driven Representation Learning for Multi-modal Knowledge Graph Completion
por: Li, Lijian
Publicado: (2025)