Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lian, Chenyu, Zhou, Hong-Yu, Liang, Dongyun, Qin, Jing, Wang, Liansheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evidential Reasoning Advances Interpretable Real-World Disease Screening
por: Lian, Chenyu, et al.
Publicado: (2026)
por: Lian, Chenyu, et al.
Publicado: (2026)
Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation Models
por: Lian, Chenyu, et al.
Publicado: (2024)
por: Lian, Chenyu, et al.
Publicado: (2024)
BenchReAD: A systematic benchmark for retinal anomaly detection
por: Lian, Chenyu, et al.
Publicado: (2025)
por: Lian, Chenyu, et al.
Publicado: (2025)
Concept-Guided Noisy Negative Suppression for Zero-Shot Classification and Grounding of Chest X-Ray Findings
por: Lian, Chenyu, et al.
Publicado: (2026)
por: Lian, Chenyu, et al.
Publicado: (2026)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
por: Lin, Zichuan, et al.
Publicado: (2025)
por: Lin, Zichuan, et al.
Publicado: (2025)
Adapting Vision-Language Models Without Labels: A Comprehensive Survey
por: Dong, Hao, et al.
Publicado: (2025)
por: Dong, Hao, et al.
Publicado: (2025)
Adapting Vision-Language Models for Evaluating World Models
por: Hendriksen, Mariya, et al.
Publicado: (2025)
por: Hendriksen, Mariya, et al.
Publicado: (2025)
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
FastVLM: Efficient Vision Encoding for Vision Language Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
Improvise, Adapt, Overcome -- Telescopic Adapters for Efficient Fine-tuning of Vision Language Models in Medical Imaging
por: Mishra, Ujjwal, et al.
Publicado: (2025)
por: Mishra, Ujjwal, et al.
Publicado: (2025)
Look Through Masks: Towards Masked Face Recognition with De-Occlusion Distillation
por: Li, Chenyu, et al.
Publicado: (2024)
por: Li, Chenyu, et al.
Publicado: (2024)
Freeze the backbones: A Parameter-Efficient Contrastive Approach to Robust Medical Vision-Language Pre-training
por: Qin, Jiuming, et al.
Publicado: (2024)
por: Qin, Jiuming, et al.
Publicado: (2024)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
por: Li, YuQian, et al.
Publicado: (2025)
por: Li, YuQian, et al.
Publicado: (2025)
Visual Modality Prompt for Adapting Vision-Language Object Detectors
por: Medeiros, Heitor R., et al.
Publicado: (2024)
por: Medeiros, Heitor R., et al.
Publicado: (2024)
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
por: Gu, Difei, et al.
Publicado: (2025)
por: Gu, Difei, et al.
Publicado: (2025)
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
por: Xie, Chunyu, et al.
Publicado: (2025)
por: Xie, Chunyu, et al.
Publicado: (2025)
Jailbreaking Vision-Language Models Through the Visual Modality
por: Azulay, Aharon, et al.
Publicado: (2026)
por: Azulay, Aharon, et al.
Publicado: (2026)
Enhancing Medical Large Vision-Language Models via Alignment Distillation
por: Chang, Aofei, et al.
Publicado: (2025)
por: Chang, Aofei, et al.
Publicado: (2025)
RadAlign: Advancing Radiology Report Generation with Vision-Language Concept Alignment
por: Gu, Difei, et al.
Publicado: (2025)
por: Gu, Difei, et al.
Publicado: (2025)
Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction
por: Filvantorkaman, Melika, et al.
Publicado: (2026)
por: Filvantorkaman, Melika, et al.
Publicado: (2026)
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models
por: He, Yuting, et al.
Publicado: (2026)
por: He, Yuting, et al.
Publicado: (2026)
Efficient Few-Shot Learning in Remote Sensing: Fusing Vision and Vision-Language Models
por: Chua, Jia Yun, et al.
Publicado: (2025)
por: Chua, Jia Yun, et al.
Publicado: (2025)
Topological Alignment of Shared Vision-Language Embedding Space
por: You, Junwon, et al.
Publicado: (2025)
por: You, Junwon, et al.
Publicado: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting
por: Maqbool, Danyal, et al.
Publicado: (2025)
por: Maqbool, Danyal, et al.
Publicado: (2025)
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
por: Zhou, Yucheng, et al.
Publicado: (2025)
por: Zhou, Yucheng, et al.
Publicado: (2025)
A Survey on Efficient Vision-Language-Action Models
por: Yu, Zhaoshu, et al.
Publicado: (2025)
por: Yu, Zhaoshu, et al.
Publicado: (2025)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
por: Yang, Senqiao, et al.
Publicado: (2025)
por: Yang, Senqiao, et al.
Publicado: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
por: Hu, Yuanze, et al.
Publicado: (2025)
por: Hu, Yuanze, et al.
Publicado: (2025)
MirrorCheck: Efficient Adversarial Defense for Vision-Language Models
por: Fares, Samar, et al.
Publicado: (2024)
por: Fares, Samar, et al.
Publicado: (2024)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
por: Cao, Shengcao, et al.
Publicado: (2025)
por: Cao, Shengcao, et al.
Publicado: (2025)
Adapting Vision-Language Models for E-commerce Understanding at Scale
por: Nulli, Matteo, et al.
Publicado: (2026)
por: Nulli, Matteo, et al.
Publicado: (2026)
Distilling Out-of-Distribution Robustness from Vision-Language Foundation Models
por: Zhou, Andy, et al.
Publicado: (2023)
por: Zhou, Andy, et al.
Publicado: (2023)
Skill-Conditioned Visual Geolocation for Vision-Language Models
por: Yang, Chenjie, et al.
Publicado: (2026)
por: Yang, Chenjie, et al.
Publicado: (2026)
Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping
por: Zhan, Xuhui, et al.
Publicado: (2025)
por: Zhan, Xuhui, et al.
Publicado: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
por: Jiang, Jiachen, et al.
Publicado: (2025)
por: Jiang, Jiachen, et al.
Publicado: (2025)
To Trust Or Not To Trust Your Vision-Language Model's Prediction
por: Dong, Hao, et al.
Publicado: (2025)
por: Dong, Hao, et al.
Publicado: (2025)
Ejemplares similares
-
Evidential Reasoning Advances Interpretable Real-World Disease Screening
por: Lian, Chenyu, et al.
Publicado: (2026) -
Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation Models
por: Lian, Chenyu, et al.
Publicado: (2024) -
BenchReAD: A systematic benchmark for retinal anomaly detection
por: Lian, Chenyu, et al.
Publicado: (2025) -
Concept-Guided Noisy Negative Suppression for Zero-Shot Classification and Grounding of Chest X-Ray Findings
por: Lian, Chenyu, et al.
Publicado: (2026) -
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
por: Lin, Zichuan, et al.
Publicado: (2025)