Does medical specialization of VLMs enhance discriminative power?: A comprehensive investigation through feature distribution analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Takeda, Keita, Sakai, Tomoya |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A comprehensive survey on deep active learning in medical image analysis
par: Wang, Haoran, et autres
Publié: (2023)
par: Wang, Haoran, et autres
Publié: (2023)
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
par: Li, Haoyuan, et autres
Publié: (2025)
par: Li, Haoyuan, et autres
Publié: (2025)
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
par: Jeddi, Ahmadreza, et autres
Publié: (2026)
par: Jeddi, Ahmadreza, et autres
Publié: (2026)
Coded-E2LF: Coded Aperture Light Field Imaging from Events
par: Tsuchida, Tomoya, et autres
Publié: (2026)
par: Tsuchida, Tomoya, et autres
Publié: (2026)
Trustworthy Few-Shot Transfer of Medical VLMs through Split Conformal Prediction
par: Silva-Rodríguez, Julio, et autres
Publié: (2025)
par: Silva-Rodríguez, Julio, et autres
Publié: (2025)
SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks
par: Song, Zijian, et autres
Publié: (2025)
par: Song, Zijian, et autres
Publié: (2025)
Animalbooth: multimodal feature enhancement for animal subject personalization
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
From Filters to VLMs: Benchmarking Defogging Methods through Object Detection and Segmentation Performance
par: Aryashad, Ardalan, et autres
Publié: (2025)
par: Aryashad, Ardalan, et autres
Publié: (2025)
A comprehensive Persian offline handwritten database for investigating the effects of heritability and family relationships on handwriting
par: Zohrevand, Abbas, et autres
Publié: (2025)
par: Zohrevand, Abbas, et autres
Publié: (2025)
Deep Pre-Alignment for VLMs
par: Yu, Tianyu, et autres
Publié: (2026)
par: Yu, Tianyu, et autres
Publié: (2026)
PyCellMech: A shape-based feature extraction pipeline for use in medical and biological studies
par: Arslan, Janan, et autres
Publié: (2024)
par: Arslan, Janan, et autres
Publié: (2024)
Are VLMs Really Blind
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
Preserving Localized Patch Semantics in VLMs
par: Esmaeilkhani, Parsa, et autres
Publié: (2026)
par: Esmaeilkhani, Parsa, et autres
Publié: (2026)
A Convex formulation for linear discriminant analysis
par: Surineela, Sai Vijay Kumar, et autres
Publié: (2025)
par: Surineela, Sai Vijay Kumar, et autres
Publié: (2025)
Regression in EO: Are VLMs Up to the Challenge?
par: Xue, Xizhe, et autres
Publié: (2025)
par: Xue, Xizhe, et autres
Publié: (2025)
Performance uncertainty in medical image analysis: a large-scale investigation of confidence intervals
par: André, Pascaline, et autres
Publié: (2026)
par: André, Pascaline, et autres
Publié: (2026)
Multimodal Event Detection: Current Approaches and Defining the New Playground through LLMs and VLMs
par: Dey, Abhishek, et autres
Publié: (2025)
par: Dey, Abhishek, et autres
Publié: (2025)
Joint-octamamba:an octa joint segmentation network based on feature enhanced mamba
par: Liu, Chuang, et autres
Publié: (2025)
par: Liu, Chuang, et autres
Publié: (2025)
Robust feature knowledge distillation for enhanced performance of lightweight crack segmentation models
par: Chen, Zhaohui, et autres
Publié: (2024)
par: Chen, Zhaohui, et autres
Publié: (2024)
When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance
par: Cao, Jinjin, et autres
Publié: (2025)
par: Cao, Jinjin, et autres
Publié: (2025)
Counting to Four is still a Chore for VLMs
par: Anh, Duy Le Dinh, et autres
Publié: (2026)
par: Anh, Duy Le Dinh, et autres
Publié: (2026)
Unlocking Dense Metric Depth Estimation in VLMs
par: Yu, Hanxun, et autres
Publié: (2026)
par: Yu, Hanxun, et autres
Publié: (2026)
CLGRPO: Reasoning Ability Enhancement for Small VLMs
par: Wang, Fanyi, et autres
Publié: (2025)
par: Wang, Fanyi, et autres
Publié: (2025)
Generate, Transduct, Adapt: Iterative Transduction with VLMs
par: Saha, Oindrila, et autres
Publié: (2025)
par: Saha, Oindrila, et autres
Publié: (2025)
Clapper: Compact Learning and Video Representation in VLMs
par: Kong, Lingyu, et autres
Publié: (2025)
par: Kong, Lingyu, et autres
Publié: (2025)
Image Recognition with Vision and Language Embeddings of VLMs
par: Volkov, Illia, et autres
Publié: (2025)
par: Volkov, Illia, et autres
Publié: (2025)
Should VLMs be Pre-trained with Image Data?
par: Keh, Sedrick, et autres
Publié: (2025)
par: Keh, Sedrick, et autres
Publié: (2025)
DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs
par: Pan, Jiazhen, et autres
Publié: (2026)
par: Pan, Jiazhen, et autres
Publié: (2026)
DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving
par: Vo, Hao, et autres
Publié: (2026)
par: Vo, Hao, et autres
Publié: (2026)
PaliGemma 2: A Family of Versatile VLMs for Transfer
par: Steiner, Andreas, et autres
Publié: (2024)
par: Steiner, Andreas, et autres
Publié: (2024)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
A comprehensive and easy-to-use multi-domain multi-task medical imaging meta-dataset
par: Woerner, Stefano, et autres
Publié: (2024)
par: Woerner, Stefano, et autres
Publié: (2024)
GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs
par: Mantini, Pranav, et autres
Publié: (2026)
par: Mantini, Pranav, et autres
Publié: (2026)
ComiCap: A VLMs pipeline for dense captioning of Comic Panels
par: Vivoli, Emanuele, et autres
Publié: (2024)
par: Vivoli, Emanuele, et autres
Publié: (2024)
The Power of One: A Single Example is All it Takes for Segmentation in VLMs
par: Hossain, Mir Rayat Imtiaz, et autres
Publié: (2025)
par: Hossain, Mir Rayat Imtiaz, et autres
Publié: (2025)
Gaze-Regularized VLMs for Ego-Centric Behavior Understanding
par: Pani, Anupam, et autres
Publié: (2026)
par: Pani, Anupam, et autres
Publié: (2026)
Linear Scaling Video VLMs for Long Video Understanding
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
par: Dong, Sixun, et autres
Publié: (2025)
par: Dong, Sixun, et autres
Publié: (2025)
How Auxiliary Reasoning Unleashes GUI Grounding in VLMs
par: Li, Weiming, et autres
Publié: (2025)
par: Li, Weiming, et autres
Publié: (2025)
VLMs Guided Interpretable Decision Making for Autonomous Driving
par: Hu, Xin, et autres
Publié: (2025)
par: Hu, Xin, et autres
Publié: (2025)
Documents similaires
-
A comprehensive survey on deep active learning in medical image analysis
par: Wang, Haoran, et autres
Publié: (2023) -
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
par: Li, Haoyuan, et autres
Publié: (2025) -
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
par: Jeddi, Ahmadreza, et autres
Publié: (2026) -
Coded-E2LF: Coded Aperture Light Field Imaging from Events
par: Tsuchida, Tomoya, et autres
Publié: (2026) -
Trustworthy Few-Shot Transfer of Medical VLMs through Split Conformal Prediction
par: Silva-Rodríguez, Julio, et autres
Publié: (2025)