Transformers in Medicine: Improving Vision-Language Alignment for Medical Image Captioning
Fuente:
arXiv
Saved in:
| Main Authors: | Suresh, Yogesh Thakku, Hogale, Vishwajeet Shivaji, Zamfira, Luca-Alexandru, Hegde, Anandavardhana |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Denoising Method to Improve The Resolution of Satellite Images
by: Hegde, Jhanavi
Published: (2024)
by: Hegde, Jhanavi
Published: (2024)
Improving Food Image Recognition with Noisy Vision Transformer
by: Ghosh, Tonmoy, et al.
Published: (2025)
by: Ghosh, Tonmoy, et al.
Published: (2025)
GCS-M3VLT: Guided Context Self-Attention based Multi-modal Medical Vision Language Transformer for Retinal Image Captioning
by: Cherukuri, Teja Krishna, et al.
Published: (2024)
by: Cherukuri, Teja Krishna, et al.
Published: (2024)
HMT-UNet: A hybird Mamba-Transformer Vision UNet for Medical Image Segmentation
by: Zhang, Mingya, et al.
Published: (2024)
by: Zhang, Mingya, et al.
Published: (2024)
Vision-Language Controlled Deep Unfolding for Joint Medical Image Restoration and Segmentation
by: Chen, Ping, et al.
Published: (2026)
by: Chen, Ping, et al.
Published: (2026)
Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review
by: Lin, Haoneng, et al.
Published: (2025)
by: Lin, Haoneng, et al.
Published: (2025)
Diagnostic Accuracy of Open-Source Vision-Language Models on Diverse Medical Imaging Tasks
by: Müller-Franzes, Gustav, et al.
Published: (2025)
by: Müller-Franzes, Gustav, et al.
Published: (2025)
Dual-Alignment Knowledge Retention for Continual Medical Image Segmentation
by: Ye, Yuxin, et al.
Published: (2025)
by: Ye, Yuxin, et al.
Published: (2025)
Region Attention Transformer for Medical Image Restoration
by: Yang, Zhiwen, et al.
Published: (2024)
by: Yang, Zhiwen, et al.
Published: (2024)
AdaViT: Adaptive Vision Transformer for Flexible Pretrain and Finetune with Variable 3D Medical Image Modalities
by: Das, Badhan Kumar, et al.
Published: (2025)
by: Das, Badhan Kumar, et al.
Published: (2025)
3D-EffiViTCaps: 3D Efficient Vision Transformer with Capsule for Medical Image Segmentation
by: Gan, Dongwei, et al.
Published: (2024)
by: Gan, Dongwei, et al.
Published: (2024)
EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices
by: Li, Xin, et al.
Published: (2024)
by: Li, Xin, et al.
Published: (2024)
Complex Style Image Transformations for Domain Generalization in Medical Images
by: Spanos, Nikolaos, et al.
Published: (2024)
by: Spanos, Nikolaos, et al.
Published: (2024)
MedBLIP: Fine-tuning BLIP for Medical Image Captioning
by: Limbu, Manshi, et al.
Published: (2025)
by: Limbu, Manshi, et al.
Published: (2025)
Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis
by: Xin, Yu, et al.
Published: (2025)
by: Xin, Yu, et al.
Published: (2025)
VLSM-Ensemble: Ensembling CLIP-based Vision-Language Models for Enhanced Medical Image Segmentation
by: Dietlmeier, Julia, et al.
Published: (2025)
by: Dietlmeier, Julia, et al.
Published: (2025)
MedicoSAM: Robust Improvement of SAM for Medical Imaging
by: Archit, Anwai, et al.
Published: (2025)
by: Archit, Anwai, et al.
Published: (2025)
SPA: Efficient User-Preference Alignment against Uncertainty in Medical Image Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
Vision Foundation Models in Medical Image Analysis: Advances and Challenges
by: Liang, Pengchen, et al.
Published: (2025)
by: Liang, Pengchen, et al.
Published: (2025)
VM-DDPM: Vision Mamba Diffusion for Medical Image Synthesis
by: Ju, Zhihan, et al.
Published: (2024)
by: Ju, Zhihan, et al.
Published: (2024)
VM-UNet: Vision Mamba UNet for Medical Image Segmentation
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
Whitened CLIP as a Likelihood Surrogate of Images and Captions
by: Betser, Roy, et al.
Published: (2025)
by: Betser, Roy, et al.
Published: (2025)
The Solution for the CVPR2023 NICE Image Captioning Challenge
by: Wu, Xiangyu, et al.
Published: (2023)
by: Wu, Xiangyu, et al.
Published: (2023)
Medical Slice Transformer: Improved Diagnosis and Explainability on 3D Medical Images with DINOv2
by: Müller-Franzes, Gustav, et al.
Published: (2024)
by: Müller-Franzes, Gustav, et al.
Published: (2024)
AgileFormer: Spatially Agile Transformer UNet for Medical Image Segmentation
by: Qiu, Peijie, et al.
Published: (2024)
by: Qiu, Peijie, et al.
Published: (2024)
Med-TTT: Vision Test-Time Training model for Medical Image Segmentation
by: Xu, Jiashu
Published: (2024)
by: Xu, Jiashu
Published: (2024)
HC-Mamba: Vision MAMBA with Hybrid Convolutional Techniques for Medical Image Segmentation
by: Xu, Jiashu
Published: (2024)
by: Xu, Jiashu
Published: (2024)
Pixel Perfect MegaMed: A Megapixel-Scale Vision-Language Foundation Model for Generating High Resolution Medical Images
by: TehraniNasab, Zahra, et al.
Published: (2025)
by: TehraniNasab, Zahra, et al.
Published: (2025)
Aberration Correcting Vision Transformers for High-Fidelity Metalens Imaging
by: Lee, Byeonghyeon, et al.
Published: (2024)
by: Lee, Byeonghyeon, et al.
Published: (2024)
Stacked Cross-modal Feature Consolidation Attention Networks for Image Captioning
by: Pourkeshavarz, Mozhgan, et al.
Published: (2023)
by: Pourkeshavarz, Mozhgan, et al.
Published: (2023)
Advancing Automatic Photovoltaic Defect Detection using Semi-Supervised Semantic Segmentation of Electroluminescence Images
by: Jha, Abhishek, et al.
Published: (2024)
by: Jha, Abhishek, et al.
Published: (2024)
Investigating the Robustness of Vision Transformers against Label Noise in Medical Image Classification
by: Khanal, Bidur, et al.
Published: (2024)
by: Khanal, Bidur, et al.
Published: (2024)
Evaluating and Improving the Effectiveness of Synthetic Chest X-Rays for Medical Image Analysis
by: Prakash, Eva, et al.
Published: (2024)
by: Prakash, Eva, et al.
Published: (2024)
CSWin-UNet: Transformer UNet with Cross-Shaped Windows for Medical Image Segmentation
by: Liu, Xiao, et al.
Published: (2024)
by: Liu, Xiao, et al.
Published: (2024)
MR-Transformer: Vision Transformer for Total Knee Replacement Prediction Using Magnetic Resonance Imaging
by: Zhang, Chaojie, et al.
Published: (2024)
by: Zhang, Chaojie, et al.
Published: (2024)
VM-UNET-V2 Rethinking Vision Mamba UNet for Medical Image Segmentation
by: Zhang, Mingya, et al.
Published: (2024)
by: Zhang, Mingya, et al.
Published: (2024)
RWKV-UNet: Improving UNet with Long-Range Cooperation for Effective Medical Image Segmentation
by: Jiang, Juntao, et al.
Published: (2025)
by: Jiang, Juntao, et al.
Published: (2025)
Advancing Healthcare: Innovative ML Approaches for Improved Medical Imaging in Data-Constrained Environments
by: Amin, Al, et al.
Published: (2024)
by: Amin, Al, et al.
Published: (2024)
Keyed Nonlinear Transform: Lightweight Privacy-Enhancing Feature Sharing for Medical Image Analysis
by: Lee, Haebom, et al.
Published: (2026)
by: Lee, Haebom, et al.
Published: (2026)
TransUKAN:Computing-Efficient Hybrid KAN-Transformer for Enhanced Medical Image Segmentation
by: Wu, Yanlin, et al.
Published: (2024)
by: Wu, Yanlin, et al.
Published: (2024)
Similar Items
-
Efficient Denoising Method to Improve The Resolution of Satellite Images
by: Hegde, Jhanavi
Published: (2024) -
Improving Food Image Recognition with Noisy Vision Transformer
by: Ghosh, Tonmoy, et al.
Published: (2025) -
GCS-M3VLT: Guided Context Self-Attention based Multi-modal Medical Vision Language Transformer for Retinal Image Captioning
by: Cherukuri, Teja Krishna, et al.
Published: (2024) -
HMT-UNet: A hybird Mamba-Transformer Vision UNet for Medical Image Segmentation
by: Zhang, Mingya, et al.
Published: (2024) -
Vision-Language Controlled Deep Unfolding for Joint Medical Image Restoration and Segmentation
by: Chen, Ping, et al.
Published: (2026)