Prototype-Enhanced Confidence Modeling for Cross-Modal Medical Image-Report Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gowda, Shreyank N, Jin, Xiaobo, Wagner, Christian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reimagining Reality: A Comprehensive Survey of Video Inpainting Techniques
par: Gowda, Shreyank N, et autres
Publié: (2024)
par: Gowda, Shreyank N, et autres
Publié: (2024)
CC-SAM: SAM with Cross-feature Attention and Context for Ultrasound Image Segmentation
par: Gowda, Shreyank N, et autres
Publié: (2024)
par: Gowda, Shreyank N, et autres
Publié: (2024)
Is Temporal Prompting All We Need For Limited Labeled Action Recognition?
par: Gowda, Shreyank N, et autres
Publié: (2025)
par: Gowda, Shreyank N, et autres
Publié: (2025)
Masks and Manuscripts: Advancing Medical Pre-training with End-to-End Masking and Narrative Structuring
par: Gowda, Shreyank N, et autres
Publié: (2024)
par: Gowda, Shreyank N, et autres
Publié: (2024)
Distribution-Based Masked Medical Vision-Language Model Using Structured Reports
par: Gowda, Shreyank N, et autres
Publié: (2025)
par: Gowda, Shreyank N, et autres
Publié: (2025)
Interpretable Zero-shot Learning with Infinite Class Concepts
par: Ye, Zihan, et autres
Publié: (2025)
par: Ye, Zihan, et autres
Publié: (2025)
FE-Adapter: Adapting Image-based Emotion Classifiers to Videos
par: Gowda, Shreyank N, et autres
Publié: (2024)
par: Gowda, Shreyank N, et autres
Publié: (2024)
Telling Stories for Common Sense Zero-Shot Action Recognition
par: Gowda, Shreyank N, et autres
Publié: (2023)
par: Gowda, Shreyank N, et autres
Publié: (2023)
Watt For What: Rethinking Deep Learning's Energy-Performance Relationship
par: Gowda, Shreyank N, et autres
Publié: (2023)
par: Gowda, Shreyank N, et autres
Publié: (2023)
Bridging the Projection Gap: Overcoming Projection Bias Through Parameterized Distance Learning
par: Zhang, Chong, et autres
Publié: (2023)
par: Zhang, Chong, et autres
Publié: (2023)
Twin Trigger Generative Networks for Backdoor Attacks against Object Detection
par: Li, Zhiying, et autres
Publié: (2024)
par: Li, Zhiying, et autres
Publié: (2024)
Continual Learning Improves Zero-Shot Action Recognition
par: Gowda, Shreyank N, et autres
Publié: (2024)
par: Gowda, Shreyank N, et autres
Publié: (2024)
Performance is not All You Need: Sustainability Considerations for Algorithms
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
ZeroDiff: Solidified Visual-Semantic Correlation in Zero-Shot Learning
par: Ye, Zihan, et autres
Publié: (2024)
par: Ye, Zihan, et autres
Publié: (2024)
Adaptive Data Dropout: Towards Self-Regulated Learning in Deep Neural Networks
par: Gahir, Amar, et autres
Publié: (2026)
par: Gahir, Amar, et autres
Publié: (2026)
Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters
par: Mustafa, Ahmed B, et autres
Publié: (2026)
par: Mustafa, Ahmed B, et autres
Publié: (2026)
Adversarial Augmentation Training Makes Action Recognition Models More Robust to Realistic Video Distribution Shifts
par: Kim, Kiyoon, et autres
Publié: (2024)
par: Kim, Kiyoon, et autres
Publié: (2024)
Compression as an Adversarial Amplifier Through Decision Space Reduction
par: Evans, Lewis, et autres
Publié: (2026)
par: Evans, Lewis, et autres
Publié: (2026)
ZeroDiff++: Substantial Unseen Visual-semantic Correlation in Zero-shot Learning
par: Ye, Zihan, et autres
Publié: (2026)
par: Ye, Zihan, et autres
Publié: (2026)
Enhancing Cross-Modal Medical Image Segmentation through Compositionality
par: Eijpe, Aniek, et autres
Publié: (2024)
par: Eijpe, Aniek, et autres
Publié: (2024)
Masked Contrastive Reconstruction for Cross-modal Medical Image-Report Retrieval
par: Wei, Zeqiang, et autres
Publié: (2023)
par: Wei, Zeqiang, et autres
Publié: (2023)
Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval
par: Fragomeni, Adriano, et autres
Publié: (2025)
par: Fragomeni, Adriano, et autres
Publié: (2025)
Anyone Can Jailbreak: Prompt-Based Attacks on LLMs and T2Is
par: Mustafa, Ahmed B, et autres
Publié: (2025)
par: Mustafa, Ahmed B, et autres
Publié: (2025)
Adversarial Robustness in Zero-Shot Learning:An Empirical Study on Class and Concept-Level Vulnerabilities
par: Peng, Zhiyuan, et autres
Publié: (2025)
par: Peng, Zhiyuan, et autres
Publié: (2025)
CPCL: Cross-Modal Prototypical Contrastive Learning for Weakly Supervised Text-based Person Retrieval
par: Zhao, Xinpeng, et autres
Publié: (2024)
par: Zhao, Xinpeng, et autres
Publié: (2024)
Unsupervised Cross-Domain Image Retrieval via Prototypical Optimal Transport
par: Li, Bin, et autres
Publié: (2024)
par: Li, Bin, et autres
Publié: (2024)
Cross-Modal Causal Intervention for Medical Report Generation
par: Chen, Weixing, et autres
Publié: (2023)
par: Chen, Weixing, et autres
Publié: (2023)
PRIOR: Prototype Representation Joint Learning from Medical Images and Reports
par: Cheng, Pujin, et autres
Publié: (2023)
par: Cheng, Pujin, et autres
Publié: (2023)
SECOS: Semantic Capture for Rigorous Classification in Open-World Semi-Supervised Learning
par: Liu, Hezhao, et autres
Publié: (2026)
par: Liu, Hezhao, et autres
Publié: (2026)
Geometry-aware Prototype Learning for Cross-domain Few-shot Medical Image Segmentation
par: Song, Feifan, et autres
Publié: (2026)
par: Song, Feifan, et autres
Publié: (2026)
Double Banking on Knowledge: Customized Modulation and Prototypes for Multi-Modality Semi-supervised Medical Image Segmentation
par: Chen, Yingyu, et autres
Publié: (2024)
par: Chen, Yingyu, et autres
Publié: (2024)
Cross-Modal Clustering-Guided Negative Sampling for Self-Supervised Joint Learning from Medical Images and Reports
par: Lan, Libin, et autres
Publié: (2025)
par: Lan, Libin, et autres
Publié: (2025)
CAPT: Class-Aware Prompt Tuning for Federated Long-Tailed Learning with Vision-Language Model
par: Hou, Shihao, et autres
Publié: (2025)
par: Hou, Shihao, et autres
Publié: (2025)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
par: Huang, Hailang, et autres
Publié: (2024)
par: Huang, Hailang, et autres
Publié: (2024)
Cross-Modal Conditioned Reconstruction for Language-guided Medical Image Segmentation
par: Huang, Xiaoshuang, et autres
Publié: (2024)
par: Huang, Xiaoshuang, et autres
Publié: (2024)
Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation
par: Csizmadia, Daniel, et autres
Publié: (2025)
par: Csizmadia, Daniel, et autres
Publié: (2025)
Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval
par: Zhang, Guosheng, et autres
Publié: (2026)
par: Zhang, Guosheng, et autres
Publié: (2026)
Image Translation-Based Unsupervised Cross-Modality Domain Adaptation for Medical Image Segmentation
par: Yang, Tao, et autres
Publié: (2025)
par: Yang, Tao, et autres
Publié: (2025)
Prototype-based Aleatoric Uncertainty Quantification for Cross-modal Retrieval
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
Principles of Visual Tokens for Efficient Video Understanding
par: Hao, Xinyue, et autres
Publié: (2024)
par: Hao, Xinyue, et autres
Publié: (2024)
Documents similaires
-
Reimagining Reality: A Comprehensive Survey of Video Inpainting Techniques
par: Gowda, Shreyank N, et autres
Publié: (2024) -
CC-SAM: SAM with Cross-feature Attention and Context for Ultrasound Image Segmentation
par: Gowda, Shreyank N, et autres
Publié: (2024) -
Is Temporal Prompting All We Need For Limited Labeled Action Recognition?
par: Gowda, Shreyank N, et autres
Publié: (2025) -
Masks and Manuscripts: Advancing Medical Pre-training with End-to-End Masking and Narrative Structuring
par: Gowda, Shreyank N, et autres
Publié: (2024) -
Distribution-Based Masked Medical Vision-Language Model Using Structured Reports
par: Gowda, Shreyank N, et autres
Publié: (2025)