Are Vision Transformer Representations Semantically Meaningful? A Case Study in Medical Imaging
Fuente:
arXiv
Guardado en:
| Autores principales: | Shams, Montasir, Islam, Chashi Mahiul, Salman, Shaeke, Tran, Phat, Liu, Xiuwen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Malicious Path Manipulations via Exploitation of Representation Vulnerabilities of Vision-Language Navigation Systems
por: Islam, Chashi Mahiul, et al.
Publicado: (2024)
por: Islam, Chashi Mahiul, et al.
Publicado: (2024)
Intriguing Equivalence Structures of the Embedding Space of Vision Transformers
por: Salman, Shaeke, et al.
Publicado: (2024)
por: Salman, Shaeke, et al.
Publicado: (2024)
Intriguing Differences Between Zero-Shot and Systematic Evaluations of Vision-Language Transformer Models
por: Salman, Shaeke, et al.
Publicado: (2024)
por: Salman, Shaeke, et al.
Publicado: (2024)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
por: Salman, Shaeke, et al.
Publicado: (2024)
por: Salman, Shaeke, et al.
Publicado: (2024)
Mechanistic Understandings of Representation Vulnerabilities and Engineering Robust Vision Transformers
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
Numerical Instability and Chaos: Quantifying the Unpredictability of Large Language Models
por: Islam, Chashi Mahiul, et al.
Publicado: (2026)
por: Islam, Chashi Mahiul, et al.
Publicado: (2026)
DeepSeek on a Trip: Inducing Targeted Visual Hallucinations via Representation Vulnerabilities
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
Spatial-ViLT: Enhancing Visual Spatial Reasoning through Multi-Task Learning
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
SegMaFormer: A Hybrid State-Space and Transformer Model for Efficient Segmentation
por: Nguyen, Duy D., et al.
Publicado: (2026)
por: Nguyen, Duy D., et al.
Publicado: (2026)
Representation Separation for Semantic Segmentation with Vision Transformers
por: Hong, Yuanduo, et al.
Publicado: (2022)
por: Hong, Yuanduo, et al.
Publicado: (2022)
Do Diffusion Models Learn Semantically Meaningful and Efficient Representations?
por: Liang, Qiyao, et al.
Publicado: (2024)
por: Liang, Qiyao, et al.
Publicado: (2024)
When Skills Don't Help: A Negative Result on Procedural Knowledge for Tool-Grounded Agents in Offensive Cybersecurity
por: Chacko, Samuel Jacob, et al.
Publicado: (2026)
por: Chacko, Samuel Jacob, et al.
Publicado: (2026)
Probing the Efficacy of Federated Parameter-Efficient Fine-Tuning of Vision Transformers for Medical Image Classification
por: Alkhunaizi, Naif, et al.
Publicado: (2024)
por: Alkhunaizi, Naif, et al.
Publicado: (2024)
MobileUNETR: A Lightweight End-To-End Hybrid Vision Transformer For Efficient Medical Image Segmentation
por: Perera, Shehan, et al.
Publicado: (2024)
por: Perera, Shehan, et al.
Publicado: (2024)
Ordinal Semantic Segmentation Applied to Medical and Odontological Images
por: Lima, Mariana Dória Prata, et al.
Publicado: (2026)
por: Lima, Mariana Dória Prata, et al.
Publicado: (2026)
WaveFormer: A 3D Transformer with Wavelet-Driven Feature Representation for Efficient Medical Image Segmentation
por: Hasan, Md Mahfuz Al, et al.
Publicado: (2025)
por: Hasan, Md Mahfuz Al, et al.
Publicado: (2025)
ViTs are Everywhere: A Comprehensive Study Showcasing Vision Transformers in Different Domain
por: Mia, Md Sohag, et al.
Publicado: (2023)
por: Mia, Md Sohag, et al.
Publicado: (2023)
Generalized Single-Image-Based Morphing Attack Detection Using Deep Representations from Vision Transformer
por: Zhang, Haoyu, et al.
Publicado: (2025)
por: Zhang, Haoyu, et al.
Publicado: (2025)
LGCA: Enhancing Semantic Representation via Progressive Expansion
por: Cao, Thanh Hieu, et al.
Publicado: (2025)
por: Cao, Thanh Hieu, et al.
Publicado: (2025)
A World Model of Radiologist Reading for Medical Image Representation Learning
por: Li, Yiwei, et al.
Publicado: (2026)
por: Li, Yiwei, et al.
Publicado: (2026)
Sensitive Image Classification by Vision Transformers
por: He, Hanxian, et al.
Publicado: (2024)
por: He, Hanxian, et al.
Publicado: (2024)
Vision Transformer-Conditioned UNet for Domain-Adaptive Semantic Segmentation
por: Ortega, Joel Valdivia, et al.
Publicado: (2026)
por: Ortega, Joel Valdivia, et al.
Publicado: (2026)
Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models
por: He, Yuting, et al.
Publicado: (2026)
por: He, Yuting, et al.
Publicado: (2026)
Case-Enhanced Vision Transformer: Improving Explanations of Image Similarity with a ViT-based Similarity Metric
por: Zhao, Ziwei, et al.
Publicado: (2024)
por: Zhao, Ziwei, et al.
Publicado: (2024)
Vision Transformers for Zero-Shot Clustering of Animal Images: A Comparative Benchmarking Study
por: Markoff, Hugo, et al.
Publicado: (2026)
por: Markoff, Hugo, et al.
Publicado: (2026)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
por: Hu, Youbing, et al.
Publicado: (2025)
por: Hu, Youbing, et al.
Publicado: (2025)
A 2D Semantic-Aware Position Encoding for Vision Transformers
por: Chen, Xi, et al.
Publicado: (2025)
por: Chen, Xi, et al.
Publicado: (2025)
DCMM-Transformer: Degree-Corrected Mixed-Membership Attention for Medical Imaging
por: Cheng, Huimin, et al.
Publicado: (2025)
por: Cheng, Huimin, et al.
Publicado: (2025)
How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images
por: Liu, Guimeng, et al.
Publicado: (2026)
por: Liu, Guimeng, et al.
Publicado: (2026)
A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction
por: Chen, Yongfan, et al.
Publicado: (2025)
por: Chen, Yongfan, et al.
Publicado: (2025)
Diffusion Model in Latent Space for Medical Image Segmentation Task
por: Ngoc, Huynh Trinh, et al.
Publicado: (2025)
por: Ngoc, Huynh Trinh, et al.
Publicado: (2025)
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation
por: Fan, Zehua, et al.
Publicado: (2026)
por: Fan, Zehua, et al.
Publicado: (2026)
Intersectional Fairness in Vision-Language Models for Medical Image Disease Classification
por: Zhang, Yupeng, et al.
Publicado: (2025)
por: Zhang, Yupeng, et al.
Publicado: (2025)
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)
por: Yang, Xikai, et al.
Publicado: (2025)
Exploring Intrinsic Properties of Medical Images for Self-Supervised Binary Semantic Segmentation
por: Singh, Pranav, et al.
Publicado: (2024)
por: Singh, Pranav, et al.
Publicado: (2024)
Transformers in Medicine: Improving Vision-Language Alignment for Medical Image Captioning
por: Suresh, Yogesh Thakku, et al.
Publicado: (2025)
por: Suresh, Yogesh Thakku, et al.
Publicado: (2025)
Case-Aware Medical Image Classification with Multimodal Knowledge Graphs and Reliability-Guided Refinement
por: Xu, Yiming, et al.
Publicado: (2026)
por: Xu, Yiming, et al.
Publicado: (2026)
Symbolic Rule Extraction from Attention-Guided Sparse Representations in Vision Transformers
por: Padalkar, Parth, et al.
Publicado: (2025)
por: Padalkar, Parth, et al.
Publicado: (2025)
IFViT: Interpretable Fixed-Length Representation for Fingerprint Matching via Vision Transformer
por: Qiu, Yuhang, et al.
Publicado: (2024)
por: Qiu, Yuhang, et al.
Publicado: (2024)
Two-stage Vision Transformers and Hard Masking offer Robust Object Representations
por: Aniraj, Ananthu, et al.
Publicado: (2025)
por: Aniraj, Ananthu, et al.
Publicado: (2025)
Ejemplares similares
-
Malicious Path Manipulations via Exploitation of Representation Vulnerabilities of Vision-Language Navigation Systems
por: Islam, Chashi Mahiul, et al.
Publicado: (2024) -
Intriguing Equivalence Structures of the Embedding Space of Vision Transformers
por: Salman, Shaeke, et al.
Publicado: (2024) -
Intriguing Differences Between Zero-Shot and Systematic Evaluations of Vision-Language Transformer Models
por: Salman, Shaeke, et al.
Publicado: (2024) -
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
por: Salman, Shaeke, et al.
Publicado: (2024) -
Mechanistic Understandings of Representation Vulnerabilities and Engineering Robust Vision Transformers
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)