Sparks of Explainability: Recent Advancements in Explaining Large Vision Models
Fuente:
arXiv
Salvato in:
| Autore principale: | Fel, Thomas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual Anagrams Reveal Hidden Differences in Holistic Shape Processing Across Vision Models
di: Doshi, Fenil R., et al.
Pubblicazione: (2025)
di: Doshi, Fenil R., et al.
Pubblicazione: (2025)
Back to the Baseline: Examining Baseline Effects on Explainability Metrics
di: Picard, Agustin Martin, et al.
Pubblicazione: (2025)
di: Picard, Agustin Martin, et al.
Pubblicazione: (2025)
Bi-Orthogonal Factor Decomposition for Vision Transformers
di: Doshi, Fenil R., et al.
Pubblicazione: (2026)
di: Doshi, Fenil R., et al.
Pubblicazione: (2026)
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
di: Giulivi, Loris, et al.
Pubblicazione: (2024)
di: Giulivi, Loris, et al.
Pubblicazione: (2024)
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
di: Shen, Guanxi
Pubblicazione: (2025)
di: Shen, Guanxi
Pubblicazione: (2025)
Advancements in Crop Analysis through Deep Learning and Explainable AI
di: Khan, Hamza
Pubblicazione: (2025)
di: Khan, Hamza
Pubblicazione: (2025)
Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders
di: Bohacek, Matyas, et al.
Pubblicazione: (2025)
di: Bohacek, Matyas, et al.
Pubblicazione: (2025)
Block-Recurrent Dynamics in Vision Transformers
di: Jacobs, Mozes, et al.
Pubblicazione: (2025)
di: Jacobs, Mozes, et al.
Pubblicazione: (2025)
Understanding Visual Feature Reliance through the Lens of Complexity
di: Fel, Thomas, et al.
Pubblicazione: (2024)
di: Fel, Thomas, et al.
Pubblicazione: (2024)
Effectiveness Assessment of Recent Large Vision-Language Models
di: Jiang, Yao, et al.
Pubblicazione: (2024)
di: Jiang, Yao, et al.
Pubblicazione: (2024)
LangXAI: Integrating Large Vision Models for Generating Textual Explanations to Enhance Explainability in Visual Perception Tasks
di: Nguyen, Truong Thanh Hung, et al.
Pubblicazione: (2024)
di: Nguyen, Truong Thanh Hung, et al.
Pubblicazione: (2024)
A Geometric Unification of Concept Learning with Concept Cones
di: Rocchi--Henry, Alexandre, et al.
Pubblicazione: (2025)
di: Rocchi--Henry, Alexandre, et al.
Pubblicazione: (2025)
CoProNN: Concept-based Prototypical Nearest Neighbors for Explaining Vision Models
di: Chiaburu, Teodor, et al.
Pubblicazione: (2024)
di: Chiaburu, Teodor, et al.
Pubblicazione: (2024)
Interpreting Physics in Video World Models
di: Joseph, Sonia, et al.
Pubblicazione: (2026)
di: Joseph, Sonia, et al.
Pubblicazione: (2026)
Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation
di: Galshetwar, Vijay M., et al.
Pubblicazione: (2025)
di: Galshetwar, Vijay M., et al.
Pubblicazione: (2025)
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
di: Bousselham, Walid, et al.
Pubblicazione: (2026)
di: Bousselham, Walid, et al.
Pubblicazione: (2026)
Position: Do Not Explain Vision Models Without Context
di: Tomaszewska, Paulina, et al.
Pubblicazione: (2024)
di: Tomaszewska, Paulina, et al.
Pubblicazione: (2024)
Transferring Visual Explainability of Self-Explaining Models to Prediction-Only Models without Additional Training
di: Yoshikawa, Yuya, et al.
Pubblicazione: (2025)
di: Yoshikawa, Yuya, et al.
Pubblicazione: (2025)
CBVLM: Training-free Explainable Concept-based Large Vision Language Models for Medical Image Classification
di: Patrício, Cristiano, et al.
Pubblicazione: (2025)
di: Patrício, Cristiano, et al.
Pubblicazione: (2025)
A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation
di: Chen, Liang, et al.
Pubblicazione: (2024)
di: Chen, Liang, et al.
Pubblicazione: (2024)
KPCA-CAM: Visual Explainability of Deep Computer Vision Models using Kernel PCA
di: Karmani, Sachin, et al.
Pubblicazione: (2024)
di: Karmani, Sachin, et al.
Pubblicazione: (2024)
Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis
di: Li, Chenjun, et al.
Pubblicazione: (2025)
di: Li, Chenjun, et al.
Pubblicazione: (2025)
Assessing Color Vision Test in Large Vision-language Models
di: Ye, Hongfei, et al.
Pubblicazione: (2025)
di: Ye, Hongfei, et al.
Pubblicazione: (2025)
SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
di: Yu, Jiongze, et al.
Pubblicazione: (2026)
di: Yu, Jiongze, et al.
Pubblicazione: (2026)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
di: Kim, Ju-Young, et al.
Pubblicazione: (2025)
di: Kim, Ju-Young, et al.
Pubblicazione: (2025)
An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis
di: Sk., Md. Sajeebul Islam, et al.
Pubblicazione: (2026)
di: Sk., Md. Sajeebul Islam, et al.
Pubblicazione: (2026)
EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion
di: Yang, Zichuan, et al.
Pubblicazione: (2025)
di: Yang, Zichuan, et al.
Pubblicazione: (2025)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
di: Nguyen, Phu-Vinh, et al.
Pubblicazione: (2025)
di: Nguyen, Phu-Vinh, et al.
Pubblicazione: (2025)
Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models
di: Mersha, Melkamu Abay, et al.
Pubblicazione: (2026)
di: Mersha, Melkamu Abay, et al.
Pubblicazione: (2026)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
di: Alzubaidi, Thuraya, et al.
Pubblicazione: (2026)
di: Alzubaidi, Thuraya, et al.
Pubblicazione: (2026)
Trustworthy Large Models in Vision: A Survey
di: Guo, Ziyan, et al.
Pubblicazione: (2023)
di: Guo, Ziyan, et al.
Pubblicazione: (2023)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
di: Kim, Eunki, et al.
Pubblicazione: (2025)
di: Kim, Eunki, et al.
Pubblicazione: (2025)
From Explainable to Explained AI: Ideas for Falsifying and Quantifying Explanations
di: Schirris, Yoni, et al.
Pubblicazione: (2025)
di: Schirris, Yoni, et al.
Pubblicazione: (2025)
Tokensome: Towards a Genetic Vision-Language GPT for Explainable and Cognitive Karyotyping
di: Zhang, Haoxi, et al.
Pubblicazione: (2024)
di: Zhang, Haoxi, et al.
Pubblicazione: (2024)
AllSpark: Reborn Labeled Features from Unlabeled in Transformer for Semi-Supervised Semantic Segmentation
di: Wang, Haonan, et al.
Pubblicazione: (2024)
di: Wang, Haonan, et al.
Pubblicazione: (2024)
From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models
di: Khokhar, Pir Bakhsh, et al.
Pubblicazione: (2026)
di: Khokhar, Pir Bakhsh, et al.
Pubblicazione: (2026)
Language Models Can Explain Visual Features via Steering
di: Ferrando, Javier, et al.
Pubblicazione: (2026)
di: Ferrando, Javier, et al.
Pubblicazione: (2026)
Review of Hallucination Understanding in Large Language and Vision Models
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
Probing Perceptual Constancy in Large Vision-Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Visual Anagrams Reveal Hidden Differences in Holistic Shape Processing Across Vision Models
di: Doshi, Fenil R., et al.
Pubblicazione: (2025) -
Back to the Baseline: Examining Baseline Effects on Explainability Metrics
di: Picard, Agustin Martin, et al.
Pubblicazione: (2025) -
Bi-Orthogonal Factor Decomposition for Vision Transformers
di: Doshi, Fenil R., et al.
Pubblicazione: (2026) -
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
di: Giulivi, Loris, et al.
Pubblicazione: (2024) -
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
di: Shen, Guanxi
Pubblicazione: (2025)