LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
Fuente:
arXiv
Guardado en:
| Autores principales: | Bousselham, Walid, Boggust, Angie, Chaybouti, Sofian, Strobelt, Hendrik, Kuehne, Hilde |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
por: Bousselham, Walid, et al.
Publicado: (2026)
por: Bousselham, Walid, et al.
Publicado: (2026)
MaskInversion: Localized Embeddings via Optimization of Explainability Maps
por: Bousselham, Walid, et al.
Publicado: (2024)
por: Bousselham, Walid, et al.
Publicado: (2024)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
por: Chaybouti, Sofian, et al.
Publicado: (2025)
por: Chaybouti, Sofian, et al.
Publicado: (2025)
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
por: Bousselham, Walid, et al.
Publicado: (2025)
por: Bousselham, Walid, et al.
Publicado: (2025)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
por: Jahagirdar, Soumya, et al.
Publicado: (2026)
VideoGEM: Training-free Action Grounding in Videos
por: Vogel, Felix, et al.
Publicado: (2025)
por: Vogel, Felix, et al.
Publicado: (2025)
SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
por: Chaybouti, Sofian, et al.
Publicado: (2025)
por: Chaybouti, Sofian, et al.
Publicado: (2025)
TimeLogic: A Temporal Logic Benchmark for Video QA
por: Swetha, Sirnam, et al.
Publicado: (2025)
por: Swetha, Sirnam, et al.
Publicado: (2025)
HowToCaption: Prompting LLMs to Transform Video Annotations at Scale
por: Shvetsova, Nina, et al.
Publicado: (2023)
por: Shvetsova, Nina, et al.
Publicado: (2023)
Dual Guidance Semi-Supervised Action Detection
por: Singh, Ankit, et al.
Publicado: (2025)
por: Singh, Ankit, et al.
Publicado: (2025)
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
por: Shvetsova, Nina, et al.
Publicado: (2025)
por: Shvetsova, Nina, et al.
Publicado: (2025)
M2SVid: End-to-End Inpainting and Refinement for Monocular-to-Stereo Video Conversion
por: Shvetsova, Nina, et al.
Publicado: (2025)
por: Shvetsova, Nina, et al.
Publicado: (2025)
DiffusionWorldViewer: Exposing and Broadening the Worldview Reflected by Generative Text-to-Image Models
por: De Simone, Zoe, et al.
Publicado: (2023)
por: De Simone, Zoe, et al.
Publicado: (2023)
WEAR: An Outdoor Sports Dataset for Wearable and Egocentric Activity Recognition
por: Bock, Marius, et al.
Publicado: (2023)
por: Bock, Marius, et al.
Publicado: (2023)
Creo: From One-Shot Image Generation to Progressive, Co-Creative Ideation
por: De Simone, Zoe, et al.
Publicado: (2026)
por: De Simone, Zoe, et al.
Publicado: (2026)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
por: Törtei, Brigitta Malagurski, et al.
Publicado: (2025)
por: Törtei, Brigitta Malagurski, et al.
Publicado: (2025)
Abstraction Alignment: Comparing Model-Learned and Human-Encoded Conceptual Relationships
por: Boggust, Angie, et al.
Publicado: (2024)
por: Boggust, Angie, et al.
Publicado: (2024)
Falcon Perception
por: Bevli, Aviraj, et al.
Publicado: (2026)
por: Bevli, Aviraj, et al.
Publicado: (2026)
ViTmiX: Vision Transformer Explainability Augmented by Mixed Visualization Methods
por: Hogea, Eduard, et al.
Publicado: (2024)
por: Hogea, Eduard, et al.
Publicado: (2024)
Convolutional Differentiable Logic Gate Networks
por: Petersen, Felix, et al.
Publicado: (2024)
por: Petersen, Felix, et al.
Publicado: (2024)
MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data
por: Sheludzko, Siarhei, et al.
Publicado: (2026)
por: Sheludzko, Siarhei, et al.
Publicado: (2026)
Is Grad-CAM Explainable in Medical Images?
por: Suara, Subhashis, et al.
Publicado: (2023)
por: Suara, Subhashis, et al.
Publicado: (2023)
TTRV: Test-Time Reinforcement Learning for Vision Language Models
por: Singh, Akshit, et al.
Publicado: (2025)
por: Singh, Akshit, et al.
Publicado: (2025)
Evaluating the Explainability of Vision Transformers in Medical Imaging
por: Barekatain, Leili, et al.
Publicado: (2025)
por: Barekatain, Leili, et al.
Publicado: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
Comprehensive Attribution: Inherently Explainable Vision Model with Feature Detector
por: Zhang, Xianren, et al.
Publicado: (2024)
por: Zhang, Xianren, et al.
Publicado: (2024)
Decision-Aware Attention Propagation for Vision Transformer Explainability
por: Jo, Sehyeong, et al.
Publicado: (2026)
por: Jo, Sehyeong, et al.
Publicado: (2026)
Automated Detection of Defects on Metal Surfaces using Vision Transformers
por: Alaa, Toqa, et al.
Publicado: (2024)
por: Alaa, Toqa, et al.
Publicado: (2024)
Efficient Masked Face Recognition Method during the COVID-19 Pandemic
por: Hariri, Walid
Publicado: (2021)
por: Hariri, Walid
Publicado: (2021)
Grad-CL: Source Free Domain Adaptation with Gradient Guided Feature Disalignment
por: Thakur, Rini Smita, et al.
Publicado: (2025)
por: Thakur, Rini Smita, et al.
Publicado: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
LibraGrad: Balancing Gradient Flow for Universally Better Vision Transformer Attributions
por: Mehri, Faridoun, et al.
Publicado: (2024)
por: Mehri, Faridoun, et al.
Publicado: (2024)
Explainable Pathomics Feature Visualization via Correlation-aware Conditional Feature Editing
por: Yang, Yuechen, et al.
Publicado: (2026)
por: Yang, Yuechen, et al.
Publicado: (2026)
Sensitive Image Classification by Vision Transformers
por: He, Hanxian, et al.
Publicado: (2024)
por: He, Hanxian, et al.
Publicado: (2024)
Q-GroundCAM: Quantifying Grounding in Vision Language Models via GradCAM
por: Rajabi, Navid, et al.
Publicado: (2024)
por: Rajabi, Navid, et al.
Publicado: (2024)
What, when, and where? -- Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated Instructions
por: Chen, Brian, et al.
Publicado: (2023)
por: Chen, Brian, et al.
Publicado: (2023)
Generalizing GradCAM for Embedding Networks
por: Bachhawat, Mudit
Publicado: (2024)
por: Bachhawat, Mudit
Publicado: (2024)
TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation
por: Asare, Akwasi, et al.
Publicado: (2025)
por: Asare, Akwasi, et al.
Publicado: (2025)
InFIP: An Explainable DNN Intellectual Property Protection Method based on Intrinsic Features
por: Xue, Mingfu, et al.
Publicado: (2022)
por: Xue, Mingfu, et al.
Publicado: (2022)
Keypoint Counting Classifiers: Turning Vision Transformers into Self-Explainable Models Without Training
por: Wickstrøm, Kristoffer, et al.
Publicado: (2025)
por: Wickstrøm, Kristoffer, et al.
Publicado: (2025)
Ejemplares similares
-
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
por: Bousselham, Walid, et al.
Publicado: (2026) -
MaskInversion: Localized Embeddings via Optimization of Explainability Maps
por: Bousselham, Walid, et al.
Publicado: (2024) -
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
por: Chaybouti, Sofian, et al.
Publicado: (2025) -
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
por: Bousselham, Walid, et al.
Publicado: (2025) -
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
por: Jahagirdar, Soumya, et al.
Publicado: (2026)