Attributions All the Way Down? The Metagame of Interpretability
Fuente:
arXiv
Salvato in:
| Autori principali: | Baniecki, Hubert, Biecek, Przemyslaw, Fumagalli, Fabian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Interpreting CLIP with Hierarchical Sparse Autoencoders
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
Adversarial attacks and defenses in explainable artificial intelligence: A survey
di: Baniecki, Hubert, et al.
Pubblicazione: (2023)
di: Baniecki, Hubert, et al.
Pubblicazione: (2023)
Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
di: Baniecki, Hubert, et al.
Pubblicazione: (2025)
di: Baniecki, Hubert, et al.
Pubblicazione: (2025)
SwordBench: Evaluating Orthogonality of Steering Image Representations
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2026)
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2026)
Birds look like cars: Adversarial analysis of intrinsically interpretable deep learning
di: Baniecki, Hubert, et al.
Pubblicazione: (2025)
di: Baniecki, Hubert, et al.
Pubblicazione: (2025)
survex: an R package for explaining machine learning survival models
di: Spytek, Mikołaj, et al.
Pubblicazione: (2023)
di: Spytek, Mikołaj, et al.
Pubblicazione: (2023)
The Grammar of Interactive Explanatory Model Analysis
di: Baniecki, Hubert, et al.
Pubblicazione: (2020)
di: Baniecki, Hubert, et al.
Pubblicazione: (2020)
shapiq: Shapley Interactions for Machine Learning
di: Muschalik, Maximilian, et al.
Pubblicazione: (2024)
di: Muschalik, Maximilian, et al.
Pubblicazione: (2024)
Red-Teaming Segment Anything Model
di: Jankowski, Krzysztof, et al.
Pubblicazione: (2024)
di: Jankowski, Krzysztof, et al.
Pubblicazione: (2024)
Model Science: getting serious about verification, explanation and control of AI systems
di: Biecek, Przemyslaw, et al.
Pubblicazione: (2025)
di: Biecek, Przemyslaw, et al.
Pubblicazione: (2025)
On the Robustness of Global Feature Effect Explanations
di: Baniecki, Hubert, et al.
Pubblicazione: (2024)
di: Baniecki, Hubert, et al.
Pubblicazione: (2024)
Efficient and Accurate Explanation Estimation with Distribution Compression
di: Baniecki, Hubert, et al.
Pubblicazione: (2024)
di: Baniecki, Hubert, et al.
Pubblicazione: (2024)
Performance is not enough: the story told by a Rashomon quartet
di: Biecek, Przemyslaw, et al.
Pubblicazione: (2023)
di: Biecek, Przemyslaw, et al.
Pubblicazione: (2023)
Proxy-Based Approximation of Shapley and Banzhaf Interactions
di: Thies, Santo M. A. R., et al.
Pubblicazione: (2026)
di: Thies, Santo M. A. R., et al.
Pubblicazione: (2026)
Position: Explain to Question not to Justify
di: Biecek, Przemyslaw, et al.
Pubblicazione: (2024)
di: Biecek, Przemyslaw, et al.
Pubblicazione: (2024)
Exploring Local Explanations of Nonlinear Models Using Animated Linear Projections
di: Spyrison, Nicholas, et al.
Pubblicazione: (2022)
di: Spyrison, Nicholas, et al.
Pubblicazione: (2022)
Position: Do Not Explain Vision Models Without Context
di: Tomaszewska, Paulina, et al.
Pubblicazione: (2024)
di: Tomaszewska, Paulina, et al.
Pubblicazione: (2024)
Global Counterfactual Directions
di: Sobieski, Bartlomiej, et al.
Pubblicazione: (2024)
di: Sobieski, Bartlomiej, et al.
Pubblicazione: (2024)
Interpretable Machine Learning for Survival Analysis
di: Langbein, Sophie Hanna, et al.
Pubblicazione: (2024)
di: Langbein, Sophie Hanna, et al.
Pubblicazione: (2024)
Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers
di: Grzywaczewski, Jakub, et al.
Pubblicazione: (2026)
di: Grzywaczewski, Jakub, et al.
Pubblicazione: (2026)
Exploration of the Rashomon Set Assists Trustworthy Explanations for Medical Data
di: Kobylińska, Katarzyna, et al.
Pubblicazione: (2023)
di: Kobylińska, Katarzyna, et al.
Pubblicazione: (2023)
Auditing Sybil: Explaining Deep Lung Cancer Risk Prediction Through Generative Interventional Attributions
di: Sobieski, Bartlomiej, et al.
Pubblicazione: (2026)
di: Sobieski, Bartlomiej, et al.
Pubblicazione: (2026)
X-ray transferable polyrepresentation learning
di: Hryniewska-Guzik, Weronika, et al.
Pubblicazione: (2025)
di: Hryniewska-Guzik, Weronika, et al.
Pubblicazione: (2025)
NormEnsembleXAI: Unveiling the Strengths and Weaknesses of XAI Ensemble Techniques
di: Hryniewska-Guzik, Weronika, et al.
Pubblicazione: (2024)
di: Hryniewska-Guzik, Weronika, et al.
Pubblicazione: (2024)
Functional Decomposition and Shapley Interactions for Interpreting Survival Models
di: Langbein, Sophie Hanna, et al.
Pubblicazione: (2026)
di: Langbein, Sophie Hanna, et al.
Pubblicazione: (2026)
PolySHAP: Extending KernelSHAP with Interaction-Informed Polynomial Regression
di: Fumagalli, Fabian, et al.
Pubblicazione: (2026)
di: Fumagalli, Fabian, et al.
Pubblicazione: (2026)
LINE: LLM-based Iterative Neuron Explanations for Vision Models
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2026)
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2026)
System-Embedded Diffusion Bridge Models
di: Sobieski, Bartlomiej, et al.
Pubblicazione: (2025)
di: Sobieski, Bartlomiej, et al.
Pubblicazione: (2025)
HyperSHAP: Shapley Values and Interactions for Explaining Hyperparameter Optimization
di: Wever, Marcel, et al.
Pubblicazione: (2025)
di: Wever, Marcel, et al.
Pubblicazione: (2025)
No learning rates needed: Introducing SALSA -- Stable Armijo Line Search Adaptation
di: Kenneweg, Philip, et al.
Pubblicazione: (2024)
di: Kenneweg, Philip, et al.
Pubblicazione: (2024)
Interpretable machine learning for time-to-event prediction in medicine and healthcare
di: Baniecki, Hubert, et al.
Pubblicazione: (2023)
di: Baniecki, Hubert, et al.
Pubblicazione: (2023)
Red Teaming Models for Hyperspectral Image Analysis Using Explainable AI
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2024)
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2024)
AIM: Attributing, Interpreting, Mitigating Data Unfairness
di: Liu, Zhining, et al.
Pubblicazione: (2024)
di: Liu, Zhining, et al.
Pubblicazione: (2024)
VRAIL: Vectorized Reward-based Attribution for Interpretable Learning
di: Kim, Jina, et al.
Pubblicazione: (2025)
di: Kim, Jina, et al.
Pubblicazione: (2025)
FP4 All the Way: Fully Quantized Training of LLMs
di: Chmiel, Brian, et al.
Pubblicazione: (2025)
di: Chmiel, Brian, et al.
Pubblicazione: (2025)
KernelSHAP-IQ: Weighted Least-Square Optimization for Shapley Interactions
di: Fumagalli, Fabian, et al.
Pubblicazione: (2024)
di: Fumagalli, Fabian, et al.
Pubblicazione: (2024)
Learning to Price: Interpretable Attribute-Level Models for Dynamic Markets
di: Sethuraman, Srividhya, et al.
Pubblicazione: (2026)
di: Sethuraman, Srividhya, et al.
Pubblicazione: (2026)
Enhancing Model Interpretability with Local Attribution over Global Exploration
di: Zhu, Zhiyu, et al.
Pubblicazione: (2024)
di: Zhu, Zhiyu, et al.
Pubblicazione: (2024)
Quanda: An Interpretability Toolkit for Training Data Attribution Evaluation and Beyond
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
Self-Improving AI Agents through Self-Play
di: Chojecki, Przemyslaw
Pubblicazione: (2025)
di: Chojecki, Przemyslaw
Pubblicazione: (2025)
Documenti analoghi
-
Interpreting CLIP with Hierarchical Sparse Autoencoders
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025) -
Adversarial attacks and defenses in explainable artificial intelligence: A survey
di: Baniecki, Hubert, et al.
Pubblicazione: (2023) -
Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
di: Baniecki, Hubert, et al.
Pubblicazione: (2025) -
SwordBench: Evaluating Orthogonality of Steering Image Representations
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2026) -
Birds look like cars: Adversarial analysis of intrinsically interpretable deep learning
di: Baniecki, Hubert, et al.
Pubblicazione: (2025)