A Close Look at Decomposition-based XAI-Methods for Transformer Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Arras, Leila, Puri, Bruno, Kahardipraja, Patrick, Lapuschkin, Sebastian, Samek, Wojciech |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Atlas-Alignment: Making Interpretability Transferable Across Language Models
par: Puri, Bruno, et autres
Publié: (2025)
par: Puri, Bruno, et autres
Publié: (2025)
FADE: Why Bad Descriptions Happen to Good Features
par: Puri, Bruno, et autres
Publié: (2025)
par: Puri, Bruno, et autres
Publié: (2025)
The Atlas of In-Context Learning: How Attention Heads Shape In-Context Retrieval Augmentation
par: Kahardipraja, Patrick, et autres
Publié: (2025)
par: Kahardipraja, Patrick, et autres
Publié: (2025)
Circuit Insights: Towards Interpretability Beyond Activations
par: Golimblevskaia, Elena, et autres
Publié: (2025)
par: Golimblevskaia, Elena, et autres
Publié: (2025)
Human-Centered Evaluation of XAI Methods
par: Dawoud, Karam, et autres
Publié: (2023)
par: Dawoud, Karam, et autres
Publié: (2023)
Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs
par: Hatefi, Sayed Mohammad Vakilzadeh, et autres
Publié: (2025)
par: Hatefi, Sayed Mohammad Vakilzadeh, et autres
Publié: (2025)
Towards Incremental Transformers: An Empirical Analysis of Transformer Models for Incremental NLU
par: Kahardipraja, Patrick, et autres
Publié: (2021)
par: Kahardipraja, Patrick, et autres
Publié: (2021)
When Only Time Will Tell: Interpreting How Transformers Process Local Ambiguities Through the Lens of Restart-Incrementality
par: Madureira, Brielen, et autres
Publié: (2024)
par: Madureira, Brielen, et autres
Publié: (2024)
Understanding the (Extra-)Ordinary: Validating Deep Model Decisions with Prototypical Concept-based Explanations
par: Dreyer, Maximilian, et autres
Publié: (2023)
par: Dreyer, Maximilian, et autres
Publié: (2023)
AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers
par: Achtibat, Reduan, et autres
Publié: (2024)
par: Achtibat, Reduan, et autres
Publié: (2024)
From Weights to Activations: Is Steering the Next Frontier of Adaptation?
par: Ostermann, Simon, et autres
Publié: (2026)
par: Ostermann, Simon, et autres
Publié: (2026)
Ensuring Medical AI Safety: Interpretability-Driven Detection and Mitigation of Spurious Model Behavior and Associated Data
par: Pahde, Frederik, et autres
Publié: (2025)
par: Pahde, Frederik, et autres
Publié: (2025)
Post-Hoc Concept Disentanglement: From Correlated to Isolated Concept Representations
par: Erogullari, Eren, et autres
Publié: (2025)
par: Erogullari, Eren, et autres
Publié: (2025)
Pruning By Explaining Revisited: Optimizing Attribution Methods to Prune CNNs and Transformers
par: Hatefi, Sayed Mohammad Vakilzadeh, et autres
Publié: (2024)
par: Hatefi, Sayed Mohammad Vakilzadeh, et autres
Publié: (2024)
Iterative Inference in a Chess-Playing Neural Network
par: Sandmann, Elias, et autres
Publié: (2025)
par: Sandmann, Elias, et autres
Publié: (2025)
Reactive Model Correction: Mitigating Harm to Task-Relevant Features via Conditional Bias Suppression
par: Bareeva, Dilyara, et autres
Publié: (2024)
par: Bareeva, Dilyara, et autres
Publié: (2024)
Contrastive Semantic Projection: Faithful Neuron Labeling with Contrastive Examples
par: Bouanani, Oussama, et autres
Publié: (2026)
par: Bouanani, Oussama, et autres
Publié: (2026)
Building Trust in PINNs: Error Estimation through Finite Difference Methods
par: Krasowski, Aleksander, et autres
Publié: (2026)
par: Krasowski, Aleksander, et autres
Publié: (2026)
PURE: Turning Polysemantic Neurons Into Pure Features by Identifying Relevant Circuits
par: Dreyer, Maximilian, et autres
Publié: (2024)
par: Dreyer, Maximilian, et autres
Publié: (2024)
Playing the network backward: A Game Theoretic Attribution Framework
par: Zimmermann, Jakob Paul, et autres
Publié: (2026)
par: Zimmermann, Jakob Paul, et autres
Publié: (2026)
XAI-guided Insulator Anomaly Detection for Imbalanced Datasets
par: Hoefler, Maximilian Andreas, et autres
Publié: (2024)
par: Hoefler, Maximilian Andreas, et autres
Publié: (2024)
From Attribution to Action: A Human-Centered Application of Activation Steering
par: Labarta, Tobias, et autres
Publié: (2026)
par: Labarta, Tobias, et autres
Publié: (2026)
Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP
par: Hufe, Lorenz, et autres
Publié: (2025)
par: Hufe, Lorenz, et autres
Publié: (2025)
A Closer Look at Claim Decomposition
par: Wanner, Miriam, et autres
Publié: (2024)
par: Wanner, Miriam, et autres
Publié: (2024)
Explaining Predictive Uncertainty by Exposing Second-Order Effects
par: Bley, Florian, et autres
Publié: (2024)
par: Bley, Florian, et autres
Publié: (2024)
Deep Learning-based Multi Project InP Wafer Simulation for Unsupervised Surface Defect Detection
par: Cantú, Emílio Dolgener, et autres
Publié: (2025)
par: Cantú, Emílio Dolgener, et autres
Publié: (2025)
See What I Mean? CUE: A Cognitive Model of Understanding Explanations
par: Labarta, Tobias, et autres
Publié: (2025)
par: Labarta, Tobias, et autres
Publié: (2025)
Transparent AI for Mathematics: Transformer-Based Large Language Models for Mathematical Entity Relationship Extraction with XAI
par: Aurpa, Tanjim Taharat
Publié: (2026)
par: Aurpa, Tanjim Taharat
Publié: (2026)
The Rosetta Paradox: Domain-Specific Performance Inversions in Large Language Models
par: Jha, Basab, et autres
Publié: (2024)
par: Jha, Basab, et autres
Publié: (2024)
Memorization: A Close Look at Books
par: Ma, Iris, et autres
Publié: (2025)
par: Ma, Iris, et autres
Publié: (2025)
XAI meets LLMs: A Survey of the Relation between Explainable AI and Large Language Models
par: Cambria, Erik, et autres
Publié: (2024)
par: Cambria, Erik, et autres
Publié: (2024)
CoXQL: A Dataset for Parsing Explanation Requests in Conversational XAI Systems
par: Wang, Qianli, et autres
Publié: (2024)
par: Wang, Qianli, et autres
Publié: (2024)
Relevance-driven Input Dropout: an Explanation-guided Regularization Technique
par: Gururaj, Shreyas, et autres
Publié: (2025)
par: Gururaj, Shreyas, et autres
Publié: (2025)
ECQ$^{\text{x}}$: Explainability-Driven Quantization for Low-Bit and Sparse DNNs
par: Becking, Daniel, et autres
Publié: (2021)
par: Becking, Daniel, et autres
Publié: (2021)
Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains
par: Wu, Juncheng, et autres
Publié: (2025)
par: Wu, Juncheng, et autres
Publié: (2025)
LieSolver: A PDE-constrained solver for IBVPs using Lie symmetries
par: Klausen, René P., et autres
Publié: (2025)
par: Klausen, René P., et autres
Publié: (2025)
Evaluating the Effectiveness of XAI Techniques for Encoder-Based Language Models
par: Mersha, Melkamu Abay, et autres
Publié: (2025)
par: Mersha, Melkamu Abay, et autres
Publié: (2025)
Efficient and Flexible Neural Network Training through Layer-wise Feedback Propagation
par: Weber, Leander, et autres
Publié: (2023)
par: Weber, Leander, et autres
Publié: (2023)
Natural Language Decomposition and Interpretation of Complex Utterances
par: Jhamtani, Harsh, et autres
Publié: (2023)
par: Jhamtani, Harsh, et autres
Publié: (2023)
Can AI Relate: Testing Large Language Model Response for Mental Health Support
par: Gabriel, Saadia, et autres
Publié: (2024)
par: Gabriel, Saadia, et autres
Publié: (2024)
Documents similaires
-
Atlas-Alignment: Making Interpretability Transferable Across Language Models
par: Puri, Bruno, et autres
Publié: (2025) -
FADE: Why Bad Descriptions Happen to Good Features
par: Puri, Bruno, et autres
Publié: (2025) -
The Atlas of In-Context Learning: How Attention Heads Shape In-Context Retrieval Augmentation
par: Kahardipraja, Patrick, et autres
Publié: (2025) -
Circuit Insights: Towards Interpretability Beyond Activations
par: Golimblevskaia, Elena, et autres
Publié: (2025) -
Human-Centered Evaluation of XAI Methods
par: Dawoud, Karam, et autres
Publié: (2023)