CoSy: Evaluating Textual Explanations of Neurons
Fuente:
arXiv
Salvato in:
| Autori principali: | Kopf, Laura, Bommer, Philine Lou, Hedström, Anna, Lapuschkin, Sebastian, Höhne, Marina M. -C., Bykov, Kirill |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Capturing Polysemanticity with PRISM: A Multi-Concept Feature Description Framework
di: Kopf, Laura, et al.
Pubblicazione: (2025)
di: Kopf, Laura, et al.
Pubblicazione: (2025)
Finding the right XAI method -- A Guide for the Evaluation and Ranking of Explainable AI Methods in Climate Science
di: Bommer, Philine, et al.
Pubblicazione: (2023)
di: Bommer, Philine, et al.
Pubblicazione: (2023)
Deep Learning Meets Teleconnections: Improving S2S Predictions for European Winter Weather
di: Bommer, Philine L., et al.
Pubblicazione: (2025)
di: Bommer, Philine L., et al.
Pubblicazione: (2025)
A Fresh Look at Sanity Checks for Saliency Maps
di: Hedström, Anna, et al.
Pubblicazione: (2024)
di: Hedström, Anna, et al.
Pubblicazione: (2024)
Sanity Checks Revisited: An Exploration to Repair the Model Parameter Randomisation Test
di: Hedström, Anna, et al.
Pubblicazione: (2024)
di: Hedström, Anna, et al.
Pubblicazione: (2024)
Labeling Neural Representations with Inverse Recognition
di: Bykov, Kirill, et al.
Pubblicazione: (2023)
di: Bykov, Kirill, et al.
Pubblicazione: (2023)
From Flexibility to Manipulation: The Slippery Slope of XAI Evaluation
di: Wickstrøm, Kristoffer, et al.
Pubblicazione: (2024)
di: Wickstrøm, Kristoffer, et al.
Pubblicazione: (2024)
Manipulating Feature Visualizations with Gradient Slingshots
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
Evaluate with the Inverse: Efficient Approximation of Latent Explanation Quality Distribution
di: Eiras-Franco, Carlos, et al.
Pubblicazione: (2025)
di: Eiras-Franco, Carlos, et al.
Pubblicazione: (2025)
Quanda: An Interpretability Toolkit for Training Data Attribution Evaluation and Beyond
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
Atlas-Alignment: Making Interpretability Transferable Across Language Models
di: Puri, Bruno, et al.
Pubblicazione: (2025)
di: Puri, Bruno, et al.
Pubblicazione: (2025)
Explaining Bayesian Neural Networks
di: Bykov, Kirill, et al.
Pubblicazione: (2021)
di: Bykov, Kirill, et al.
Pubblicazione: (2021)
Interpreting Language Models Through Concept Descriptions: A Survey
di: Feldhus, Nils, et al.
Pubblicazione: (2025)
di: Feldhus, Nils, et al.
Pubblicazione: (2025)
Circuit Insights: Towards Interpretability Beyond Activations
di: Golimblevskaia, Elena, et al.
Pubblicazione: (2025)
di: Golimblevskaia, Elena, et al.
Pubblicazione: (2025)
FADE: Why Bad Descriptions Happen to Good Features
di: Puri, Bruno, et al.
Pubblicazione: (2025)
di: Puri, Bruno, et al.
Pubblicazione: (2025)
From Attribution Maps to Human-Understandable Explanations through Concept Relevance Propagation
di: Achtibat, Reduan, et al.
Pubblicazione: (2022)
di: Achtibat, Reduan, et al.
Pubblicazione: (2022)
SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data
di: Pradhan, Bidyapati, et al.
Pubblicazione: (2025)
di: Pradhan, Bidyapati, et al.
Pubblicazione: (2025)
Relevance-driven Input Dropout: an Explanation-guided Regularization Technique
di: Gururaj, Shreyas, et al.
Pubblicazione: (2025)
di: Gururaj, Shreyas, et al.
Pubblicazione: (2025)
Towards Generating Informative Textual Description for Neurons in Language Models
di: Mondal, Shrayani, et al.
Pubblicazione: (2024)
di: Mondal, Shrayani, et al.
Pubblicazione: (2024)
LatentChem: From Textual CoT to Latent Thinking in Chemical Reasoning
di: Ye, Xinwu, et al.
Pubblicazione: (2026)
di: Ye, Xinwu, et al.
Pubblicazione: (2026)
Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs
di: Hatefi, Sayed Mohammad Vakilzadeh, et al.
Pubblicazione: (2025)
di: Hatefi, Sayed Mohammad Vakilzadeh, et al.
Pubblicazione: (2025)
Uncertainty Gating for Cost-Aware Explainable Artificial Intelligence
di: Mikriukov, Georgii, et al.
Pubblicazione: (2026)
di: Mikriukov, Georgii, et al.
Pubblicazione: (2026)
PURE: Turning Polysemantic Neurons Into Pure Features by Identifying Relevant Circuits
di: Dreyer, Maximilian, et al.
Pubblicazione: (2024)
di: Dreyer, Maximilian, et al.
Pubblicazione: (2024)
Textual Aesthetics in Large Language Models
di: Jiang, Lingjie, et al.
Pubblicazione: (2024)
di: Jiang, Lingjie, et al.
Pubblicazione: (2024)
Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2025)
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2025)
Iterative Inference in a Chess-Playing Neural Network
di: Sandmann, Elias, et al.
Pubblicazione: (2025)
di: Sandmann, Elias, et al.
Pubblicazione: (2025)
Hyperbolic sentence representations for solving Textual Entailment
di: Petrovski, Igor
Pubblicazione: (2024)
di: Petrovski, Igor
Pubblicazione: (2024)
Towards Aligning Language Models with Textual Feedback
di: Lloret, Saüc Abadal, et al.
Pubblicazione: (2024)
di: Lloret, Saüc Abadal, et al.
Pubblicazione: (2024)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
di: Pan, Birong, et al.
Pubblicazione: (2025)
di: Pan, Birong, et al.
Pubblicazione: (2025)
Towards Consistent Natural-Language Explanations via Explanation-Consistency Finetuning
di: Chen, Yanda, et al.
Pubblicazione: (2024)
di: Chen, Yanda, et al.
Pubblicazione: (2024)
PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus
di: Noroozizadeh, Shahriar, et al.
Pubblicazione: (2025)
di: Noroozizadeh, Shahriar, et al.
Pubblicazione: (2025)
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
di: Wang, Qianli, et al.
Pubblicazione: (2024)
di: Wang, Qianli, et al.
Pubblicazione: (2024)
Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis
di: Noroozizadeh, Shahriar, et al.
Pubblicazione: (2025)
di: Noroozizadeh, Shahriar, et al.
Pubblicazione: (2025)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
di: Wang, Qianli, et al.
Pubblicazione: (2026)
di: Wang, Qianli, et al.
Pubblicazione: (2026)
Classification of Hope in Textual Data using Transformer-Based Models
di: Ijezue, Chukwuebuka Fortunate, et al.
Pubblicazione: (2025)
di: Ijezue, Chukwuebuka Fortunate, et al.
Pubblicazione: (2025)
ProRefine: Inference-Time Prompt Refinement with Textual Feedback
di: Pandita, Deepak, et al.
Pubblicazione: (2025)
di: Pandita, Deepak, et al.
Pubblicazione: (2025)
Confidence Regulation Neurons in Language Models
di: Stolfo, Alessandro, et al.
Pubblicazione: (2024)
di: Stolfo, Alessandro, et al.
Pubblicazione: (2024)
Can LLM-Generated Textual Explanations Enhance Model Classification Performance? An Empirical Study
di: Dhaini, Mahdi, et al.
Pubblicazione: (2025)
di: Dhaini, Mahdi, et al.
Pubblicazione: (2025)
Prototypical Self-Explainable Models Without Re-training
di: Gautam, Srishti, et al.
Pubblicazione: (2023)
di: Gautam, Srishti, et al.
Pubblicazione: (2023)
Text2Data: Low-Resource Data Generation with Textual Control
di: Wang, Shiyu, et al.
Pubblicazione: (2024)
di: Wang, Shiyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Capturing Polysemanticity with PRISM: A Multi-Concept Feature Description Framework
di: Kopf, Laura, et al.
Pubblicazione: (2025) -
Finding the right XAI method -- A Guide for the Evaluation and Ranking of Explainable AI Methods in Climate Science
di: Bommer, Philine, et al.
Pubblicazione: (2023) -
Deep Learning Meets Teleconnections: Improving S2S Predictions for European Winter Weather
di: Bommer, Philine L., et al.
Pubblicazione: (2025) -
A Fresh Look at Sanity Checks for Saliency Maps
di: Hedström, Anna, et al.
Pubblicazione: (2024) -
Sanity Checks Revisited: An Exploration to Repair the Model Parameter Randomisation Test
di: Hedström, Anna, et al.
Pubblicazione: (2024)