Do LLM Self-Explanations Help Users Predict Model Behavior? Evaluating Counterfactual Simulatability with Pragmatic Perturbations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hong, Pingjun, Roth, Benjamin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales
par: Hong, Pingjun, et autres
Publié: (2026)
par: Hong, Pingjun, et autres
Publié: (2026)
Counterfactual Simulatability of LLM Explanations for Generation Tasks
par: Limpijankit, Marvin, et autres
Publié: (2025)
par: Limpijankit, Marvin, et autres
Publié: (2025)
Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization
par: Chen, Beiduo, et autres
Publié: (2026)
par: Chen, Beiduo, et autres
Publié: (2026)
Agree, Disagree, Explain: Decomposing Human Label Variation in NLI through the Lens of Explanations
par: Hong, Pingjun, et autres
Publié: (2025)
par: Hong, Pingjun, et autres
Publié: (2025)
ConSim: Measuring Concept-Based Explanations' Effectiveness with Automated Simulatability
par: Poché, Antonin, et autres
Publié: (2025)
par: Poché, Antonin, et autres
Publié: (2025)
Select or Project? Evaluating Lower-dimensional Vectors for LLM Training Data Explanations
par: Hinterleitner, Lukas, et autres
Publié: (2026)
par: Hinterleitner, Lukas, et autres
Publié: (2026)
LiTEx: A Linguistic Taxonomy of Explanations for Understanding Within-Label Variation in Natural Language Inference
par: Hong, Pingjun, et autres
Publié: (2025)
par: Hong, Pingjun, et autres
Publié: (2025)
Evaluating Large Language Models for Cross-Lingual Retrieval
par: Zuo, Longfei, et autres
Publié: (2025)
par: Zuo, Longfei, et autres
Publié: (2025)
An Evaluation of Explanation Methods for Black-Box Detectors of Machine-Generated Text
par: Schoenegger, Loris, et autres
Publié: (2024)
par: Schoenegger, Loris, et autres
Publié: (2024)
ALMANACS: A Simulatability Benchmark for Language Model Explainability
par: Mills, Edmund, et autres
Publié: (2023)
par: Mills, Edmund, et autres
Publié: (2023)
Compact Example-Based Explanations for Language Models
par: Schoenegger, Loris, et autres
Publié: (2026)
par: Schoenegger, Loris, et autres
Publié: (2026)
Prompt-Counterfactual Explanations for Generative AI System Behavior
par: Goethals, Sofie, et autres
Publié: (2026)
par: Goethals, Sofie, et autres
Publié: (2026)
LLM-Generated Black-box Explanations Can Be Adversarially Helpful
par: Ajwani, Rohan, et autres
Publié: (2024)
par: Ajwani, Rohan, et autres
Publié: (2024)
Faithfulness vs. Safety: Evaluating LLM Behavior Under Counterfactual Medical Evidence
par: Mo, Kaijie, et autres
Publié: (2026)
par: Mo, Kaijie, et autres
Publié: (2026)
Counterfactual Reasoning with Knowledge Graph Embeddings
par: Zellinger, Lena, et autres
Publié: (2024)
par: Zellinger, Lena, et autres
Publié: (2024)
Helpful assistant or fruitful facilitator? Investigating how personas affect language model behavior
par: de Araujo, Pedro Henrique Luz, et autres
Publié: (2024)
par: de Araujo, Pedro Henrique Luz, et autres
Publié: (2024)
DRIV-EX: Counterfactual Explanations for Driving LLMs
par: Cardiel, Amaia, et autres
Publié: (2026)
par: Cardiel, Amaia, et autres
Publié: (2026)
Evaluating the Reliability of Self-Explanations in Large Language Models
par: Randl, Korbinian, et autres
Publié: (2024)
par: Randl, Korbinian, et autres
Publié: (2024)
What if you said that differently?: How Explanation Formats Affect Human Feedback Efficacy and User Perception
par: Malaviya, Chaitanya, et autres
Publié: (2023)
par: Malaviya, Chaitanya, et autres
Publié: (2023)
Self-Explanation in Social AI Agents
par: Basappa, Rhea, et autres
Publié: (2025)
par: Basappa, Rhea, et autres
Publié: (2025)
Towards Unifying Evaluation of Counterfactual Explanations: Leveraging Large Language Models for Human-Centric Assessments
par: Domnich, Marharyta, et autres
Publié: (2024)
par: Domnich, Marharyta, et autres
Publié: (2024)
Tuning Language Models for Robust Prediction of Diverse User Behaviors
par: Meng, Fanjin, et autres
Publié: (2025)
par: Meng, Fanjin, et autres
Publié: (2025)
Experimental Pragmatics with Machines: Testing LLM Predictions for the Inferences of Plain and Embedded Disjunctions
par: Tsvilodub, Polina, et autres
Publié: (2024)
par: Tsvilodub, Polina, et autres
Publié: (2024)
NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment
par: Bhan, Milan, et autres
Publié: (2025)
par: Bhan, Milan, et autres
Publié: (2025)
PLEX: Perturbation-free Local Explanations for LLM-Based Text Classification
par: Rahulamathavan, Yogachandran, et autres
Publié: (2025)
par: Rahulamathavan, Yogachandran, et autres
Publié: (2025)
Counterfactual LLM-based Framework for Measuring Rhetorical Style
par: Qiu, Jingyi, et autres
Publié: (2025)
par: Qiu, Jingyi, et autres
Publié: (2025)
Beyond Isolated Behaviors: Hierarchical User Modeling for LLM Personalization
par: Wang, Liang, et autres
Publié: (2026)
par: Wang, Liang, et autres
Publié: (2026)
Bisimilarity and Simulatability of Processes Parameterized by Join Interactions
par: Grabmayer, Clemens, et autres
Publié: (2025)
par: Grabmayer, Clemens, et autres
Publié: (2025)
When Do "More Contexts" Help with Sarcasm Recognition?
par: Nimase, Ojas, et autres
Publié: (2024)
par: Nimase, Ojas, et autres
Publié: (2024)
Counterfactual Graph for Multi-Agent LLM Calibration
par: Huang, Jiatan, et autres
Publié: (2026)
par: Huang, Jiatan, et autres
Publié: (2026)
Do language models accommodate their users? A study of linguistic convergence
par: Blevins, Terra, et autres
Publié: (2025)
par: Blevins, Terra, et autres
Publié: (2025)
Characterizing LLM Abstention Behavior in Science QA with Context Perturbations
par: Wen, Bingbing, et autres
Publié: (2024)
par: Wen, Bingbing, et autres
Publié: (2024)
Counterfactual Explanations for MITL Violations
par: Finkbeiner, Bernd, et autres
Publié: (2024)
par: Finkbeiner, Bernd, et autres
Publié: (2024)
Aligning What LLMs Do and Say: Towards Self-Consistent Explanations
par: Admoni, Sahar, et autres
Publié: (2025)
par: Admoni, Sahar, et autres
Publié: (2025)
Natural Language Counterfactual Explanations for Graphs Using Large Language Models
par: Giorgi, Flavio, et autres
Publié: (2024)
par: Giorgi, Flavio, et autres
Publié: (2024)
Pragmatic Competence Evaluation of Large Language Models for the Korean Language
par: Park, Dojun, et autres
Publié: (2024)
par: Park, Dojun, et autres
Publié: (2024)
The Illusion of Competence: Evaluating the Effect of Explanations on Users' Mental Models of Visual Question Answering Systems
par: Sieker, Judith, et autres
Publié: (2024)
par: Sieker, Judith, et autres
Publié: (2024)
Safety Training Persists Through Helpfulness Optimization in LLM Agents
par: Plaut, Benjamin
Publié: (2026)
par: Plaut, Benjamin
Publié: (2026)
LLM Self-Explanations Fail Semantic Invariance
par: Szeider, Stefan
Publié: (2026)
par: Szeider, Stefan
Publié: (2026)
Do Metrics for Counterfactual Explanations Align with User Perception?
par: Liedeker, Felix, et autres
Publié: (2026)
par: Liedeker, Felix, et autres
Publié: (2026)
Documents similaires
-
Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales
par: Hong, Pingjun, et autres
Publié: (2026) -
Counterfactual Simulatability of LLM Explanations for Generation Tasks
par: Limpijankit, Marvin, et autres
Publié: (2025) -
Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization
par: Chen, Beiduo, et autres
Publié: (2026) -
Agree, Disagree, Explain: Decomposing Human Label Variation in NLI through the Lens of Explanations
par: Hong, Pingjun, et autres
Publié: (2025) -
ConSim: Measuring Concept-Based Explanations' Effectiveness with Automated Simulatability
par: Poché, Antonin, et autres
Publié: (2025)