ExPLAIND: Unifying Model, Data, and Training Attribution to Study Model Behavior
Fuente:
arXiv
Salvato in:
| Autori principali: | Eichin, Florian, Du, Yupei, Mondorf, Philipp, Matveev, Maria, Plank, Barbara, Hedderich, Michael A. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
What's the Difference? Supporting Users in Identifying the Effects of Prompt and Model Changes Through Token Patterns
di: Hedderich, Michael A., et al.
Pubblicazione: (2025)
di: Hedderich, Michael A., et al.
Pubblicazione: (2025)
Circuit Compositions: Exploring Modular Structures in Transformer-Based Language Models
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
Reason to Rote: Rethinking Memorization in Reasoning
di: Du, Yupei, et al.
Pubblicazione: (2025)
di: Du, Yupei, et al.
Pubblicazione: (2025)
Probing LLMs for Multilingual Discourse Generalization Through a Unified Label Set
di: Eichin, Florian, et al.
Pubblicazione: (2025)
di: Eichin, Florian, et al.
Pubblicazione: (2025)
Copy First, Translate Later: Interpreting Translation Dynamics in Multilingual Pretraining
di: Körner, Felicia, et al.
Pubblicazione: (2026)
di: Körner, Felicia, et al.
Pubblicazione: (2026)
Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
Understanding When Tree of Thoughts Succeeds: Larger Models Excel in Generation, Not Discrimination
di: Chen, Qiqi, et al.
Pubblicazione: (2024)
di: Chen, Qiqi, et al.
Pubblicazione: (2024)
Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
Liar, Liar, Logical Mire: A Benchmark for Suppositional Reasoning in Large Language Models
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
Tracing Uncertainty in Language Model "Reasoning"
di: Grünefeld, Nils, et al.
Pubblicazione: (2026)
di: Grünefeld, Nils, et al.
Pubblicazione: (2026)
If Probable, Then Acceptable? Understanding Conditional Acceptability Judgments in Large Language Models
di: Orth, Jasmin, et al.
Pubblicazione: (2025)
di: Orth, Jasmin, et al.
Pubblicazione: (2025)
LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models
di: Rabern, Brian, et al.
Pubblicazione: (2026)
di: Rabern, Brian, et al.
Pubblicazione: (2026)
Semantic Component Analysis: Introducing Multi-Topic Distributions to Clustering-Based Topic Modeling
di: Eichin, Florian, et al.
Pubblicazione: (2024)
di: Eichin, Florian, et al.
Pubblicazione: (2024)
BlackboxNLP-2025 MIB Shared Task: Exploring Ensemble Strategies for Circuit Localization Methods
di: Mondorf, Philipp, et al.
Pubblicazione: (2025)
di: Mondorf, Philipp, et al.
Pubblicazione: (2025)
FTFT: Efficient and Robust Fine-Tuning by Transferring Training Dynamics
di: Du, Yupei, et al.
Pubblicazione: (2023)
di: Du, Yupei, et al.
Pubblicazione: (2023)
Nonparametric Data Attribution for Diffusion Models
di: Zhao, Yutian, et al.
Pubblicazione: (2025)
di: Zhao, Yutian, et al.
Pubblicazione: (2025)
Reasoning that Travels: Dissecting How Chain-of-Thought Transfers Across Models
di: Cheng, Xinyuan, et al.
Pubblicazione: (2026)
di: Cheng, Xinyuan, et al.
Pubblicazione: (2026)
LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling
di: Mondorf, Philipp, et al.
Pubblicazione: (2026)
di: Mondorf, Philipp, et al.
Pubblicazione: (2026)
The Validation Gap: A Mechanistic Analysis of How Language Models Compute Arithmetic but Fail to Validate It
di: Bertolazzi, Leonardo, et al.
Pubblicazione: (2025)
di: Bertolazzi, Leonardo, et al.
Pubblicazione: (2025)
Final-Model-Only Data Attribution with a Unifying View of Gradient-Based Methods
di: Wei, Dennis, et al.
Pubblicazione: (2024)
di: Wei, Dennis, et al.
Pubblicazione: (2024)
Defending Deep Regression Models against Backdoor Attacks
di: Du, Lingyu, et al.
Pubblicazione: (2024)
di: Du, Lingyu, et al.
Pubblicazione: (2024)
Efficient Sketches for Training Data Attribution and Studying the Loss Landscape
di: Schioppa, Andrea
Pubblicazione: (2024)
di: Schioppa, Andrea
Pubblicazione: (2024)
Diffusion Attribution Score: Evaluating Training Data Influence in Diffusion Models
di: Lin, Jinxu, et al.
Pubblicazione: (2024)
di: Lin, Jinxu, et al.
Pubblicazione: (2024)
Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training
di: Xiao, Frank, et al.
Pubblicazione: (2026)
di: Xiao, Frank, et al.
Pubblicazione: (2026)
Enhancing Training Data Attribution with Representational Optimization
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
Wrapper Boxes: Faithful Attribution of Model Predictions to Training Data
di: Su, Yiheng, et al.
Pubblicazione: (2023)
di: Su, Yiheng, et al.
Pubblicazione: (2023)
Backward Compatibility in Attributive Explanation and Enhanced Model Training Method
di: Matsuno, Ryuta
Pubblicazione: (2024)
di: Matsuno, Ryuta
Pubblicazione: (2024)
Unifying Perplexing Behaviors in Modified BP Attributions through Alignment Perspective
di: Zheng, Guanhua, et al.
Pubblicazione: (2025)
di: Zheng, Guanhua, et al.
Pubblicazione: (2025)
Compositional-ARC: Assessing Systematic Generalization in Abstract Spatial Reasoning
di: Mondorf, Philipp, et al.
Pubblicazione: (2025)
di: Mondorf, Philipp, et al.
Pubblicazione: (2025)
Training Data Attribution via Approximate Unrolled Differentiation
di: Bae, Juhan, et al.
Pubblicazione: (2024)
di: Bae, Juhan, et al.
Pubblicazione: (2024)
Intriguing Properties of Data Attribution on Diffusion Models
di: Zheng, Xiaosen, et al.
Pubblicazione: (2023)
di: Zheng, Xiaosen, et al.
Pubblicazione: (2023)
GUDA: Counterfactual Group-wise Training Data Attribution for Diffusion Models via Unlearning
di: Murata, Naoki, et al.
Pubblicazione: (2026)
di: Murata, Naoki, et al.
Pubblicazione: (2026)
Training Feature Attribution for Vision Models
di: Bacha, Aziz, et al.
Pubblicazione: (2025)
di: Bacha, Aziz, et al.
Pubblicazione: (2025)
UniGLM: Training One Unified Language Model for Text-Attributed Graph Embedding
di: Fang, Yi, et al.
Pubblicazione: (2024)
di: Fang, Yi, et al.
Pubblicazione: (2024)
Measuring Non-Adversarial Reproduction of Training Data in Large Language Models
di: Aerni, Michael, et al.
Pubblicazione: (2024)
di: Aerni, Michael, et al.
Pubblicazione: (2024)
Bayesian Surrogate Training on Multiple Data Sources: A Hybrid Modeling Strategy
di: Reiser, Philipp, et al.
Pubblicazione: (2024)
di: Reiser, Philipp, et al.
Pubblicazione: (2024)
Stochastic Amortization: A Unified Approach to Accelerate Feature and Data Attribution
di: Covert, Ian, et al.
Pubblicazione: (2024)
di: Covert, Ian, et al.
Pubblicazione: (2024)
Hybrid Attribution Priors for Explainable and Robust Model Training
di: Zhang, Zhuoran, et al.
Pubblicazione: (2025)
di: Zhang, Zhuoran, et al.
Pubblicazione: (2025)
Efficient Ensembles Improve Training Data Attribution
di: Deng, Junwei, et al.
Pubblicazione: (2024)
di: Deng, Junwei, et al.
Pubblicazione: (2024)
Exploring Training Data Attribution under Limited Access Constraints
di: Zhang, Shiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Shiyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
What's the Difference? Supporting Users in Identifying the Effects of Prompt and Model Changes Through Token Patterns
di: Hedderich, Michael A., et al.
Pubblicazione: (2025) -
Circuit Compositions: Exploring Modular Structures in Transformer-Based Language Models
di: Mondorf, Philipp, et al.
Pubblicazione: (2024) -
Reason to Rote: Rethinking Memorization in Reasoning
di: Du, Yupei, et al.
Pubblicazione: (2025) -
Probing LLMs for Multilingual Discourse Generalization Through a Unified Label Set
di: Eichin, Florian, et al.
Pubblicazione: (2025) -
Copy First, Translate Later: Interpreting Translation Dynamics in Multilingual Pretraining
di: Körner, Felicia, et al.
Pubblicazione: (2026)