DataDignity: Training Data Attribution for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Xiaomin, Banburski-Fahey, Andrzej, Lanier, Jaron |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Real-time Animation Generation and Control on Rigged Models via Large Language Models
by: Huang, Han, et al.
Published: (2023)
by: Huang, Han, et al.
Published: (2023)
LLMR: Real-time Prompting of Interactive Worlds using Large Language Models
by: De La Torre, Fernanda, et al.
Published: (2023)
by: De La Torre, Fernanda, et al.
Published: (2023)
Social Conjuring: Multi-User Runtime Collaboration with AI in Building Virtual 3D Worlds
by: Kobenova, Amina, et al.
Published: (2024)
by: Kobenova, Amina, et al.
Published: (2024)
Reprompting: Automated Chain-of-Thought Prompt Inference Through Gibbs Sampling
by: Xu, Weijia, et al.
Published: (2023)
by: Xu, Weijia, et al.
Published: (2023)
DreamGarden: A Designer Assistant for Growing Games from a Single Prompt
by: Earle, Sam, et al.
Published: (2024)
by: Earle, Sam, et al.
Published: (2024)
ScriptDoctor: Automatic Generation of PuzzleScript Games via Large Language Models and Tree Search
by: Earle, Sam, et al.
Published: (2025)
by: Earle, Sam, et al.
Published: (2025)
PuzzleJAX: A Benchmark for Reasoning and Learning
by: Earle, Sam, et al.
Published: (2025)
by: Earle, Sam, et al.
Published: (2025)
Training Data for Large Language Model
by: Ju, Yiming, et al.
Published: (2024)
by: Ju, Yiming, et al.
Published: (2024)
Source Attribution for Large Language Model-Generated Data
by: Wang, Jingtan, et al.
Published: (2023)
by: Wang, Jingtan, et al.
Published: (2023)
Text-Only Data Synthesis for Vision Language Model Training
by: Yu, Xiaomin, et al.
Published: (2025)
by: Yu, Xiaomin, et al.
Published: (2025)
Efficient Ensembles Improve Training Data Attribution
by: Deng, Junwei, et al.
Published: (2024)
by: Deng, Junwei, et al.
Published: (2024)
Provable Training Data Identification for Large Language Models
by: Liu, Zhenlong, et al.
Published: (2025)
by: Liu, Zhenlong, et al.
Published: (2025)
Wrapper Boxes: Faithful Attribution of Model Predictions to Training Data
by: Su, Yiheng, et al.
Published: (2023)
by: Su, Yiheng, et al.
Published: (2023)
Diffusion Attribution Score: Evaluating Training Data Influence in Diffusion Models
by: Lin, Jinxu, et al.
Published: (2024)
by: Lin, Jinxu, et al.
Published: (2024)
Attribution Bias in Large Language Models
by: Berman, Eliza, et al.
Published: (2026)
by: Berman, Eliza, et al.
Published: (2026)
Data Management For Training Large Language Models: A Survey
by: Wang, Zige, et al.
Published: (2023)
by: Wang, Zige, et al.
Published: (2023)
GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models
by: Niu, Peizhi, et al.
Published: (2025)
by: Niu, Peizhi, et al.
Published: (2025)
Large Language Models as Attribution Regularizers for Efficient Model Training
by: Vukadin, Davor, et al.
Published: (2025)
by: Vukadin, Davor, et al.
Published: (2025)
Regurgitative Training: The Value of Real Data in Training Large Language Models
by: Zhang, Jinghui, et al.
Published: (2024)
by: Zhang, Jinghui, et al.
Published: (2024)
Interpreting Multi-Attribute Confounding through Numerical Attributes in Large Language Models
by: Takagi, Hirohane, et al.
Published: (2025)
by: Takagi, Hirohane, et al.
Published: (2025)
LATEX-GCL: Large Language Models (LLMs)-Based Data Augmentation for Text-Attributed Graph Contrastive Learning
by: Yang, Haoran, et al.
Published: (2024)
by: Yang, Haoran, et al.
Published: (2024)
Training Data Attribution for Image Generation using Ontology-Aligned Knowledge Graphs
by: Aivalis, Theodoros, et al.
Published: (2025)
by: Aivalis, Theodoros, et al.
Published: (2025)
Quanda: An Interpretability Toolkit for Training Data Attribution Evaluation and Beyond
by: Bareeva, Dilyara, et al.
Published: (2024)
by: Bareeva, Dilyara, et al.
Published: (2024)
Data Efficacy for Language Model Training
by: Dai, Yalun, et al.
Published: (2025)
by: Dai, Yalun, et al.
Published: (2025)
GUDA: Counterfactual Group-wise Training Data Attribution for Diffusion Models via Unlearning
by: Murata, Naoki, et al.
Published: (2026)
by: Murata, Naoki, et al.
Published: (2026)
scInterpreter: Training Large Language Models to Interpret scRNA-seq Data for Cell Type Annotation
by: Li, Cong, et al.
Published: (2024)
by: Li, Cong, et al.
Published: (2024)
Prospector Heads: Generalized Feature Attribution for Large Models & Data
by: Machiraju, Gautam, et al.
Published: (2024)
by: Machiraju, Gautam, et al.
Published: (2024)
Balanced Data Sampling for Language Model Training with Clustering
by: Shao, Yunfan, et al.
Published: (2024)
by: Shao, Yunfan, et al.
Published: (2024)
Detecting Data Contamination in Large Language Models
by: Janicki, Juliusz, et al.
Published: (2026)
by: Janicki, Juliusz, et al.
Published: (2026)
Large Language Models as Data Preprocessors
by: Zhang, Haochen, et al.
Published: (2023)
by: Zhang, Haochen, et al.
Published: (2023)
Distributional Training Data Attribution: What do Influence Functions Sample?
by: Mlodozeniec, Bruno, et al.
Published: (2025)
by: Mlodozeniec, Bruno, et al.
Published: (2025)
Detecting Training Data of Large Language Models via Expectation Maximization
by: Kim, Gyuwan, et al.
Published: (2024)
by: Kim, Gyuwan, et al.
Published: (2024)
Escaping Collapse: The Strength of Weak Data for Large Language Model Training
by: Amin, Kareem, et al.
Published: (2025)
by: Amin, Kareem, et al.
Published: (2025)
Pandora's White-Box: Precise Training Data Detection and Extraction in Large Language Models
by: Wang, Jeffrey G., et al.
Published: (2024)
by: Wang, Jeffrey G., et al.
Published: (2024)
Extracting Training Dialogue Data from Large Language Model based Task Bots
by: Zhang, Shuo, et al.
Published: (2026)
by: Zhang, Shuo, et al.
Published: (2026)
Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
by: Zhang, Shuo, et al.
Published: (2025)
by: Zhang, Shuo, et al.
Published: (2025)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
by: Wang, Yuanfu, et al.
Published: (2026)
by: Wang, Yuanfu, et al.
Published: (2026)
Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
by: Li, Yuan, et al.
Published: (2025)
by: Li, Yuan, et al.
Published: (2025)
A Training Data Recipe to Accelerate A* Search with Language Models
by: Gupta, Devaansh, et al.
Published: (2024)
by: Gupta, Devaansh, et al.
Published: (2024)
LEDD: Large Language Model-Empowered Data Discovery in Data Lakes
by: An, Qi, et al.
Published: (2025)
by: An, Qi, et al.
Published: (2025)
Similar Items
-
Real-time Animation Generation and Control on Rigged Models via Large Language Models
by: Huang, Han, et al.
Published: (2023) -
LLMR: Real-time Prompting of Interactive Worlds using Large Language Models
by: De La Torre, Fernanda, et al.
Published: (2023) -
Social Conjuring: Multi-User Runtime Collaboration with AI in Building Virtual 3D Worlds
by: Kobenova, Amina, et al.
Published: (2024) -
Reprompting: Automated Chain-of-Thought Prompt Inference Through Gibbs Sampling
by: Xu, Weijia, et al.
Published: (2023) -
DreamGarden: A Designer Assistant for Growing Games from a Single Prompt
by: Earle, Sam, et al.
Published: (2024)