The Empirical Impact of Data Sanitization on Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Pal, Anwesan, Bhargava, Radhika, Hinsz, Kyle, Esterhuizen, Jacques, Bhattacharya, Sudipta |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ELLA: Efficient Lifelong Learning for Adapters in Large Language Models
by: Biswas, Shristi Das, et al.
Published: (2026)
by: Biswas, Shristi Das, et al.
Published: (2026)
Knowledge Sanitization of Large Language Models
by: Ishibashi, Yoichi, et al.
Published: (2023)
by: Ishibashi, Yoichi, et al.
Published: (2023)
The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration
by: Ghosh, Sudipta, et al.
Published: (2026)
by: Ghosh, Sudipta, et al.
Published: (2026)
Tagging-Augmented Generation: Assisting Language Models in Finding Intricate Knowledge In Long Contexts
by: Pal, Anwesan, et al.
Published: (2025)
by: Pal, Anwesan, et al.
Published: (2025)
Impact of Non-Standard Unicode Characters on Security and Comprehension in Large Language Models
by: Daniel, Johan S, et al.
Published: (2024)
by: Daniel, Johan S, et al.
Published: (2024)
On the Impact of Language Nuances on Sentiment Analysis with Large Language Models: Paraphrasing, Sarcasm, and Emojis
by: Bhargava, Naman, et al.
Published: (2025)
by: Bhargava, Naman, et al.
Published: (2025)
Here's a Free Lunch: Sanitizing Backdoored Models with Model Merge
by: Arora, Ansh, et al.
Published: (2024)
by: Arora, Ansh, et al.
Published: (2024)
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
by: Fu, Wenjie, et al.
Published: (2025)
by: Fu, Wenjie, et al.
Published: (2025)
Leverage Unlearning to Sanitize LLMs
by: Boutet, Antoine, et al.
Published: (2025)
by: Boutet, Antoine, et al.
Published: (2025)
Truthful Text Sanitization Guided by Inference Attacks
by: Pilán, Ildikó, et al.
Published: (2024)
by: Pilán, Ildikó, et al.
Published: (2024)
Intent2QoS: Language Model-Driven Automation of Traffic Shaping Configurations
by: Acharya, Sudipta, et al.
Published: (2026)
by: Acharya, Sudipta, et al.
Published: (2026)
Impacts of Racial Bias in Historical Training Data for News AI
by: Bhargava, Rahul, et al.
Published: (2025)
by: Bhargava, Rahul, et al.
Published: (2025)
Large Language Models Decide Early and Explain Later
by: Datta, Ayan, et al.
Published: (2026)
by: Datta, Ayan, et al.
Published: (2026)
Analyzing Biases in Political Dialogue: Tagging U.S. Presidential Debates with an Extended DAMSL Framework
by: Prahallad, Lavanya, et al.
Published: (2025)
by: Prahallad, Lavanya, et al.
Published: (2025)
Adapting Small Language Models to Low-Resource Domains: A Case Study in Hindi Tourism QA
by: Majhi, Sandipan, et al.
Published: (2025)
by: Majhi, Sandipan, et al.
Published: (2025)
How Linguistics Learned to Stop Worrying and Love the Language Models
by: Futrell, Richard, et al.
Published: (2025)
by: Futrell, Richard, et al.
Published: (2025)
Knowledge-based Consistency Testing of Large Language Models
by: Rajan, Sai Sathiesh, et al.
Published: (2024)
by: Rajan, Sai Sathiesh, et al.
Published: (2024)
LIONs: An Empirically Optimized Approach to Align Language Models
by: Yu, Xiao, et al.
Published: (2024)
by: Yu, Xiao, et al.
Published: (2024)
Basic Category Usage in Vision Language Models
by: Sawyer, Hunter, et al.
Published: (2025)
by: Sawyer, Hunter, et al.
Published: (2025)
On the Diversity of Synthetic Data and its Impact on Training Large Language Models
by: Chen, Hao, et al.
Published: (2024)
by: Chen, Hao, et al.
Published: (2024)
Krutrim LLM: A Novel Tokenization Strategy for Multilingual Indic Languages with Petabyte-Scale Data Processing
by: Kumar, Rahul, et al.
Published: (2024)
by: Kumar, Rahul, et al.
Published: (2024)
Language Models Learn Rare Phenomena from Less Rare Phenomena: The Case of the Missing AANNs
by: Misra, Kanishka, et al.
Published: (2024)
by: Misra, Kanishka, et al.
Published: (2024)
Data Generation Using Large Language Models for Text Classification: An Empirical Case Study
by: Li, Yinheng, et al.
Published: (2024)
by: Li, Yinheng, et al.
Published: (2024)
PARAMANU-GANITA: Can Small Math Language Models Rival with Large Language Models on Mathematical Reasoning?
by: Niyogi, Mitodru, et al.
Published: (2024)
by: Niyogi, Mitodru, et al.
Published: (2024)
Inference-Time Structural Reasoning for Compositional Vision-Language Understanding
by: Bhattacharya, Amartya
Published: (2026)
by: Bhattacharya, Amartya
Published: (2026)
Are Language Models More Like Libraries or Like Librarians? Bibliotechnism, the Novel Reference Problem, and the Attitudes of LLMs
by: Lederman, Harvey, et al.
Published: (2024)
by: Lederman, Harvey, et al.
Published: (2024)
An Empirical Study on Information Extraction using Large Language Models
by: Han, Ridong, et al.
Published: (2024)
by: Han, Ridong, et al.
Published: (2024)
On Language Models' Sensitivity to Suspicious Coincidences
by: Padmanabhan, Sriram, et al.
Published: (2025)
by: Padmanabhan, Sriram, et al.
Published: (2025)
An Empirical Study on Information Extraction using Large Language Models
by: Han, Ridong, et al.
Published: (2023)
by: Han, Ridong, et al.
Published: (2023)
Prompting Large Language Models for Counterfactual Generation: An Empirical Study
by: Li, Yongqi, et al.
Published: (2023)
by: Li, Yongqi, et al.
Published: (2023)
Leveraging LLMs for Bangla Grammar Error Correction:Error Categorization, Synthetic Data, and Model Evaluation
by: Bhattacharyya, Pramit, et al.
Published: (2024)
by: Bhattacharyya, Pramit, et al.
Published: (2024)
AutoTutor meets Large Language Models: A Language Model Tutor with Rich Pedagogy and Guardrails
by: Chowdhury, Sankalan Pal, et al.
Published: (2024)
by: Chowdhury, Sankalan Pal, et al.
Published: (2024)
Can Large Language Models Understand Context?
by: Zhu, Yilun, et al.
Published: (2024)
by: Zhu, Yilun, et al.
Published: (2024)
PIIGuard: Mitigating PII Harvesting under Adversarial Sanitization
by: Liu, Mingshuo, et al.
Published: (2026)
by: Liu, Mingshuo, et al.
Published: (2026)
Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages
by: Niyogi, Mitodru, et al.
Published: (2024)
by: Niyogi, Mitodru, et al.
Published: (2024)
Language Modeling by Language Models
by: Cheng, Junyan, et al.
Published: (2025)
by: Cheng, Junyan, et al.
Published: (2025)
Language Models Fail to Introspect About Their Knowledge of Language
by: Song, Siyuan, et al.
Published: (2025)
by: Song, Siyuan, et al.
Published: (2025)
Significance of Chain of Thought in Gender Bias Mitigation for English-Dravidian Machine Translation
by: Prahallad, Lavanya, et al.
Published: (2024)
by: Prahallad, Lavanya, et al.
Published: (2024)
Chain-of-Instructions: Compositional Instruction Tuning on Large Language Models
by: Hayati, Shirley Anugrah, et al.
Published: (2024)
by: Hayati, Shirley Anugrah, et al.
Published: (2024)
An Empirical Study of Mamba-based Language Models
by: Waleffe, Roger, et al.
Published: (2024)
by: Waleffe, Roger, et al.
Published: (2024)
Similar Items
-
ELLA: Efficient Lifelong Learning for Adapters in Large Language Models
by: Biswas, Shristi Das, et al.
Published: (2026) -
Knowledge Sanitization of Large Language Models
by: Ishibashi, Yoichi, et al.
Published: (2023) -
The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration
by: Ghosh, Sudipta, et al.
Published: (2026) -
Tagging-Augmented Generation: Assisting Language Models in Finding Intricate Knowledge In Long Contexts
by: Pal, Anwesan, et al.
Published: (2025) -
Impact of Non-Standard Unicode Characters on Security and Comprehension in Large Language Models
by: Daniel, Johan S, et al.
Published: (2024)