Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Xinyuan, Chen, Jiahui, Hu, Bocheng, Sun, Yu, Chen, Xinyang, Song, Shaoxu, Tong, Yongxin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Data Cleaning Using Large Language Models
by: Zhang, Shuo, et al.
Published: (2024)
by: Zhang, Shuo, et al.
Published: (2024)
AutoDCWorkflow: LLM-based Data Cleaning Workflow Auto-Generation and Benchmark
by: Li, Lan, et al.
Published: (2024)
by: Li, Lan, et al.
Published: (2024)
LLMClean: Context-Aware Tabular Data Cleaning via LLM-Generated OFDs
by: Biester, Fabian, et al.
Published: (2024)
by: Biester, Fabian, et al.
Published: (2024)
Data Cleaning of Data Streams
by: Restat, Valerie, et al.
Published: (2025)
by: Restat, Valerie, et al.
Published: (2025)
Sync Without Guesswork: Incomplete Time Series Alignment
by: Jia, Ding, et al.
Published: (2025)
by: Jia, Ding, et al.
Published: (2025)
DB-GPT-Hub: Towards Open Benchmarking Text-to-SQL Empowered by Large Language Models
by: Zhou, Fan, et al.
Published: (2024)
by: Zhou, Fan, et al.
Published: (2024)
Distance Comparison Operations Are Not Silver Bullets in Vector Similarity Search: A Benchmark Study on Their Merits and Limits
by: Zheng, Zhuanglin, et al.
Published: (2026)
by: Zheng, Zhuanglin, et al.
Published: (2026)
Towards Autonomous Graph Data Analytics with Analytics-Augmented Generation
by: Wang, Qiange, et al.
Published: (2026)
by: Wang, Qiange, et al.
Published: (2026)
RetClean: Retrieval-Based Data Cleaning Using Foundation Models and Data Lakes
by: Naeem, Zan Ahmad, et al.
Published: (2023)
by: Naeem, Zan Ahmad, et al.
Published: (2023)
AegisTS: A Hierarchical Agent System with Reinforcement Learning for Multivariate Time Series Data Cleaning
by: Shi, Yuhan, et al.
Published: (2026)
by: Shi, Yuhan, et al.
Published: (2026)
Graph Structure Learning for Spatial-Temporal Imputation: Adapting to Node and Feature Scales
by: Yang, Xinyu, et al.
Published: (2024)
by: Yang, Xinyu, et al.
Published: (2024)
Efficient Data Valuation Approximation in Federated Learning: A Sampling-based Approach
by: Wei, Shuyue, et al.
Published: (2025)
by: Wei, Shuyue, et al.
Published: (2025)
eXpath: Explaining Knowledge Graph Link Prediction with Ontological Closed Path Rules
by: Sun, Ye, et al.
Published: (2024)
by: Sun, Ye, et al.
Published: (2024)
DEREC-SIMPRO: unlock Language Model benefits to advance Synthesis in Data Clean Room
by: Kwok, Tung Sum Thomas, et al.
Published: (2024)
by: Kwok, Tung Sum Thomas, et al.
Published: (2024)
Step-by-Step Data Cleaning Recommendations to Improve ML Prediction Accuracy
by: Mohammed, Sedir, et al.
Published: (2025)
by: Mohammed, Sedir, et al.
Published: (2025)
BoostER: Leveraging Large Language Models for Enhancing Entity Resolution
by: Li, Huahang, et al.
Published: (2024)
by: Li, Huahang, et al.
Published: (2024)
Improving Data Cleaning Using Discrete Optimization
by: Smith, Kenneth, et al.
Published: (2024)
by: Smith, Kenneth, et al.
Published: (2024)
Cleaning data with Swipe
by: Boeckling, Toon, et al.
Published: (2024)
by: Boeckling, Toon, et al.
Published: (2024)
Honesty-Aware Multi-Agent Framework for High-Fidelity Synthetic Data Generation in Digital Psychiatric Intake Doctor-Patient Interactions
by: Zhang, Xinyuan, et al.
Published: (2026)
by: Zhang, Xinyuan, et al.
Published: (2026)
From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and Editing
by: Wei, Jingxuan, et al.
Published: (2024)
by: Wei, Jingxuan, et al.
Published: (2024)
Benchmarking Large Language Models for Knowledge Graph Validation
by: Shami, Farzad, et al.
Published: (2026)
by: Shami, Farzad, et al.
Published: (2026)
Towards Visualizing Electronic Medical Records via Natural Language Queries
by: Zhang, Haodi, et al.
Published: (2025)
by: Zhang, Haodi, et al.
Published: (2025)
COLE$^+$: Towards Practical Column-based Learned Storage for Blockchain Systems
by: Zhang, Ce, et al.
Published: (2026)
by: Zhang, Ce, et al.
Published: (2026)
A Catalog of Data Errors
by: Bhadauria, Divya, et al.
Published: (2026)
by: Bhadauria, Divya, et al.
Published: (2026)
FGIM: a Fast Graph-based Indexes Merging Framework for Approximate Nearest Neighbor Search
by: Wu, Zekai, et al.
Published: (2026)
by: Wu, Zekai, et al.
Published: (2026)
Data Cleaning and Machine Learning: A Systematic Literature Review
by: Côté, Pierre-Olivier, et al.
Published: (2023)
by: Côté, Pierre-Olivier, et al.
Published: (2023)
Towards Operationalizing Heterogeneous Data Discovery
by: Wang, Jin, et al.
Published: (2025)
by: Wang, Jin, et al.
Published: (2025)
RLMiner: Finding the Most Frequent k-sized Subgraph via Reinforcement Learning
by: Huang, Wei, et al.
Published: (2026)
by: Huang, Wei, et al.
Published: (2026)
SQL-Factory: A Multi-Agent Framework for High-Quality and Large-Scale SQL Generation
by: Li, Jiahui, et al.
Published: (2025)
by: Li, Jiahui, et al.
Published: (2025)
The Human Factor in Data Cleaning: Exploring Preferences and Biases
by: AbdElazim, Hazim, et al.
Published: (2026)
by: AbdElazim, Hazim, et al.
Published: (2026)
MixLLM: Dynamic Routing in Mixed Large Language Models
by: Wang, Xinyuan, et al.
Published: (2025)
by: Wang, Xinyuan, et al.
Published: (2025)
Towards Next Generation Data Engineering Pipelines
by: Kramer, Kevin M., et al.
Published: (2025)
by: Kramer, Kevin M., et al.
Published: (2025)
Large Language Model-Enhanced Relational Operators: Taxonomy, Benchmark, and Analysis
by: Su, Yunxiang, et al.
Published: (2026)
by: Su, Yunxiang, et al.
Published: (2026)
Revolutionizing Database Q&A with Large Language Models: Comprehensive Benchmark and Evaluation
by: Zheng, Yihang, et al.
Published: (2024)
by: Zheng, Yihang, et al.
Published: (2024)
Towards General-Purpose Data Discovery: A Programming Languages Approach
by: Kang, Andrew, et al.
Published: (2025)
by: Kang, Andrew, et al.
Published: (2025)
ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement
by: Hong, Zijin, et al.
Published: (2026)
by: Hong, Zijin, et al.
Published: (2026)
Relational Deep Dive: Error-Aware Queries Over Unstructured Data
by: Chao, Daren, et al.
Published: (2025)
by: Chao, Daren, et al.
Published: (2025)
Prompt4Vis: Prompting Large Language Models with Example Mining and Schema Filtering for Tabular Data Visualization
by: Li, Shuaimin, et al.
Published: (2024)
by: Li, Shuaimin, et al.
Published: (2024)
Towards Accurate and Efficient Document Analytics with Large Language Models
by: Lin, Yiming, et al.
Published: (2024)
by: Lin, Yiming, et al.
Published: (2024)
Relational Database Augmented Large Language Model
by: Qin, Zongyue, et al.
Published: (2024)
by: Qin, Zongyue, et al.
Published: (2024)
Similar Items
-
Data Cleaning Using Large Language Models
by: Zhang, Shuo, et al.
Published: (2024) -
AutoDCWorkflow: LLM-based Data Cleaning Workflow Auto-Generation and Benchmark
by: Li, Lan, et al.
Published: (2024) -
LLMClean: Context-Aware Tabular Data Cleaning via LLM-Generated OFDs
by: Biester, Fabian, et al.
Published: (2024) -
Data Cleaning of Data Streams
by: Restat, Valerie, et al.
Published: (2025) -
Sync Without Guesswork: Incomplete Time Series Alignment
by: Jia, Ding, et al.
Published: (2025)