AutoDCWorkflow: LLM-based Data Cleaning Workflow Auto-Generation and Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Lan, Fang, Liri, Ludäscher, Bertram, Torvik, Vetle I. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
T-KAER: Transparency-enhanced Knowledge-Augmented Entity Resolution Framework
by: Li, Lan, et al.
Published: (2024)
by: Li, Lan, et al.
Published: (2024)
Reconciling Conflicting Data Curation Actions: Transparency Through Argumentation
by: Xia, Yilin, et al.
Published: (2024)
by: Xia, Yilin, et al.
Published: (2024)
LLM-AutoDiff: Auto-Differentiate Any LLM Workflow
by: Yin, Li, et al.
Published: (2025)
by: Yin, Li, et al.
Published: (2025)
Euler/X: A Toolkit for Logic-based Taxonomy Integration
by: Chen, Mingmin, et al.
Published: (2014)
by: Chen, Mingmin, et al.
Published: (2014)
Auto-Formula: Recommend Formulas in Spreadsheets using Contrastive Learning for Table Representations
by: Chen, Sibei, et al.
Published: (2024)
by: Chen, Sibei, et al.
Published: (2024)
AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
by: Wang, Ziyang, et al.
Published: (2025)
by: Wang, Ziyang, et al.
Published: (2025)
Advancing the Database of Cross-Linguistic Colexifications with New Workflows and Data
by: Tjuka, Annika, et al.
Published: (2025)
by: Tjuka, Annika, et al.
Published: (2025)
Knapsack Optimization-based Schema Linking for LLM-based Text-to-SQL Generation
by: Yuan, Zheng, et al.
Published: (2025)
by: Yuan, Zheng, et al.
Published: (2025)
Logica-TGD: Transforming Graph Databases Logically
by: Skvortsov, Evgeny, et al.
Published: (2025)
by: Skvortsov, Evgeny, et al.
Published: (2025)
AutoGEEval: A Multimodal and Automated Framework for Geospatial Code Generation on GEE with Large Language Models
by: Hou, Shuyang, et al.
Published: (2025)
by: Hou, Shuyang, et al.
Published: (2025)
Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA
by: Li, Fengyu, et al.
Published: (2026)
by: Li, Fengyu, et al.
Published: (2026)
PM-LLM-Benchmark: Evaluating Large Language Models on Process Mining Tasks
by: Berti, Alessandro, et al.
Published: (2024)
by: Berti, Alessandro, et al.
Published: (2024)
RADAR: Benchmarking Language Models on Imperfect Tabular Data
by: Gu, Ken, et al.
Published: (2025)
by: Gu, Ken, et al.
Published: (2025)
An LLM-Based Approach for Insight Generation in Data Analysis
by: Pérez, Alberto Sánchez, et al.
Published: (2025)
by: Pérez, Alberto Sánchez, et al.
Published: (2025)
DP-Bench: A Benchmark for Evaluating Data Product Creation Systems
by: Chowdhury, Faisal, et al.
Published: (2025)
by: Chowdhury, Faisal, et al.
Published: (2025)
SQLStructEval: Structural Evaluation of LLM Text-to-SQL Generation
by: Zhou, Yixi, et al.
Published: (2026)
by: Zhou, Yixi, et al.
Published: (2026)
What Do LLMs Need to Understand Graphs: A Survey of Parametric Representation of Graphs
by: Fu, Dongqi, et al.
Published: (2024)
by: Fu, Dongqi, et al.
Published: (2024)
Rethinking Agentic Workflows: Evaluating Inference-Based Test-Time Scaling Strategies in Text2SQL Tasks
by: Guo, Jiajing, et al.
Published: (2025)
by: Guo, Jiajing, et al.
Published: (2025)
LLM-R2: A Large Language Model Enhanced Rule-based Rewrite System for Boosting Query Efficiency
by: Li, Zhaodonghui, et al.
Published: (2024)
by: Li, Zhaodonghui, et al.
Published: (2024)
Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs
by: Zhou, Wei, et al.
Published: (2026)
by: Zhou, Wei, et al.
Published: (2026)
Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework
by: Wu, Yanchen, et al.
Published: (2026)
by: Wu, Yanchen, et al.
Published: (2026)
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
by: Hong, Zijin, et al.
Published: (2024)
by: Hong, Zijin, et al.
Published: (2024)
Generating Explanations to Understand and Repair Embedding-based Entity Alignment
by: Tian, Xiaobin, et al.
Published: (2023)
by: Tian, Xiaobin, et al.
Published: (2023)
LLM-Enhanced Data Management
by: Zhou, Xuanhe, et al.
Published: (2024)
by: Zhou, Xuanhe, et al.
Published: (2024)
DataLab: A Unified Platform for LLM-Powered Business Intelligence
by: Weng, Luoxuan, et al.
Published: (2024)
by: Weng, Luoxuan, et al.
Published: (2024)
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
by: Lei, Fangyu, et al.
Published: (2024)
by: Lei, Fangyu, et al.
Published: (2024)
TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine
by: Xie, Jiacheng, et al.
Published: (2025)
by: Xie, Jiacheng, et al.
Published: (2025)
A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection
by: Reis, Philipp, et al.
Published: (2026)
by: Reis, Philipp, et al.
Published: (2026)
LLM and Agent-Driven Data Analysis: A Systematic Approach for Enterprise Applications and System-level Deployment
by: Wang, Xi, et al.
Published: (2025)
by: Wang, Xi, et al.
Published: (2025)
MEBench: Benchmarking Large Language Models for Cross-Document Multi-Entity Question Answering
by: Lin, Teng, et al.
Published: (2025)
by: Lin, Teng, et al.
Published: (2025)
LLM-SQL-Solver: Can LLMs Determine SQL Equivalence?
by: Zhao, Fuheng, et al.
Published: (2023)
by: Zhao, Fuheng, et al.
Published: (2023)
OmniRouter: Budget and Performance Controllable Multi-LLM Routing
by: Mei, Kai, et al.
Published: (2025)
by: Mei, Kai, et al.
Published: (2025)
An LLM Agent-Based Complex Semantic Table Annotation Approach
by: Geng, Yilin, et al.
Published: (2025)
by: Geng, Yilin, et al.
Published: (2025)
ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement
by: Hong, Zijin, et al.
Published: (2026)
by: Hong, Zijin, et al.
Published: (2026)
OmniSQL: Synthesizing High-quality Text-to-SQL Data at Scale
by: Li, Haoyang, et al.
Published: (2025)
by: Li, Haoyang, et al.
Published: (2025)
SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering
by: Lee, Gyubok, et al.
Published: (2025)
by: Lee, Gyubok, et al.
Published: (2025)
LLMpedia: A Transparent Framework to Materialize an LLM's Encyclopedic Knowledge at Scale
by: Saeed, Muhammed, et al.
Published: (2026)
by: Saeed, Muhammed, et al.
Published: (2026)
How Robust Are Router-LLMs? Analysis of the Fragility of LLM Routing Capabilities
by: Kassem, Aly M., et al.
Published: (2025)
by: Kassem, Aly M., et al.
Published: (2025)
LakeHopper: Cross Data Lakes Column Type Annotation through Model Adaptation
by: Sun, Yushi, et al.
Published: (2026)
by: Sun, Yushi, et al.
Published: (2026)
HyperJoin: LLM-augmented Hypergraph Link Prediction for Joinable Table Discovery
by: Liu, Shiyuan, et al.
Published: (2026)
by: Liu, Shiyuan, et al.
Published: (2026)
Similar Items
-
T-KAER: Transparency-enhanced Knowledge-Augmented Entity Resolution Framework
by: Li, Lan, et al.
Published: (2024) -
Reconciling Conflicting Data Curation Actions: Transparency Through Argumentation
by: Xia, Yilin, et al.
Published: (2024) -
LLM-AutoDiff: Auto-Differentiate Any LLM Workflow
by: Yin, Li, et al.
Published: (2025) -
Euler/X: A Toolkit for Logic-based Taxonomy Integration
by: Chen, Mingmin, et al.
Published: (2014) -
Auto-Formula: Recommend Formulas in Spreadsheets using Contrastive Learning for Table Representations
by: Chen, Sibei, et al.
Published: (2024)