SEED: Domain-Specific Data Curation With Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Zui, Cao, Lei, Madden, Sam, Kraska, Tim, Shang, Zeyuan, Fan, Ju, Tang, Nan, Gu, Zihui, Liu, Chunwei, Cafarella, Michael |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Declarative System for Optimizing AI Workloads
por: Liu, Chunwei, et al.
Publicado: (2024)
por: Liu, Chunwei, et al.
Publicado: (2024)
Abacus: A Cost-Based Optimizer for Semantic Operator Systems
por: Russo, Matthew, et al.
Publicado: (2025)
por: Russo, Matthew, et al.
Publicado: (2025)
Improving DBMS Scheduling Decisions with Fine-grained Performance Prediction on Concurrent Queries -- Extended
por: Wu, Ziniu, et al.
Publicado: (2025)
por: Wu, Ziniu, et al.
Publicado: (2025)
SAGE: Selective Attention-Guided Extraction for Token-Efficient Document Indexing
por: Wang, Xinzhi, et al.
Publicado: (2026)
por: Wang, Xinzhi, et al.
Publicado: (2026)
PBench: Workload Synthesizer with Real Statistics for Cloud Analytics Benchmarking
por: Zhou, Yan, et al.
Publicado: (2025)
por: Zhou, Yan, et al.
Publicado: (2025)
Extract-Transform-Load for Video Streams
por: Kossmann, Ferdinand, et al.
Publicado: (2023)
por: Kossmann, Ferdinand, et al.
Publicado: (2023)
Blueprinting the Cloud: Unifying and Automatically Optimizing Cloud Data Infrastructures with BRAD -- Extended Version
por: Yu, Geoffrey X., et al.
Publicado: (2024)
por: Yu, Geoffrey X., et al.
Publicado: (2024)
Tailwind: A Practical Framework for Query Accelerators
por: Yu, Geoffrey X., et al.
Publicado: (2026)
por: Yu, Geoffrey X., et al.
Publicado: (2026)
Data Agents: Levels, State of the Art, and Open Problems
por: Luo, Yuyu, et al.
Publicado: (2026)
por: Luo, Yuyu, et al.
Publicado: (2026)
KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes
por: Lai, Eugenie, et al.
Publicado: (2025)
por: Lai, Eugenie, et al.
Publicado: (2025)
Computer-Orchestrated Design of Algorithms: From Join Specification to Implementation
por: Hu, Zeyuan
Publicado: (2026)
por: Hu, Zeyuan
Publicado: (2026)
PalimpChat: Declarative and Interactive AI analytics
por: Liu, Chunwei, et al.
Publicado: (2025)
por: Liu, Chunwei, et al.
Publicado: (2025)
A Plug-and-Play Natural Language Rewriter for Natural Language to SQL
por: Ma, Peixian, et al.
Publicado: (2024)
por: Ma, Peixian, et al.
Publicado: (2024)
Deep Research is the New Analytics System: Towards Building the Runtime for AI-Driven Analytics
por: Russo, Matthew, et al.
Publicado: (2025)
por: Russo, Matthew, et al.
Publicado: (2025)
ODIN: A NL2SQL Recommender to Handle Schema Ambiguity
por: Vaidya, Kapil, et al.
Publicado: (2025)
por: Vaidya, Kapil, et al.
Publicado: (2025)
Summarized Causal Explanations For Aggregate Views (Full version)
por: Youngmann, Brit, et al.
Publicado: (2024)
por: Youngmann, Brit, et al.
Publicado: (2024)
DeepAnalyze: Agentic Large Language Models for Autonomous Data Science
por: Zhang, Shaolei, et al.
Publicado: (2025)
por: Zhang, Shaolei, et al.
Publicado: (2025)
Data Formats in Analytical DBMSs: Performance Trade-offs and Future Directions
por: Liu, Chunwei, et al.
Publicado: (2024)
por: Liu, Chunwei, et al.
Publicado: (2024)
Parachute: Single-Pass Bi-Directional Information Passing
por: Stoian, Mihail, et al.
Publicado: (2025)
por: Stoian, Mihail, et al.
Publicado: (2025)
Reconciling Conflicting Data Curation Actions: Transparency Through Argumentation
por: Xia, Yilin, et al.
Publicado: (2024)
por: Xia, Yilin, et al.
Publicado: (2024)
Experiversum: an Ecosystem for Curating and Enhancing Data-Driven Experimental Science
por: Vargas-Solar, Genoveva, et al.
Publicado: (2025)
por: Vargas-Solar, Genoveva, et al.
Publicado: (2025)
ResQ: Realistic Performance-Aware Query Generation
por: Wang, Zhengle, et al.
Publicado: (2026)
por: Wang, Zhengle, et al.
Publicado: (2026)
Optimizing Disjunctive Queries with Tagged Execution
por: Kim, Albert, et al.
Publicado: (2024)
por: Kim, Albert, et al.
Publicado: (2024)
Alpha-SQL: Zero-Shot Text-to-SQL using Monte Carlo Tree Search
por: Li, Boyan, et al.
Publicado: (2025)
por: Li, Boyan, et al.
Publicado: (2025)
Comprehending Spatio-temporal Data via Cinematic Storytelling using Large Language Models
por: Shang, Panos Kalnis. Shuo, et al.
Publicado: (2025)
por: Shang, Panos Kalnis. Shuo, et al.
Publicado: (2025)
TailorSQL: An NL2SQL System Tailored to Your Query Workload
por: Vaidya, Kapil, et al.
Publicado: (2025)
por: Vaidya, Kapil, et al.
Publicado: (2025)
AgentSM: Semantic Memory for Agentic Text-to-SQL
por: Biswal, Asim, et al.
Publicado: (2026)
por: Biswal, Asim, et al.
Publicado: (2026)
Automatic Database Configuration Debugging using Retrieval-Augmented Language Models
por: Chen, Sibei, et al.
Publicado: (2024)
por: Chen, Sibei, et al.
Publicado: (2024)
Reliable Curation of EHR Dataset via Large Language Models under Environmental Constraints
por: Xiong, Raymond M., et al.
Publicado: (2025)
por: Xiong, Raymond M., et al.
Publicado: (2025)
Stage: Query Execution Time Prediction in Amazon Redshift
por: Wu, Ziniu, et al.
Publicado: (2024)
por: Wu, Ziniu, et al.
Publicado: (2024)
Dataversifying Natural Sciences: Pioneering a Data Lake Architecture for Curated Data-Centric Experiments in Life \& Earth Sciences
por: Vargas-Solar, Genoveva, et al.
Publicado: (2024)
por: Vargas-Solar, Genoveva, et al.
Publicado: (2024)
GRACE: A Dynamic Coreset Selection Framework for Large Language Model Optimization
por: Tang, Tianhao, et al.
Publicado: (2026)
por: Tang, Tianhao, et al.
Publicado: (2026)
Are Large Language Models a Good Replacement of Taxonomies?
por: Sun, Yushi, et al.
Publicado: (2024)
por: Sun, Yushi, et al.
Publicado: (2024)
Domain Specific Question to SQL Conversion with Embedded Data Balancing Technique
por: Jyothi, et al.
Publicado: (2025)
por: Jyothi, et al.
Publicado: (2025)
Predictive Query Language: A Domain-Specific Language for Predictive Modeling on Relational Databases
por: Kocijan, Vid, et al.
Publicado: (2026)
por: Kocijan, Vid, et al.
Publicado: (2026)
Data Cleaning Using Large Language Models
por: Zhang, Shuo, et al.
Publicado: (2024)
por: Zhang, Shuo, et al.
Publicado: (2024)
The Dawn of Natural Language to SQL: Are We Fully Ready?
por: Li, Boyan, et al.
Publicado: (2024)
por: Li, Boyan, et al.
Publicado: (2024)
LakeHopper: Cross Data Lakes Column Type Annotation through Model Adaptation
por: Sun, Yushi, et al.
Publicado: (2026)
por: Sun, Yushi, et al.
Publicado: (2026)
Causal DAG Summarization (Full Version)
por: Zeng, Anna, et al.
Publicado: (2025)
por: Zeng, Anna, et al.
Publicado: (2025)
A Unified Model for Cardinality Estimation by Learning from Data and Queries via Sum-Product Networks
por: Liu, Jiawei, et al.
Publicado: (2025)
por: Liu, Jiawei, et al.
Publicado: (2025)
Ejemplares similares
-
A Declarative System for Optimizing AI Workloads
por: Liu, Chunwei, et al.
Publicado: (2024) -
Abacus: A Cost-Based Optimizer for Semantic Operator Systems
por: Russo, Matthew, et al.
Publicado: (2025) -
Improving DBMS Scheduling Decisions with Fine-grained Performance Prediction on Concurrent Queries -- Extended
por: Wu, Ziniu, et al.
Publicado: (2025) -
SAGE: Selective Attention-Guided Extraction for Token-Efficient Document Indexing
por: Wang, Xinzhi, et al.
Publicado: (2026) -
PBench: Workload Synthesizer with Real Statistics for Cloud Analytics Benchmarking
por: Zhou, Yan, et al.
Publicado: (2025)