Humans, Machine Learning, and Language Models in Union: A Cognitive Study on Table Unionability
Fuente:
arXiv
Guardado en:
| Autores principales: | Marimuthu, Sreeram, Klimenkova, Nina, Shraga, Roee |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diverse Unionable Tuple Search: Novelty-Driven Discovery in Data Lakes [Technical Report]
por: Khatiwada, Aamod, et al.
Publicado: (2025)
por: Khatiwada, Aamod, et al.
Publicado: (2025)
Gen-T: Table Reclamation in Data Lakes
por: Fan, Grace, et al.
Publicado: (2024)
por: Fan, Grace, et al.
Publicado: (2024)
Fuzzy Integration of Data Lake Tables
por: Khatiwada, Aamod, et al.
Publicado: (2025)
por: Khatiwada, Aamod, et al.
Publicado: (2025)
BEACON: Budget-Aware Entity Matching Across Domains (Extended Technical Report)
por: Pulsone, Nicholas, et al.
Publicado: (2026)
por: Pulsone, Nicholas, et al.
Publicado: (2026)
SAVeD: Semantic Aware Version Discovery
por: Frenk, Artem, et al.
Publicado: (2025)
por: Frenk, Artem, et al.
Publicado: (2025)
A Declarative Query Language for Scientific Machine Learning
por: Jamil, Hasan M
Publicado: (2024)
por: Jamil, Hasan M
Publicado: (2024)
Bullion: A Column Store for Machine Learning
por: Liao, Gang, et al.
Publicado: (2024)
por: Liao, Gang, et al.
Publicado: (2024)
3dSAGER: Geospatial Entity Resolution over 3D Objects (Technical Report)
por: Genossar, Bar, et al.
Publicado: (2025)
por: Genossar, Bar, et al.
Publicado: (2025)
TabulaX: Leveraging Large Language Models for Multi-Class Table Transformations
por: Nobari, Arash Dargahi, et al.
Publicado: (2024)
por: Nobari, Arash Dargahi, et al.
Publicado: (2024)
Data Cleaning and Machine Learning: A Systematic Literature Review
por: Côté, Pierre-Olivier, et al.
Publicado: (2023)
por: Côté, Pierre-Olivier, et al.
Publicado: (2023)
CoLSE: A Lightweight and Robust Hybrid Learned Model for Single-Table Cardinality Estimation using Joint CDF
por: Rathuwadu, Lankadinee, et al.
Publicado: (2025)
por: Rathuwadu, Lankadinee, et al.
Publicado: (2025)
Algorithmic Data Minimization for Machine Learning over Internet-of-Things Data Streams
por: Shaowang, Ted, et al.
Publicado: (2025)
por: Shaowang, Ted, et al.
Publicado: (2025)
SemPipes -- Optimizable Semantic Data Operators for Tabular Machine Learning Pipelines
por: Ovcharenko, Olga, et al.
Publicado: (2026)
por: Ovcharenko, Olga, et al.
Publicado: (2026)
ExioML: Eco-economic dataset for Machine Learning in Global Sectoral Sustainability
por: Guo, Yanming, et al.
Publicado: (2024)
por: Guo, Yanming, et al.
Publicado: (2024)
Hippasus: Effective and Efficient Automatic Feature Augmentation for Machine Learning Tasks on Relational Data
por: Papadias, Serafeim, et al.
Publicado: (2026)
por: Papadias, Serafeim, et al.
Publicado: (2026)
Pre-Execution Query Slot-Time Prediction in Cloud Data Warehouses: A Feature-Scoped Machine Learning Approach
por: Pathak, Prashant Kumar
Publicado: (2026)
por: Pathak, Prashant Kumar
Publicado: (2026)
Table-LLM-Specialist: Language Model Specialists for Tables using Iterative Generator-Validator Fine-tuning
por: Xing, Junjie, et al.
Publicado: (2024)
por: Xing, Junjie, et al.
Publicado: (2024)
Auto-Test: Learning Semantic-Domain Constraints for Unsupervised Error Detection in Tables
por: Chen, Qixu, et al.
Publicado: (2025)
por: Chen, Qixu, et al.
Publicado: (2025)
Poodle: Seamlessly Scaling Down Large Language Models with Just-in-Time Model Replacement
por: Strassenburg, Nils, et al.
Publicado: (2025)
por: Strassenburg, Nils, et al.
Publicado: (2025)
Machine Learning-Based Pre-Test Risk Stratification for PCR-Confirmed Chlamydia Using Patient-Reported Data and Urine Biomarkers
por: Mahdian, Mehrab, et al.
Publicado: (2026)
por: Mahdian, Mehrab, et al.
Publicado: (2026)
The CAP Principle for LLM Serving: A Survey of Long-Context Large Language Model Serving
por: Zeng, Pai, et al.
Publicado: (2024)
por: Zeng, Pai, et al.
Publicado: (2024)
SEED: Domain-Specific Data Curation With Large Language Models
por: Chen, Zui, et al.
Publicado: (2023)
por: Chen, Zui, et al.
Publicado: (2023)
Magneto: Combining Small and Large Language Models for Schema Matching
por: Liu, Yurong, et al.
Publicado: (2024)
por: Liu, Yurong, et al.
Publicado: (2024)
A Learned Cost Model-based Cross-engine Optimizer for SQL Workloads
por: Strausz, András, et al.
Publicado: (2025)
por: Strausz, András, et al.
Publicado: (2025)
Demonstration of MaskSearch: Efficiently Querying Image Masks for Machine Learning Workflows
por: Wei, Lindsey Linxi, et al.
Publicado: (2024)
por: Wei, Lindsey Linxi, et al.
Publicado: (2024)
Certain and Approximately Certain Models for Statistical Learning
por: Zhen, Cheng, et al.
Publicado: (2024)
por: Zhen, Cheng, et al.
Publicado: (2024)
TranSQL+: Serving Large Language Models with SQL on Low-Resource Hardware
por: Sun, Wenbo, et al.
Publicado: (2025)
por: Sun, Wenbo, et al.
Publicado: (2025)
TorchQL: A Programming Framework for Integrity Constraints in Machine Learning
por: Naik, Aaditya, et al.
Publicado: (2023)
por: Naik, Aaditya, et al.
Publicado: (2023)
Data Collection and Labeling Techniques for Machine Learning
por: Huang, Qianyu, et al.
Publicado: (2024)
por: Huang, Qianyu, et al.
Publicado: (2024)
DEREC-SIMPRO: unlock Language Model benefits to advance Synthesis in Data Clean Room
por: Kwok, Tung Sum Thomas, et al.
Publicado: (2024)
por: Kwok, Tung Sum Thomas, et al.
Publicado: (2024)
Couler: Unified Machine Learning Workflow Optimization in Cloud
por: Wang, Xiaoda, et al.
Publicado: (2024)
por: Wang, Xiaoda, et al.
Publicado: (2024)
TabularMark: Watermarking Tabular Datasets for Machine Learning
por: Zheng, Yihao, et al.
Publicado: (2024)
por: Zheng, Yihao, et al.
Publicado: (2024)
ZeroED: Hybrid Zero-shot Error Detection through Large Language Model Reasoning
por: Ni, Wei, et al.
Publicado: (2025)
por: Ni, Wei, et al.
Publicado: (2025)
NeurStore: Efficient In-database Deep Learning Model Management System
por: Xiang, Siqi, et al.
Publicado: (2025)
por: Xiang, Siqi, et al.
Publicado: (2025)
Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models
por: Liu, Xinyuan, et al.
Publicado: (2025)
por: Liu, Xinyuan, et al.
Publicado: (2025)
Sig2Model: A Boosting-Driven Model for Updatable Learned Indexes
por: Heidari, Alireza, et al.
Publicado: (2025)
por: Heidari, Alireza, et al.
Publicado: (2025)
Observatory: Characterizing Embeddings of Relational Tables
por: Cong, Tianji, et al.
Publicado: (2023)
por: Cong, Tianji, et al.
Publicado: (2023)
A Comprehensive Study of Shapley Value in Data Analytics
por: Lin, Hong, et al.
Publicado: (2024)
por: Lin, Hong, et al.
Publicado: (2024)
QoS-QoE Translation with Large Language Model
por: Yu, Yingjie, et al.
Publicado: (2026)
por: Yu, Yingjie, et al.
Publicado: (2026)
Retrieve, Merge, Predict: Augmenting Tables with Data Lakes
por: Cappuzzo, Riccardo, et al.
Publicado: (2024)
por: Cappuzzo, Riccardo, et al.
Publicado: (2024)
Ejemplares similares
-
Diverse Unionable Tuple Search: Novelty-Driven Discovery in Data Lakes [Technical Report]
por: Khatiwada, Aamod, et al.
Publicado: (2025) -
Gen-T: Table Reclamation in Data Lakes
por: Fan, Grace, et al.
Publicado: (2024) -
Fuzzy Integration of Data Lake Tables
por: Khatiwada, Aamod, et al.
Publicado: (2025) -
BEACON: Budget-Aware Entity Matching Across Domains (Extended Technical Report)
por: Pulsone, Nicholas, et al.
Publicado: (2026) -
SAVeD: Semantic Aware Version Discovery
por: Frenk, Artem, et al.
Publicado: (2025)