LakeHopper: Cross Data Lakes Column Type Annotation through Model Adaptation
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Yushi, Li, Xujia, Tang, Nan, Xu, Quanqing, Yang, Chuanhui, Chen, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Virtuous Cycle: AI-Powered Vector Search and Vector Search-Augmented AI
di: Wei, Jiuqi, et al.
Pubblicazione: (2026)
di: Wei, Jiuqi, et al.
Pubblicazione: (2026)
Are Large Language Models a Good Replacement of Taxonomies?
di: Sun, Yushi, et al.
Pubblicazione: (2024)
di: Sun, Yushi, et al.
Pubblicazione: (2024)
TaCo: Data-adaptive and Query-aware Subspace Collision for High-dimensional Approximate Nearest Neighbor Search
di: Wei, Jiuqi, et al.
Pubblicazione: (2026)
di: Wei, Jiuqi, et al.
Pubblicazione: (2026)
PDET-LSH: Scalable In-Memory Indexing for High-Dimensional Approximate Nearest Neighbor Search with Quality Guarantees
di: Wei, Jiuqi, et al.
Pubblicazione: (2026)
di: Wei, Jiuqi, et al.
Pubblicazione: (2026)
MCI-SQL: Text-to-SQL with Metadata-Complete Context and Intermediate Correction
di: Wang, Qin, et al.
Pubblicazione: (2026)
di: Wang, Qin, et al.
Pubblicazione: (2026)
A Tree-Structured Two-Phase Commit Framework for OceanBase: Optimizing Scalability and Consistency
di: Xu, Quanqing, et al.
Pubblicazione: (2026)
di: Xu, Quanqing, et al.
Pubblicazione: (2026)
A High-Throughput GPU Framework for Adaptive Lossless Compression of Floating-Point Data
di: Li, Zheng, et al.
Pubblicazione: (2025)
di: Li, Zheng, et al.
Pubblicazione: (2025)
Columbo: Expanding Abbreviated Column Names for Tabular Data Using Large Language Models
di: Cai, Ting, et al.
Pubblicazione: (2025)
di: Cai, Ting, et al.
Pubblicazione: (2025)
Cross-domain-aware Worker Selection with Training for Crowdsourced Annotation
di: Sun, Yushi, et al.
Pubblicazione: (2024)
di: Sun, Yushi, et al.
Pubblicazione: (2024)
Rethinking LSM-tree based Key-Value Stores: A Survey
di: Lv, Yina, et al.
Pubblicazione: (2025)
di: Lv, Yina, et al.
Pubblicazione: (2025)
MEBench: Benchmarking Large Language Models for Cross-Document Multi-Entity Question Answering
di: Lin, Teng, et al.
Pubblicazione: (2025)
di: Lin, Teng, et al.
Pubblicazione: (2025)
RetClean: Retrieval-Based Data Cleaning Using Foundation Models and Data Lakes
di: Naeem, Zan Ahmad, et al.
Pubblicazione: (2023)
di: Naeem, Zan Ahmad, et al.
Pubblicazione: (2023)
OceanBase Bacchus: a High-Performance and Scalable Cloud-Native Shared Storage Architecture for Multi-Cloud
di: Xu, Quanqing, et al.
Pubblicazione: (2026)
di: Xu, Quanqing, et al.
Pubblicazione: (2026)
Retrieve-and-Verify: A Table Context Selection Framework for Accurate Column Annotations
di: Ding, Zhihao, et al.
Pubblicazione: (2025)
di: Ding, Zhihao, et al.
Pubblicazione: (2025)
TQL: Towards Type-Driven Data Discovery
di: Kang, Andrew, et al.
Pubblicazione: (2025)
di: Kang, Andrew, et al.
Pubblicazione: (2025)
A Cross-Perspective Annotated Dataset for Dynamic Object-Level Attention Modeling in Cloud Gaming
di: Lei, Hongqin, et al.
Pubblicazione: (2025)
di: Lei, Hongqin, et al.
Pubblicazione: (2025)
A General Framework for Per-record Differential Privacy
di: Chen, Xinghe, et al.
Pubblicazione: (2025)
di: Chen, Xinghe, et al.
Pubblicazione: (2025)
Synthetic SQL Column Descriptions and Their Impact on Text-to-SQL Performance
di: Wretblad, Niklas, et al.
Pubblicazione: (2024)
di: Wretblad, Niklas, et al.
Pubblicazione: (2024)
Create Benchmarks for Data Lakes
di: Lyu, Yi, et al.
Pubblicazione: (2026)
di: Lyu, Yi, et al.
Pubblicazione: (2026)
Optimizing Data Lakes' Queries
di: Gregory, et al.
Pubblicazione: (2025)
di: Gregory, et al.
Pubblicazione: (2025)
Defense against Poisoning Attacks under Shuffle-DP
di: Wang, Siyi, et al.
Pubblicazione: (2026)
di: Wang, Siyi, et al.
Pubblicazione: (2026)
RACOON: An LLM-based Framework for Retrieval-Augmented Column Type Annotation with a Knowledge Graph
di: Wei, Lindsey Linxi, et al.
Pubblicazione: (2024)
di: Wei, Lindsey Linxi, et al.
Pubblicazione: (2024)
Advancing the Database of Cross-Linguistic Colexifications with New Workflows and Data
di: Tjuka, Annika, et al.
Pubblicazione: (2025)
di: Tjuka, Annika, et al.
Pubblicazione: (2025)
LakeVisage: Towards Scalable, Flexible and Interactive Visualization Recommendation for Data Discovery over Data Lakes
di: Hu, Yihao, et al.
Pubblicazione: (2025)
di: Hu, Yihao, et al.
Pubblicazione: (2025)
LEDD: Large Language Model-Empowered Data Discovery in Data Lakes
di: An, Qi, et al.
Pubblicazione: (2025)
di: An, Qi, et al.
Pubblicazione: (2025)
Query Performance Explanation through Large Language Model for HTAP Systems
di: Xiu, Haibo, et al.
Pubblicazione: (2024)
di: Xiu, Haibo, et al.
Pubblicazione: (2024)
Gen-T: Table Reclamation in Data Lakes
di: Fan, Grace, et al.
Pubblicazione: (2024)
di: Fan, Grace, et al.
Pubblicazione: (2024)
Automating Database-Native Function Code Synthesis with LLMs
di: Zhou, Wei, et al.
Pubblicazione: (2026)
di: Zhou, Wei, et al.
Pubblicazione: (2026)
RADAR: Benchmarking Language Models on Imperfect Tabular Data
di: Gu, Ken, et al.
Pubblicazione: (2025)
di: Gu, Ken, et al.
Pubblicazione: (2025)
An LLM Agent-Based Complex Semantic Table Annotation Approach
di: Geng, Yilin, et al.
Pubblicazione: (2025)
di: Geng, Yilin, et al.
Pubblicazione: (2025)
SketchFill: Sketch-Guided Code Generation for Imputing Derived Missing Values
di: Zhang, Yunfan, et al.
Pubblicazione: (2024)
di: Zhang, Yunfan, et al.
Pubblicazione: (2024)
Something's Fishy In The Data Lake: A Critical Re-evaluation of Table Union Search Benchmarks
di: Boutaleb, Allaa, et al.
Pubblicazione: (2025)
di: Boutaleb, Allaa, et al.
Pubblicazione: (2025)
Efficient and Effective Table-Centric Table Union Search in Data Lakes
di: Sun, Yongkang, et al.
Pubblicazione: (2026)
di: Sun, Yongkang, et al.
Pubblicazione: (2026)
Model Lakes
di: Pal, Koyena, et al.
Pubblicazione: (2024)
di: Pal, Koyena, et al.
Pubblicazione: (2024)
Context-Driven Index Trimming: A Data Quality Perspective to Enhancing Precision of RALMs
di: Ma, Kexin, et al.
Pubblicazione: (2024)
di: Ma, Kexin, et al.
Pubblicazione: (2024)
XTable in Action: Seamless Interoperability in Data Lakes
di: Agrawal, Ashvin, et al.
Pubblicazione: (2024)
di: Agrawal, Ashvin, et al.
Pubblicazione: (2024)
FREYJA: Efficient Join Discovery in Data Lakes
di: Maynou, Marc, et al.
Pubblicazione: (2024)
di: Maynou, Marc, et al.
Pubblicazione: (2024)
Exploiting Formal Concept Analysis for Data Modeling in Data Lakes
di: Bendimerad, Anes, et al.
Pubblicazione: (2024)
di: Bendimerad, Anes, et al.
Pubblicazione: (2024)
TAIJI: MCP-based Multi-Modal Data Analytics on Data Lakes
di: Zhang, Chao, et al.
Pubblicazione: (2025)
di: Zhang, Chao, et al.
Pubblicazione: (2025)
EllieSQL: Cost-Efficient Text-to-SQL with Complexity-Aware Routing
di: Zhu, Yizhang, et al.
Pubblicazione: (2025)
di: Zhu, Yizhang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Virtuous Cycle: AI-Powered Vector Search and Vector Search-Augmented AI
di: Wei, Jiuqi, et al.
Pubblicazione: (2026) -
Are Large Language Models a Good Replacement of Taxonomies?
di: Sun, Yushi, et al.
Pubblicazione: (2024) -
TaCo: Data-adaptive and Query-aware Subspace Collision for High-dimensional Approximate Nearest Neighbor Search
di: Wei, Jiuqi, et al.
Pubblicazione: (2026) -
PDET-LSH: Scalable In-Memory Indexing for High-Dimensional Approximate Nearest Neighbor Search with Quality Guarantees
di: Wei, Jiuqi, et al.
Pubblicazione: (2026) -
MCI-SQL: Text-to-SQL with Metadata-Complete Context and Intermediate Correction
di: Wang, Qin, et al.
Pubblicazione: (2026)