PLM4NDV: Minimizing Data Access for Number of Distinct Values Estimation with Pre-trained Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Xianghong, He, Xiao, Zhang, Tieying, Zhang, Lei, Shi, Rui, Chen, Jianjun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AdaNDV: Adaptive Number of Distinct Value Estimation via Learning to Select and Fuse Estimators
by: Xu, Xianghong, et al.
Published: (2025)
by: Xu, Xianghong, et al.
Published: (2025)
ZeroCard: Cardinality Estimation with Zero Dependence on Target Databases -- No Data, No Query, No Retraining
by: Xu, Xianghong, et al.
Published: (2025)
by: Xu, Xianghong, et al.
Published: (2025)
VIDEX: A Disaggregated and Extensible Virtual Index for the Cloud and AI Era
by: Kang, Rong, et al.
Published: (2025)
by: Kang, Rong, et al.
Published: (2025)
Can Large Language Models be a Cardinality Estimator? An Empirical study
by: Liu, Liangzu, et al.
Published: (2026)
by: Liu, Liangzu, et al.
Published: (2026)
Query Performance Explanation through Large Language Model for HTAP Systems
by: Xiu, Haibo, et al.
Published: (2024)
by: Xiu, Haibo, et al.
Published: (2024)
Zero-Cost NDV Estimation from Columnar File Metadata
by: Brisson, Claude
Published: (2026)
by: Brisson, Claude
Published: (2026)
Revisiting Data Analysis with Pre-trained Foundation Models
by: Liang, Chen, et al.
Published: (2025)
by: Liang, Chen, et al.
Published: (2025)
Data-Agnostic Cardinality Learning from Imperfect Workloads
by: Wu, Peizhi, et al.
Published: (2025)
by: Wu, Peizhi, et al.
Published: (2025)
OmniSQL: Synthesizing High-quality Text-to-SQL Data at Scale
by: Li, Haoyang, et al.
Published: (2025)
by: Li, Haoyang, et al.
Published: (2025)
DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation
by: Fan, Meihao, et al.
Published: (2026)
by: Fan, Meihao, et al.
Published: (2026)
E2ETune: End-to-End Knob Tuning via Fine-tuned Generative Language Model
by: Huang, Xinmei, et al.
Published: (2024)
by: Huang, Xinmei, et al.
Published: (2024)
LLMIA: An Out-of-the-Box Index Advisor via In-Context Learning with LLMs
by: Zhao, Xinxin, et al.
Published: (2025)
by: Zhao, Xinxin, et al.
Published: (2025)
DataVisT5: A Pre-trained Language Model for Jointly Understanding Text and Data Visualization
by: Wan, Zhuoyue, et al.
Published: (2024)
by: Wan, Zhuoyue, et al.
Published: (2024)
ABase: the Multi-Tenant NoSQL Serverless Database for Diverse and Dynamic Workloads in Large-scale Cloud Environments
by: Kang, Rong, et al.
Published: (2025)
by: Kang, Rong, et al.
Published: (2025)
LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO
by: Li, Jiahui, et al.
Published: (2026)
by: Li, Jiahui, et al.
Published: (2026)
Tidehunter: Large-Value Storage With Minimal Data Relocation
by: Chursin, Andrey, et al.
Published: (2026)
by: Chursin, Andrey, et al.
Published: (2026)
Intelligent Transaction Scheduling via Conflict Prediction in OLTP DBMS
by: Zhang, Tieying, et al.
Published: (2024)
by: Zhang, Tieying, et al.
Published: (2024)
KRONE: Scalable LLM-Augmented Log Anomaly Detection via Hierarchical Abstraction
by: Ma, Lei, et al.
Published: (2026)
by: Ma, Lei, et al.
Published: (2026)
Relational In-Context Learning via Synthetic Pre-training with Structural Prior
by: Wang, Yanbo, et al.
Published: (2026)
by: Wang, Yanbo, et al.
Published: (2026)
Large Language Models as Data Preprocessors
by: Zhang, Haochen, et al.
Published: (2023)
by: Zhang, Haochen, et al.
Published: (2023)
Efficient Unsupervised Community Search with Pre-trained Graph Transformer
by: Wang, Jianwei, et al.
Published: (2024)
by: Wang, Jianwei, et al.
Published: (2024)
Data Cleaning Using Large Language Models
by: Zhang, Shuo, et al.
Published: (2024)
by: Zhang, Shuo, et al.
Published: (2024)
LEDD: Large Language Model-Empowered Data Discovery in Data Lakes
by: An, Qi, et al.
Published: (2025)
by: An, Qi, et al.
Published: (2025)
CompassDB: Pioneering High-Performance Key-Value Store with Perfect Hash
by: Jiang, Jin, et al.
Published: (2024)
by: Jiang, Jin, et al.
Published: (2024)
ACE: A Cardinality Estimator for Set-Valued Queries
by: Sheng, Yufan, et al.
Published: (2025)
by: Sheng, Yufan, et al.
Published: (2025)
FOCUS: Boosting Schema-aware Access for KV Stores via Hierarchical Data Management
by: Liu, Zhen, et al.
Published: (2025)
by: Liu, Zhen, et al.
Published: (2025)
Distinctiveness Maximization in Datasets Assemblage
by: Wang, Tingting, et al.
Published: (2024)
by: Wang, Tingting, et al.
Published: (2024)
Heterogeneous Data Access Model for Concurrency Control and Methods to Deal with High Data Contention
by: Thomasian, Alexander
Published: (2024)
by: Thomasian, Alexander
Published: (2024)
CHASE: A Native Relational Database for Hybrid Queries on Structured and Unstructured Data
by: Ma, Rui, et al.
Published: (2025)
by: Ma, Rui, et al.
Published: (2025)
Efficient Influence Minimization via Node Blocking
by: Wang, Jinghao, et al.
Published: (2024)
by: Wang, Jinghao, et al.
Published: (2024)
Castle: Causal Cascade Updates in Relational Databases with Large Language Models
by: Su, Yongye, et al.
Published: (2025)
by: Su, Yongye, et al.
Published: (2025)
Common Neighborhood Estimation over Bipartite Graphs under Local Differential Privacy
by: He, Yizhang, et al.
Published: (2025)
by: He, Yizhang, et al.
Published: (2025)
Updateable Data-Driven Cardinality Estimator with Bounded Q-error
by: Li, Yingze, et al.
Published: (2024)
by: Li, Yingze, et al.
Published: (2024)
AutoCE: An Accurate and Efficient Model Advisor for Learned Cardinality Estimation
by: Zhang, Jintao, et al.
Published: (2024)
by: Zhang, Jintao, et al.
Published: (2024)
Relation-Stratified Sampling for Shapley Values Estimation in Relational Databases
by: Alizad, Amirhossein, et al.
Published: (2025)
by: Alizad, Amirhossein, et al.
Published: (2025)
Jellyfish: A Large Language Model for Data Preprocessing
by: Zhang, Haochen, et al.
Published: (2023)
by: Zhang, Haochen, et al.
Published: (2023)
Enterprise Data Science Platform: A Unified Architecture for Federated Data Access
by: Miyamoto, Ryoto, et al.
Published: (2025)
by: Miyamoto, Ryoto, et al.
Published: (2025)
Machine Learning-Augmented Ontology-Based Data Access for Renewable Energy Data
by: Calautti, Marco, et al.
Published: (2024)
by: Calautti, Marco, et al.
Published: (2024)
BoostER: Leveraging Large Language Models for Enhancing Entity Resolution
by: Li, Huahang, et al.
Published: (2024)
by: Li, Huahang, et al.
Published: (2024)
RADAR: Benchmarking Language Models on Imperfect Tabular Data
by: Gu, Ken, et al.
Published: (2025)
by: Gu, Ken, et al.
Published: (2025)
Similar Items
-
AdaNDV: Adaptive Number of Distinct Value Estimation via Learning to Select and Fuse Estimators
by: Xu, Xianghong, et al.
Published: (2025) -
ZeroCard: Cardinality Estimation with Zero Dependence on Target Databases -- No Data, No Query, No Retraining
by: Xu, Xianghong, et al.
Published: (2025) -
VIDEX: A Disaggregated and Extensible Virtual Index for the Cloud and AI Era
by: Kang, Rong, et al.
Published: (2025) -
Can Large Language Models be a Cardinality Estimator? An Empirical study
by: Liu, Liangzu, et al.
Published: (2026) -
Query Performance Explanation through Large Language Model for HTAP Systems
by: Xiu, Haibo, et al.
Published: (2024)