Large Language Models and Synthetic Data for Monitoring Dataset Mentions in Research Papers
Fuente:
arXiv
Saved in:
| Main Authors: | Solatorio, Aivin V., Macalaba, Rafael, Liounis, James |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AI for Monitoring and Classifying Data Used in Research Literature
by: Macalaba, Rafael, et al.
Published: (2026)
by: Macalaba, Rafael, et al.
Published: (2026)
Proof-Carrying Numbers (PCN): A Protocol for Trustworthy Numeric Answers from LLMs via Claim Verification
by: Solatorio, Aivin V.
Published: (2025)
by: Solatorio, Aivin V.
Published: (2025)
GISTEmbed: Guided In-sample Selection of Training Negatives for Text Embedding Fine-tuning
by: Solatorio, Aivin V.
Published: (2024)
by: Solatorio, Aivin V.
Published: (2024)
Double Jeopardy and Climate Impact in the Use of Large Language Models: Socio-economic Disparities and Reduced Utility for Non-English Speakers
by: Solatorio, Aivin V., et al.
Published: (2024)
by: Solatorio, Aivin V., et al.
Published: (2024)
Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models
by: Liu, Wei, et al.
Published: (2026)
by: Liu, Wei, et al.
Published: (2026)
Jellyfish: A Large Language Model for Data Preprocessing
by: Zhang, Haochen, et al.
Published: (2023)
by: Zhang, Haochen, et al.
Published: (2023)
Informatics for Food Processing
by: Ispirova, Gordana, et al.
Published: (2025)
by: Ispirova, Gordana, et al.
Published: (2025)
SQL-GEN: Bridging the Dialect Gap for Text-to-SQL Via Synthetic Data And Model Merging
by: Pourreza, Mohammadreza, et al.
Published: (2024)
by: Pourreza, Mohammadreza, et al.
Published: (2024)
When Large Language Models Meet Vector Databases: A Survey
by: Jing, Zhi, et al.
Published: (2024)
by: Jing, Zhi, et al.
Published: (2024)
ResumeAtlas: Revisiting Resume Classification with Large-Scale Datasets and Large Language Models
by: Heakl, Ahmed, et al.
Published: (2024)
by: Heakl, Ahmed, et al.
Published: (2024)
SQLBarber: A System Leveraging Large Language Models to Generate Customized and Realistic SQL Workloads
by: Lao, Jiale, et al.
Published: (2025)
by: Lao, Jiale, et al.
Published: (2025)
Unmasking and Improving Data Credibility: A Study with Datasets for Training Harmless Language Models
by: Zhu, Zhaowei, et al.
Published: (2023)
by: Zhu, Zhaowei, et al.
Published: (2023)
OmniPred: Language Models as Universal Regressors
by: Song, Xingyou, et al.
Published: (2024)
by: Song, Xingyou, et al.
Published: (2024)
Trajectory Data Management and Mining: A Survey from Deep Learning to the LLM Era
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
Beyond Via: Analysis and Estimation of the Impact of Large Language Models in Academic Papers
by: Geng, Mingmeng, et al.
Published: (2026)
by: Geng, Mingmeng, et al.
Published: (2026)
Editing Conceptual Knowledge for Large Language Models
by: Wang, Xiaohan, et al.
Published: (2024)
by: Wang, Xiaohan, et al.
Published: (2024)
DualAlign: Generating Clinically Grounded Synthetic Data
by: Li, Rumeng, et al.
Published: (2025)
by: Li, Rumeng, et al.
Published: (2025)
Graph Learning in the Era of LLMs: A Survey from the Perspective of Data, Models, and Tasks
by: Li, Xunkai, et al.
Published: (2024)
by: Li, Xunkai, et al.
Published: (2024)
Evaluating the Generalization Ability of Spatiotemporal Model in Urban Scenario
by: Wang, Hongjun, et al.
Published: (2024)
by: Wang, Hongjun, et al.
Published: (2024)
SMART: Automatically Scaling Down Language Models with Accuracy Guarantees for Reduced Processing Fees
by: Jo, Saehan, et al.
Published: (2024)
by: Jo, Saehan, et al.
Published: (2024)
Correlated Errors in Large Language Models
by: Kim, Elliot, et al.
Published: (2025)
by: Kim, Elliot, et al.
Published: (2025)
Hypothesis Generation with Large Language Models
by: Zhou, Yangqiaoyu, et al.
Published: (2024)
by: Zhou, Yangqiaoyu, et al.
Published: (2024)
Large Language Models are Geographically Biased
by: Manvi, Rohin, et al.
Published: (2024)
by: Manvi, Rohin, et al.
Published: (2024)
Data Agent: A Holistic Architecture for Orchestrating Data+AI Ecosystems
by: Sun, Zhaoyan, et al.
Published: (2025)
by: Sun, Zhaoyan, et al.
Published: (2025)
Psychological Counseling Ability of Large Language Models
by: Peng, Fangyu, et al.
Published: (2025)
by: Peng, Fangyu, et al.
Published: (2025)
Assessing Large Language Models on Climate Information
by: Bulian, Jannis, et al.
Published: (2023)
by: Bulian, Jannis, et al.
Published: (2023)
LLM-Enhanced Data Management
by: Zhou, Xuanhe, et al.
Published: (2024)
by: Zhou, Xuanhe, et al.
Published: (2024)
Unveiling the Pitfalls of Knowledge Editing for Large Language Models
by: Li, Zhoubo, et al.
Published: (2023)
by: Li, Zhoubo, et al.
Published: (2023)
A Taxonomy of Stereotype Content in Large Language Models
by: Nicolas, Gandalf, et al.
Published: (2024)
by: Nicolas, Gandalf, et al.
Published: (2024)
Bias and Fairness in Large Language Models: A Survey
by: Gallegos, Isabel O., et al.
Published: (2023)
by: Gallegos, Isabel O., et al.
Published: (2023)
Transforming Agency. On the mode of existence of Large Language Models
by: Barandiaran, Xabier E., et al.
Published: (2024)
by: Barandiaran, Xabier E., et al.
Published: (2024)
LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models
by: Faiz, Ahmad, et al.
Published: (2023)
by: Faiz, Ahmad, et al.
Published: (2023)
Skill Learning Using Process Mining for Large Language Model Plan Generation
by: Redis, Andrei Cosmin, et al.
Published: (2024)
by: Redis, Andrei Cosmin, et al.
Published: (2024)
Database Entity Recognition with Data Augmentation and Deep Learning
by: Fu, Zikun, et al.
Published: (2025)
by: Fu, Zikun, et al.
Published: (2025)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
by: Anwar, Usman, et al.
Published: (2024)
by: Anwar, Usman, et al.
Published: (2024)
Exploring Accuracy-Fairness Trade-off in Large Language Models
by: Zhang, Qingquan, et al.
Published: (2024)
by: Zhang, Qingquan, et al.
Published: (2024)
Are Large Language Models Chameleons? An Attempt to Simulate Social Surveys
by: Geng, Mingmeng, et al.
Published: (2024)
by: Geng, Mingmeng, et al.
Published: (2024)
QUIS: Question-guided Insights Generation for Automated Exploratory Data Analysis
by: Manatkar, Abhijit, et al.
Published: (2024)
by: Manatkar, Abhijit, et al.
Published: (2024)
PMKLC: Parallel Multi-Knowledge Learning-based Lossless Compression for Large-Scale Genomics Database
by: Sun, Hui, et al.
Published: (2025)
by: Sun, Hui, et al.
Published: (2025)
Towards Large Language Models that Benefit for All: Benchmarking Group Fairness in Reward Models
by: Song, Kefan, et al.
Published: (2025)
by: Song, Kefan, et al.
Published: (2025)
Similar Items
-
AI for Monitoring and Classifying Data Used in Research Literature
by: Macalaba, Rafael, et al.
Published: (2026) -
Proof-Carrying Numbers (PCN): A Protocol for Trustworthy Numeric Answers from LLMs via Claim Verification
by: Solatorio, Aivin V.
Published: (2025) -
GISTEmbed: Guided In-sample Selection of Training Negatives for Text Embedding Fine-tuning
by: Solatorio, Aivin V.
Published: (2024) -
Double Jeopardy and Climate Impact in the Use of Large Language Models: Socio-economic Disparities and Reduced Utility for Non-English Speakers
by: Solatorio, Aivin V., et al.
Published: (2024) -
Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models
by: Liu, Wei, et al.
Published: (2026)