What Level of Automation is "Good Enough"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Lingbo, Mathrani, Anuradha, Susnjak, Teo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Transforming Evidence Synthesis: A Systematic Review of the Evolution of Automated Meta-Analysis in the Age of AI
par: Li, Lingbo, et autres
Publié: (2025)
par: Li, Lingbo, et autres
Publié: (2025)
Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification
par: Han, Binglan, et autres
Publié: (2025)
par: Han, Binglan, et autres
Publié: (2025)
Automated Risk-of-Bias Assessment of Randomized Controlled Trials: A First Look at a GEPA-trained Programmatic Prompting Framework
par: Li, Lingbo, et autres
Publié: (2025)
par: Li, Lingbo, et autres
Publié: (2025)
Compiling Prompts, Not Crafting Them: A Reproducible Workflow for AI-Assisted Evidence Synthesis
par: Susnjak, Teo
Publié: (2025)
par: Susnjak, Teo
Publié: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
par: Song, Weixi, et autres
Publié: (2023)
par: Song, Weixi, et autres
Publié: (2023)
Large Language Models are Good Relational Learners
par: Wu, Fang, et autres
Publié: (2025)
par: Wu, Fang, et autres
Publié: (2025)
API Is Enough: Conformal Prediction for Large Language Models Without Logit-Access
par: Su, Jiayuan, et autres
Publié: (2024)
par: Su, Jiayuan, et autres
Publié: (2024)
AfroBench: How Good are Large Language Models on African Languages?
par: Ojo, Jessica, et autres
Publié: (2023)
par: Ojo, Jessica, et autres
Publié: (2023)
Large Language Models for Medical Forecasting -- Foresight 2
par: Kraljevic, Zeljko, et autres
Publié: (2024)
par: Kraljevic, Zeljko, et autres
Publié: (2024)
Benchmarking Benchmark Leakage in Large Language Models
par: Xu, Ruijie, et autres
Publié: (2024)
par: Xu, Ruijie, et autres
Publié: (2024)
Stabilising Learner Trajectories: A Doubly Robust Evaluation of AI-Guided Student Support using Activity Theory
par: Susnjak, Teo, et autres
Publié: (2025)
par: Susnjak, Teo, et autres
Publié: (2025)
MetaTool: Facilitating Large Language Models to Master Tools with Meta-task Augmentation
par: Wang, Xiaohan, et autres
Publié: (2024)
par: Wang, Xiaohan, et autres
Publié: (2024)
When Bad Data Leads to Good Models
par: Li, Kenneth, et autres
Publié: (2025)
par: Li, Kenneth, et autres
Publié: (2025)
Generalisation Bounds of Zero-Shot Economic Forecasting using Time Series Foundation Models
par: Jetwiriyanon, Jittarin, et autres
Publié: (2025)
par: Jetwiriyanon, Jittarin, et autres
Publié: (2025)
Large Language Models for Automating Clinical Data Standardization: HL7 FHIR Use Case
par: Riquelme, Alvaro, et autres
Publié: (2025)
par: Riquelme, Alvaro, et autres
Publié: (2025)
Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning
par: Wang, Xinyi, et autres
Publié: (2023)
par: Wang, Xinyi, et autres
Publié: (2023)
What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning
par: Liu, Wei, et autres
Publié: (2023)
par: Liu, Wei, et autres
Publié: (2023)
Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis
par: Tan, Zhiyin, et autres
Publié: (2026)
par: Tan, Zhiyin, et autres
Publié: (2026)
How to Connect Speech Foundation Models and Large Language Models? What Matters and What Does Not
par: Verdini, Francesco, et autres
Publié: (2024)
par: Verdini, Francesco, et autres
Publié: (2024)
Document-Level In-Context Few-Shot Relation Extraction via Pre-Trained Language Models
par: Ozyurt, Yilmazcan, et autres
Publié: (2023)
par: Ozyurt, Yilmazcan, et autres
Publié: (2023)
AutoFlow: Automated Workflow Generation for Large Language Model Agents
par: Li, Zelong, et autres
Publié: (2024)
par: Li, Zelong, et autres
Publié: (2024)
Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models
par: Giebisch, Rafael, et autres
Publié: (2025)
par: Giebisch, Rafael, et autres
Publié: (2025)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
par: Zhu, Kaijie, et autres
Publié: (2024)
par: Zhu, Kaijie, et autres
Publié: (2024)
What Makes a Reward Model a Good Teacher? An Optimization Perspective
par: Razin, Noam, et autres
Publié: (2025)
par: Razin, Noam, et autres
Publié: (2025)
Screening Is Enough
par: Nakanishi, Ken M.
Publié: (2026)
par: Nakanishi, Ken M.
Publié: (2026)
(Im)possibility of Automated Hallucination Detection in Large Language Models
par: Karbasi, Amin, et autres
Publié: (2025)
par: Karbasi, Amin, et autres
Publié: (2025)
Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence
par: McIntosh, Timothy R., et autres
Publié: (2024)
par: McIntosh, Timothy R., et autres
Publié: (2024)
A Women's Health Benchmark for Large Language Models
par: Gruber, Victoria-Elisabeth, et autres
Publié: (2025)
par: Gruber, Victoria-Elisabeth, et autres
Publié: (2025)
Uncovering Competency Gaps in Large Language Models and Their Benchmarks
par: Bohacek, Maty, et autres
Publié: (2025)
par: Bohacek, Maty, et autres
Publié: (2025)
Exploring and Benchmarking the Planning Capabilities of Large Language Models
par: Bohnet, Bernd, et autres
Publié: (2024)
par: Bohnet, Bernd, et autres
Publié: (2024)
Method-Based Reasoning for Large Language Models: Extraction, Reuse, and Continuous Improvement
par: Su, Hong
Publié: (2025)
par: Su, Hong
Publié: (2025)
Large Language Models Struggle in Token-Level Clinical Named Entity Recognition
par: Lu, Qiuhao, et autres
Publié: (2024)
par: Lu, Qiuhao, et autres
Publié: (2024)
RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models
par: Jin, Zhuoran, et autres
Publié: (2024)
par: Jin, Zhuoran, et autres
Publié: (2024)
Beware of Calibration Data for Pruning Large Language Models
par: Ji, Yixin, et autres
Publié: (2024)
par: Ji, Yixin, et autres
Publié: (2024)
Scalable Token-Level Hallucination Detection in Large Language Models
par: Min, Rui, et autres
Publié: (2026)
par: Min, Rui, et autres
Publié: (2026)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Large Language Models Streamline Automated Machine Learning for Clinical Studies
par: Arasteh, Soroosh Tayebi, et autres
Publié: (2023)
par: Arasteh, Soroosh Tayebi, et autres
Publié: (2023)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
par: Zhang, Tunyu, et autres
Publié: (2025)
par: Zhang, Tunyu, et autres
Publié: (2025)
Episodic Memories Generation and Evaluation Benchmark for Large Language Models
par: Huet, Alexis, et autres
Publié: (2025)
par: Huet, Alexis, et autres
Publié: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
Documents similaires
-
Transforming Evidence Synthesis: A Systematic Review of the Evolution of Automated Meta-Analysis in the Age of AI
par: Li, Lingbo, et autres
Publié: (2025) -
Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification
par: Han, Binglan, et autres
Publié: (2025) -
Automated Risk-of-Bias Assessment of Randomized Controlled Trials: A First Look at a GEPA-trained Programmatic Prompting Framework
par: Li, Lingbo, et autres
Publié: (2025) -
Compiling Prompts, Not Crafting Them: A Reproducible Workflow for AI-Assisted Evidence Synthesis
par: Susnjak, Teo
Publié: (2025) -
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
par: Song, Weixi, et autres
Publié: (2023)