Effective Context Selection in LLM-based Leaderboard Generation: An Empirical Study
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kabongo, Salomon, D'Souza, Jennifer, Auer, Sören |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring the Latest LLMs for Leaderboard Extraction
par: Kabongo, Salomon, et autres
Publié: (2024)
par: Kabongo, Salomon, et autres
Publié: (2024)
Instruction Finetuning for Leaderboard Generation from Empirical AI Research
par: Kabongo, Salomon, et autres
Publié: (2024)
par: Kabongo, Salomon, et autres
Publié: (2024)
Large Language Models for Scientific Information Extraction: An Empirical Study for Virology
par: Shamsabadi, Mahsa, et autres
Publié: (2024)
par: Shamsabadi, Mahsa, et autres
Publié: (2024)
Large Language Models as Evaluators for Scientific Synthesis
par: Evans, Julia, et autres
Publié: (2024)
par: Evans, Julia, et autres
Publié: (2024)
LLMs4OL 2024 Overview: The 1st Large Language Models for Ontology Learning Challenge
par: Giglou, Hamed Babaei, et autres
Publié: (2024)
par: Giglou, Hamed Babaei, et autres
Publié: (2024)
LLMs4Synthesis: Leveraging Large Language Models for Scientific Synthesis
par: Giglou, Hamed Babaei, et autres
Publié: (2024)
par: Giglou, Hamed Babaei, et autres
Publié: (2024)
Fine-tuning and Prompt Engineering with Cognitive Knowledge Graphs for Scholarly Knowledge Organization
par: Rabby, Gollam, et autres
Publié: (2024)
par: Rabby, Gollam, et autres
Publié: (2024)
OntoAligner: A Comprehensive Modular and Robust Python Toolkit for Ontology Alignment
par: Giglou, Hamed Babaei, et autres
Publié: (2025)
par: Giglou, Hamed Babaei, et autres
Publié: (2025)
Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis
par: Tan, Zhiyin, et autres
Publié: (2026)
par: Tan, Zhiyin, et autres
Publié: (2026)
A FAIR and Free Prompt-based Research Assistant
par: Shamsabadi, Mahsa, et autres
Publié: (2024)
par: Shamsabadi, Mahsa, et autres
Publié: (2024)
The Leaderboard Illusion
par: Singh, Shivalika, et autres
Publié: (2025)
par: Singh, Shivalika, et autres
Publié: (2025)
Scholarly Question Answering using Large Language Models in the NFDI4DataScience Gateway
par: Giglou, Hamed Babaei, et autres
Publié: (2024)
par: Giglou, Hamed Babaei, et autres
Publié: (2024)
YESciEval: Robust LLM-as-a-Judge for Scientific Question Answering
par: D'Souza, Jennifer, et autres
Publié: (2025)
par: D'Souza, Jennifer, et autres
Publié: (2025)
Toward Purpose-oriented Topic Model Evaluation enabled by Large Language Models
par: Tan, Zhiyin, et autres
Publié: (2025)
par: Tan, Zhiyin, et autres
Publié: (2025)
Bridging the Evaluation Gap: Leveraging Large Language Models for Topic Model Evaluation
par: Tan, Zhiyin, et autres
Publié: (2025)
par: Tan, Zhiyin, et autres
Publié: (2025)
LEGOBench: Scientific Leaderboard Generation Benchmark
par: Singh, Shruti, et autres
Publié: (2024)
par: Singh, Shruti, et autres
Publié: (2024)
Improving LLM Leaderboards with Psychometrical Methodology
par: Federiakin, Denis
Publié: (2025)
par: Federiakin, Denis
Publié: (2025)
League: Leaderboard Generation on Demand
par: Wu, Jian, et autres
Publié: (2025)
par: Wu, Jian, et autres
Publié: (2025)
From Keywords to Structured Summaries: Streamlining Scholarly Information Access
par: Shamsabadi, Mahsa, et autres
Publié: (2024)
par: Shamsabadi, Mahsa, et autres
Publié: (2024)
Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards
par: Tamber, Manveer Singh, et autres
Publié: (2025)
par: Tamber, Manveer Singh, et autres
Publié: (2025)
Can We Locate and Prevent Stereotypes in LLMs?
par: D'Souza, Alex
Publié: (2026)
par: D'Souza, Alex
Publié: (2026)
Iterative Hypothesis Generation for Scientific Discovery with Monte Carlo Nash Equilibrium Self-Refining Trees
par: Rabby, Gollam, et autres
Publié: (2025)
par: Rabby, Gollam, et autres
Publié: (2025)
Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM Leaderboard
par: Park, Chanjun, et autres
Publié: (2024)
par: Park, Chanjun, et autres
Publié: (2024)
Publishing FAIR and Machine-actionable Reviews in Materials Science: The Case for Symbolic Knowledge in Neuro-symbolic Artificial Intelligence
par: D'Souza, Jennifer, et autres
Publié: (2026)
par: D'Souza, Jennifer, et autres
Publié: (2026)
The Trust Paradox: How CS Researchers Engage LLM Leaderboards
par: Sadeghi, Pouya, et autres
Publié: (2026)
par: Sadeghi, Pouya, et autres
Publié: (2026)
Prompt-to-Leaderboard
par: Frick, Evan, et autres
Publié: (2025)
par: Frick, Evan, et autres
Publié: (2025)
LLMs4SchemaDiscovery: A Human-in-the-Loop Workflow for Scientific Schema Mining with Large Language Models
par: Sadruddin, Sameer, et autres
Publié: (2025)
par: Sadruddin, Sameer, et autres
Publié: (2025)
Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability
par: Li, Haonan, et autres
Publié: (2024)
par: Li, Haonan, et autres
Publié: (2024)
Evaluating Large Language Models for Structured Science Summarization in the Open Research Knowledge Graph
par: Nechakhin, Vladyslav, et autres
Publié: (2024)
par: Nechakhin, Vladyslav, et autres
Publié: (2024)
Astro-NER -- Astronomy Named Entity Recognition: Is GPT a Good Domain Expert Annotator?
par: Evans, Julia, et autres
Publié: (2024)
par: Evans, Julia, et autres
Publié: (2024)
SemEval-2025 Task 5: LLMs4Subjects -- LLM-based Automated Subject Tagging for a National Technical Library's Open-Access Catalog
par: D'Souza, Jennifer, et autres
Publié: (2025)
par: D'Souza, Jennifer, et autres
Publié: (2025)
SCI-IDEA: Context-Aware Scientific Ideation Using Token and Sentence Embeddings
par: Keya, Farhana, et autres
Publié: (2025)
par: Keya, Farhana, et autres
Publié: (2025)
Misconfidence-based Demonstration Selection for LLM In-Context Learning
par: Xu, Shangqing, et autres
Publié: (2024)
par: Xu, Shangqing, et autres
Publié: (2024)
La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America
par: Grandury, María, et autres
Publié: (2025)
par: Grandury, María, et autres
Publié: (2025)
CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility
par: Silva, João, et autres
Publié: (2026)
par: Silva, João, et autres
Publié: (2026)
Open Universal Arabic ASR Leaderboard
par: Wang, Yingzhi, et autres
Publié: (2024)
par: Wang, Yingzhi, et autres
Publié: (2024)
A Position Paper on the Automatic Generation of Machine Learning Leaderboards
par: Timmer, Roelien C, et autres
Publié: (2025)
par: Timmer, Roelien C, et autres
Publié: (2025)
DeepResearch$^{\text{Eco}}$: A Recursive Agentic Workflow for Complex Scientific Question Answering in Ecology
par: D'Souza, Jennifer, et autres
Publié: (2025)
par: D'Souza, Jennifer, et autres
Publié: (2025)
Influence Guided Context Selection for Effective Retrieval-Augmented Generation
par: Deng, Jiale, et autres
Publié: (2025)
par: Deng, Jiale, et autres
Publié: (2025)
Computational Fact-Checking of Online Discourse: Scoring scientific accuracy in climate change related news articles
par: Wittenborg, Tim, et autres
Publié: (2025)
par: Wittenborg, Tim, et autres
Publié: (2025)
Documents similaires
-
Exploring the Latest LLMs for Leaderboard Extraction
par: Kabongo, Salomon, et autres
Publié: (2024) -
Instruction Finetuning for Leaderboard Generation from Empirical AI Research
par: Kabongo, Salomon, et autres
Publié: (2024) -
Large Language Models for Scientific Information Extraction: An Empirical Study for Virology
par: Shamsabadi, Mahsa, et autres
Publié: (2024) -
Large Language Models as Evaluators for Scientific Synthesis
par: Evans, Julia, et autres
Publié: (2024) -
LLMs4OL 2024 Overview: The 1st Large Language Models for Ontology Learning Challenge
par: Giglou, Hamed Babaei, et autres
Publié: (2024)