LEGOBench: Scientific Leaderboard Generation Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Singh, Shruti, Alam, Shoaib, Malwat, Husain, Singh, Mayank |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SciDQA: A Deep Reading Comprehension Dataset over Scientific Papers
par: Singh, Shruti, et autres
Publié: (2024)
par: Singh, Shruti, et autres
Publié: (2024)
Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards
par: Tamber, Manveer Singh, et autres
Publié: (2025)
par: Tamber, Manveer Singh, et autres
Publié: (2025)
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
par: Yadav, Ankit, et autres
Publié: (2024)
par: Yadav, Ankit, et autres
Publié: (2024)
Sparse Graph Representations for Procedural Instructional Documents
par: Singh, Shruti, et autres
Publié: (2024)
par: Singh, Shruti, et autres
Publié: (2024)
The Leaderboard Illusion
par: Singh, Shivalika, et autres
Publié: (2025)
par: Singh, Shivalika, et autres
Publié: (2025)
The FACTS Grounding Leaderboard: Benchmarking LLMs' Ability to Ground Responses to Long-Form Input
par: Jacovi, Alon, et autres
Publié: (2025)
par: Jacovi, Alon, et autres
Publié: (2025)
League: Leaderboard Generation on Demand
par: Wu, Jian, et autres
Publié: (2025)
par: Wu, Jian, et autres
Publié: (2025)
Beyond the Numbers: Transparency in Relation Extraction Benchmark Creation and Leaderboards
par: Arzt, Varvara, et autres
Publié: (2024)
par: Arzt, Varvara, et autres
Publié: (2024)
How Robust are the Tabular QA Models for Scientific Tables? A Study using Customized Dataset
par: Ghosh, Akash, et autres
Publié: (2024)
par: Ghosh, Akash, et autres
Publié: (2024)
Efficient Performance Tracking: Leveraging Large Language Models for Automated Construction of Scientific Leaderboards
par: Şahinuç, Furkan, et autres
Publié: (2024)
par: Şahinuç, Furkan, et autres
Publié: (2024)
The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality
par: Cheng, Aileen, et autres
Publié: (2025)
par: Cheng, Aileen, et autres
Publié: (2025)
Prompt-to-Leaderboard
par: Frick, Evan, et autres
Publié: (2025)
par: Frick, Evan, et autres
Publié: (2025)
Speech Recognition Transformers: Topological-lingualism Perspective
par: Singh, Shruti, et autres
Publié: (2024)
par: Singh, Shruti, et autres
Publié: (2024)
Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability
par: Li, Haonan, et autres
Publié: (2024)
par: Li, Haonan, et autres
Publié: (2024)
Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models
par: Beniwal, Himanshu, et autres
Publié: (2026)
par: Beniwal, Himanshu, et autres
Publié: (2026)
Instruction Finetuning for Leaderboard Generation from Empirical AI Research
par: Kabongo, Salomon, et autres
Publié: (2024)
par: Kabongo, Salomon, et autres
Publié: (2024)
La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America
par: Grandury, María, et autres
Publié: (2025)
par: Grandury, María, et autres
Publié: (2025)
Open Universal Arabic ASR Leaderboard
par: Wang, Yingzhi, et autres
Publié: (2024)
par: Wang, Yingzhi, et autres
Publié: (2024)
Effective Context Selection in LLM-based Leaderboard Generation: An Empirical Study
par: Kabongo, Salomon, et autres
Publié: (2024)
par: Kabongo, Salomon, et autres
Publié: (2024)
A Position Paper on the Automatic Generation of Machine Learning Leaderboards
par: Timmer, Roelien C, et autres
Publié: (2025)
par: Timmer, Roelien C, et autres
Publié: (2025)
COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing
par: Sheth, Rajvee, et autres
Publié: (2025)
par: Sheth, Rajvee, et autres
Publié: (2025)
Task--Specificity Score: Measuring How Much Instructions Really Matter for Supervision
par: Kadasi, Pritam, et autres
Publié: (2026)
par: Kadasi, Pritam, et autres
Publié: (2026)
One Instruction Does Not Fit All: How Well Do Embeddings Align Personas and Instructions in Low-Resource Indian Languages?
par: Shah, Arya, et autres
Publié: (2026)
par: Shah, Arya, et autres
Publié: (2026)
When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards
par: Alzahrani, Norah, et autres
Publié: (2024)
par: Alzahrani, Norah, et autres
Publié: (2024)
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
par: Chen, Wenting, et autres
Publié: (2025)
par: Chen, Wenting, et autres
Publié: (2025)
Leveraging Retrieval Augmented Generative LLMs For Automated Metadata Description Generation to Enhance Data Catalogs
par: Singh, Mayank, et autres
Publié: (2025)
par: Singh, Mayank, et autres
Publié: (2025)
When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models
par: Panda, Sailesh, et autres
Publié: (2026)
par: Panda, Sailesh, et autres
Publié: (2026)
Exploring the Latest LLMs for Leaderboard Extraction
par: Kabongo, Salomon, et autres
Publié: (2024)
par: Kabongo, Salomon, et autres
Publié: (2024)
User-centric Subjective Leaderboard by Customizable Reward Modeling
par: Jia, Qi, et autres
Publié: (2025)
par: Jia, Qi, et autres
Publié: (2025)
Cross-lingual Editing in Multilingual Language Models
par: Beniwal, Himanshu, et autres
Publié: (2024)
par: Beniwal, Himanshu, et autres
Publié: (2024)
Error Taxonomy-Guided Prompt Optimization
par: Singh, Mayank, et autres
Publié: (2026)
par: Singh, Mayank, et autres
Publié: (2026)
HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models
par: Ajayi, Edward, et autres
Publié: (2026)
par: Ajayi, Edward, et autres
Publié: (2026)
Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models
par: Sinha, Samridhi Raj, et autres
Publié: (2025)
par: Sinha, Samridhi Raj, et autres
Publié: (2025)
PreScience: A Benchmark for Forecasting Scientific Contributions
par: Ajith, Anirudh, et autres
Publié: (2026)
par: Ajith, Anirudh, et autres
Publié: (2026)
Improving LLM Leaderboards with Psychometrical Methodology
par: Federiakin, Denis
Publié: (2025)
par: Federiakin, Denis
Publié: (2025)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
par: Park, Chanjun, et autres
Publié: (2024)
par: Park, Chanjun, et autres
Publié: (2024)
Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena
par: Myrzakhan, Aidar, et autres
Publié: (2024)
par: Myrzakhan, Aidar, et autres
Publié: (2024)
Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM
par: Xia, Chunqiu Steven, et autres
Publié: (2024)
par: Xia, Chunqiu Steven, et autres
Publié: (2024)
Measuring Sustainability Intention of ESG Fund Disclosure using Few-Shot Learning
par: Singh, Mayank, et autres
Publié: (2024)
par: Singh, Mayank, et autres
Publié: (2024)
MMT: A Multilingual and Multi-Topic Indian Social Media Dataset
par: Dalal, Dwip, et autres
Publié: (2023)
par: Dalal, Dwip, et autres
Publié: (2023)
Documents similaires
-
SciDQA: A Deep Reading Comprehension Dataset over Scientific Papers
par: Singh, Shruti, et autres
Publié: (2024) -
Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards
par: Tamber, Manveer Singh, et autres
Publié: (2025) -
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
par: Yadav, Ankit, et autres
Publié: (2024) -
Sparse Graph Representations for Procedural Instructional Documents
par: Singh, Shruti, et autres
Publié: (2024) -
The Leaderboard Illusion
par: Singh, Shivalika, et autres
Publié: (2025)