Enregistré dans:
| Auteurs principaux: | Kovatchev, Venelin, Lease, Matthew |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2404.00748 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Finding Pareto Trade-offs in Fair and Accurate Detection of Toxic Speech
par: Gupta, Soumyajit, et autres
Publié: (2022)
par: Gupta, Soumyajit, et autres
Publié: (2022)
Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning
par: Liu, Jinlong, et autres
Publié: (2025)
par: Liu, Jinlong, et autres
Publié: (2025)
Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks
par: Luo, Zhimeng, et autres
Publié: (2025)
par: Luo, Zhimeng, et autres
Publié: (2025)
Transparent Screening for LLM Inference and Training Impacts
par: Pachot, Arnault, et autres
Publié: (2026)
par: Pachot, Arnault, et autres
Publié: (2026)
Codenames as a Benchmark for Large Language Models
par: Stephenson, Matthew, et autres
Publié: (2024)
par: Stephenson, Matthew, et autres
Publié: (2024)
Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses
par: An, Subin, et autres
Publié: (2025)
par: An, Subin, et autres
Publié: (2025)
Wrapper Boxes: Faithful Attribution of Model Predictions to Training Data
par: Su, Yiheng, et autres
Publié: (2023)
par: Su, Yiheng, et autres
Publié: (2023)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
par: Yu, Yongan, et autres
Publié: (2025)
par: Yu, Yongan, et autres
Publié: (2025)
HoH: A Dynamic Benchmark for Evaluating the Impact of Outdated Information on Retrieval-Augmented Generation
par: Ouyang, Jie, et autres
Publié: (2025)
par: Ouyang, Jie, et autres
Publié: (2025)
Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
par: Zhang, Shuo, et autres
Publié: (2025)
par: Zhang, Shuo, et autres
Publié: (2025)
Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents
par: Testini, Irene, et autres
Publié: (2025)
par: Testini, Irene, et autres
Publié: (2025)
Evaluating the Evaluator: Measuring LLMs' Adherence to Task Evaluation Instructions
par: Murugadoss, Bhuvanashree, et autres
Publié: (2024)
par: Murugadoss, Bhuvanashree, et autres
Publié: (2024)
Who Benchmarks the Benchmarks? A Case Study of LLM Evaluation in Icelandic
par: Ingimundarson, Finnur Ágúst, et autres
Publié: (2026)
par: Ingimundarson, Finnur Ágúst, et autres
Publié: (2026)
Benchmarking Data Science Agents
par: Zhang, Yuge, et autres
Publié: (2024)
par: Zhang, Yuge, et autres
Publié: (2024)
Transparent and Coherent Procedural Mistake Detection
par: Storks, Shane, et autres
Publié: (2024)
par: Storks, Shane, et autres
Publié: (2024)
NarraBench: A Comprehensive Framework for Narrative Benchmarking
par: Hamilton, Sil, et autres
Publié: (2025)
par: Hamilton, Sil, et autres
Publié: (2025)
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
par: Jiang, Botian, et autres
Publié: (2024)
par: Jiang, Botian, et autres
Publié: (2024)
DHP Benchmark: Are LLMs Good NLG Evaluators?
par: Wang, Yicheng, et autres
Publié: (2024)
par: Wang, Yicheng, et autres
Publié: (2024)
Generating Benchmarks for Factuality Evaluation of Language Models
par: Muhlgay, Dor, et autres
Publié: (2023)
par: Muhlgay, Dor, et autres
Publié: (2023)
On Robustness and Reliability of Benchmark-Based Evaluation of LLMs
par: Lunardi, Riccardo, et autres
Publié: (2025)
par: Lunardi, Riccardo, et autres
Publié: (2025)
The Qiyas Benchmark: Measuring ChatGPT Mathematical and Language Understanding in Arabic
par: Al-Khalifa, Shahad, et autres
Publié: (2024)
par: Al-Khalifa, Shahad, et autres
Publié: (2024)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
par: Pauli, Amalie Brogaard, et autres
Publié: (2024)
par: Pauli, Amalie Brogaard, et autres
Publié: (2024)
Measuring what Matters: Construct Validity in Large Language Model Benchmarks
par: Bean, Andrew M., et autres
Publié: (2025)
par: Bean, Andrew M., et autres
Publié: (2025)
RUVA: Personalized Transparent On-Device Graph Reasoning
par: Conte, Gabriele, et autres
Publié: (2026)
par: Conte, Gabriele, et autres
Publié: (2026)
Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation
par: Kocyigit, Muhammed Yusuf, et autres
Publié: (2025)
par: Kocyigit, Muhammed Yusuf, et autres
Publié: (2025)
The Self-Execution Benchmark: Measuring LLMs' Attempts to Overcome Their Lack of Self-Execution
par: Ezra, Elon, et autres
Publié: (2025)
par: Ezra, Elon, et autres
Publié: (2025)
QGEval: Benchmarking Multi-dimensional Evaluation for Question Generation
par: Fu, Weiping, et autres
Publié: (2024)
par: Fu, Weiping, et autres
Publié: (2024)
CEval: A Benchmark for Evaluating Counterfactual Text Generation
par: Nguyen, Van Bach, et autres
Publié: (2024)
par: Nguyen, Van Bach, et autres
Publié: (2024)
Generating Leakage-Free Benchmarks for Robust RAG Evaluation
par: Liu, Jiayi, et autres
Publié: (2026)
par: Liu, Jiayi, et autres
Publié: (2026)
NC-Bench: An LLM Benchmark for Evaluating Conversational Competence
par: Moore, Robert J., et autres
Publié: (2026)
par: Moore, Robert J., et autres
Publié: (2026)
RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation
par: Xu, Xinnuo, et autres
Publié: (2025)
par: Xu, Xinnuo, et autres
Publié: (2025)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
par: Zhang, Xiaotian, et autres
Publié: (2023)
par: Zhang, Xiaotian, et autres
Publié: (2023)
Kinship Data Benchmark for Multi-hop Reasoning
par: Sun, Tianda, et autres
Publié: (2026)
par: Sun, Tianda, et autres
Publié: (2026)
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
par: Lei, Fangyu, et autres
Publié: (2025)
par: Lei, Fangyu, et autres
Publié: (2025)
SPARQL Query Generation with LLMs: Measuring the Impact of Training Data Memorization and Knowledge Injection
par: Gashkov, Aleksandr, et autres
Publié: (2025)
par: Gashkov, Aleksandr, et autres
Publié: (2025)
An LLM Maturity Model for Reliable and Transparent Text-to-Query
par: Yu, Lei, et autres
Publié: (2024)
par: Yu, Lei, et autres
Publié: (2024)
Every Answer Matters: Evaluating Commonsense with Probabilistic Measures
par: Cheng, Qi, et autres
Publié: (2024)
par: Cheng, Qi, et autres
Publié: (2024)
AgentQuest: A Modular Benchmark Framework to Measure Progress and Improve LLM Agents
par: Gioacchini, Luca, et autres
Publié: (2024)
par: Gioacchini, Luca, et autres
Publié: (2024)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
par: Deng, Shihan, et autres
Publié: (2024)
par: Deng, Shihan, et autres
Publié: (2024)
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
par: Yadav, Ankit, et autres
Publié: (2024)
par: Yadav, Ankit, et autres
Publié: (2024)
Documents similaires
-
Finding Pareto Trade-offs in Fair and Accurate Detection of Toxic Speech
par: Gupta, Soumyajit, et autres
Publié: (2022) -
Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning
par: Liu, Jinlong, et autres
Publié: (2025) -
Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks
par: Luo, Zhimeng, et autres
Publié: (2025) -
Transparent Screening for LLM Inference and Training Impacts
par: Pachot, Arnault, et autres
Publié: (2026) -
Codenames as a Benchmark for Large Language Models
par: Stephenson, Matthew, et autres
Publié: (2024)