BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
Fuente:
arXiv
Saved in:
| Main Authors: | Sokol, Anna, Daly, Elizabeth, Hind, Michael, Piorkowski, David, Zhang, Xiangliang, Moniz, Nuno, Chawla, Nitesh |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Auto-BenchmarkCard: Automated Synthesis of Benchmark Documentation
by: Hofmann, Aris, et al.
Published: (2025)
by: Hofmann, Aris, et al.
Published: (2025)
Conformalized Selective Regression
by: Sokol, Anna, et al.
Published: (2024)
by: Sokol, Anna, et al.
Published: (2024)
Breaking Language Barriers: Equitable Performance in Multilingual Language Models
by: Nagar, Tanay, et al.
Published: (2025)
by: Nagar, Tanay, et al.
Published: (2025)
Class-Aware Contrastive Optimization for Imbalanced Text Classification
by: Khvatskii, Grigorii, et al.
Published: (2024)
by: Khvatskii, Grigorii, et al.
Published: (2024)
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
by: Zhou, Yujun, et al.
Published: (2024)
by: Zhou, Yujun, et al.
Published: (2024)
AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive
by: Guo, Taicheng, et al.
Published: (2026)
by: Guo, Taicheng, et al.
Published: (2026)
Language Models in Dialogue: Conversational Maxims for Human-AI Interactions
by: Miehling, Erik, et al.
Published: (2024)
by: Miehling, Erik, et al.
Published: (2024)
Large Language Model based Multi-Agents: A Survey of Progress and Challenges
by: Guo, Taicheng, et al.
Published: (2024)
by: Guo, Taicheng, et al.
Published: (2024)
Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models
by: Fettach, Yousra, et al.
Published: (2026)
by: Fettach, Yousra, et al.
Published: (2026)
Capability-Oriented Training Induced Alignment Risk
by: Zhou, Yujun, et al.
Published: (2026)
by: Zhou, Yujun, et al.
Published: (2026)
SMOTExT: SMOTE meets Large Language Models
by: Bystroński, Mateusz, et al.
Published: (2025)
by: Bystroński, Mateusz, et al.
Published: (2025)
NGQA: A Nutritional Graph Question Answering Benchmark for Personalized Health-aware Nutritional Reasoning
by: Zhang, Zheyuan, et al.
Published: (2024)
by: Zhang, Zheyuan, et al.
Published: (2024)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
by: Ye, Jiayi, et al.
Published: (2024)
by: Ye, Jiayi, et al.
Published: (2024)
PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models
by: Bao, Han, et al.
Published: (2026)
by: Bao, Han, et al.
Published: (2026)
Fast Explanations via Policy Gradient-Optimized Explainer
by: Pan, Deng, et al.
Published: (2024)
by: Pan, Deng, et al.
Published: (2024)
CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era
by: Shi, Kaiwen, et al.
Published: (2026)
by: Shi, Kaiwen, et al.
Published: (2026)
Automated Benchmark Generation from Domain Guidelines Informed by Bloom's Taxonomy
by: Chen, Si, et al.
Published: (2026)
by: Chen, Si, et al.
Published: (2026)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
by: Xu, Zixiang, et al.
Published: (2025)
by: Xu, Zixiang, et al.
Published: (2025)
Redefining Simplicity: Benchmarking Large Language Models from Lexical to Document Simplification
by: Qiang, Jipeng, et al.
Published: (2025)
by: Qiang, Jipeng, et al.
Published: (2025)
Benchmarking Large Language Models for Conversational Question Answering in Multi-instructional Documents
by: Wu, Shiwei, et al.
Published: (2024)
by: Wu, Shiwei, et al.
Published: (2024)
Do Multimodal Large Language Models Understand Welding?
by: Khvatskii, Grigorii, et al.
Published: (2025)
by: Khvatskii, Grigorii, et al.
Published: (2025)
Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks
by: Li, Peiyu, et al.
Published: (2025)
by: Li, Peiyu, et al.
Published: (2025)
MEBench: Benchmarking Large Language Models for Cross-Document Multi-Entity Question Answering
by: Lin, Teng, et al.
Published: (2025)
by: Lin, Teng, et al.
Published: (2025)
GAF-Guard: An Agentic Framework for Risk Management and Governance in Large Language Models
by: Tirupathi, Seshu, et al.
Published: (2025)
by: Tirupathi, Seshu, et al.
Published: (2025)
Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models
by: Jang, Haeun, et al.
Published: (2026)
by: Jang, Haeun, et al.
Published: (2026)
AnyLoss: Transforming Classification Metrics into Loss Functions
by: Han, Doheon, et al.
Published: (2024)
by: Han, Doheon, et al.
Published: (2024)
Intersectional Divergence: Measuring Fairness in Regression
by: Germino, Joe, et al.
Published: (2025)
by: Germino, Joe, et al.
Published: (2025)
Emergent Social Intelligence Risks in Generative Multi-Agent Systems
by: Huang, Yue, et al.
Published: (2026)
by: Huang, Yue, et al.
Published: (2026)
Evaluating a Methodology for Increasing AI Transparency: A Case Study
by: Piorkowski, David, et al.
Published: (2022)
by: Piorkowski, David, et al.
Published: (2022)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
by: Doris, Anna C., et al.
Published: (2024)
by: Doris, Anna C., et al.
Published: (2024)
A Survey on Large Language Model Benchmarks
by: Ni, Shiwen, et al.
Published: (2025)
by: Ni, Shiwen, et al.
Published: (2025)
Can Large Language Models Master Complex Card Games?
by: Wang, Wei, et al.
Published: (2025)
by: Wang, Wei, et al.
Published: (2025)
Benchmarking Benchmark Leakage in Large Language Models
by: Xu, Ruijie, et al.
Published: (2024)
by: Xu, Ruijie, et al.
Published: (2024)
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
by: Zhou, Hongli, et al.
Published: (2025)
by: Zhou, Hongli, et al.
Published: (2025)
Benchmarking Linguistic Diversity of Large Language Models
by: Guo, Yanzhu, et al.
Published: (2024)
by: Guo, Yanzhu, et al.
Published: (2024)
Estonian Native Large Language Model Benchmark
by: Lillepalu, Helena Grete, et al.
Published: (2025)
by: Lillepalu, Helena Grete, et al.
Published: (2025)
Ebisu: Benchmarking Large Language Models in Japanese Finance
by: Peng, Xueqing, et al.
Published: (2026)
by: Peng, Xueqing, et al.
Published: (2026)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
by: Zhuang, Haomin, et al.
Published: (2026)
by: Zhuang, Haomin, et al.
Published: (2026)
Graph Neural Prompting with Large Language Models
by: Tian, Yijun, et al.
Published: (2023)
by: Tian, Yijun, et al.
Published: (2023)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
Similar Items
-
Auto-BenchmarkCard: Automated Synthesis of Benchmark Documentation
by: Hofmann, Aris, et al.
Published: (2025) -
Conformalized Selective Regression
by: Sokol, Anna, et al.
Published: (2024) -
Breaking Language Barriers: Equitable Performance in Multilingual Language Models
by: Nagar, Tanay, et al.
Published: (2025) -
Class-Aware Contrastive Optimization for Imbalanced Text Classification
by: Khvatskii, Grigorii, et al.
Published: (2024) -
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
by: Zhou, Yujun, et al.
Published: (2024)