BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sokol, Anna, Daly, Elizabeth, Hind, Michael, Piorkowski, David, Zhang, Xiangliang, Moniz, Nuno, Chawla, Nitesh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Auto-BenchmarkCard: Automated Synthesis of Benchmark Documentation
par: Hofmann, Aris, et autres
Publié: (2025)
par: Hofmann, Aris, et autres
Publié: (2025)
Conformalized Selective Regression
par: Sokol, Anna, et autres
Publié: (2024)
par: Sokol, Anna, et autres
Publié: (2024)
Breaking Language Barriers: Equitable Performance in Multilingual Language Models
par: Nagar, Tanay, et autres
Publié: (2025)
par: Nagar, Tanay, et autres
Publié: (2025)
Class-Aware Contrastive Optimization for Imbalanced Text Classification
par: Khvatskii, Grigorii, et autres
Publié: (2024)
par: Khvatskii, Grigorii, et autres
Publié: (2024)
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
par: Zhou, Yujun, et autres
Publié: (2024)
par: Zhou, Yujun, et autres
Publié: (2024)
AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive
par: Guo, Taicheng, et autres
Publié: (2026)
par: Guo, Taicheng, et autres
Publié: (2026)
Language Models in Dialogue: Conversational Maxims for Human-AI Interactions
par: Miehling, Erik, et autres
Publié: (2024)
par: Miehling, Erik, et autres
Publié: (2024)
Large Language Model based Multi-Agents: A Survey of Progress and Challenges
par: Guo, Taicheng, et autres
Publié: (2024)
par: Guo, Taicheng, et autres
Publié: (2024)
Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models
par: Fettach, Yousra, et autres
Publié: (2026)
par: Fettach, Yousra, et autres
Publié: (2026)
Capability-Oriented Training Induced Alignment Risk
par: Zhou, Yujun, et autres
Publié: (2026)
par: Zhou, Yujun, et autres
Publié: (2026)
SMOTExT: SMOTE meets Large Language Models
par: Bystroński, Mateusz, et autres
Publié: (2025)
par: Bystroński, Mateusz, et autres
Publié: (2025)
NGQA: A Nutritional Graph Question Answering Benchmark for Personalized Health-aware Nutritional Reasoning
par: Zhang, Zheyuan, et autres
Publié: (2024)
par: Zhang, Zheyuan, et autres
Publié: (2024)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
par: Ye, Jiayi, et autres
Publié: (2024)
par: Ye, Jiayi, et autres
Publié: (2024)
PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models
par: Bao, Han, et autres
Publié: (2026)
par: Bao, Han, et autres
Publié: (2026)
Fast Explanations via Policy Gradient-Optimized Explainer
par: Pan, Deng, et autres
Publié: (2024)
par: Pan, Deng, et autres
Publié: (2024)
CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era
par: Shi, Kaiwen, et autres
Publié: (2026)
par: Shi, Kaiwen, et autres
Publié: (2026)
Automated Benchmark Generation from Domain Guidelines Informed by Bloom's Taxonomy
par: Chen, Si, et autres
Publié: (2026)
par: Chen, Si, et autres
Publié: (2026)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
par: Xu, Zixiang, et autres
Publié: (2025)
par: Xu, Zixiang, et autres
Publié: (2025)
Redefining Simplicity: Benchmarking Large Language Models from Lexical to Document Simplification
par: Qiang, Jipeng, et autres
Publié: (2025)
par: Qiang, Jipeng, et autres
Publié: (2025)
Benchmarking Large Language Models for Conversational Question Answering in Multi-instructional Documents
par: Wu, Shiwei, et autres
Publié: (2024)
par: Wu, Shiwei, et autres
Publié: (2024)
Do Multimodal Large Language Models Understand Welding?
par: Khvatskii, Grigorii, et autres
Publié: (2025)
par: Khvatskii, Grigorii, et autres
Publié: (2025)
Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks
par: Li, Peiyu, et autres
Publié: (2025)
par: Li, Peiyu, et autres
Publié: (2025)
MEBench: Benchmarking Large Language Models for Cross-Document Multi-Entity Question Answering
par: Lin, Teng, et autres
Publié: (2025)
par: Lin, Teng, et autres
Publié: (2025)
GAF-Guard: An Agentic Framework for Risk Management and Governance in Large Language Models
par: Tirupathi, Seshu, et autres
Publié: (2025)
par: Tirupathi, Seshu, et autres
Publié: (2025)
Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models
par: Jang, Haeun, et autres
Publié: (2026)
par: Jang, Haeun, et autres
Publié: (2026)
AnyLoss: Transforming Classification Metrics into Loss Functions
par: Han, Doheon, et autres
Publié: (2024)
par: Han, Doheon, et autres
Publié: (2024)
Intersectional Divergence: Measuring Fairness in Regression
par: Germino, Joe, et autres
Publié: (2025)
par: Germino, Joe, et autres
Publié: (2025)
Emergent Social Intelligence Risks in Generative Multi-Agent Systems
par: Huang, Yue, et autres
Publié: (2026)
par: Huang, Yue, et autres
Publié: (2026)
Evaluating a Methodology for Increasing AI Transparency: A Case Study
par: Piorkowski, David, et autres
Publié: (2022)
par: Piorkowski, David, et autres
Publié: (2022)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
par: Doris, Anna C., et autres
Publié: (2024)
par: Doris, Anna C., et autres
Publié: (2024)
A Survey on Large Language Model Benchmarks
par: Ni, Shiwen, et autres
Publié: (2025)
par: Ni, Shiwen, et autres
Publié: (2025)
Can Large Language Models Master Complex Card Games?
par: Wang, Wei, et autres
Publié: (2025)
par: Wang, Wei, et autres
Publié: (2025)
Benchmarking Benchmark Leakage in Large Language Models
par: Xu, Ruijie, et autres
Publié: (2024)
par: Xu, Ruijie, et autres
Publié: (2024)
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
par: Zhou, Hongli, et autres
Publié: (2025)
par: Zhou, Hongli, et autres
Publié: (2025)
Benchmarking Linguistic Diversity of Large Language Models
par: Guo, Yanzhu, et autres
Publié: (2024)
par: Guo, Yanzhu, et autres
Publié: (2024)
Estonian Native Large Language Model Benchmark
par: Lillepalu, Helena Grete, et autres
Publié: (2025)
par: Lillepalu, Helena Grete, et autres
Publié: (2025)
Ebisu: Benchmarking Large Language Models in Japanese Finance
par: Peng, Xueqing, et autres
Publié: (2026)
par: Peng, Xueqing, et autres
Publié: (2026)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
par: Zhuang, Haomin, et autres
Publié: (2026)
par: Zhuang, Haomin, et autres
Publié: (2026)
Graph Neural Prompting with Large Language Models
par: Tian, Yijun, et autres
Publié: (2023)
par: Tian, Yijun, et autres
Publié: (2023)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
Documents similaires
-
Auto-BenchmarkCard: Automated Synthesis of Benchmark Documentation
par: Hofmann, Aris, et autres
Publié: (2025) -
Conformalized Selective Regression
par: Sokol, Anna, et autres
Publié: (2024) -
Breaking Language Barriers: Equitable Performance in Multilingual Language Models
par: Nagar, Tanay, et autres
Publié: (2025) -
Class-Aware Contrastive Optimization for Imbalanced Text Classification
par: Khvatskii, Grigorii, et autres
Publié: (2024) -
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
par: Zhou, Yujun, et autres
Publié: (2024)