Uncovering Competency Gaps in Large Language Models and Their Benchmarks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bohacek, Maty, Scherrer, Nino, Dufour, Nicholas, Leung, Thomas, Bregler, Christoph, Chan, Stephanie C. Y. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Unsteady Metrics and Benchmarking Cultures of AI Model Builders
von: Baack, Stefan, et al.
Veröffentlicht: (2026)
von: Baack, Stefan, et al.
Veröffentlicht: (2026)
Uncovering Biases with Reflective Large Language Models
von: Chang, Edward Y.
Veröffentlicht: (2024)
von: Chang, Edward Y.
Veröffentlicht: (2024)
An evolutionary perspective on modes of learning in Transformers
von: Ku, Alexander Y., et al.
Veröffentlicht: (2025)
von: Ku, Alexander Y., et al.
Veröffentlicht: (2025)
A Zero-shot and Few-shot Study of Instruction-Finetuned Large Language Models Applied to Clinical and Biomedical Tasks
von: Labrak, Yanis, et al.
Veröffentlicht: (2023)
von: Labrak, Yanis, et al.
Veröffentlicht: (2023)
Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)
Uncovering Scaling Laws for Large Language Models via Inverse Problems
von: Verma, Arun, et al.
Veröffentlicht: (2025)
von: Verma, Arun, et al.
Veröffentlicht: (2025)
Uncovering Emergent Physics Representations Learned In-Context by Large Language Models
von: Song, Yeongwoo, et al.
Veröffentlicht: (2025)
von: Song, Yeongwoo, et al.
Veröffentlicht: (2025)
DrBenchmark: A Large Language Understanding Evaluation Benchmark for French Biomedical Domain
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
Do Depth-Grown Models Overcome the Curse of Depth? An In-Depth Analysis
von: Kapl, Ferdinand, et al.
Veröffentlicht: (2025)
von: Kapl, Ferdinand, et al.
Veröffentlicht: (2025)
Benchmarking Benchmark Leakage in Large Language Models
von: Xu, Ruijie, et al.
Veröffentlicht: (2024)
von: Xu, Ruijie, et al.
Veröffentlicht: (2024)
The Impact of AI-Generated Text on the Internet
von: Dolezal, Jonas, et al.
Veröffentlicht: (2026)
von: Dolezal, Jonas, et al.
Veröffentlicht: (2026)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
von: Tsui, Ken
Veröffentlicht: (2025)
von: Tsui, Ken
Veröffentlicht: (2025)
BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
Layer by Layer: Uncovering Hidden Representations in Language Models
von: Skean, Oscar, et al.
Veröffentlicht: (2025)
von: Skean, Oscar, et al.
Veröffentlicht: (2025)
Bridging the Semantic Gap for Categorical Data Clustering via Large Language Models
von: Yang, Zihua, et al.
Veröffentlicht: (2026)
von: Yang, Zihua, et al.
Veröffentlicht: (2026)
A Women's Health Benchmark for Large Language Models
von: Gruber, Victoria-Elisabeth, et al.
Veröffentlicht: (2025)
von: Gruber, Victoria-Elisabeth, et al.
Veröffentlicht: (2025)
Exploring and Benchmarking the Planning Capabilities of Large Language Models
von: Bohnet, Bernd, et al.
Veröffentlicht: (2024)
von: Bohnet, Bernd, et al.
Veröffentlicht: (2024)
GAPMAP: Mapping Scientific Knowledge Gaps in Biomedical Literature Using Large Language Models
von: Salem, Nourah M, et al.
Veröffentlicht: (2025)
von: Salem, Nourah M, et al.
Veröffentlicht: (2025)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
von: Li, Zheqing, et al.
Veröffentlicht: (2025)
von: Li, Zheqing, et al.
Veröffentlicht: (2025)
Episodic Memories Generation and Evaluation Benchmark for Large Language Models
von: Huet, Alexis, et al.
Veröffentlicht: (2025)
von: Huet, Alexis, et al.
Veröffentlicht: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
How Important Is Tokenization in French Medical Masked Language Models?
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
Not Every AI Problem is a Data Problem: We Should Be Intentional About Data Scaling
von: Rodchenko, Tanya, et al.
Veröffentlicht: (2025)
von: Rodchenko, Tanya, et al.
Veröffentlicht: (2025)
RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards
von: Alzahrani, Norah, et al.
Veröffentlicht: (2024)
von: Alzahrani, Norah, et al.
Veröffentlicht: (2024)
Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant
von: Järviniemi, Olli, et al.
Veröffentlicht: (2024)
von: Järviniemi, Olli, et al.
Veröffentlicht: (2024)
Rational Metareasoning for Large Language Models
von: De Sabbata, C. Nicolò, et al.
Veröffentlicht: (2024)
von: De Sabbata, C. Nicolò, et al.
Veröffentlicht: (2024)
A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian
von: Rogoz, Ana-Cristina, et al.
Veröffentlicht: (2025)
von: Rogoz, Ana-Cristina, et al.
Veröffentlicht: (2025)
Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?
von: Renduchintala, H S V N S Kowndinya, et al.
Veröffentlicht: (2026)
von: Renduchintala, H S V N S Kowndinya, et al.
Veröffentlicht: (2026)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
von: AlDahoul, Nouar, et al.
Veröffentlicht: (2025)
von: AlDahoul, Nouar, et al.
Veröffentlicht: (2025)
TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation
von: Ezzakri, Anas, et al.
Veröffentlicht: (2025)
von: Ezzakri, Anas, et al.
Veröffentlicht: (2025)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
von: Komanduri, Aneesh, et al.
Veröffentlicht: (2025)
von: Komanduri, Aneesh, et al.
Veröffentlicht: (2025)
PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models
von: Xu, Yinggan, et al.
Veröffentlicht: (2025)
von: Xu, Yinggan, et al.
Veröffentlicht: (2025)
Line Goes Up? Inherent Limitations of Benchmarks for Evaluating Large Language Models
von: Fodor, James
Veröffentlicht: (2025)
von: Fodor, James
Veröffentlicht: (2025)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
von: Lee, Jaeho, et al.
Veröffentlicht: (2025)
von: Lee, Jaeho, et al.
Veröffentlicht: (2025)
BioCoder: A Benchmark for Bioinformatics Code Generation with Large Language Models
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
Code Simulation Challenges for Large Language Models
von: La Malfa, Emanuele, et al.
Veröffentlicht: (2024)
von: La Malfa, Emanuele, et al.
Veröffentlicht: (2024)
Towards the Law of Capacity Gap in Distilling Language Models
von: Zhang, Chen, et al.
Veröffentlicht: (2023)
von: Zhang, Chen, et al.
Veröffentlicht: (2023)
Offset Unlearning for Large Language Models
von: Huang, James Y., et al.
Veröffentlicht: (2024)
von: Huang, James Y., et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Unsteady Metrics and Benchmarking Cultures of AI Model Builders
von: Baack, Stefan, et al.
Veröffentlicht: (2026) -
Uncovering Biases with Reflective Large Language Models
von: Chang, Edward Y.
Veröffentlicht: (2024) -
An evolutionary perspective on modes of learning in Transformers
von: Ku, Alexander Y., et al.
Veröffentlicht: (2025) -
A Zero-shot and Few-shot Study of Instruction-Finetuned Large Language Models Applied to Clinical and Biomedical Tasks
von: Labrak, Yanis, et al.
Veröffentlicht: (2023) -
Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)