Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing
Fuente:
arXiv
Saved in:
| Main Authors: | Boughorbel, Sabri, Dalvi, Fahim, Durrani, Nadir, Hawasly, Majd |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Scaling up Discovery of Latent Concepts in Deep NLP Models
by: Hawasly, Majd, et al.
Published: (2023)
by: Hawasly, Majd, et al.
Published: (2023)
There Is More to Refusal in Large Language Models than a Single Direction
by: Joad, Faaiz, et al.
Published: (2026)
by: Joad, Faaiz, et al.
Published: (2026)
Exploring Alignment in Shared Cross-lingual Spaces
by: Mousi, Basel, et al.
Published: (2024)
by: Mousi, Basel, et al.
Published: (2024)
Improving Language Models Trained on Translated Data with Continual Pre-Training and Dictionary Learning Analysis
by: Boughorbel, Sabri, et al.
Published: (2024)
by: Boughorbel, Sabri, et al.
Published: (2024)
Discovering Salient Neurons in Deep NLP Models
by: Durrani, Nadir, et al.
Published: (2022)
by: Durrani, Nadir, et al.
Published: (2022)
Editing Across Languages: A Survey of Multilingual Knowledge Editing
by: Durrani, Nadir, et al.
Published: (2025)
by: Durrani, Nadir, et al.
Published: (2025)
An Exploration of Knowledge Editing for Arabic
by: Mousi, Basel, et al.
Published: (2025)
by: Mousi, Basel, et al.
Published: (2025)
Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models
by: Mousi, Basel, et al.
Published: (2026)
by: Mousi, Basel, et al.
Published: (2026)
LAraBench: Benchmarking Arabic AI with Large Language Models
by: Abdelali, Ahmed, et al.
Published: (2023)
by: Abdelali, Ahmed, et al.
Published: (2023)
Latent Concept-based Explanation of NLP Models
by: Yu, Xuemin, et al.
Published: (2024)
by: Yu, Xuemin, et al.
Published: (2024)
LLMeBench: A Flexible Framework for Accelerating LLMs Benchmarking
by: Dalvi, Fahim, et al.
Published: (2023)
by: Dalvi, Fahim, et al.
Published: (2023)
From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models
by: Ersoy, Asım, et al.
Published: (2025)
by: Ersoy, Asım, et al.
Published: (2025)
The Landscape of Arabic Large Language Models (ALLMs): A New Era for Arabic Language Technology
by: Al-Khalifa, Shahad, et al.
Published: (2025)
by: Al-Khalifa, Shahad, et al.
Published: (2025)
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
by: Chen, Wenting, et al.
Published: (2025)
by: Chen, Wenting, et al.
Published: (2025)
La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America
by: Grandury, María, et al.
Published: (2025)
by: Grandury, María, et al.
Published: (2025)
Efficient Performance Tracking: Leveraging Large Language Models for Automated Construction of Scientific Leaderboards
by: Şahinuç, Furkan, et al.
Published: (2024)
by: Şahinuç, Furkan, et al.
Published: (2024)
The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models
by: Hong, Giwon, et al.
Published: (2024)
by: Hong, Giwon, et al.
Published: (2024)
The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality
by: Cheng, Aileen, et al.
Published: (2025)
by: Cheng, Aileen, et al.
Published: (2025)
Seeing is Not Understanding: A Benchmark on Perception-Cognition Disparities in Large Language Models
by: Li, Haokun, et al.
Published: (2025)
by: Li, Haokun, et al.
Published: (2025)
Large Language Models for Page Stream Segmentation
by: Heidenreich, Hunter, et al.
Published: (2024)
by: Heidenreich, Hunter, et al.
Published: (2024)
Disparities In Negation Understanding Across Languages In Vision-Language Models
by: Moraitaki, Charikleia, et al.
Published: (2026)
by: Moraitaki, Charikleia, et al.
Published: (2026)
HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models
by: Ajayi, Edward, et al.
Published: (2026)
by: Ajayi, Edward, et al.
Published: (2026)
When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards
by: Alzahrani, Norah, et al.
Published: (2024)
by: Alzahrani, Norah, et al.
Published: (2024)
AraDiCE: Benchmarks for Dialectal and Cultural Capabilities in LLMs
by: Mousi, Basel, et al.
Published: (2024)
by: Mousi, Basel, et al.
Published: (2024)
Quantifying Language Disparities in Multilingual Large Language Models
by: Hu, Songbo, et al.
Published: (2025)
by: Hu, Songbo, et al.
Published: (2025)
Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM Reasoning
by: Saparkhan, Raman, et al.
Published: (2026)
by: Saparkhan, Raman, et al.
Published: (2026)
Anatomy of Neural Language Models
by: Saleh, Majd, et al.
Published: (2024)
by: Saleh, Majd, et al.
Published: (2024)
PalmX 2025: The First Shared Task on Benchmarking LLMs on Arabic and Islamic Culture
by: Alwajih, Fakhraddin, et al.
Published: (2025)
by: Alwajih, Fakhraddin, et al.
Published: (2025)
Beyond the Numbers: Transparency in Relation Extraction Benchmark Creation and Leaderboards
by: Arzt, Varvara, et al.
Published: (2024)
by: Arzt, Varvara, et al.
Published: (2024)
LLM-ProS: Analyzing Large Language Models' Performance in Competitive Problem Solving
by: Hossain, Md Sifat, et al.
Published: (2025)
by: Hossain, Md Sifat, et al.
Published: (2025)
User-centric Subjective Leaderboard by Customizable Reward Modeling
by: Jia, Qi, et al.
Published: (2025)
by: Jia, Qi, et al.
Published: (2025)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
by: Park, Chanjun, et al.
Published: (2024)
by: Park, Chanjun, et al.
Published: (2024)
MULTI: Multimodal Understanding Leaderboard with Text and Images
by: Zhu, Zichen, et al.
Published: (2024)
by: Zhu, Zichen, et al.
Published: (2024)
The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?
by: Shani, Chen, et al.
Published: (2026)
by: Shani, Chen, et al.
Published: (2026)
LLeMpower: Understanding Disparities in the Control and Access of Large Language Models
by: Sathish, Vishwas, et al.
Published: (2024)
by: Sathish, Vishwas, et al.
Published: (2024)
Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard
by: Topsakal, Oguzhan, et al.
Published: (2024)
by: Topsakal, Oguzhan, et al.
Published: (2024)
An Efficient Approach for Studying Cross-Lingual Transfer in Multilingual Language Models
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
Prompt-to-Leaderboard
by: Frick, Evan, et al.
Published: (2025)
by: Frick, Evan, et al.
Published: (2025)
Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability
by: Li, Haonan, et al.
Published: (2024)
by: Li, Haonan, et al.
Published: (2024)
Reviving Your MNEME: Predicting The Side Effects of LLM Unlearning and Fine-Tuning via Sparse Model Diffing
by: Kassem, Aly M., et al.
Published: (2025)
by: Kassem, Aly M., et al.
Published: (2025)
Similar Items
-
Scaling up Discovery of Latent Concepts in Deep NLP Models
by: Hawasly, Majd, et al.
Published: (2023) -
There Is More to Refusal in Large Language Models than a Single Direction
by: Joad, Faaiz, et al.
Published: (2026) -
Exploring Alignment in Shared Cross-lingual Spaces
by: Mousi, Basel, et al.
Published: (2024) -
Improving Language Models Trained on Translated Data with Continual Pre-Training and Dictionary Learning Analysis
by: Boughorbel, Sabri, et al.
Published: (2024) -
Discovering Salient Neurons in Deep NLP Models
by: Durrani, Nadir, et al.
Published: (2022)