Exposing Assumptions in AI Benchmarks through Cognitive Modelling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rystrøm, Jonathan H., Enevoldsen, Kenneth C. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Grounding Text Embeddings in Stakeholder Associations
par: Rystrøm, Jonathan, et autres
Publié: (2026)
par: Rystrøm, Jonathan, et autres
Publié: (2026)
The Scandinavian Embedding Benchmarks: Comprehensive Assessment of Multilingual and Monolingual Text Embedding
par: Enevoldsen, Kenneth, et autres
Publié: (2024)
par: Enevoldsen, Kenneth, et autres
Publié: (2024)
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
par: Rystrøm, Jonathan, et autres
Publié: (2025)
par: Rystrøm, Jonathan, et autres
Publié: (2025)
Maintaining MTEB: Towards Long Term Usability and Reproducibility of Embedding Benchmarks
par: Chung, Isaac, et autres
Publié: (2025)
par: Chung, Isaac, et autres
Publié: (2025)
Oversight Structures for Agentic AI in Public-Sector Organizations
par: Schmitz, Chris, et autres
Publié: (2025)
par: Schmitz, Chris, et autres
Publié: (2025)
Are You Human? An Adversarial Benchmark to Expose LLMs
par: Gressel, Gilad, et autres
Publié: (2024)
par: Gressel, Gilad, et autres
Publié: (2024)
Encoder vs Decoder: Comparative Analysis of Encoder and Decoder Language Models on Multilingual NLU Tasks
par: Nielsen, Dan Saattrup, et autres
Publié: (2024)
par: Nielsen, Dan Saattrup, et autres
Publié: (2024)
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Bridging Legal Interpretation and Formal Logic: Faithfulness, Assumption, and the Future of AI Legal Reasoning
par: Wang, Olivia Peiyu, et autres
Publié: (2026)
par: Wang, Olivia Peiyu, et autres
Publié: (2026)
OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI
par: Huang, Zhen, et autres
Publié: (2024)
par: Huang, Zhen, et autres
Publié: (2024)
Agent Benchmarks Fail Public Sector Requirements
par: Rystrøm, Jonathan, et autres
Publié: (2026)
par: Rystrøm, Jonathan, et autres
Publié: (2026)
Cognitive Effects in Large Language Models
par: Shaki, Jonathan, et autres
Publié: (2023)
par: Shaki, Jonathan, et autres
Publié: (2023)
Cognitive LLMs: Towards Integrating Cognitive Architectures and Large Language Models for Manufacturing Decision-making
par: Wu, Siyu, et autres
Publié: (2024)
par: Wu, Siyu, et autres
Publié: (2024)
Hallucination is Inevitable for LLMs with the Open World Assumption
par: Xu, Bowen
Publié: (2025)
par: Xu, Bowen
Publié: (2025)
BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
par: Tang, Yuzhe
Publié: (2026)
par: Tang, Yuzhe
Publié: (2026)
An analysis of AI Decision under Risk: Prospect theory emerges in Large Language Models
par: Payne, Kenneth
Publié: (2025)
par: Payne, Kenneth
Publié: (2025)
StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation
par: Zheng, Huawei, et autres
Publié: (2026)
par: Zheng, Huawei, et autres
Publié: (2026)
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
par: Dong, Nguyen Tien, et autres
Publié: (2025)
par: Dong, Nguyen Tien, et autres
Publié: (2025)
Measuring what Matters: Construct Validity in Large Language Model Benchmarks
par: Bean, Andrew M., et autres
Publié: (2025)
par: Bean, Andrew M., et autres
Publié: (2025)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
A Question on the Explainability of Large Language Models and the Word-Level Univariate First-Order Plausibility Assumption
par: Bogaert, Jeremie, et autres
Publié: (2024)
par: Bogaert, Jeremie, et autres
Publié: (2024)
How Small Transformation Expose the Weakness of Semantic Similarity Measures
par: Nikiema, Serge Lionel, et autres
Publié: (2025)
par: Nikiema, Serge Lionel, et autres
Publié: (2025)
Benchmarking Cognitive Domains for LLMs: Insights from Taiwanese Hakka Culture
par: Chang, Chen-Chi, et autres
Publié: (2024)
par: Chang, Chen-Chi, et autres
Publié: (2024)
The LLM Fallacy: Misattribution in AI-Assisted Cognitive Workflows
par: Kim, Hyunwoo, et autres
Publié: (2026)
par: Kim, Hyunwoo, et autres
Publié: (2026)
Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs
par: Mor-Lan, Guy, et autres
Publié: (2026)
par: Mor-Lan, Guy, et autres
Publié: (2026)
HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Models through Curriculum Tuning
par: Yang, Qihao, et autres
Publié: (2025)
par: Yang, Qihao, et autres
Publié: (2025)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
AI Idea Bench 2025: AI Research Idea Generation Benchmark
par: Qiu, Yansheng, et autres
Publié: (2025)
par: Qiu, Yansheng, et autres
Publié: (2025)
Mapping Overlaps in Benchmarks through Perplexity in the Wild
par: Wu, Siyang, et autres
Publié: (2025)
par: Wu, Siyang, et autres
Publié: (2025)
Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning
par: Zhao, Boxiang, et autres
Publié: (2026)
par: Zhao, Boxiang, et autres
Publié: (2026)
Enhancing Diagnostic Accuracy through Multi-Agent Conversations: Using Large Language Models to Mitigate Cognitive Bias
par: Ke, Yu He, et autres
Publié: (2024)
par: Ke, Yu He, et autres
Publié: (2024)
Exposing Limitations of Language Model Agents in Sequential-Task Compositions on the Web
par: Furuta, Hiroki, et autres
Publié: (2023)
par: Furuta, Hiroki, et autres
Publié: (2023)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
par: Jiang, Peihai, et autres
Publié: (2025)
par: Jiang, Peihai, et autres
Publié: (2025)
ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
Assessing AI-Generated Questions' Alignment with Cognitive Frameworks in Educational Assessment
par: Yaacoub, Antoun, et autres
Publié: (2025)
par: Yaacoub, Antoun, et autres
Publié: (2025)
How Different AI Chatbots Behave? Benchmarking Large Language Models in Behavioral Economics Games
par: Xie, Yutong, et autres
Publié: (2024)
par: Xie, Yutong, et autres
Publié: (2024)
MAEB: Massive Audio Embedding Benchmark
par: Assadi, Adnan El, et autres
Publié: (2026)
par: Assadi, Adnan El, et autres
Publié: (2026)
M3GIA: A Cognition Inspired Multilingual and Multimodal General Intelligence Ability Benchmark
par: Song, Wei, et autres
Publié: (2024)
par: Song, Wei, et autres
Publié: (2024)
INTIMA: A Benchmark for Human-AI Companionship Behavior
par: Kaffee, Lucie-Aimée, et autres
Publié: (2025)
par: Kaffee, Lucie-Aimée, et autres
Publié: (2025)
Mitigation of Gender and Ethnicity Bias in AI-Generated Stories through Model Explanations
par: Dimgba, Martha O., et autres
Publié: (2025)
par: Dimgba, Martha O., et autres
Publié: (2025)
Documents similaires
-
Grounding Text Embeddings in Stakeholder Associations
par: Rystrøm, Jonathan, et autres
Publié: (2026) -
The Scandinavian Embedding Benchmarks: Comprehensive Assessment of Multilingual and Monolingual Text Embedding
par: Enevoldsen, Kenneth, et autres
Publié: (2024) -
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
par: Rystrøm, Jonathan, et autres
Publié: (2025) -
Maintaining MTEB: Towards Long Term Usability and Reproducibility of Embedding Benchmarks
par: Chung, Isaac, et autres
Publié: (2025) -
Oversight Structures for Agentic AI in Public-Sector Organizations
par: Schmitz, Chris, et autres
Publié: (2025)