Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing
Fuente:
arXiv
Saved in:
| Main Authors: | Dhar, Ruchira, Søgaard, Anders |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Adjective-Noun Compositionality in LLMs: Functional vs Representational Perspectives
by: Dhar, Ruchira, et al.
Published: (2026)
by: Dhar, Ruchira, et al.
Published: (2026)
From Words to Worlds: Compositionality for Cognitive Architectures
by: Dhar, Ruchira, et al.
Published: (2024)
by: Dhar, Ruchira, et al.
Published: (2024)
Defining Knowledge: Bridging Epistemology and Large Language Models
by: Fierro, Constanza, et al.
Published: (2024)
by: Fierro, Constanza, et al.
Published: (2024)
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
by: Karamolegkou, Antonia, et al.
Published: (2025)
by: Karamolegkou, Antonia, et al.
Published: (2025)
Revisiting the Othello World Model Hypothesis
by: Yuan, Yifei, et al.
Published: (2025)
by: Yuan, Yifei, et al.
Published: (2025)
Beyond Technocratic XAI: The Who, What & How in Explanation Design
by: Dhar, Ruchira, et al.
Published: (2025)
by: Dhar, Ruchira, et al.
Published: (2025)
Realist and Pluralist Conceptions of Intelligence and Their Implications on AI Research
by: Oldenburg, Ninell, et al.
Published: (2025)
by: Oldenburg, Ninell, et al.
Published: (2025)
Trick or Neat: Adversarial Ambiguity and Language Model Evaluation
by: Karamolegkou, Antonia, et al.
Published: (2025)
by: Karamolegkou, Antonia, et al.
Published: (2025)
EvalCards: A Framework for Standardized Evaluation Reporting
by: Dhar, Ruchira, et al.
Published: (2025)
by: Dhar, Ruchira, et al.
Published: (2025)
Mechanistic Interpretability Needs Philosophy
by: Williams, Iwan, et al.
Published: (2025)
by: Williams, Iwan, et al.
Published: (2025)
Factual Consistency of Multilingual Pretrained Language Models
by: Fierro, Constanza, et al.
Published: (2022)
by: Fierro, Constanza, et al.
Published: (2022)
Comprehensive Reassessment of Large-Scale Evaluation Outcomes in LLMs: A Multifaceted Statistical Approach
by: Sun, Kun, et al.
Published: (2024)
by: Sun, Kun, et al.
Published: (2024)
A Taxonomy for Design and Evaluation of Prompt-Based Natural Language Explanations
by: Nejadgholi, Isar, et al.
Published: (2025)
by: Nejadgholi, Isar, et al.
Published: (2025)
Evaluating Webcam-based Gaze Data as an Alternative for Human Rationale Annotations
by: Brandl, Stephanie, et al.
Published: (2024)
by: Brandl, Stephanie, et al.
Published: (2024)
Concept Space Alignment in Multilingual LLMs
by: Peng, Qiwei, et al.
Published: (2024)
by: Peng, Qiwei, et al.
Published: (2024)
Ethical Concern Identification in NLP: A Corpus of ACL Anthology Ethics Statements
by: Karamolegkou, Antonia, et al.
Published: (2024)
by: Karamolegkou, Antonia, et al.
Published: (2024)
Mitigating Exaggerated Safety in Large Language Models
by: Ray, Ruchira, et al.
Published: (2024)
by: Ray, Ruchira, et al.
Published: (2024)
How Do Multilingual Language Models Remember Facts?
by: Fierro, Constanza, et al.
Published: (2024)
by: Fierro, Constanza, et al.
Published: (2024)
Evaluating Large Language Models for Radiology Natural Language Processing
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
Understanding Subword Compositionality of Large Language Models
by: Peng, Qiwei, et al.
Published: (2025)
by: Peng, Qiwei, et al.
Published: (2025)
MuLan: A Study of Fact Mutability in Language Models
by: Fierro, Constanza, et al.
Published: (2024)
by: Fierro, Constanza, et al.
Published: (2024)
Does Instruction Tuning Make LLMs More Consistent?
by: Fierro, Constanza, et al.
Published: (2024)
by: Fierro, Constanza, et al.
Published: (2024)
Revisiting Noise in Natural Language Processing for Computational Social Science
by: Borenstein, Nadav
Published: (2025)
by: Borenstein, Nadav
Published: (2025)
Reference-Free Evaluation of Taxonomies
by: Wullschleger, Pascal, et al.
Published: (2025)
by: Wullschleger, Pascal, et al.
Published: (2025)
Taxonomy-based CheckList for Large Language Model Evaluation
by: Zhang, Damin
Published: (2023)
by: Zhang, Damin
Published: (2023)
Survey of Natural Language Processing for Education: Taxonomy, Systematic Review, and Future Trends
by: Lan, Yunshi, et al.
Published: (2024)
by: Lan, Yunshi, et al.
Published: (2024)
Unlocking Markets: A Multilingual Benchmark to Cross-Market Question Answering
by: Yuan, Yifei, et al.
Published: (2024)
by: Yuan, Yifei, et al.
Published: (2024)
WebQAmGaze: A Multilingual Webcam Eye-Tracking-While-Reading Dataset
by: Ribeiro, Tiago, et al.
Published: (2023)
by: Ribeiro, Tiago, et al.
Published: (2023)
Revisiting Classification Taxonomy for Grammatical Errors
by: Zou, Deqing, et al.
Published: (2025)
by: Zou, Deqing, et al.
Published: (2025)
Do Vision and Language Models Share Concepts? A Vector Space Alignment Study
by: Li, Jiaang, et al.
Published: (2023)
by: Li, Jiaang, et al.
Published: (2023)
From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility
by: Levinson, Gavin, et al.
Published: (2026)
by: Levinson, Gavin, et al.
Published: (2026)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
by: Zhan, Zaifu, et al.
Published: (2025)
by: Zhan, Zaifu, et al.
Published: (2025)
Evaluating Large Language Models on Time Series Feature Understanding: A Comprehensive Taxonomy and Benchmark
by: Fons, Elizabeth, et al.
Published: (2024)
by: Fons, Elizabeth, et al.
Published: (2024)
Correlating and Predicting Human Evaluations of Language Models from Natural Language Processing Benchmarks
by: Schaeffer, Rylan, et al.
Published: (2025)
by: Schaeffer, Rylan, et al.
Published: (2025)
A Discriminative Latent-Variable Model for Bilingual Lexicon Induction
by: Ruder, Sebastian, et al.
Published: (2018)
by: Ruder, Sebastian, et al.
Published: (2018)
Towards Fair ASR For Second Language Speakers Using Fairness Prompted Finetuning
by: Swain, Monorama, et al.
Published: (2025)
by: Swain, Monorama, et al.
Published: (2025)
Lost in Embeddings: Information Loss in Vision-Language Models
by: Li, Wenyan, et al.
Published: (2025)
by: Li, Wenyan, et al.
Published: (2025)
LITE: LLM-Impelled efficient Taxonomy Evaluation
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
Word Order and World Knowledge
by: Zhao, Qinghua, et al.
Published: (2024)
by: Zhao, Qinghua, et al.
Published: (2024)
A Principled Framework for Evaluating on Typologically Diverse Languages
by: Ploeger, Esther, et al.
Published: (2024)
by: Ploeger, Esther, et al.
Published: (2024)
Similar Items
-
Evaluating Adjective-Noun Compositionality in LLMs: Functional vs Representational Perspectives
by: Dhar, Ruchira, et al.
Published: (2026) -
From Words to Worlds: Compositionality for Cognitive Architectures
by: Dhar, Ruchira, et al.
Published: (2024) -
Defining Knowledge: Bridging Epistemology and Large Language Models
by: Fierro, Constanza, et al.
Published: (2024) -
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
by: Karamolegkou, Antonia, et al.
Published: (2025) -
Revisiting the Othello World Model Hypothesis
by: Yuan, Yifei, et al.
Published: (2025)