EvalCards: A Framework for Standardized Evaluation Reporting
Fuente:
arXiv
Saved in:
| Main Authors: | Dhar, Ruchira, Villegas, Danae Sanchez, Karamolegkou, Antonia, Schiavone, Alice, Yuan, Yifei, Chen, Xinyi, Li, Jiaang, Frank, Stella, De Grazia, Laura, Swain, Monorama, Brandl, Stephanie, Hershcovich, Daniel, Søgaard, Anders, Elliott, Desmond |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
by: Karamolegkou, Antonia, et al.
Published: (2025)
by: Karamolegkou, Antonia, et al.
Published: (2025)
Beyond Technocratic XAI: The Who, What & How in Explanation Design
by: Dhar, Ruchira, et al.
Published: (2025)
by: Dhar, Ruchira, et al.
Published: (2025)
Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing
by: Dhar, Ruchira, et al.
Published: (2026)
by: Dhar, Ruchira, et al.
Published: (2026)
From Words to Worlds: Compositionality for Cognitive Architectures
by: Dhar, Ruchira, et al.
Published: (2024)
by: Dhar, Ruchira, et al.
Published: (2024)
Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing
by: Cao, Yong, et al.
Published: (2024)
by: Cao, Yong, et al.
Published: (2024)
Vision-Language Models under Cultural and Inclusive Considerations
by: Karamolegkou, Antonia, et al.
Published: (2024)
by: Karamolegkou, Antonia, et al.
Published: (2024)
Realist and Pluralist Conceptions of Intelligence and Their Implications on AI Research
by: Oldenburg, Ninell, et al.
Published: (2025)
by: Oldenburg, Ninell, et al.
Published: (2025)
Evaluating Adjective-Noun Compositionality in LLMs: Functional vs Representational Perspectives
by: Dhar, Ruchira, et al.
Published: (2026)
by: Dhar, Ruchira, et al.
Published: (2026)
Cultural Compass: Predicting Transfer Learning Success in Offensive Language Detection with Cultural Features
by: Zhou, Li, et al.
Published: (2023)
by: Zhou, Li, et al.
Published: (2023)
FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food Culture
by: Li, Wenyan, et al.
Published: (2024)
by: Li, Wenyan, et al.
Published: (2024)
Trick or Neat: Adversarial Ambiguity and Language Model Evaluation
by: Karamolegkou, Antonia, et al.
Published: (2025)
by: Karamolegkou, Antonia, et al.
Published: (2025)
Defining Knowledge: Bridging Epistemology and Large Language Models
by: Fierro, Constanza, et al.
Published: (2024)
by: Fierro, Constanza, et al.
Published: (2024)
Does Instruction Tuning Make LLMs More Consistent?
by: Fierro, Constanza, et al.
Published: (2024)
by: Fierro, Constanza, et al.
Published: (2024)
Towards Fair ASR For Second Language Speakers Using Fairness Prompted Finetuning
by: Swain, Monorama, et al.
Published: (2025)
by: Swain, Monorama, et al.
Published: (2025)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
by: Villegas, Danae Sánchez, et al.
Published: (2025)
by: Villegas, Danae Sánchez, et al.
Published: (2025)
Beyond Binary Classification: Detecting Fine-Grained Sexism in Social Media Videos
by: De Grazia, Laura, et al.
Published: (2026)
by: De Grazia, Laura, et al.
Published: (2026)
What if Othello-Playing Language Models Could See?
by: Chen, Xinyi, et al.
Published: (2025)
by: Chen, Xinyi, et al.
Published: (2025)
How Do Multilingual Language Models Remember Facts?
by: Fierro, Constanza, et al.
Published: (2024)
by: Fierro, Constanza, et al.
Published: (2024)
H-RAG at SemEval-2026 Task 8: Hierarchical Parent-Child Retrieval for Multi-Turn RAG Conversations
by: Elchafei, Passant, et al.
Published: (2026)
by: Elchafei, Passant, et al.
Published: (2026)
On the Measure of a Model: From Intelligence to Generality
by: Dhar, Ruchira, et al.
Published: (2025)
by: Dhar, Ruchira, et al.
Published: (2025)
Do Vision and Language Models Share Concepts? A Vector Space Alignment Study
by: Li, Jiaang, et al.
Published: (2023)
by: Li, Jiaang, et al.
Published: (2023)
Ethical Concern Identification in NLP: A Corpus of ACL Anthology Ethics Statements
by: Karamolegkou, Antonia, et al.
Published: (2024)
by: Karamolegkou, Antonia, et al.
Published: (2024)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
by: Villegas, Danae Sánchez, et al.
Published: (2026)
by: Villegas, Danae Sánchez, et al.
Published: (2026)
Evaluation of Cultural Competence of Vision-Language Models
by: Yadav, Srishti, et al.
Published: (2025)
by: Yadav, Srishti, et al.
Published: (2025)
Revisiting the Othello World Model Hypothesis
by: Yuan, Yifei, et al.
Published: (2025)
by: Yuan, Yifei, et al.
Published: (2025)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
by: Li, Jiaang, et al.
Published: (2025)
by: Li, Jiaang, et al.
Published: (2025)
MuSeD: A Multimodal Spanish Dataset for Sexism Detection in Social Media Videos
by: De Grazia, Laura, et al.
Published: (2025)
by: De Grazia, Laura, et al.
Published: (2025)
WebQAmGaze: A Multilingual Webcam Eye-Tracking-While-Reading Dataset
by: Ribeiro, Tiago, et al.
Published: (2023)
by: Ribeiro, Tiago, et al.
Published: (2023)
Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning
by: Li, Wenyan, et al.
Published: (2024)
by: Li, Wenyan, et al.
Published: (2024)
Facet-Level Tracing of Evidence Uncertainty and Hallucination in RAG
by: Elchafei, Passant, et al.
Published: (2026)
by: Elchafei, Passant, et al.
Published: (2026)
Evaluating Webcam-based Gaze Data as an Alternative for Human Rationale Annotations
by: Brandl, Stephanie, et al.
Published: (2024)
by: Brandl, Stephanie, et al.
Published: (2024)
Seeing What Tastes Good: Revisiting Multimodal Distributional Semantics in the Billion Parameter Era
by: Oneata, Dan, et al.
Published: (2025)
by: Oneata, Dan, et al.
Published: (2025)
Can Small Agents Collaborate to Beat a Single Large Language Model?
by: Żywot, Agata, et al.
Published: (2026)
by: Żywot, Agata, et al.
Published: (2026)
Mechanistic Interpretability Needs Philosophy
by: Williams, Iwan, et al.
Published: (2025)
by: Williams, Iwan, et al.
Published: (2025)
Unlocking Markets: A Multilingual Benchmark to Cross-Market Question Answering
by: Yuan, Yifei, et al.
Published: (2024)
by: Yuan, Yifei, et al.
Published: (2024)
Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
by: Karamolegkou, Antonia, et al.
Published: (2026)
by: Karamolegkou, Antonia, et al.
Published: (2026)
Credit Card Fraud Detection: A Deep Learning Approach
by: Verma, Sourav, et al.
Published: (2024)
by: Verma, Sourav, et al.
Published: (2024)
LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation
by: Xu, Shanshan, et al.
Published: (2026)
by: Xu, Shanshan, et al.
Published: (2026)
Empirical Evaluation of Progressive Coding for Sparse Autoencoders
by: Peter, Hans, et al.
Published: (2025)
by: Peter, Hans, et al.
Published: (2025)
Factual Consistency of Multilingual Pretrained Language Models
by: Fierro, Constanza, et al.
Published: (2022)
by: Fierro, Constanza, et al.
Published: (2022)
Similar Items
-
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
by: Karamolegkou, Antonia, et al.
Published: (2025) -
Beyond Technocratic XAI: The Who, What & How in Explanation Design
by: Dhar, Ruchira, et al.
Published: (2025) -
Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing
by: Dhar, Ruchira, et al.
Published: (2026) -
From Words to Worlds: Compositionality for Cognitive Architectures
by: Dhar, Ruchira, et al.
Published: (2024) -
Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing
by: Cao, Yong, et al.
Published: (2024)