EvalCards: A Framework for Standardized Evaluation Reporting
Fuente:
arXiv
Salvato in:
| Autori principali: | Dhar, Ruchira, Villegas, Danae Sanchez, Karamolegkou, Antonia, Schiavone, Alice, Yuan, Yifei, Chen, Xinyi, Li, Jiaang, Frank, Stella, De Grazia, Laura, Swain, Monorama, Brandl, Stephanie, Hershcovich, Daniel, Søgaard, Anders, Elliott, Desmond |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2025)
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2025)
Beyond Technocratic XAI: The Who, What & How in Explanation Design
di: Dhar, Ruchira, et al.
Pubblicazione: (2025)
di: Dhar, Ruchira, et al.
Pubblicazione: (2025)
Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing
di: Dhar, Ruchira, et al.
Pubblicazione: (2026)
di: Dhar, Ruchira, et al.
Pubblicazione: (2026)
From Words to Worlds: Compositionality for Cognitive Architectures
di: Dhar, Ruchira, et al.
Pubblicazione: (2024)
di: Dhar, Ruchira, et al.
Pubblicazione: (2024)
Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing
di: Cao, Yong, et al.
Pubblicazione: (2024)
di: Cao, Yong, et al.
Pubblicazione: (2024)
Vision-Language Models under Cultural and Inclusive Considerations
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2024)
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2024)
Realist and Pluralist Conceptions of Intelligence and Their Implications on AI Research
di: Oldenburg, Ninell, et al.
Pubblicazione: (2025)
di: Oldenburg, Ninell, et al.
Pubblicazione: (2025)
Evaluating Adjective-Noun Compositionality in LLMs: Functional vs Representational Perspectives
di: Dhar, Ruchira, et al.
Pubblicazione: (2026)
di: Dhar, Ruchira, et al.
Pubblicazione: (2026)
Cultural Compass: Predicting Transfer Learning Success in Offensive Language Detection with Cultural Features
di: Zhou, Li, et al.
Pubblicazione: (2023)
di: Zhou, Li, et al.
Pubblicazione: (2023)
FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food Culture
di: Li, Wenyan, et al.
Pubblicazione: (2024)
di: Li, Wenyan, et al.
Pubblicazione: (2024)
Trick or Neat: Adversarial Ambiguity and Language Model Evaluation
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2025)
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2025)
Defining Knowledge: Bridging Epistemology and Large Language Models
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
Does Instruction Tuning Make LLMs More Consistent?
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
Towards Fair ASR For Second Language Speakers Using Fairness Prompted Finetuning
di: Swain, Monorama, et al.
Pubblicazione: (2025)
di: Swain, Monorama, et al.
Pubblicazione: (2025)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2025)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2025)
Beyond Binary Classification: Detecting Fine-Grained Sexism in Social Media Videos
di: De Grazia, Laura, et al.
Pubblicazione: (2026)
di: De Grazia, Laura, et al.
Pubblicazione: (2026)
What if Othello-Playing Language Models Could See?
di: Chen, Xinyi, et al.
Pubblicazione: (2025)
di: Chen, Xinyi, et al.
Pubblicazione: (2025)
How Do Multilingual Language Models Remember Facts?
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
H-RAG at SemEval-2026 Task 8: Hierarchical Parent-Child Retrieval for Multi-Turn RAG Conversations
di: Elchafei, Passant, et al.
Pubblicazione: (2026)
di: Elchafei, Passant, et al.
Pubblicazione: (2026)
On the Measure of a Model: From Intelligence to Generality
di: Dhar, Ruchira, et al.
Pubblicazione: (2025)
di: Dhar, Ruchira, et al.
Pubblicazione: (2025)
Do Vision and Language Models Share Concepts? A Vector Space Alignment Study
di: Li, Jiaang, et al.
Pubblicazione: (2023)
di: Li, Jiaang, et al.
Pubblicazione: (2023)
Ethical Concern Identification in NLP: A Corpus of ACL Anthology Ethics Statements
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2024)
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2024)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
Evaluation of Cultural Competence of Vision-Language Models
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
Revisiting the Othello World Model Hypothesis
di: Yuan, Yifei, et al.
Pubblicazione: (2025)
di: Yuan, Yifei, et al.
Pubblicazione: (2025)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
di: Li, Jiaang, et al.
Pubblicazione: (2025)
di: Li, Jiaang, et al.
Pubblicazione: (2025)
MuSeD: A Multimodal Spanish Dataset for Sexism Detection in Social Media Videos
di: De Grazia, Laura, et al.
Pubblicazione: (2025)
di: De Grazia, Laura, et al.
Pubblicazione: (2025)
WebQAmGaze: A Multilingual Webcam Eye-Tracking-While-Reading Dataset
di: Ribeiro, Tiago, et al.
Pubblicazione: (2023)
di: Ribeiro, Tiago, et al.
Pubblicazione: (2023)
Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2024)
di: Li, Wenyan, et al.
Pubblicazione: (2024)
Facet-Level Tracing of Evidence Uncertainty and Hallucination in RAG
di: Elchafei, Passant, et al.
Pubblicazione: (2026)
di: Elchafei, Passant, et al.
Pubblicazione: (2026)
Evaluating Webcam-based Gaze Data as an Alternative for Human Rationale Annotations
di: Brandl, Stephanie, et al.
Pubblicazione: (2024)
di: Brandl, Stephanie, et al.
Pubblicazione: (2024)
Seeing What Tastes Good: Revisiting Multimodal Distributional Semantics in the Billion Parameter Era
di: Oneata, Dan, et al.
Pubblicazione: (2025)
di: Oneata, Dan, et al.
Pubblicazione: (2025)
Can Small Agents Collaborate to Beat a Single Large Language Model?
di: Żywot, Agata, et al.
Pubblicazione: (2026)
di: Żywot, Agata, et al.
Pubblicazione: (2026)
Mechanistic Interpretability Needs Philosophy
di: Williams, Iwan, et al.
Pubblicazione: (2025)
di: Williams, Iwan, et al.
Pubblicazione: (2025)
Unlocking Markets: A Multilingual Benchmark to Cross-Market Question Answering
di: Yuan, Yifei, et al.
Pubblicazione: (2024)
di: Yuan, Yifei, et al.
Pubblicazione: (2024)
Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2026)
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2026)
Credit Card Fraud Detection: A Deep Learning Approach
di: Verma, Sourav, et al.
Pubblicazione: (2024)
di: Verma, Sourav, et al.
Pubblicazione: (2024)
LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation
di: Xu, Shanshan, et al.
Pubblicazione: (2026)
di: Xu, Shanshan, et al.
Pubblicazione: (2026)
Empirical Evaluation of Progressive Coding for Sparse Autoencoders
di: Peter, Hans, et al.
Pubblicazione: (2025)
di: Peter, Hans, et al.
Pubblicazione: (2025)
Factual Consistency of Multilingual Pretrained Language Models
di: Fierro, Constanza, et al.
Pubblicazione: (2022)
di: Fierro, Constanza, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2025) -
Beyond Technocratic XAI: The Who, What & How in Explanation Design
di: Dhar, Ruchira, et al.
Pubblicazione: (2025) -
Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing
di: Dhar, Ruchira, et al.
Pubblicazione: (2026) -
From Words to Worlds: Compositionality for Cognitive Architectures
di: Dhar, Ruchira, et al.
Pubblicazione: (2024) -
Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing
di: Cao, Yong, et al.
Pubblicazione: (2024)