CIRCLE: A Framework for Evaluating AI from a Real-World Lens
Fuente:
arXiv
Salvato in:
| Autori principali: | Schwartz, Reva, Westling, Carina, Briggs, Morgan, Fadaee, Marzieh, Nejadgholi, Isar, Holmes, Matthew, Rashid, Fariza, Carlyle, Maya, Taïk, Afaf, Wilson, Kyra, Douglas, Peter, Skeadas, Theodora, Waters, Gabriella, Chowdhury, Rumman, Lacerda, Thiago |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reality Check: A New Evaluation Ecosystem Is Necessary to Understand AI's Real World Effects
di: Schwartz, Reva, et al.
Pubblicazione: (2025)
di: Schwartz, Reva, et al.
Pubblicazione: (2025)
Real-World AI Evaluation: How FRAME Generates Systematic Evidence to Resolve the Decision-Maker's Dilemma
di: Schwartz, Reva, et al.
Pubblicazione: (2026)
di: Schwartz, Reva, et al.
Pubblicazione: (2026)
Making AI Evaluation Deployment Relevant Through Context Specification
di: Holmes, Matthew, et al.
Pubblicazione: (2026)
di: Holmes, Matthew, et al.
Pubblicazione: (2026)
Ask What Your Country Can Do For You: Towards a Public Red Teaming Model
di: Kennedy, Wm. Matthew, et al.
Pubblicazione: (2025)
di: Kennedy, Wm. Matthew, et al.
Pubblicazione: (2025)
WildFireCan-MMD: A Multimodal Dataset for Classification of User-Generated Content During Wildfires in Canada
di: Sherritt, Braeden, et al.
Pubblicazione: (2025)
di: Sherritt, Braeden, et al.
Pubblicazione: (2025)
Automatic WordNet Construction Using Markov Chain Monte Carlo
di: Marzieh Fadaee
Pubblicazione: (2013)
di: Marzieh Fadaee
Pubblicazione: (2013)
Social and Ethical Risks Posed by General-Purpose LLMs for Settling Newcomers in Canada
di: Nejadgholi, Isar, et al.
Pubblicazione: (2024)
di: Nejadgholi, Isar, et al.
Pubblicazione: (2024)
Systemizing Multiplicity: The Curious Case of Arbitrariness in Machine Learning
di: Ganesh, Prakhar, et al.
Pubblicazione: (2025)
di: Ganesh, Prakhar, et al.
Pubblicazione: (2025)
Fairness in Federated Learning: Fairness for Whom?
di: Taik, Afaf, et al.
Pubblicazione: (2025)
di: Taik, Afaf, et al.
Pubblicazione: (2025)
Multilingual Hallucination Gaps in Large Language Models
di: Chataigner, Cléa, et al.
Pubblicazione: (2024)
di: Chataigner, Cléa, et al.
Pubblicazione: (2024)
Promoting Fair Vaccination Strategies Through Influence Maximization: A Case Study on COVID-19 Spread
di: Neophytou, Nicola, et al.
Pubblicazione: (2024)
di: Neophytou, Nicola, et al.
Pubblicazione: (2024)
Differentially Private Clustered Federated Learning
di: Malekmohammadi, Saber, et al.
Pubblicazione: (2024)
di: Malekmohammadi, Saber, et al.
Pubblicazione: (2024)
WMT24 Test Suite: Gender Resolution in Speaker-Listener Dialogue Roles
di: Dawkins, Hillary, et al.
Pubblicazione: (2024)
di: Dawkins, Hillary, et al.
Pubblicazione: (2024)
Gender-Neutral Machine Translation Strategies in Practice
di: Dawkins, Hillary, et al.
Pubblicazione: (2025)
di: Dawkins, Hillary, et al.
Pubblicazione: (2025)
Socially Aware Synthetic Data Generation for Suicidal Ideation Detection Using Large Language Models
di: Ghanadian, Hamideh, et al.
Pubblicazione: (2024)
di: Ghanadian, Hamideh, et al.
Pubblicazione: (2024)
Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation
di: Kreutzer, Julia, et al.
Pubblicazione: (2025)
di: Kreutzer, Julia, et al.
Pubblicazione: (2025)
Defining Cultural Capabilities for AI Evaluation: A Taxonomy Grounded in Intercultural Communication Theory
di: Nejadgholi, Isar, et al.
Pubblicazione: (2026)
di: Nejadgholi, Isar, et al.
Pubblicazione: (2026)
LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories
di: Vishnubhotla, Krishnapriya, et al.
Pubblicazione: (2026)
di: Vishnubhotla, Krishnapriya, et al.
Pubblicazione: (2026)
Human-Centered AI Applications for Canada's Immigration Settlement Sector
di: Nejadgholi, Isar, et al.
Pubblicazione: (2024)
di: Nejadgholi, Isar, et al.
Pubblicazione: (2024)
A Taxonomy for Design and Evaluation of Prompt-Based Natural Language Explanations
di: Nejadgholi, Isar, et al.
Pubblicazione: (2025)
di: Nejadgholi, Isar, et al.
Pubblicazione: (2025)
From Perceived Effectiveness to Measured Impact: Identity-Aware Evaluation of Automated Counter-Stereotypes
di: Kiritchenko, Svetlana, et al.
Pubblicazione: (2025)
di: Kiritchenko, Svetlana, et al.
Pubblicazione: (2025)
Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency
di: Fraser, Kathleen C., et al.
Pubblicazione: (2025)
di: Fraser, Kathleen C., et al.
Pubblicazione: (2025)
The crime of being poor
di: Curto, Georgina, et al.
Pubblicazione: (2023)
di: Curto, Georgina, et al.
Pubblicazione: (2023)
Projective Methods for Mitigating Gender Bias in Pre-trained Language Models
di: Dawkins, Hillary, et al.
Pubblicazione: (2024)
di: Dawkins, Hillary, et al.
Pubblicazione: (2024)
Challenging Negative Gender Stereotypes: A Study on the Effectiveness of Automated Counter-Stereotypes
di: Nejadgholi, Isar, et al.
Pubblicazione: (2024)
di: Nejadgholi, Isar, et al.
Pubblicazione: (2024)
Semantic Differentiation in Speech Emotion Recognition: Insights from Descriptive and Expressive Speech Roles
di: Guo, Rongchen, et al.
Pubblicazione: (2025)
di: Guo, Rongchen, et al.
Pubblicazione: (2025)
Fairness Incentives in Response to Unfair Dynamic Pricing
di: Thibodeau, Jesse, et al.
Pubblicazione: (2024)
di: Thibodeau, Jesse, et al.
Pubblicazione: (2024)
Balancing Profit and Fairness in Risk-Based Pricing Markets
di: Thibodeau, Jesse, et al.
Pubblicazione: (2025)
di: Thibodeau, Jesse, et al.
Pubblicazione: (2025)
Uncanny or Not? Perceptions of AI-Generated Faces in Autism
di: Waters, Gabriella
Pubblicazione: (2025)
di: Waters, Gabriella
Pubblicazione: (2025)
Testing, Evaluation, Verification and Validation (TEVV) of Digital Twins: A Comprehensive Framework
di: Waters, Gabriella
Pubblicazione: (2025)
di: Waters, Gabriella
Pubblicazione: (2025)
Adaptable Moral Stances of Large Language Models on Sexist Content: Implications for Society and Gender Discourse
di: Guo, Rongchen, et al.
Pubblicazione: (2024)
di: Guo, Rongchen, et al.
Pubblicazione: (2024)
PRAGMATIK ADABIYOTSHUNOSLIK FAN SOHASI SIFATIDA: MUTOLAA FENOMENOLOGIYASI MISOLIDA
di: Maxmudjonova Fariza
Pubblicazione: (2025)
di: Maxmudjonova Fariza
Pubblicazione: (2025)
Proof of Concept for Mammography Classification with Enhanced Compactness and Separability Modules
di: Dahes, Fariza
Pubblicazione: (2025)
di: Dahes, Fariza
Pubblicazione: (2025)
LLMs are One-Shot URL Classifiers and Explainers
di: Rashid, Fariza, et al.
Pubblicazione: (2024)
di: Rashid, Fariza, et al.
Pubblicazione: (2024)
Eliciting Least-to-Most Reasoning for Phishing URL Detection
di: Trikilis, Holly, et al.
Pubblicazione: (2026)
di: Trikilis, Holly, et al.
Pubblicazione: (2026)
A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics
di: Shimabucoro, Luisa, et al.
Pubblicazione: (2025)
di: Shimabucoro, Luisa, et al.
Pubblicazione: (2025)
Diversify and Conquer: Diversity-Centric Data Selection with Iterative Refinement
di: Yu, Simon, et al.
Pubblicazione: (2024)
di: Yu, Simon, et al.
Pubblicazione: (2024)
Manifold-Matching Autoencoders
di: Cheret, Laurent, et al.
Pubblicazione: (2026)
di: Cheret, Laurent, et al.
Pubblicazione: (2026)
Tackling Social Bias against the Poor: A Dataset and Taxonomy on Aporophobia
di: Curto, Georgina, et al.
Pubblicazione: (2025)
di: Curto, Georgina, et al.
Pubblicazione: (2025)
Nonparametric Sensitivity Analysis for Unobserved Confounding with Survival Outcomes
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reality Check: A New Evaluation Ecosystem Is Necessary to Understand AI's Real World Effects
di: Schwartz, Reva, et al.
Pubblicazione: (2025) -
Real-World AI Evaluation: How FRAME Generates Systematic Evidence to Resolve the Decision-Maker's Dilemma
di: Schwartz, Reva, et al.
Pubblicazione: (2026) -
Making AI Evaluation Deployment Relevant Through Context Specification
di: Holmes, Matthew, et al.
Pubblicazione: (2026) -
Ask What Your Country Can Do For You: Towards a Public Red Teaming Model
di: Kennedy, Wm. Matthew, et al.
Pubblicazione: (2025) -
WildFireCan-MMD: A Multimodal Dataset for Classification of User-Generated Content During Wildfires in Canada
di: Sherritt, Braeden, et al.
Pubblicazione: (2025)