Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pandita, Deepak, Korn, Flip, Welty, Chris, Homan, Christopher M. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Forest vs Tree: The $(N, K)$ Trade-off in Reproducible ML Evaluation
par: Pandita, Deepak, et autres
Publié: (2025)
par: Pandita, Deepak, et autres
Publié: (2025)
How Many Ratings per Item are Necessary for Reliable Significance Testing?
par: Homan, Christopher, et autres
Publié: (2024)
par: Homan, Christopher, et autres
Publié: (2024)
LPI-RIT at LeWiDi-2025: Improving Distributional Predictions via Metadata and Loss Reweighting with DisCo
par: Sawkar, Mandira, et autres
Publié: (2025)
par: Sawkar, Mandira, et autres
Publié: (2025)
Learning Who Disagrees: Demographic Importance Weighting for Modeling Annotator Distributions with DiADEM
par: Shetty, Samay U., et autres
Publié: (2026)
par: Shetty, Samay U., et autres
Publié: (2026)
Kernel Banzhaf: A Fast and Robust Estimator for Banzhaf Values
par: Liu, Yurong, et autres
Publié: (2024)
par: Liu, Yurong, et autres
Publié: (2024)
ProRefine: Inference-Time Prompt Refinement with Textual Feedback
par: Pandita, Deepak, et autres
Publié: (2025)
par: Pandita, Deepak, et autres
Publié: (2025)
ARTICLE: Annotator Reliability Through In-Context Learning
par: Dutta, Sujan, et autres
Publié: (2024)
par: Dutta, Sujan, et autres
Publié: (2024)
Annotation-guided Protein Design with Multi-Level Domain Alignment
par: Yuan, Chaohao, et autres
Publié: (2024)
par: Yuan, Chaohao, et autres
Publié: (2024)
Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
par: Panigrahy, Deepak, et autres
Publié: (2026)
par: Panigrahy, Deepak, et autres
Publié: (2026)
TaxDistill: Improving Metagenomic Taxonomic Annotation via Distilled Genomic Foundation Models
par: Ye, Rongye, et autres
Publié: (2026)
par: Ye, Rongye, et autres
Publié: (2026)
Improving User Behavior Prediction: Leveraging Annotator Metadata in Supervised Machine Learning Models
par: Ng, Lynnette Hui Xian, et autres
Publié: (2025)
par: Ng, Lynnette Hui Xian, et autres
Publié: (2025)
Multi-Level Collaboration in Model Merging
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Procrustean Bed for AI-Driven Retrosynthesis: A Unified Framework for Reproducible Evaluation
par: Morgunov, Anton, et autres
Publié: (2025)
par: Morgunov, Anton, et autres
Publié: (2025)
GradientSpace: Unsupervised Data Clustering for Improved Instruction Tuning
par: Sridharan, Shrihari, et autres
Publié: (2025)
par: Sridharan, Shrihari, et autres
Publié: (2025)
Beyond Expected Return: Accounting for Policy Reproducibility when Evaluating Reinforcement Learning Algorithms
par: Flageat, Manon, et autres
Publié: (2023)
par: Flageat, Manon, et autres
Publié: (2023)
Out of Spuriousity: Improving Robustness to Spurious Correlations without Group Annotations
par: Le, Phuong Quynh, et autres
Publié: (2024)
par: Le, Phuong Quynh, et autres
Publié: (2024)
Finding the Muses: Identifying Coresets through Loss Trajectories
par: Nagaraj, Manish, et autres
Publié: (2025)
par: Nagaraj, Manish, et autres
Publié: (2025)
Reproducibility study of FairAC
par: de Jong, Gijs, et autres
Publié: (2024)
par: de Jong, Gijs, et autres
Publié: (2024)
Maximizing Confidence Alone Improves Reasoning
par: Prabhudesai, Mihir, et autres
Publié: (2025)
par: Prabhudesai, Mihir, et autres
Publié: (2025)
Visual Timelines of Police Encounters in Body-Worn Camera Footage: Operational Context and Activity Cataloging for Training and Analysis in OpenBWC
par: Srbinovska, Angela, et autres
Publié: (2026)
par: Srbinovska, Angela, et autres
Publié: (2026)
Improving Rule-based Reasoning in LLMs using Neurosymbolic Representations
par: Dhanraj, Varun, et autres
Publié: (2025)
par: Dhanraj, Varun, et autres
Publié: (2025)
Follow-up Attention: An Empirical Study of Developer and Neural Model Code Exploration
par: Paltenghi, Matteo, et autres
Publié: (2022)
par: Paltenghi, Matteo, et autres
Publié: (2022)
ASTRA: Communication-Efficient Acceleration for Multi-Device Transformer Inference
par: Liu, Xiao, et autres
Publié: (2025)
par: Liu, Xiao, et autres
Publié: (2025)
Multi-Task Learning with Multi-Annotation Triplet Loss for Improved Object Detection
par: Zhou, Meilun, et autres
Publié: (2025)
par: Zhou, Meilun, et autres
Publié: (2025)
InsightVision: A Comprehensive, Multi-Level Chinese-based Benchmark for Evaluating Implicit Visual Semantics in Large Vision Language Models
par: Yin, Xiaofei, et autres
Publié: (2025)
par: Yin, Xiaofei, et autres
Publié: (2025)
Multi-Level Causal Embeddings
par: Schooltink, Willem, et autres
Publié: (2026)
par: Schooltink, Willem, et autres
Publié: (2026)
Evaluating the Ability of Explanations to Disambiguate Models in a Rashomon Set
par: Rawal, Kaivalya, et autres
Publié: (2026)
par: Rawal, Kaivalya, et autres
Publié: (2026)
Structured Prompts Improve Evaluation of Language Models
par: Aali, Asad, et autres
Publié: (2025)
par: Aali, Asad, et autres
Publié: (2025)
Adversarial Training for Process Reward Models
par: Juneja, Gurusha, et autres
Publié: (2025)
par: Juneja, Gurusha, et autres
Publié: (2025)
Peering Inside the Black Box: Uncovering LLM Errors in Optimization Modelling through Component-Level Evaluation
par: Refai, Dania, et autres
Publié: (2025)
par: Refai, Dania, et autres
Publié: (2025)
K-means Derived Unsupervised Feature Selection using Improved ADMM
par: Sun, Ziheng, et autres
Publié: (2024)
par: Sun, Ziheng, et autres
Publié: (2024)
Learning Reconstructive Embeddings in Reproducing Kernel Hilbert Spaces via the Representer Theorem
par: Feito-Casares, Enrique, et autres
Publié: (2026)
par: Feito-Casares, Enrique, et autres
Publié: (2026)
What Do Machine Learning Researchers Mean by "Reproducible"?
par: Raff, Edward, et autres
Publié: (2024)
par: Raff, Edward, et autres
Publié: (2024)
Policy Newton Algorithm in Reproducing Kernel Hilbert Space
par: Zhang, Yixian, et autres
Publié: (2025)
par: Zhang, Yixian, et autres
Publié: (2025)
Conformal Generative Modeling with Improved Sample Efficiency through Sequential Greedy Filtering
par: Kladny, Klaus-Rudolf, et autres
Publié: (2024)
par: Kladny, Klaus-Rudolf, et autres
Publié: (2024)
Enabling Granular Subgroup Level Model Evaluations by Generating Synthetic Medical Time Series
par: Ibrahim, Mahmoud, et autres
Publié: (2025)
par: Ibrahim, Mahmoud, et autres
Publié: (2025)
Efficient Multi-Task Modeling through Automated Fusion of Trained Models
par: Zhou, Jingxuan, et autres
Publié: (2025)
par: Zhou, Jingxuan, et autres
Publié: (2025)
Domain-Generalization to Improve Learning in Meta-Learning Algorithms
par: Anjum, Usman, et autres
Publié: (2025)
par: Anjum, Usman, et autres
Publié: (2025)
DiffHybrid-UQ: Uncertainty Quantification for Differentiable Hybrid Neural Modeling
par: Akhare, Deepak, et autres
Publié: (2023)
par: Akhare, Deepak, et autres
Publié: (2023)
Picid: A Modular Evaluation Infrastructure for Reproducible PHM Across Tasks and Domains
par: Telyatnikov, Lev, et autres
Publié: (2026)
par: Telyatnikov, Lev, et autres
Publié: (2026)
Documents similaires
-
Forest vs Tree: The $(N, K)$ Trade-off in Reproducible ML Evaluation
par: Pandita, Deepak, et autres
Publié: (2025) -
How Many Ratings per Item are Necessary for Reliable Significance Testing?
par: Homan, Christopher, et autres
Publié: (2024) -
LPI-RIT at LeWiDi-2025: Improving Distributional Predictions via Metadata and Loss Reweighting with DisCo
par: Sawkar, Mandira, et autres
Publié: (2025) -
Learning Who Disagrees: Demographic Importance Weighting for Modeling Annotator Distributions with DiADEM
par: Shetty, Samay U., et autres
Publié: (2026) -
Kernel Banzhaf: A Fast and Robust Estimator for Banzhaf Values
par: Liu, Yurong, et autres
Publié: (2024)