Metadata Predictability Is Not Evidence Dependence: An Intervention-Based Audit for Weak-Label Benchmarks
Fuente:
arXiv
Guardado en:
| Autor principal: | Shao, Kan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cross-Environment Neural Reranking for Sample-Efficient Action Selection in Text-Based Agents
por: Shao, Kan
Publicado: (2026)
por: Shao, Kan
Publicado: (2026)
Textless Dependency Parsing by Labeled Sequence Prediction
por: Kando, Shunsuke, et al.
Publicado: (2024)
por: Kando, Shunsuke, et al.
Publicado: (2024)
Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation
por: Kan, Shao
Publicado: (2026)
por: Kan, Shao
Publicado: (2026)
Label Dependencies-aware Set Prediction Networks for Multi-label Text Classification
por: Xinkai, Du, et al.
Publicado: (2023)
por: Xinkai, Du, et al.
Publicado: (2023)
Auditing LLM Benchmarks with Item Response Theory
por: Land, Sander, et al.
Publicado: (2026)
por: Land, Sander, et al.
Publicado: (2026)
SciAnnotate: A Tool for Integrating Weak Labeling Sources for Sequence Labeling
por: Liu, Mengyang, et al.
Publicado: (2022)
por: Liu, Mengyang, et al.
Publicado: (2022)
Dependency Graph Parsing as Sequence Labeling
por: Ezquerro, Ana, et al.
Publicado: (2024)
por: Ezquerro, Ana, et al.
Publicado: (2024)
Automated Benchmark Auditing for AI Agents and Large Language Models
por: Wang, Junlin, et al.
Publicado: (2026)
por: Wang, Junlin, et al.
Publicado: (2026)
AuditGPT: Auditing Smart Contracts with ChatGPT
por: Xia, Shihao, et al.
Publicado: (2024)
por: Xia, Shihao, et al.
Publicado: (2024)
Keeping Up with the Language Models: Systematic Benchmark Extension for Bias Auditing
por: Baldini, Ioana, et al.
Publicado: (2023)
por: Baldini, Ioana, et al.
Publicado: (2023)
Predicting Microbial Ontology and Pathogen Risk from Environmental Metadata with Large Language Models
por: Yoo, Hyunwoo, et al.
Publicado: (2025)
por: Yoo, Hyunwoo, et al.
Publicado: (2025)
MIRA: A Bilingual Benchmark for Medical Information Response Audit
por: Xu, Mengyu, et al.
Publicado: (2026)
por: Xu, Mengyu, et al.
Publicado: (2026)
Metric-Dependent Annotation Saturation for Learning from Label Distributions
por: Kohli, Guneet
Publicado: (2026)
por: Kohli, Guneet
Publicado: (2026)
Position: LLM Unlearning Benchmarks are Weak Measures of Progress
por: Thaker, Pratiksha, et al.
Publicado: (2024)
por: Thaker, Pratiksha, et al.
Publicado: (2024)
EviSearch: A Human in the Loop System for Extracting and Auditing Clinical Evidence for Systematic Reviews
por: Ahuja, Naman, et al.
Publicado: (2026)
por: Ahuja, Naman, et al.
Publicado: (2026)
GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence
por: Krishna, Kundan, et al.
Publicado: (2024)
por: Krishna, Kundan, et al.
Publicado: (2024)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
por: Xu, Danni, et al.
Publicado: (2025)
por: Xu, Danni, et al.
Publicado: (2025)
Metadata Conditioned Large Language Models for Localization
por: Mukherjee, Anjishnu, et al.
Publicado: (2026)
por: Mukherjee, Anjishnu, et al.
Publicado: (2026)
QQ: A Toolkit for Language Identifiers and Metadata
por: Poelman, Wessel, et al.
Publicado: (2026)
por: Poelman, Wessel, et al.
Publicado: (2026)
Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks
por: Iyer, Karthik Raghu, et al.
Publicado: (2026)
por: Iyer, Karthik Raghu, et al.
Publicado: (2026)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
por: Du, Junjia, et al.
Publicado: (2025)
por: Du, Junjia, et al.
Publicado: (2025)
BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
por: Tu, Xinming, et al.
Publicado: (2026)
por: Tu, Xinming, et al.
Publicado: (2026)
Revisiting Semantic Role Labeling: Efficient Structured Inference with Dependency-Informed Analysis
por: Youm, Sangpil, et al.
Publicado: (2026)
por: Youm, Sangpil, et al.
Publicado: (2026)
Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images
por: Jiang, Yuechen, et al.
Publicado: (2026)
por: Jiang, Yuechen, et al.
Publicado: (2026)
EvidenceBench: A Benchmark for Extracting Evidence from Biomedical Papers
por: Wang, Jianyou, et al.
Publicado: (2025)
por: Wang, Jianyou, et al.
Publicado: (2025)
Better Benchmarking LLMs for Zero-Shot Dependency Parsing
por: Ezquerro, Ana, et al.
Publicado: (2025)
por: Ezquerro, Ana, et al.
Publicado: (2025)
AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors
por: Sheshadri, Abhay, et al.
Publicado: (2026)
por: Sheshadri, Abhay, et al.
Publicado: (2026)
Metadata Conditioning Accelerates Language Model Pre-training
por: Gao, Tianyu, et al.
Publicado: (2025)
por: Gao, Tianyu, et al.
Publicado: (2025)
From Chaos to Clarity: Schema-Constrained AI for Auditable Biomedical Evidence Extraction from Full-Text PDFs
por: Mortezaagha, Pouria, et al.
Publicado: (2025)
por: Mortezaagha, Pouria, et al.
Publicado: (2025)
LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces
por: Kirgis, Peter, et al.
Publicado: (2026)
por: Kirgis, Peter, et al.
Publicado: (2026)
ECBD: Evidence-Centered Benchmark Design for NLP
por: Liu, Yu Lu, et al.
Publicado: (2024)
por: Liu, Yu Lu, et al.
Publicado: (2024)
Contextual Label Projection for Cross-Lingual Structured Prediction
por: Parekh, Tanmay, et al.
Publicado: (2023)
por: Parekh, Tanmay, et al.
Publicado: (2023)
MOLE: Metadata Extraction and Validation in Scientific Papers Using LLMs
por: Alyafeai, Zaid, et al.
Publicado: (2025)
por: Alyafeai, Zaid, et al.
Publicado: (2025)
Question Suggestion for Conversational Shopping Assistants Using Product Metadata
por: Vedula, Nikhita, et al.
Publicado: (2024)
por: Vedula, Nikhita, et al.
Publicado: (2024)
BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture
por: Ridoy, Shahriyar Zaman, et al.
Publicado: (2025)
por: Ridoy, Shahriyar Zaman, et al.
Publicado: (2025)
SPOT: An Annotated French Corpus and Benchmark for Detecting Critical Interventions in Online Conversations
por: Berriche, Manon, et al.
Publicado: (2025)
por: Berriche, Manon, et al.
Publicado: (2025)
A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks
por: Ishikawa, Takehiro, et al.
Publicado: (2026)
por: Ishikawa, Takehiro, et al.
Publicado: (2026)
Constructing Benchmarks and Interventions for Combating Hallucinations in LLMs
por: Simhi, Adi, et al.
Publicado: (2024)
por: Simhi, Adi, et al.
Publicado: (2024)
DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
por: Venkit, Pranav Narayanan, et al.
Publicado: (2025)
por: Venkit, Pranav Narayanan, et al.
Publicado: (2025)
Interpreting Predictive Probabilities: Model Confidence or Human Label Variation?
por: Baan, Joris, et al.
Publicado: (2024)
por: Baan, Joris, et al.
Publicado: (2024)
Ejemplares similares
-
Cross-Environment Neural Reranking for Sample-Efficient Action Selection in Text-Based Agents
por: Shao, Kan
Publicado: (2026) -
Textless Dependency Parsing by Labeled Sequence Prediction
por: Kando, Shunsuke, et al.
Publicado: (2024) -
Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation
por: Kan, Shao
Publicado: (2026) -
Label Dependencies-aware Set Prediction Networks for Multi-label Text Classification
por: Xinkai, Du, et al.
Publicado: (2023) -
Auditing LLM Benchmarks with Item Response Theory
por: Land, Sander, et al.
Publicado: (2026)