Metadata Predictability Is Not Evidence Dependence: An Intervention-Based Audit for Weak-Label Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Shao, Kan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Environment Neural Reranking for Sample-Efficient Action Selection in Text-Based Agents
par: Shao, Kan
Publié: (2026)
par: Shao, Kan
Publié: (2026)
Textless Dependency Parsing by Labeled Sequence Prediction
par: Kando, Shunsuke, et autres
Publié: (2024)
par: Kando, Shunsuke, et autres
Publié: (2024)
Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation
par: Kan, Shao
Publié: (2026)
par: Kan, Shao
Publié: (2026)
Label Dependencies-aware Set Prediction Networks for Multi-label Text Classification
par: Xinkai, Du, et autres
Publié: (2023)
par: Xinkai, Du, et autres
Publié: (2023)
Auditing LLM Benchmarks with Item Response Theory
par: Land, Sander, et autres
Publié: (2026)
par: Land, Sander, et autres
Publié: (2026)
SciAnnotate: A Tool for Integrating Weak Labeling Sources for Sequence Labeling
par: Liu, Mengyang, et autres
Publié: (2022)
par: Liu, Mengyang, et autres
Publié: (2022)
Dependency Graph Parsing as Sequence Labeling
par: Ezquerro, Ana, et autres
Publié: (2024)
par: Ezquerro, Ana, et autres
Publié: (2024)
Automated Benchmark Auditing for AI Agents and Large Language Models
par: Wang, Junlin, et autres
Publié: (2026)
par: Wang, Junlin, et autres
Publié: (2026)
AuditGPT: Auditing Smart Contracts with ChatGPT
par: Xia, Shihao, et autres
Publié: (2024)
par: Xia, Shihao, et autres
Publié: (2024)
Keeping Up with the Language Models: Systematic Benchmark Extension for Bias Auditing
par: Baldini, Ioana, et autres
Publié: (2023)
par: Baldini, Ioana, et autres
Publié: (2023)
Predicting Microbial Ontology and Pathogen Risk from Environmental Metadata with Large Language Models
par: Yoo, Hyunwoo, et autres
Publié: (2025)
par: Yoo, Hyunwoo, et autres
Publié: (2025)
MIRA: A Bilingual Benchmark for Medical Information Response Audit
par: Xu, Mengyu, et autres
Publié: (2026)
par: Xu, Mengyu, et autres
Publié: (2026)
Metric-Dependent Annotation Saturation for Learning from Label Distributions
par: Kohli, Guneet
Publié: (2026)
par: Kohli, Guneet
Publié: (2026)
Position: LLM Unlearning Benchmarks are Weak Measures of Progress
par: Thaker, Pratiksha, et autres
Publié: (2024)
par: Thaker, Pratiksha, et autres
Publié: (2024)
EviSearch: A Human in the Loop System for Extracting and Auditing Clinical Evidence for Systematic Reviews
par: Ahuja, Naman, et autres
Publié: (2026)
par: Ahuja, Naman, et autres
Publié: (2026)
GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence
par: Krishna, Kundan, et autres
Publié: (2024)
par: Krishna, Kundan, et autres
Publié: (2024)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
par: Xu, Danni, et autres
Publié: (2025)
par: Xu, Danni, et autres
Publié: (2025)
Metadata Conditioned Large Language Models for Localization
par: Mukherjee, Anjishnu, et autres
Publié: (2026)
par: Mukherjee, Anjishnu, et autres
Publié: (2026)
QQ: A Toolkit for Language Identifiers and Metadata
par: Poelman, Wessel, et autres
Publié: (2026)
par: Poelman, Wessel, et autres
Publié: (2026)
Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks
par: Iyer, Karthik Raghu, et autres
Publié: (2026)
par: Iyer, Karthik Raghu, et autres
Publié: (2026)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
par: Du, Junjia, et autres
Publié: (2025)
par: Du, Junjia, et autres
Publié: (2025)
BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
par: Tu, Xinming, et autres
Publié: (2026)
par: Tu, Xinming, et autres
Publié: (2026)
Revisiting Semantic Role Labeling: Efficient Structured Inference with Dependency-Informed Analysis
par: Youm, Sangpil, et autres
Publié: (2026)
par: Youm, Sangpil, et autres
Publié: (2026)
Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images
par: Jiang, Yuechen, et autres
Publié: (2026)
par: Jiang, Yuechen, et autres
Publié: (2026)
EvidenceBench: A Benchmark for Extracting Evidence from Biomedical Papers
par: Wang, Jianyou, et autres
Publié: (2025)
par: Wang, Jianyou, et autres
Publié: (2025)
Better Benchmarking LLMs for Zero-Shot Dependency Parsing
par: Ezquerro, Ana, et autres
Publié: (2025)
par: Ezquerro, Ana, et autres
Publié: (2025)
AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors
par: Sheshadri, Abhay, et autres
Publié: (2026)
par: Sheshadri, Abhay, et autres
Publié: (2026)
Metadata Conditioning Accelerates Language Model Pre-training
par: Gao, Tianyu, et autres
Publié: (2025)
par: Gao, Tianyu, et autres
Publié: (2025)
From Chaos to Clarity: Schema-Constrained AI for Auditable Biomedical Evidence Extraction from Full-Text PDFs
par: Mortezaagha, Pouria, et autres
Publié: (2025)
par: Mortezaagha, Pouria, et autres
Publié: (2025)
LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces
par: Kirgis, Peter, et autres
Publié: (2026)
par: Kirgis, Peter, et autres
Publié: (2026)
ECBD: Evidence-Centered Benchmark Design for NLP
par: Liu, Yu Lu, et autres
Publié: (2024)
par: Liu, Yu Lu, et autres
Publié: (2024)
Contextual Label Projection for Cross-Lingual Structured Prediction
par: Parekh, Tanmay, et autres
Publié: (2023)
par: Parekh, Tanmay, et autres
Publié: (2023)
MOLE: Metadata Extraction and Validation in Scientific Papers Using LLMs
par: Alyafeai, Zaid, et autres
Publié: (2025)
par: Alyafeai, Zaid, et autres
Publié: (2025)
Question Suggestion for Conversational Shopping Assistants Using Product Metadata
par: Vedula, Nikhita, et autres
Publié: (2024)
par: Vedula, Nikhita, et autres
Publié: (2024)
BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture
par: Ridoy, Shahriyar Zaman, et autres
Publié: (2025)
par: Ridoy, Shahriyar Zaman, et autres
Publié: (2025)
SPOT: An Annotated French Corpus and Benchmark for Detecting Critical Interventions in Online Conversations
par: Berriche, Manon, et autres
Publié: (2025)
par: Berriche, Manon, et autres
Publié: (2025)
A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks
par: Ishikawa, Takehiro, et autres
Publié: (2026)
par: Ishikawa, Takehiro, et autres
Publié: (2026)
Constructing Benchmarks and Interventions for Combating Hallucinations in LLMs
par: Simhi, Adi, et autres
Publié: (2024)
par: Simhi, Adi, et autres
Publié: (2024)
DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
par: Venkit, Pranav Narayanan, et autres
Publié: (2025)
par: Venkit, Pranav Narayanan, et autres
Publié: (2025)
Interpreting Predictive Probabilities: Model Confidence or Human Label Variation?
par: Baan, Joris, et autres
Publié: (2024)
par: Baan, Joris, et autres
Publié: (2024)
Documents similaires
-
Cross-Environment Neural Reranking for Sample-Efficient Action Selection in Text-Based Agents
par: Shao, Kan
Publié: (2026) -
Textless Dependency Parsing by Labeled Sequence Prediction
par: Kando, Shunsuke, et autres
Publié: (2024) -
Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation
par: Kan, Shao
Publié: (2026) -
Label Dependencies-aware Set Prediction Networks for Multi-label Text Classification
par: Xinkai, Du, et autres
Publié: (2023) -
Auditing LLM Benchmarks with Item Response Theory
par: Land, Sander, et autres
Publié: (2026)