MEDLEY-BENCH: Scale Buys Evaluation but Not Control in AI Metacognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Abtahi, Farhad, Karbalaie, Abdolamir, Illueca-Fernandez, Eduardo, Seoane, Fernando |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation
par: Karbalaie, Abdolamir, et autres
Publié: (2026)
par: Karbalaie, Abdolamir, et autres
Publié: (2026)
Leveraging Imperfection with MEDLEY A Multi-Model Approach Harnessing Bias in Medical AI
par: Abtahi, Farhad, et autres
Publié: (2025)
par: Abtahi, Farhad, et autres
Publié: (2025)
DUALRec: A Hybrid Sequential and Language Model Framework for Context-Aware Movie Recommendation
par: Li, Yitong, et autres
Publié: (2025)
par: Li, Yitong, et autres
Publié: (2025)
LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation
par: Zhang, Haichao, et autres
Publié: (2025)
par: Zhang, Haichao, et autres
Publié: (2025)
Conformal Prediction Sets for Next-Token Prediction in Large Language Models: Balancing Coverage Guarantees with Set Efficiency
par: Kotla, Yoshith Roy, et autres
Publié: (2025)
par: Kotla, Yoshith Roy, et autres
Publié: (2025)
Perception-Aware Bias Detection for Query Suggestions
par: Haak, Fabian, et autres
Publié: (2026)
par: Haak, Fabian, et autres
Publié: (2026)
Mapping the Web of Science, a large-scale graph and text-based dataset with LLM embeddings
par: Kunt, Tim, et autres
Publié: (2026)
par: Kunt, Tim, et autres
Publié: (2026)
Whisper-LM: Improving ASR Models with Language Models for Low-Resource Languages
par: de Zuazo, Xabier, et autres
Publié: (2025)
par: de Zuazo, Xabier, et autres
Publié: (2025)
Claim Automation using Large Language Model
par: Mo, Zhengda, et autres
Publié: (2026)
par: Mo, Zhengda, et autres
Publié: (2026)
Can Agentic AI Match the Performance of Human Data Scientists?
par: Luo, An, et autres
Publié: (2025)
par: Luo, An, et autres
Publié: (2025)
AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Science
par: Luo, An, et autres
Publié: (2026)
par: Luo, An, et autres
Publié: (2026)
A Hybrid Framework for Real-Time Data Drift and Anomaly Identification Using Hierarchical Temporal Memory and Statistical Tests
par: Bandyopadhyay, Subhadip, et autres
Publié: (2025)
par: Bandyopadhyay, Subhadip, et autres
Publié: (2025)
Enhancing Diversity in Multi-objective Feature Selection
par: Miyandoab, Sevil Zanjani, et autres
Publié: (2024)
par: Miyandoab, Sevil Zanjani, et autres
Publié: (2024)
An Information-Theoretic Approach for Detecting Edits in AI-Generated Text
par: Kashtan, Idan, et autres
Publié: (2023)
par: Kashtan, Idan, et autres
Publié: (2023)
A Novel Kuhnian Ontology for Epistemic Classification of STM Scholarly Articles
par: Saqr, Khalid M.
Publié: (2020)
par: Saqr, Khalid M.
Publié: (2020)
Artificial intelligence and downscaling global climate model future projections
par: Benestad, Rasmus E.
Publié: (2026)
par: Benestad, Rasmus E.
Publié: (2026)
Dense Video Understanding with Gated Residual Tokenization
par: Zhang, Haichao, et autres
Publié: (2025)
par: Zhang, Haichao, et autres
Publié: (2025)
ICE: Intervention-Consistent Explanation Evaluation with Statistical Grounding for LLMs
par: Basu, Abhinaba, et autres
Publié: (2026)
par: Basu, Abhinaba, et autres
Publié: (2026)
Advancements in Machine Learning and Deep Learning for Early Detection and Management of Mental Health Disorder
par: Kannan, Kamala Devi, et autres
Publié: (2024)
par: Kannan, Kamala Devi, et autres
Publié: (2024)
Scalable Bayesian Clustering for Integrative Analysis of Multi-View Data
par: Cabral, Rafael, et autres
Publié: (2024)
par: Cabral, Rafael, et autres
Publié: (2024)
Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses
par: Wang, Yan, et autres
Publié: (2026)
par: Wang, Yan, et autres
Publié: (2026)
Automated Quality Assessment for LLM-Based Complex Qualitative Coding: A Confidence-Diversity Framework
par: Zhao, Zhilong, et autres
Publié: (2025)
par: Zhao, Zhilong, et autres
Publié: (2025)
GIM: Evaluating models via tasks that integrate multiple cognitive domains
par: Patel, Rohit, et autres
Publié: (2026)
par: Patel, Rohit, et autres
Publié: (2026)
ProactBench: Beyond What The User Asked For
par: Harfi, Sepehr, et autres
Publié: (2026)
par: Harfi, Sepehr, et autres
Publié: (2026)
Classifier Calibration at Scale: An Empirical Study of Model-Agnostic Post-Hoc Methods
par: Manokhin, Valery, et autres
Publié: (2026)
par: Manokhin, Valery, et autres
Publié: (2026)
EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge
par: Sun, Yuhong, et autres
Publié: (2026)
par: Sun, Yuhong, et autres
Publié: (2026)
AssistedDS: Benchmarking How External Domain Knowledge Assists LLMs in Automated Data Science
par: Luo, An, et autres
Publié: (2025)
par: Luo, An, et autres
Publié: (2025)
Measures of Overlapping Multivariate Gaussian Clusters in Unsupervised Online Learning
par: Ožbot, Miha, et autres
Publié: (2025)
par: Ožbot, Miha, et autres
Publié: (2025)
AI Psychometrics: Evaluating the Psychological Reasoning of Large Language Models with Psychometric Validities
par: Li, Yibai, et autres
Publié: (2026)
par: Li, Yibai, et autres
Publié: (2026)
Knowledge Distillation for Low-Resource Open-source Text-to-SQL Model
par: Qiu, Tianhao, et autres
Publié: (2026)
par: Qiu, Tianhao, et autres
Publié: (2026)
Ice Cream Doesn't Cause Drowning: Benchmarking LLMs Against Statistical Pitfalls in Causal Inference
par: Du, Jin, et autres
Publié: (2025)
par: Du, Jin, et autres
Publié: (2025)
RCProb: Probabilistic Rule Extraction for Efficient Simplification of Tree Ensembles
par: Obregon, Josue
Publié: (2026)
par: Obregon, Josue
Publié: (2026)
Urban Spatio-Temporal Foundation Models for Climate-Resilient Housing: Scaling Diffusion Transformers for Disaster Risk Prediction
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
Multi-source Heterogeneous Public Opinion Analysis via Collaborative Reasoning and Adaptive Fusion: A Systematically Integrated Approach
par: Liu, Yi
Publié: (2026)
par: Liu, Yi
Publié: (2026)
Gaussian Ensemble Belief Propagation for Efficient Inference in High-Dimensional Systems
par: MacKinlay, Dan, et autres
Publié: (2024)
par: MacKinlay, Dan, et autres
Publié: (2024)
AI-Driven Decision Support in Oncology: Evaluating Data Readiness for Skin Cancer Treatment
par: Grüger, Joscha, et autres
Publié: (2025)
par: Grüger, Joscha, et autres
Publié: (2025)
Scalable AI-Driven Analytics for User Engagement and Stance Detection on Social Media
par: Seneviratne, Thammitage Piyumi Wathsala, et autres
Publié: (2026)
par: Seneviratne, Thammitage Piyumi Wathsala, et autres
Publié: (2026)
MRMS-Net and LMRMS-Net: Scalable Multi-Representation Multi-Scale Networks for Time Series Classification
par: Alagöz, Celal, et autres
Publié: (2026)
par: Alagöz, Celal, et autres
Publié: (2026)
Text Clustering with Large Language Model Embeddings
par: Petukhova, Alina, et autres
Publié: (2024)
par: Petukhova, Alina, et autres
Publié: (2024)
AI Literacy and LLM Engagement in Higher Education: A Cross-National Quantitative Study
par: Hossain, Shahin, et autres
Publié: (2025)
par: Hossain, Shahin, et autres
Publié: (2025)
Documents similaires
-
From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation
par: Karbalaie, Abdolamir, et autres
Publié: (2026) -
Leveraging Imperfection with MEDLEY A Multi-Model Approach Harnessing Bias in Medical AI
par: Abtahi, Farhad, et autres
Publié: (2025) -
DUALRec: A Hybrid Sequential and Language Model Framework for Context-Aware Movie Recommendation
par: Li, Yitong, et autres
Publié: (2025) -
LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation
par: Zhang, Haichao, et autres
Publié: (2025) -
Conformal Prediction Sets for Next-Token Prediction in Large Language Models: Balancing Coverage Guarantees with Set Efficiency
par: Kotla, Yoshith Roy, et autres
Publié: (2025)