Metacognition Benchmark: Evaluating Confidence Calibration and Sycophancy Resistance in Clinical AI
Fuente:
Zenodo
Salvato in:
| Autore principale: | Khan, Nabeera |
|---|---|
| Natura: | Recurso digital |
| Lingua: | inglese |
| Pubblicazione: |
Zenodo
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLM Token Estimation Benchmarks: Tokenizer Efficiency and Cost Analysis Across 17 Large Language Models
di: Khare, Mohit
Pubblicazione: (2026)
di: Khare, Mohit
Pubblicazione: (2026)
Gemini Update Clinical decision support based on Bevacizumab cancer trials and pushing the limitations of advanced LLMs
di: Kawchak, Kevin
Pubblicazione: (2025)
di: Kawchak, Kevin
Pubblicazione: (2025)
The Brain Problem: Creative Constraint Optimization in Large Language Models
di: Marinello, Nicola, et al.
Pubblicazione: (2026)
di: Marinello, Nicola, et al.
Pubblicazione: (2026)
Estimating the Impact of Automation on Vocational Education: The Case of Technical Courses
di: Lima, Yuri, et al.
Pubblicazione: (2024)
di: Lima, Yuri, et al.
Pubblicazione: (2024)
LACF Emotional Paradigm: A Personalized Artificial Nervous System for Human-AI Alignment
di: Ochej, Stephane, et al.
Pubblicazione: (2026)
di: Ochej, Stephane, et al.
Pubblicazione: (2026)
AGI Certification Framework: A Multi-Dimensional Evaluation Standard for Measuring AI Understanding
di: Head, Hank
Pubblicazione: (2026)
di: Head, Hank
Pubblicazione: (2026)
Public Comment on NIST AI 800-2: Anthropomorphic Construct Projection in AI Benchmark Evaluation
di: Sophia, Franny Philos
Pubblicazione: (2026)
di: Sophia, Franny Philos
Pubblicazione: (2026)
When AI Tells You What You Want to Hear: Sycophantic Behavior of Large Language Models in Dementia Care Settings
di: Kolb, Christian
Pubblicazione: (2026)
di: Kolb, Christian
Pubblicazione: (2026)
Anima AI Community Pulse Dataset
di: AI Companion Picker, et al.
Pubblicazione: (2026)
di: AI Companion Picker, et al.
Pubblicazione: (2026)
REAL-AI-Benchmark: Real-World Reasoning and Physical-AI Benchmark Suite
di: Ivković, Jovan
Pubblicazione: (2026)
di: Ivković, Jovan
Pubblicazione: (2026)
Theatrical Compliance: A Failure Mode in Large Language Models
di: Nowickij (Navitski), Kirill Vladimirovich
Pubblicazione: (2026)
di: Nowickij (Navitski), Kirill Vladimirovich
Pubblicazione: (2026)
How Far Does the Trolley Problem Go in AI Ethics Evaluation? Limits of a Canonical Benchmark and the Risks of Its Misuse
di: mizutani, aya
Pubblicazione: (2026)
di: mizutani, aya
Pubblicazione: (2026)
Persona, Shadow, and Cheap Coherence: A Jungian Map of the Soul in the Digital Age (Read Through Structural Intelligence)
di: Jovanovic, Vladisav
Pubblicazione: (2026)
di: Jovanovic, Vladisav
Pubblicazione: (2026)
The Benchmark Illusion: Why Current AI Evaluations Cannot Detect Structural Confabulation
di: Devin, Andrew James
Pubblicazione: (2026)
di: Devin, Andrew James
Pubblicazione: (2026)
I Let Claude Run My Fantasy Football Team for a Whole Season — It Beat 11 of My Friends
di: AI Angels
Pubblicazione: (2026)
di: AI Angels
Pubblicazione: (2026)
Why Voice-Mode Gemini Beat My $400 Italian Tutor in 21 Days (Full Daily Script Inside)
di: AI Angels
Pubblicazione: (2026)
di: AI Angels
Pubblicazione: (2026)
GALATEA II: Benchmarking LLM Safety in Clinical Simulation. Behavioural Safety and Ethical Robustness of Large Language Models in a Multi-Agent ICU Decision Support Architecture
di: Shlyakhta, Taras
Pubblicazione: (2026)
di: Shlyakhta, Taras
Pubblicazione: (2026)
Shallow Pass Budget Constraints and Structured Data Trade-offs in LLM Training Ingestion
di: Mas, Joseph
Pubblicazione: (2026)
di: Mas, Joseph
Pubblicazione: (2026)
AI Eval Forge: Mixed-Check Regression Testing for LLM and Agent Workflows
di: Katta, Mukunda Rao
Pubblicazione: (2026)
di: Katta, Mukunda Rao
Pubblicazione: (2026)
Executive Summary: AI Privacy Risks and Mitigations in Large Language Models
di: Khan, Masood
Pubblicazione: (2025)
di: Khan, Masood
Pubblicazione: (2025)
The Four-Layer Model: A Socio-Psychological Framework for LLM Behavior
di: Delannoy, Lorenzo, et al.
Pubblicazione: (2026)
di: Delannoy, Lorenzo, et al.
Pubblicazione: (2026)
aikenkyu001/iterative_self_healing_benchmark: v1.0.0: Scaffolding Trinity for Deterministic LLM Code Generation
di: Miyata, Fumio
Pubblicazione: (2026)
di: Miyata, Fumio
Pubblicazione: (2026)
Signs of Life - Visual Art from 469 Conversations with Claude
di: Chesterton, Bo, et al.
Pubblicazione: (2026)
di: Chesterton, Bo, et al.
Pubblicazione: (2026)
Machine-Readable Behavioural Compliance Evidence for AI Systems: A Specification Profiling Framework
di: Caprazli, Kafkas M.
Pubblicazione: (2026)
di: Caprazli, Kafkas M.
Pubblicazione: (2026)
Anti-Hydra vs Anthropic Benchmark Comparison
di: Ochej, Stephane
Pubblicazione: (2026)
di: Ochej, Stephane
Pubblicazione: (2026)
Oracle Difficulty Decomposed: Four Independent Mechanisms Explain 95%+ of Benchmark Variance
di: Sanchez, Bryan
Pubblicazione: (2026)
di: Sanchez, Bryan
Pubblicazione: (2026)
Deterministic σ-Regularized Benchmarking of the Cekirge Model Against GPT-Transformer Baselines
di: CEKIRGE, Huseyin Murat
Pubblicazione: (2025)
di: CEKIRGE, Huseyin Murat
Pubblicazione: (2025)
AI Writing Ethics: Responsible and Ethical Use of Generative AI in Academic Writing
di: Zuzafre, Mohd Nor, et al.
Pubblicazione: (2026)
di: Zuzafre, Mohd Nor, et al.
Pubblicazione: (2026)
OMNIA-MINIMAL: Structural Stability Beyond Surface Correctness
di: Brighindi, Massimiliano
Pubblicazione: (2026)
di: Brighindi, Massimiliano
Pubblicazione: (2026)
Pattern Pressure, Accuracy Drift, and False User-State Attribution
di: Honeycutt, Edwin Marshall III
Pubblicazione: (2026)
di: Honeycutt, Edwin Marshall III
Pubblicazione: (2026)
30. TEORÍA DE LA POTENCIALIDAD CONSCIENTE (TPC): BENCHMARK DE CAPACIDADES COGNITIVAS EN IA - APLICACIÓN DEL PROTOCOLO RFC-EVAL-001. RESULTADOS COMPLETOS DE EVALUACIÓN CRUZADA CIEGA ENTRE 6 IAS COMERCIALES.
di: Bernal Díaz, Víctor Cristóbal
Pubblicazione: (2026)
di: Bernal Díaz, Víctor Cristóbal
Pubblicazione: (2026)
30. TEORÍA DE LA POTENCIALIDAD CONSCIENTE (TPC): BENCHMARK DE CAPACIDADES COGNITIVAS EN IA - APLICACIÓN DEL PROTOCOLO RFC-EVAL-001 V1.1. RESULTADOS COMPLETOS DE EVALUACIÓN CRUZADA CIEGA ENTRE 6 IAS COMERCIALES.
di: Bernal Díaz, Víctor Cristóbal
Pubblicazione: (2026)
di: Bernal Díaz, Víctor Cristóbal
Pubblicazione: (2026)
Supplementary materials for Words That Won't Hold Still
di: Reynolds, Brett
Pubblicazione: (2025)
di: Reynolds, Brett
Pubblicazione: (2025)
31. DATASET COMPLETO DE EVALUACIONES CRUZADAS RFC-EVAL-001 – 6 SISTEMAS DE IA (ENERO 2026).
di: Bernal Díaz, Víctor Cristóbal
Pubblicazione: (2026)
di: Bernal Díaz, Víctor Cristóbal
Pubblicazione: (2026)
Extra Large Language Models Benchmarking for Medicinal Chemistry
di: Kawchak, Kevin
Pubblicazione: (2024)
di: Kawchak, Kevin
Pubblicazione: (2024)
Selection Mechanics Framework (SMF): A Structural Perspective on Variability and Its Transformation in Large Language Model Outputs
di: Kaneda, Mutsumi
Pubblicazione: (2026)
di: Kaneda, Mutsumi
Pubblicazione: (2026)
Hidden in plain sight: Unraveling compensation disclosure bloat with generative AI and its impact on executive compensation
di: Burduli, Lizi, et al.
Pubblicazione: (2026)
di: Burduli, Lizi, et al.
Pubblicazione: (2026)
A Comparative Analysis of AI-Generated vs. Human-Written Marketing Content Using Readability and SEO Metrics
di: Abuhumaid, Ibrahim
Pubblicazione: (2026)
di: Abuhumaid, Ibrahim
Pubblicazione: (2026)
A Benchmark for Symbolic Reasoning from Pixel Sequences: Grid-Level Visual Completion and Correction
di: Kang, Lei, et al.
Pubblicazione: (2025)
di: Kang, Lei, et al.
Pubblicazione: (2025)
Language-as-Dimension Theory (LDT): A New Scientific Framework for Intelligence, Meaning, and Reality Formation
di: Woodard, Bethany, et al.
Pubblicazione: (2025)
di: Woodard, Bethany, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LLM Token Estimation Benchmarks: Tokenizer Efficiency and Cost Analysis Across 17 Large Language Models
di: Khare, Mohit
Pubblicazione: (2026) -
Gemini Update Clinical decision support based on Bevacizumab cancer trials and pushing the limitations of advanced LLMs
di: Kawchak, Kevin
Pubblicazione: (2025) -
The Brain Problem: Creative Constraint Optimization in Large Language Models
di: Marinello, Nicola, et al.
Pubblicazione: (2026) -
Estimating the Impact of Automation on Vocational Education: The Case of Technical Courses
di: Lima, Yuri, et al.
Pubblicazione: (2024) -
LACF Emotional Paradigm: A Personalized Artificial Nervous System for Human-AI Alignment
di: Ochej, Stephane, et al.
Pubblicazione: (2026)