Before You Interpret the Profile: Validity Scaling for LLM Metacognitive Self-Report
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Cacioli, Jon-Paul |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Screen Before You Interpret: A Portable Validity Protocol for Benchmark-Based LLM Confidence Signals
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Concurrent Criterion Validation of a Validity Screen for LLM Confidence Signals via Selective Prediction
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
The Metacognitive Monitoring Battery: A Cross-Domain Benchmark for LLM Self-Monitoring
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Distilling Self-Consistency into Verbal Confidence: A Pre-Registered Negative Result and Post-Hoc Rescue on Gemma 3 4B
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
LLMs as Signal Detectors: Sensitivity, Bias, and the Temperature-Criterion Analogy
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Weber's Law in Transformer Magnitude Representations: Efficient Coding, Representational Geometry, and Psychophysical Laws in Language Models
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Option-Order Randomisation Reveals a Distributional Position Attractor in Prompted Sandbagging
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Quantisation Reshapes the Metacognitive Geometry of Language Models
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Cross-Entropy Is Load-Bearing: A Pre-Registered Scope Test of the K-Way Energy Probe on Bidirectional Predictive Coding
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Exemplar Retrieval Without Overhypothesis Induction: Limits of Distributional Sequence Learning in Early Word Learning
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Categorical Perception in Large Language Model Hidden States: Structural Warping at Digit-Count Boundaries
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
K-Way Energy Probes for Metacognition Reduce to Softmax in Discriminative Predictive Coding Networks
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Do Before You Judge: Self-Reference as a Pathway to Better LLM Evaluation
par: Lin, Wei-Hsiang, et autres
Publié: (2025)
par: Lin, Wei-Hsiang, et autres
Publié: (2025)
Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
par: Yuan, Wenhao, et autres
Publié: (2026)
par: Yuan, Wenhao, et autres
Publié: (2026)
Look Before You Leap: Autonomous Exploration for LLM Agents
par: Ye, Ziang, et autres
Publié: (2026)
par: Ye, Ziang, et autres
Publié: (2026)
SnapKV: LLM Knows What You are Looking for Before Generation
par: Li, Yuhong, et autres
Publié: (2024)
par: Li, Yuhong, et autres
Publié: (2024)
Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
par: He, Jiashu, et autres
Publié: (2026)
par: He, Jiashu, et autres
Publié: (2026)
Read Before You Think: Mitigating LLM Comprehension Failures with Step-by-Step Reading
par: Han, Feijiang, et autres
Publié: (2025)
par: Han, Feijiang, et autres
Publié: (2025)
Look Before You Leap: Enhancing Attention and Vigilance Regarding Harmful Content with GuidelineLLM
par: Zhang, Shaoqing, et autres
Publié: (2024)
par: Zhang, Shaoqing, et autres
Publié: (2024)
Cite Before You Speak: Enhancing Context-Response Grounding in E-commerce Conversational LLM-Agents
par: Zeng, Jingying, et autres
Publié: (2025)
par: Zeng, Jingying, et autres
Publié: (2025)
Scaling Law in LLM Simulated Personality: More Detailed and Realistic Persona Profile Is All You Need
par: Bai, Yuqi, et autres
Publié: (2025)
par: Bai, Yuqi, et autres
Publié: (2025)
Repetition Without Exclusivity: Scale Sensitivity of Referential Mechanisms in Child-Scale Language Models
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
par: Chen, Sirui, et autres
Publié: (2026)
par: Chen, Sirui, et autres
Publié: (2026)
Tuning-Free Accountable Intervention for LLM Deployment -- A Metacognitive Approach
par: Tan, Zhen, et autres
Publié: (2024)
par: Tan, Zhen, et autres
Publié: (2024)
Think$^{2}$: Grounded Metacognitive Reasoning in Large Language Models
par: Elenjical, Abraham Paul, et autres
Publié: (2026)
par: Elenjical, Abraham Paul, et autres
Publié: (2026)
Journalists, Emotions, and the Introduction of Generative AI Chatbots: A Large-Scale Analysis of Tweets Before and After the Launch of ChatGPT
par: Lewis, Seth C., et autres
Publié: (2024)
par: Lewis, Seth C., et autres
Publié: (2024)
Same Geometry, Opposite Noise: Transformer Magnitude Representations Lack Scalar Variability
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Think Thrice Before You Act: Progressive Thought Refinement in Large Language Models
par: Du, Chengyu, et autres
Publié: (2024)
par: Du, Chengyu, et autres
Publié: (2024)
Warm Up Before You Train: Unlocking General Reasoning in Resource-Constrained Settings
par: Shrestha, Safal, et autres
Publié: (2025)
par: Shrestha, Safal, et autres
Publié: (2025)
Think Before You Lie: How Reasoning Leads to Honesty
par: Yuan, Ann, et autres
Publié: (2026)
par: Yuan, Ann, et autres
Publié: (2026)
Think Before You Act: Decision Transformers with Working Memory
par: Kang, Jikun, et autres
Publié: (2023)
par: Kang, Jikun, et autres
Publié: (2023)
Look Before You Leap: Problem Elaboration Prompting Improves Mathematical Reasoning in Large Language Models
par: Liao, Haoran, et autres
Publié: (2024)
par: Liao, Haoran, et autres
Publié: (2024)
Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models
par: Zhang, Qingjie, et autres
Publié: (2025)
par: Zhang, Qingjie, et autres
Publié: (2025)
Documents similaires
-
Screen Before You Interpret: A Portable Validity Protocol for Benchmark-Based LLM Confidence Signals
par: Cacioli, Jon-Paul
Publié: (2026) -
Concurrent Criterion Validation of a Validity Screen for LLM Confidence Signals via Selective Prediction
par: Cacioli, Jon-Paul
Publié: (2026) -
Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen
par: Cacioli, Jon-Paul
Publié: (2026) -
Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory
par: Cacioli, Jon-Paul
Publié: (2026) -
Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation
par: Cacioli, Jon-Paul
Publié: (2026)