Disentangling Ambiguity from Instability in Large Language Models: A Clinical Text-to-SQL Case Study

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Ziletti, Angelo, D'Ambrosi, Leonardo
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866917507249471488
author Ziletti, Angelo
D'Ambrosi, Leonardo
author_facet Ziletti, Angelo
D'Ambrosi, Leonardo
contents Deploying large language models for clinical Text-to-SQL requires distinguishing two qualitatively different causes of output diversity: (i) input ambiguity that should trigger clarification, and (ii) model instability that should trigger human review. We propose CLUES, a framework that models Text-to-SQL as a two-stage process (interpretations --> answers) and decomposes semantic uncertainty into an ambiguity score and an instability score. The instability score is computed via the Schur complement of a bipartite semantic graph matrix. Across AmbigQA/SituatedQA (gold interpretations) and a clinical Text-to-SQL benchmark (known interpretations), CLUES improves failure prediction over state-of-the-art Kernel Language Entropy. In deployment settings, it remains competitive while providing a diagnostic decomposition unavailable from a single score. The resulting uncertainty regimes map to targeted interventions - query refinement for ambiguity, model improvement for instability. The high-ambiguity/high-instability regime contains 51% of errors while covering 25% of queries, enabling efficient triage.
format Preprint
id arxiv_https___arxiv_org_abs_2602_12015
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Disentangling Ambiguity from Instability in Large Language Models: A Clinical Text-to-SQL Case Study
Ziletti, Angelo
D'Ambrosi, Leonardo
Computation and Language
Deploying large language models for clinical Text-to-SQL requires distinguishing two qualitatively different causes of output diversity: (i) input ambiguity that should trigger clarification, and (ii) model instability that should trigger human review. We propose CLUES, a framework that models Text-to-SQL as a two-stage process (interpretations --> answers) and decomposes semantic uncertainty into an ambiguity score and an instability score. The instability score is computed via the Schur complement of a bipartite semantic graph matrix. Across AmbigQA/SituatedQA (gold interpretations) and a clinical Text-to-SQL benchmark (known interpretations), CLUES improves failure prediction over state-of-the-art Kernel Language Entropy. In deployment settings, it remains competitive while providing a diagnostic decomposition unavailable from a single score. The resulting uncertainty regimes map to targeted interventions - query refinement for ambiguity, model improvement for instability. The high-ambiguity/high-instability regime contains 51% of errors while covering 25% of queries, enabling efficient triage.
title Disentangling Ambiguity from Instability in Large Language Models: A Clinical Text-to-SQL Case Study
topic Computation and Language
url https://arxiv.org/abs/2602.12015