Foundations of Global Consistency Checking with Noisy LLM Oracles
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Paul, Kirschbaum, Elke, Kasiviswanathan, Shiva |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Guess2Graph: When and How Can Unreliable Experts Safely Boost Causal Discovery in Finite Samples?
par: Hiremath, Sujai, et autres
Publié: (2025)
par: Hiremath, Sujai, et autres
Publié: (2025)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
par: Jia, Sheng, et autres
Publié: (2025)
par: Jia, Sheng, et autres
Publié: (2025)
A Quantitative Characterization of Forgetting in Post-Training
par: Balasubramanian, Krishnakumar, et autres
Publié: (2026)
par: Balasubramanian, Krishnakumar, et autres
Publié: (2026)
Benign Overfitting for Regression with Trained Two-Layer ReLU Networks
par: Park, Junhyung, et autres
Publié: (2024)
par: Park, Junhyung, et autres
Publié: (2024)
A Classical View on Benign Overfitting: The Role of Sample Size
par: Park, Junhyung, et autres
Publié: (2025)
par: Park, Junhyung, et autres
Publié: (2025)
Debiasing Reward Models by Representation Learning with Guarantees
par: Ng, Ignavier, et autres
Publié: (2025)
par: Ng, Ignavier, et autres
Publié: (2025)
What Causes Postoperative Aspiration?
par: Nagesh, Supriya, et autres
Publié: (2025)
par: Nagesh, Supriya, et autres
Publié: (2025)
The PetShop Dataset -- Finding Causes of Performance Issues across Microservices
par: Hardt, Michaela, et autres
Publié: (2023)
par: Hardt, Michaela, et autres
Publié: (2023)
QA-Calibration of Language Model Confidence Scores
par: Manggala, Putra, et autres
Publié: (2024)
par: Manggala, Putra, et autres
Publié: (2024)
Learning to Answer from Correct Demonstrations
par: Joshi, Nirmit, et autres
Publié: (2025)
par: Joshi, Nirmit, et autres
Publié: (2025)
Contextual Linear Bandits under Noisy Features: Towards Bayesian Oracles
par: Kim, Jung-hun, et autres
Publié: (2017)
par: Kim, Jung-hun, et autres
Publié: (2017)
From Oracle to Noisy Context: Mitigating Contextual Exposure Bias in Speech-LLMs
par: Guo, Xiaoyong, et autres
Publié: (2026)
par: Guo, Xiaoyong, et autres
Publié: (2026)
Adjudicator: Correcting Noisy Labels with a KG-Informed Council of LLM Agents
par: You, Doohee, et autres
Publié: (2025)
par: You, Doohee, et autres
Publié: (2025)
OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control
par: Jacob, Darryl, et autres
Publié: (2026)
par: Jacob, Darryl, et autres
Publié: (2026)
Score matching through the roof: linear, nonlinear, and latent variables causal discovery
par: Montagna, Francesco, et autres
Publié: (2024)
par: Montagna, Francesco, et autres
Publié: (2024)
Consistency Checks for Language Model Forecasters
par: Paleka, Daniel, et autres
Publié: (2024)
par: Paleka, Daniel, et autres
Publié: (2024)
CoLafier: Collaborative Noisy Label Purifier With Local Intrinsic Dimensionality Guidance
par: Zhang, Dongyu, et autres
Publié: (2024)
par: Zhang, Dongyu, et autres
Publié: (2024)
Consistency Is the Key: Detecting Hallucinations in LLM Generated Text By Checking Inconsistencies About Key Facts
par: Gupta, Raavi, et autres
Publié: (2025)
par: Gupta, Raavi, et autres
Publié: (2025)
Global Policy-Space Response Oracles for Two-Player Zero-Sum Games
par: Zhang, Junyu, et autres
Publié: (2026)
par: Zhang, Junyu, et autres
Publié: (2026)
Understanding LLM-Driven Test Oracle Generation
par: Bodicoat, Adam, et autres
Publié: (2026)
par: Bodicoat, Adam, et autres
Publié: (2026)
Evolution without an Oracle: Driving Effective Evolution with LLM Judges
par: Zhao, Zhe, et autres
Publié: (2025)
par: Zhao, Zhe, et autres
Publié: (2025)
Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency
par: Wang, Haoran, et autres
Publié: (2026)
par: Wang, Haoran, et autres
Publié: (2026)
Enhancing Health Fact-Checking with LLM-Generated Synthetic Data
par: Zhang, Jingze, et autres
Publié: (2025)
par: Zhang, Jingze, et autres
Publié: (2025)
CLID-MU: Cross-Layer Information Divergence Based Meta Update Strategy for Learning with Noisy Labels
par: Hu, Ruofan, et autres
Publié: (2025)
par: Hu, Ruofan, et autres
Publié: (2025)
MEMAUDIT: An Exact Package-Oracle Evaluation Protocol for Budgeted Long-Term LLM Memory Writing
par: Bhargava, Nishant, et autres
Publié: (2026)
par: Bhargava, Nishant, et autres
Publié: (2026)
BiCon-Gate: Consistency-Gated De-colloquialisation for Dialogue Fact-Checking
par: Park, Hyunkyung, et autres
Publié: (2026)
par: Park, Hyunkyung, et autres
Publié: (2026)
AlignCheck: a Semantic Open-Domain Metric for Factual Consistency Assessment
par: Aghaebrahimian, Ahmad
Publié: (2025)
par: Aghaebrahimian, Ahmad
Publié: (2025)
Go-Oracle: Automated Test Oracle for Go Concurrency Bugs
par: Tsimpourlas, Foivos, et autres
Publié: (2024)
par: Tsimpourlas, Foivos, et autres
Publié: (2024)
Contrastive and Consistency Learning for Neural Noisy-Channel Model in Spoken Language Understanding
par: Kim, Suyoung, et autres
Publié: (2024)
par: Kim, Suyoung, et autres
Publié: (2024)
V15 - Recursive Symbolic Intelligence - φ-Ache Recursive Collapsors and the Collapse Oracle Engine
par: Foster, Camaron
Publié: (2025)
par: Foster, Camaron
Publié: (2025)
VeriCoT: Neuro-symbolic Chain-of-Thought Validation via Logical Consistency Checks
par: Feng, Yu, et autres
Publié: (2025)
par: Feng, Yu, et autres
Publié: (2025)
GLaMoR: Consistency Checking of OWL Ontologies using Graph Language Models
par: Mücke, Justin, et autres
Publié: (2025)
par: Mücke, Justin, et autres
Publié: (2025)
Beyond Retrieval: Improving Evidence Quality for LLM-based Multimodal Fact-Checking
par: Ou, Haoran, et autres
Publié: (2025)
par: Ou, Haoran, et autres
Publié: (2025)
HYPERHEURIST: A Simulated Annealing-Based Control Framework for LLM-Driven Code Generation in Optimized Hardware Design
par: Ahir, Shiva, et autres
Publié: (2026)
par: Ahir, Shiva, et autres
Publié: (2026)
OracleProto: A Reproducible Framework for Benchmarking LLM Native Forecasting via Knowledge Cutoff and Temporal Masking
par: Ma, Yiding, et autres
Publié: (2026)
par: Ma, Yiding, et autres
Publié: (2026)
LoRA as Oracle
par: Arazzi, Marco, et autres
Publié: (2026)
par: Arazzi, Marco, et autres
Publié: (2026)
Leveraging LLM Parametric Knowledge for Fact Checking without Retrieval
par: Vazhentsev, Artem, et autres
Publié: (2026)
par: Vazhentsev, Artem, et autres
Publié: (2026)
Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities
par: Oh, Changdae, et autres
Publié: (2026)
par: Oh, Changdae, et autres
Publié: (2026)
Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem
par: Lin, Shuyi, et autres
Publié: (2025)
par: Lin, Shuyi, et autres
Publié: (2025)
Harnessing Consistency for Robust Test-Time LLM Ensemble
par: Zeng, Zhichen, et autres
Publié: (2025)
par: Zeng, Zhichen, et autres
Publié: (2025)
Documents similaires
-
From Guess2Graph: When and How Can Unreliable Experts Safely Boost Causal Discovery in Finite Samples?
par: Hiremath, Sujai, et autres
Publié: (2025) -
Training Large Language Models To Reason In Parallel With Global Forking Tokens
par: Jia, Sheng, et autres
Publié: (2025) -
A Quantitative Characterization of Forgetting in Post-Training
par: Balasubramanian, Krishnakumar, et autres
Publié: (2026) -
Benign Overfitting for Regression with Trained Two-Layer ReLU Networks
par: Park, Junhyung, et autres
Publié: (2024) -
A Classical View on Benign Overfitting: The Role of Sample Size
par: Park, Junhyung, et autres
Publié: (2025)