MCQA-Eval: Efficient Confidence Evaluation in NLG with Gold-Standard Correctness Labels
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xiaoou, Lin, Zhen, Da, Longchao, Chen, Chacha, Trivedi, Shubhendu, Wei, Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey
par: Liu, Xiaoou, et autres
Publié: (2025)
par: Liu, Xiaoou, et autres
Publié: (2025)
Contextualized Sequence Likelihood: Enhanced Confidence Scores for Natural Language Generation
par: Lin, Zhen, et autres
Publié: (2024)
par: Lin, Zhen, et autres
Publié: (2024)
Uncertainty Quantification of Large Language Models through Multi-Dimensional Responses
par: Chen, Tiejin, et autres
Publié: (2025)
par: Chen, Tiejin, et autres
Publié: (2025)
Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering
par: Chen, Tiejin, et autres
Publié: (2026)
par: Chen, Tiejin, et autres
Publié: (2026)
DHP Benchmark: Are LLMs Good NLG Evaluators?
par: Wang, Yicheng, et autres
Publié: (2024)
par: Wang, Yicheng, et autres
Publié: (2024)
Generating with Confidence: Uncertainty Quantification for Black-box Large Language Models
par: Lin, Zhen, et autres
Publié: (2023)
par: Lin, Zhen, et autres
Publié: (2023)
LLMs May Perform MCQA by Selecting the Least Incorrect Option
par: Wang, Haochun, et autres
Publié: (2024)
par: Wang, Haochun, et autres
Publié: (2024)
Low-Confidence Gold: Refining Low-Confidence Samples for Efficient Instruction Tuning
par: Cai, Hongyi, et autres
Publié: (2025)
par: Cai, Hongyi, et autres
Publié: (2025)
Understanding the Uncertainty of LLM Explanations: A Perspective Based on Reasoning Topology
par: Da, Longchao, et autres
Publié: (2025)
par: Da, Longchao, et autres
Publié: (2025)
EvalCards: A Framework for Standardized Evaluation Reporting
par: Dhar, Ruchira, et autres
Publié: (2025)
par: Dhar, Ruchira, et autres
Publié: (2025)
Is Your Explanation Reliable: Confidence-Aware Explanation on Graph Neural Networks
par: Zhang, Jiaxing, et autres
Publié: (2025)
par: Zhang, Jiaxing, et autres
Publié: (2025)
From Instruction to Output: The Role of Prompting in Modern NLG
par: Zaib, Munazza, et autres
Publié: (2026)
par: Zaib, Munazza, et autres
Publié: (2026)
Direct-Scoring NLG Evaluators Can Use Pairwise Comparisons Too
par: Lawrence, Logan, et autres
Publié: (2025)
par: Lawrence, Logan, et autres
Publié: (2025)
Label-Confidence-Aware Uncertainty Estimation in Natural Language Generation
par: Lin, Qinhong, et autres
Publié: (2024)
par: Lin, Qinhong, et autres
Publié: (2024)
Multilingual Controlled Generation And Gold-Standard-Agnostic Evaluation of Code-Mixed Sentences
par: Gupta, Ayushman, et autres
Publié: (2024)
par: Gupta, Ayushman, et autres
Publié: (2024)
CriticEval: Evaluating Large Language Model as Critic
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA
par: Martinez, John Ray B.
Publié: (2026)
par: Martinez, John Ray B.
Publié: (2026)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
par: Shu, Lei, et autres
Publié: (2023)
par: Shu, Lei, et autres
Publié: (2023)
The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models
par: Cho, Seonglae, et autres
Publié: (2026)
par: Cho, Seonglae, et autres
Publié: (2026)
Fact-Level Confidence Calibration and Self-Correction
par: Yuan, Yige, et autres
Publié: (2024)
par: Yuan, Yige, et autres
Publié: (2024)
A Systematic Review of Data-to-Text NLG
par: Osuji, Chinonso Cynthia, et autres
Publié: (2024)
par: Osuji, Chinonso Cynthia, et autres
Publié: (2024)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
par: Yu, Zhuohao, et autres
Publié: (2024)
par: Yu, Zhuohao, et autres
Publié: (2024)
Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs
par: Wang, Ganghua, et autres
Publié: (2025)
par: Wang, Ganghua, et autres
Publié: (2025)
Measuring and Reducing LLM Hallucination without Gold-Standard Answers
par: Wei, Jiaheng, et autres
Publié: (2024)
par: Wei, Jiaheng, et autres
Publié: (2024)
NLP at UC Santa Cruz at SemEval-2024 Task 5: Legal Answer Validation using Few-Shot Multi-Choice QA
par: Pahilajani, Anish, et autres
Publié: (2024)
par: Pahilajani, Anish, et autres
Publié: (2024)
LangMARL: Natural Language Multi-Agent Reinforcement Learning
par: Yao, Huaiyuan, et autres
Publié: (2026)
par: Yao, Huaiyuan, et autres
Publié: (2026)
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
par: Choi, Byungjin, et autres
Publié: (2026)
par: Choi, Byungjin, et autres
Publié: (2026)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
par: Ren, Huimin, et autres
Publié: (2025)
par: Ren, Huimin, et autres
Publié: (2025)
Codebook-Injected Dialogue Segmentation for Multi-Utterance Constructs Annotation: LLM-Assisted and Gold-Label-Free Evaluation
par: Lee, Jinsook, et autres
Publié: (2026)
par: Lee, Jinsook, et autres
Publié: (2026)
Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
par: Li, Loka, et autres
Publié: (2024)
par: Li, Loka, et autres
Publié: (2024)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
par: Zhang, Chuang, et autres
Publié: (2026)
par: Zhang, Chuang, et autres
Publié: (2026)
ScholarEval: Research Idea Evaluation Grounded in Literature
par: Moussa, Hanane Nour, et autres
Publié: (2025)
par: Moussa, Hanane Nour, et autres
Publié: (2025)
Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models
par: Gokdemir, Ozan, et autres
Publié: (2025)
par: Gokdemir, Ozan, et autres
Publié: (2025)
LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models
par: Sun, Chongyan, et autres
Publié: (2024)
par: Sun, Chongyan, et autres
Publié: (2024)
Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution
par: Liu, Xiaoou, et autres
Publié: (2026)
par: Liu, Xiaoou, et autres
Publié: (2026)
Knowledge Graph Error Detection with Contrastive Confidence Adaption
par: Liu, Xiangyu, et autres
Publié: (2023)
par: Liu, Xiangyu, et autres
Publié: (2023)
Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs
par: Chen, Yurun, et autres
Publié: (2025)
par: Chen, Yurun, et autres
Publié: (2025)
ACCEPT: Adaptive Codebook for Composite and Efficient Prompt Tuning
par: Lin, Yu-Chen, et autres
Publié: (2024)
par: Lin, Yu-Chen, et autres
Publié: (2024)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
par: Garg, Madhav Krishan, et autres
Publié: (2025)
par: Garg, Madhav Krishan, et autres
Publié: (2025)
LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators
par: Lango, Mateusz, et autres
Publié: (2025)
par: Lango, Mateusz, et autres
Publié: (2025)
Documents similaires
-
Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey
par: Liu, Xiaoou, et autres
Publié: (2025) -
Contextualized Sequence Likelihood: Enhanced Confidence Scores for Natural Language Generation
par: Lin, Zhen, et autres
Publié: (2024) -
Uncertainty Quantification of Large Language Models through Multi-Dimensional Responses
par: Chen, Tiejin, et autres
Publié: (2025) -
Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering
par: Chen, Tiejin, et autres
Publié: (2026) -
DHP Benchmark: Are LLMs Good NLG Evaluators?
par: Wang, Yicheng, et autres
Publié: (2024)