Oracle-Checker Scheme for Evaluating a Generative Large Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zeng, Yueling Jenny, Wang, Li-C., Ibbetson, Thomas |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models
par: Hu, Xiangkun, et autres
Publié: (2024)
par: Hu, Xiangkun, et autres
Publié: (2024)
Are Large Language Models Table-based Fact-Checkers?
par: Zhang, Hanwen, et autres
Publié: (2024)
par: Zhang, Hanwen, et autres
Publié: (2024)
Self-Checker: Plug-and-Play Modules for Fact-Checking with Large Language Models
par: Li, Miaoran, et autres
Publié: (2023)
par: Li, Miaoran, et autres
Publié: (2023)
Random Testing of Model Checkers for Timed Automata with Automated Oracle Generation
par: Manini, Andrea, et autres
Publié: (2025)
par: Manini, Andrea, et autres
Publié: (2025)
Interactive DualChecker for Mitigating Hallucinations in Distilling Large Language Models
par: Wang, Meiyun, et autres
Publié: (2024)
par: Wang, Meiyun, et autres
Publié: (2024)
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
par: Do, Quyet V., et autres
Publié: (2024)
par: Do, Quyet V., et autres
Publié: (2024)
ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities
par: Hong, Zhaochen, et autres
Publié: (2025)
par: Hong, Zhaochen, et autres
Publié: (2025)
Evaluating the Generation Capabilities of Large Chinese Language Models
par: Zeng, Hui, et autres
Publié: (2023)
par: Zeng, Hui, et autres
Publié: (2023)
LLMEffiChecker: Understanding and Testing Efficiency Degradation of Large Language Models
par: Feng, Xiaoning, et autres
Publié: (2022)
par: Feng, Xiaoning, et autres
Publié: (2022)
FoldGPT: Simple and Effective Large Language Model Compression Scheme
par: Liu, Songwei, et autres
Publié: (2024)
par: Liu, Songwei, et autres
Publié: (2024)
Assessing Evaluation Metrics for Neural Test Oracle Generation
par: Shin, Jiho, et autres
Publié: (2023)
par: Shin, Jiho, et autres
Publié: (2023)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA
par: Ji, Yuelyu, et autres
Publié: (2026)
par: Ji, Yuelyu, et autres
Publié: (2026)
Deciphering Oracle Bone Language with Diffusion Models
par: Guan, Haisu, et autres
Publié: (2024)
par: Guan, Haisu, et autres
Publié: (2024)
Large Language Models on Wikipedia-Style Survey Generation: an Evaluation in NLP Concepts
par: Gao, Fan, et autres
Publié: (2023)
par: Gao, Fan, et autres
Publié: (2023)
Socrates or Smartypants: Testing Logic Reasoning Capabilities of Large Language Models with Logic Programming-based Test Oracles
par: Xu, Zihao, et autres
Publié: (2025)
par: Xu, Zihao, et autres
Publié: (2025)
A Systematic Evaluation of Large Language Models for Natural Language Generation Tasks
par: Ni, Xuanfan, et autres
Publié: (2024)
par: Ni, Xuanfan, et autres
Publié: (2024)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
par: Li, Zheqing, et autres
Publié: (2025)
par: Li, Zheqing, et autres
Publié: (2025)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
par: Ke, Pei, et autres
Publié: (2023)
par: Ke, Pei, et autres
Publié: (2023)
Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models
par: Sahnan, Dhruv, et autres
Publié: (2026)
par: Sahnan, Dhruv, et autres
Publié: (2026)
A Full-duplex Speech Dialogue Scheme Based On Large Language Models
par: Wang, Peng, et autres
Publié: (2024)
par: Wang, Peng, et autres
Publié: (2024)
PsychCounsel-Bench: Evaluating the Psychology Intelligence of Large Language Models
par: Zeng, Min
Publié: (2025)
par: Zeng, Min
Publié: (2025)
Evaluating Large Language Models with Psychometrics
par: Li, Yuan, et autres
Publié: (2024)
par: Li, Yuan, et autres
Publié: (2024)
Learning Evaluation Models from Large Language Models for Sequence Generation
par: Wang, Chenglong, et autres
Publié: (2023)
par: Wang, Chenglong, et autres
Publié: (2023)
Vibe Checker: Aligning Code Evaluation with Human Preference
par: Zhong, Ming, et autres
Publié: (2025)
par: Zhong, Ming, et autres
Publié: (2025)
Evaluating Self-Generated Documents for Enhancing Retrieval-Augmented Generation with Large Language Models
par: Li, Jiatao, et autres
Publié: (2024)
par: Li, Jiatao, et autres
Publié: (2024)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Evaluating Large Language Models at Evaluating Instruction Following
par: Zeng, Zhiyuan, et autres
Publié: (2023)
par: Zeng, Zhiyuan, et autres
Publié: (2023)
The SCAN Statistical Model Checker
par: Ghiorzi, Enrico, et autres
Publié: (2026)
par: Ghiorzi, Enrico, et autres
Publié: (2026)
Evaluating Accounting Reasoning Capabilities of Large Language Models
par: Zhou, Jie, et autres
Publié: (2026)
par: Zhou, Jie, et autres
Publié: (2026)
Evaluating Rare Disease Diagnostic Performance in Symptom Checkers: A Synthetic Vignette Simulation Approach
par: Nishibayashi, Takashi, et autres
Publié: (2025)
par: Nishibayashi, Takashi, et autres
Publié: (2025)
Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Models
par: Liu, Shuliang, et autres
Publié: (2025)
par: Liu, Shuliang, et autres
Publié: (2025)
Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges
par: Samuel, Vinay, et autres
Publié: (2024)
par: Samuel, Vinay, et autres
Publié: (2024)
A Fully Automated Pipeline for Conversational Discourse Annotation: Tree Scheme Generation and Labeling with Large Language Models
par: Petukhova, Kseniia, et autres
Publié: (2025)
par: Petukhova, Kseniia, et autres
Publié: (2025)
AI Analyst: Framework and Comprehensive Evaluation of Large Language Models for Financial Time Series Report Generation
par: Fons, Elizabeth, et autres
Publié: (2025)
par: Fons, Elizabeth, et autres
Publié: (2025)
ShiZhi: A Chinese Lightweight Large Language Model for Court View Generation
par: Hou, Zhitian, et autres
Publié: (2025)
par: Hou, Zhitian, et autres
Publié: (2025)
Exploring Lightweight Large Language Models for Court View Generation
par: Hou, Zhitian, et autres
Publié: (2026)
par: Hou, Zhitian, et autres
Publié: (2026)
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
par: Wei, Fangyun, et autres
Publié: (2024)
par: Wei, Fangyun, et autres
Publié: (2024)
Evaluating Large Language Model Biases in Persona-Steered Generation
par: Liu, Andy, et autres
Publié: (2024)
par: Liu, Andy, et autres
Publié: (2024)
Evaluating and Improving Graph to Text Generation with Large Language Models
par: He, Jie, et autres
Publié: (2025)
par: He, Jie, et autres
Publié: (2025)
Documents similaires
-
RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models
par: Hu, Xiangkun, et autres
Publié: (2024) -
Are Large Language Models Table-based Fact-Checkers?
par: Zhang, Hanwen, et autres
Publié: (2024) -
Self-Checker: Plug-and-Play Modules for Fact-Checking with Large Language Models
par: Li, Miaoran, et autres
Publié: (2023) -
Random Testing of Model Checkers for Timed Automata with Automated Oracle Generation
par: Manini, Andrea, et autres
Publié: (2025) -
Interactive DualChecker for Mitigating Hallucinations in Distilling Large Language Models
par: Wang, Meiyun, et autres
Publié: (2024)