CheckEval: A reliable LLM-as-a-Judge framework for evaluating text generation using checklists
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Yukyung, Kim, Joonghoon, Kim, Jaehee, Cho, Hyowon, Kang, Jaewook, Kang, Pilsung, Kim, Najoung |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs
par: Kim, Jaehee, et autres
Publié: (2026)
par: Kim, Jaehee, et autres
Publié: (2026)
A Gradient Accumulation Method for Dense Retriever under Memory Constraint
par: Kim, Jaehee, et autres
Publié: (2024)
par: Kim, Jaehee, et autres
Publié: (2024)
Navigating the Path of Writing: Outline-guided Text Generation with Large Language Models
par: Lee, Yukyung, et autres
Publié: (2024)
par: Lee, Yukyung, et autres
Publié: (2024)
A systematic framework for generating novel experimental hypotheses from language models
par: Misra, Kanishka, et autres
Publié: (2024)
par: Misra, Kanishka, et autres
Publié: (2024)
RExBench: Can coding agents autonomously implement AI research extensions?
par: Edwards, Nicholas, et autres
Publié: (2025)
par: Edwards, Nicholas, et autres
Publié: (2025)
QFFN-BERT: An Empirical Study of Depth, Performance, and Data Efficiency in Hybrid Quantum-Classical Transformers
par: Kang, Pilsung
Publié: (2025)
par: Kang, Pilsung
Publié: (2025)
RadEval: A framework for radiology text evaluation
par: Xu, Justin, et autres
Publié: (2025)
par: Xu, Justin, et autres
Publié: (2025)
Can You Trick the Grader? Adversarial Persuasion of LLM Judges
par: Hwang, Yerin, et autres
Publié: (2025)
par: Hwang, Yerin, et autres
Publié: (2025)
Don't Judge Code by Its Cover: Exploring Biases in LLM Judges for Code Evaluation
par: Moon, Jiwon, et autres
Publié: (2025)
par: Moon, Jiwon, et autres
Publié: (2025)
Is analogy enough to draw novel adjective-noun inferences?
par: Ross, Hayley, et autres
Publié: (2025)
par: Ross, Hayley, et autres
Publié: (2025)
Syn-QA2: Evaluating False Assumptions in Long-tail Questions with Synthetic QA Datasets
par: Daswani, Ashwin, et autres
Publié: (2024)
par: Daswani, Ashwin, et autres
Publié: (2024)
Is artificial intelligence still intelligence? LLMs generalize to novel adjective-noun pairs, but don't mimic the full human distribution
par: Ross, Hayley, et autres
Publié: (2024)
par: Ross, Hayley, et autres
Publié: (2024)
COUNTDOWN: Contextually Sparse Activation Filtering Out Unnecessary Weights in Down Projection
par: Cheon, Jaewon, et autres
Publié: (2025)
par: Cheon, Jaewon, et autres
Publié: (2025)
MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models
par: Son, Guijin, et autres
Publié: (2024)
par: Son, Guijin, et autres
Publié: (2024)
Code Pretraining Improves Entity Tracking Abilities of Language Models
par: Kim, Najoung, et autres
Publié: (2024)
par: Kim, Najoung, et autres
Publié: (2024)
Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration
par: Kim, Hankyeol, et autres
Publié: (2026)
par: Kim, Hankyeol, et autres
Publié: (2026)
Natural Language Declarative Prompting (NLD-P): A Modular Governance Method for Prompt Design Under Model Drift
par: Kim, Hyunwoo, et autres
Publié: (2026)
par: Kim, Hyunwoo, et autres
Publié: (2026)
Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation
par: Lee, Dongryeol, et autres
Publié: (2026)
par: Lee, Dongryeol, et autres
Publié: (2026)
VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation
par: Song, Yixiao, et autres
Publié: (2024)
par: Song, Yixiao, et autres
Publié: (2024)
Death of the Novel(ty): Beyond n-Gram Novelty as a Metric for Textual Creativity
par: Saakyan, Arkadiy, et autres
Publié: (2025)
par: Saakyan, Arkadiy, et autres
Publié: (2025)
Self-Correcting Code Generation Using Small Language Models
par: Cho, Jeonghun, et autres
Publié: (2025)
par: Cho, Jeonghun, et autres
Publié: (2025)
FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay Feedback
par: Chu, Seongyeub, et autres
Publié: (2026)
par: Chu, Seongyeub, et autres
Publié: (2026)
Are LLM-Judges Robust to Expressions of Uncertainty? Investigating the effect of Epistemic Markers on LLM-based Evaluation
par: Lee, Dongryeol, et autres
Publié: (2024)
par: Lee, Dongryeol, et autres
Publié: (2024)
LLM-as-a-Judge & Reward Model: What They Can and Cannot Do
par: Son, Guijin, et autres
Publié: (2024)
par: Son, Guijin, et autres
Publié: (2024)
Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation
par: Hwang, Yerin, et autres
Publié: (2025)
par: Hwang, Yerin, et autres
Publié: (2025)
naPINN: Noise-Adaptive Physics-Informed Neural Networks for Recovering Physics from Corrupted Measurement
par: Kim, Hankyeol, et autres
Publié: (2026)
par: Kim, Hankyeol, et autres
Publié: (2026)
Can Large Language Models Differentiate Harmful from Argumentative Essays? Steps Toward Ethical Essay Scoring
par: Kim, Hongjin, et autres
Publié: (2026)
par: Kim, Hongjin, et autres
Publié: (2026)
Generation-Based and Emotion-Reflected Memory Update: Creating the KEEM Dataset for Better Long-Term Conversation
par: Kang, Jeonghyun, et autres
Publié: (2026)
par: Kang, Jeonghyun, et autres
Publié: (2026)
PsyProbe: Proactive and Interpretable Dialogue through User State Modeling for Exploratory Counseling
par: Park, Sohhyung, et autres
Publié: (2026)
par: Park, Sohhyung, et autres
Publié: (2026)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
par: Kim, Tae Soo, et autres
Publié: (2023)
par: Kim, Tae Soo, et autres
Publié: (2023)
PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?
par: Zhou, Lingfeng, et autres
Publié: (2025)
par: Zhou, Lingfeng, et autres
Publié: (2025)
Verbosity-Aware Rationale Reduction: Effective Reduction of Redundant Rationale via Principled Criteria
par: Jang, Joonwon, et autres
Publié: (2024)
par: Jang, Joonwon, et autres
Publié: (2024)
Cactus: Towards Psychological Counseling Conversations using Cognitive Behavioral Theory
par: Lee, Suyeon, et autres
Publié: (2024)
par: Lee, Suyeon, et autres
Publié: (2024)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
par: Park, Chanjun, et autres
Publié: (2024)
par: Park, Chanjun, et autres
Publié: (2024)
KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding
par: Hwang, Bokwang, et autres
Publié: (2025)
par: Hwang, Bokwang, et autres
Publié: (2025)
Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation
par: Lee, Seongyun, et autres
Publié: (2024)
par: Lee, Seongyun, et autres
Publié: (2024)
Training-free Dropout Sampling for Semantic Token Acceptance in Speculative Decoding
par: Lee, Jeongtae, et autres
Publié: (2026)
par: Lee, Jeongtae, et autres
Publié: (2026)
Review-driven Personalized Preference Reasoning with Large Language Models for Recommendation
par: Kim, Jieyong, et autres
Publié: (2024)
par: Kim, Jieyong, et autres
Publié: (2024)
Towards Fully-Automated Materials Discovery via Large-Scale Synthesis Dataset and Expert-Level LLM-as-a-Judge
par: Kim, Heegyu, et autres
Publié: (2025)
par: Kim, Heegyu, et autres
Publié: (2025)
Investigating the Influence of Prompt-Specific Shortcuts in AI Generated Text Detection
par: Park, Choonghyun, et autres
Publié: (2024)
par: Park, Choonghyun, et autres
Publié: (2024)
Documents similaires
-
AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs
par: Kim, Jaehee, et autres
Publié: (2026) -
A Gradient Accumulation Method for Dense Retriever under Memory Constraint
par: Kim, Jaehee, et autres
Publié: (2024) -
Navigating the Path of Writing: Outline-guided Text Generation with Large Language Models
par: Lee, Yukyung, et autres
Publié: (2024) -
A systematic framework for generating novel experimental hypotheses from language models
par: Misra, Kanishka, et autres
Publié: (2024) -
RExBench: Can coding agents autonomously implement AI research extensions?
par: Edwards, Nicholas, et autres
Publié: (2025)