Return of EM: Entity-driven Answer Set Expansion for QA Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Dongryeol, Lee, Minwoo, Min, Kyungmin, Park, Joonsuk, Jung, Kyomin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Are LLM-Judges Robust to Expressions of Uncertainty? Investigating the effect of Epistemic Markers on LLM-based Evaluation
par: Lee, Dongryeol, et autres
Publié: (2024)
par: Lee, Dongryeol, et autres
Publié: (2024)
Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation
par: Lee, Dongryeol, et autres
Publié: (2026)
par: Lee, Dongryeol, et autres
Publié: (2026)
When Wording Steers the Evaluation: Framing Bias in LLM judges
par: Hwang, Yerin, et autres
Publié: (2026)
par: Hwang, Yerin, et autres
Publié: (2026)
AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective Intelligence
par: Kim, Minbeom, et autres
Publié: (2024)
par: Kim, Minbeom, et autres
Publié: (2024)
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
par: Min, Kyungmin, et autres
Publié: (2024)
par: Min, Kyungmin, et autres
Publié: (2024)
Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation
par: Hwang, Yerin, et autres
Publié: (2025)
par: Hwang, Yerin, et autres
Publié: (2025)
LifeTox: Unveiling Implicit Toxicity in Life Advice
par: Kim, Minbeom, et autres
Publié: (2023)
par: Kim, Minbeom, et autres
Publié: (2023)
Can You Trick the Grader? Adversarial Persuasion of LLM Judges
par: Hwang, Yerin, et autres
Publié: (2025)
par: Hwang, Yerin, et autres
Publié: (2025)
Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
par: Jo, Hwiyeol, et autres
Publié: (2025)
par: Jo, Hwiyeol, et autres
Publié: (2025)
Fine-grained Gender Control in Machine Translation with Large Language Models
par: Lee, Minwoo, et autres
Publié: (2024)
par: Lee, Minwoo, et autres
Publié: (2024)
Don't Judge Code by Its Cover: Exploring Biases in LLM Judges for Code Evaluation
par: Moon, Jiwon, et autres
Publié: (2025)
par: Moon, Jiwon, et autres
Publié: (2025)
Can LLMs Recognize Toxicity? A Structured Investigation Framework and Toxicity Metric
par: Koh, Hyukhun, et autres
Publié: (2024)
par: Koh, Hyukhun, et autres
Publié: (2024)
Black-Box Hallucination Detection via Consistency Under the Uncertain Expression
par: Joo, Seongho, et autres
Publié: (2025)
par: Joo, Seongho, et autres
Publié: (2025)
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
par: Kim, Junseok, et autres
Publié: (2026)
par: Kim, Junseok, et autres
Publié: (2026)
Program Synthesis via Test-Time Transduction
par: Lee, Kang-il, et autres
Publié: (2025)
par: Lee, Kang-il, et autres
Publié: (2025)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
par: Lee, Kang-il, et autres
Publié: (2024)
par: Lee, Kang-il, et autres
Publié: (2024)
A Character-Centric Creative Story Generation via Imagination
par: Park, Kyeongman, et autres
Publié: (2024)
par: Park, Kyeongman, et autres
Publié: (2024)
SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMs
par: Kim, Jaehyung, et autres
Publié: (2024)
par: Kim, Jaehyung, et autres
Publié: (2024)
ExpertQA: Expert-Curated Questions and Attributed Answers
par: Malaviya, Chaitanya, et autres
Publié: (2023)
par: Malaviya, Chaitanya, et autres
Publié: (2023)
LongStory: Coherent, Complete and Length Controlled Long story Generation
par: Park, Kyeongman, et autres
Publié: (2023)
par: Park, Kyeongman, et autres
Publié: (2023)
Avoidance Decoding for Diverse Multi-Branch Story Generation
par: Park, Kyeongman, et autres
Publié: (2025)
par: Park, Kyeongman, et autres
Publié: (2025)
A Universal Avoidance Method for Diverse Multi-branch Generation
par: Park, Kyeongman, et autres
Publié: (2026)
par: Park, Kyeongman, et autres
Publié: (2026)
UltraWiki: Ultra-fine-grained Entity Set Expansion with Negative Seed Entities
par: Li, Yangning, et autres
Publié: (2024)
par: Li, Yangning, et autres
Publié: (2024)
Scientific QA System with Verifiable Answers
par: Ljajić, Adela, et autres
Publié: (2024)
par: Ljajić, Adela, et autres
Publié: (2024)
Automatic Context Pattern Generation for Entity Set Expansion
par: Li, Yinghui, et autres
Publié: (2022)
par: Li, Yinghui, et autres
Publié: (2022)
Enhancing Hallucination Detection via Future Context
par: Lee, Joosung, et autres
Publié: (2025)
par: Lee, Joosung, et autres
Publié: (2025)
A Unified Taxonomy-Guided Instruction Tuning Framework for Entity Set Expansion and Taxonomy Expansion
par: Shen, Yanzhen, et autres
Publié: (2024)
par: Shen, Yanzhen, et autres
Publié: (2024)
Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning
par: Lee, Sangmook, et autres
Publié: (2025)
par: Lee, Sangmook, et autres
Publié: (2025)
From Retrieval to Generation: Efficient and Effective Entity Set Expansion
par: Huang, Shulin, et autres
Publié: (2023)
par: Huang, Shulin, et autres
Publié: (2023)
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
par: Kim, Wonjoong, et autres
Publié: (2025)
par: Kim, Wonjoong, et autres
Publié: (2025)
Drift: Decoding-time Personalized Alignments with Implicit User Preferences
par: Kim, Minbeom, et autres
Publié: (2025)
par: Kim, Minbeom, et autres
Publié: (2025)
Integrated Framework for LLM Evaluation with Answer Generation
par: Lee, Sujeong, et autres
Publié: (2025)
par: Lee, Sujeong, et autres
Publié: (2025)
Which Retain Set Matters for LLM Unlearning? A Case Study on Entity Unlearning
par: Chang, Hwan, et autres
Publié: (2025)
par: Chang, Hwan, et autres
Publié: (2025)
RealTime QA: What's the Answer Right Now?
par: Kasai, Jungo, et autres
Publié: (2022)
par: Kasai, Jungo, et autres
Publié: (2022)
Persona is a Double-edged Sword: Mitigating the Negative Impact of Role-playing Prompts in Zero-shot Reasoning Tasks
par: Kim, Junseok, et autres
Publié: (2024)
par: Kim, Junseok, et autres
Publié: (2024)
Persona Switch: Mixing Distinct Perspectives in Decoding Time
par: Kim, Junseok, et autres
Publié: (2026)
par: Kim, Junseok, et autres
Publié: (2026)
Wrong Answers Can Also Be Useful: PlausibleQA -- A Large-Scale QA Dataset with Answer Plausibility Scores
par: Mozafari, Jamshid, et autres
Publié: (2025)
par: Mozafari, Jamshid, et autres
Publié: (2025)
Formal Analysis of Networked PLC Controllers Interacting with Physical Environments
par: Lee, Jaeseo, et autres
Publié: (2025)
par: Lee, Jaeseo, et autres
Publié: (2025)
ReflectCAP: Detailed Image Captioning with Reflective Memory
par: Min, Kyungmin, et autres
Publié: (2026)
par: Min, Kyungmin, et autres
Publié: (2026)
Conditional [MASK] Discrete Diffusion Language Model
par: Koh, Hyukhun, et autres
Publié: (2024)
par: Koh, Hyukhun, et autres
Publié: (2024)
Documents similaires
-
Are LLM-Judges Robust to Expressions of Uncertainty? Investigating the effect of Epistemic Markers on LLM-based Evaluation
par: Lee, Dongryeol, et autres
Publié: (2024) -
Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation
par: Lee, Dongryeol, et autres
Publié: (2026) -
When Wording Steers the Evaluation: Framing Bias in LLM judges
par: Hwang, Yerin, et autres
Publié: (2026) -
AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective Intelligence
par: Kim, Minbeom, et autres
Publié: (2024) -
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
par: Min, Kyungmin, et autres
Publié: (2024)