Revisiting NLI: Towards Cost-Effective and Human-Aligned Metrics for Evaluating LLMs in Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Balamurali, Sai Shridhar, Cheng, Lu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Evaluation of Healthcare LLMs Beyond Question-Answering
par: Arias-Duart, Anna, et autres
Publié: (2025)
par: Arias-Duart, Anna, et autres
Publié: (2025)
Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering
par: Prahallad, Lavanya, et autres
Publié: (2026)
par: Prahallad, Lavanya, et autres
Publié: (2026)
RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering
par: Um, Kaehyun, et autres
Publié: (2026)
par: Um, Kaehyun, et autres
Publié: (2026)
Aligning LLMs through Multi-perspective User Preference Ranking-based Feedback for Programming Question Answering
par: Yang, Hongyu, et autres
Publié: (2024)
par: Yang, Hongyu, et autres
Publié: (2024)
Knowledgeable Preference Alignment for LLMs in Domain-specific Question Answering
par: Zhang, Yichi, et autres
Publié: (2023)
par: Zhang, Yichi, et autres
Publié: (2023)
Evaluation of RAG Metrics for Question Answering in the Telecom Domain
par: Roychowdhury, Sujoy, et autres
Publié: (2024)
par: Roychowdhury, Sujoy, et autres
Publié: (2024)
QPaug: Question and Passage Augmentation for Open-Domain Question Answering of LLMs
par: Kim, Minsang, et autres
Publié: (2024)
par: Kim, Minsang, et autres
Publié: (2024)
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
par: Kendre, Shrikant, et autres
Publié: (2025)
par: Kendre, Shrikant, et autres
Publié: (2025)
RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content
par: Monteiro, Joao, et autres
Publié: (2024)
par: Monteiro, Joao, et autres
Publié: (2024)
Evaluating Correctness and Faithfulness of Instruction-Following Models for Question Answering
par: Adlakha, Vaibhav, et autres
Publié: (2023)
par: Adlakha, Vaibhav, et autres
Publié: (2023)
Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics
par: Cho, Yousang, et autres
Publié: (2025)
par: Cho, Yousang, et autres
Publié: (2025)
Distilling LLMs' Decomposition Abilities into Compact Language Models
par: Tarasov, Denis, et autres
Publié: (2024)
par: Tarasov, Denis, et autres
Publié: (2024)
Cost-efficient Knowledge-based Question Answering with Large Language Models
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025)
par: Wei, Jianhui, et autres
Publié: (2025)
Affective-NLI: Towards Accurate and Interpretable Personality Recognition in Conversation
par: Wen, Zhiyuan, et autres
Publié: (2024)
par: Wen, Zhiyuan, et autres
Publié: (2024)
Fine-Tuning LLMs for Reliable Medical Question-Answering Services
par: Anaissi, Ali, et autres
Publié: (2024)
par: Anaissi, Ali, et autres
Publié: (2024)
HeySQuAD: A Spoken Question Answering Dataset
par: Wu, Yijing, et autres
Publié: (2023)
par: Wu, Yijing, et autres
Publié: (2023)
Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness
par: Banayeeanzade, Amin, et autres
Publié: (2025)
par: Banayeeanzade, Amin, et autres
Publié: (2025)
Question Answering on Patient Medical Records with Private Fine-Tuned LLMs
par: Kothari, Sara, et autres
Publié: (2025)
par: Kothari, Sara, et autres
Publié: (2025)
Hybrid Graphs for Table-and-Text based Question Answering using LLMs
par: Agarwal, Ankush, et autres
Publié: (2025)
par: Agarwal, Ankush, et autres
Publié: (2025)
Augmenting Black-box LLMs with Medical Textbooks for Biomedical Question Answering
par: Wang, Yubo, et autres
Publié: (2023)
par: Wang, Yubo, et autres
Publié: (2023)
Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering
par: Amirizaniani, Maryam, et autres
Publié: (2026)
par: Amirizaniani, Maryam, et autres
Publié: (2026)
60 Data Points are Sufficient to Fine-Tune LLMs for Question-Answering
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Performance Assessment of ChatGPT vs Bard in Detecting Alzheimer's Dementia
par: T, Balamurali B, et autres
Publié: (2024)
par: T, Balamurali B, et autres
Publié: (2024)
LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation
par: Yang, Gao, et autres
Publié: (2025)
par: Yang, Gao, et autres
Publié: (2025)
Towards Human-Like Grading: A Unified LLM-Enhanced Framework for Subjective Question Evaluation
par: Zhua, Fanwei, et autres
Publié: (2025)
par: Zhua, Fanwei, et autres
Publié: (2025)
To Generate or to Retrieve? On the Effectiveness of Artificial Contexts for Medical Open-Domain Question Answering
par: Frisoni, Giacomo, et autres
Publié: (2024)
par: Frisoni, Giacomo, et autres
Publié: (2024)
Question Answering with LLMs and Learning from Answer Sets
par: Borroto, Manuel, et autres
Publié: (2025)
par: Borroto, Manuel, et autres
Publié: (2025)
Mind the Ambiguity: Aleatoric Uncertainty Quantification in LLMs for Safe Medical Question Answering
par: Liu, Yaokun, et autres
Publié: (2026)
par: Liu, Yaokun, et autres
Publié: (2026)
I've got the "Answer"! Interpretation of LLMs Hidden States in Question Answering
par: Goloviznina, Valeriya, et autres
Publié: (2024)
par: Goloviznina, Valeriya, et autres
Publié: (2024)
Generative Data Augmentation using LLMs improves Distributional Robustness in Question Answering
par: Chowdhury, Arijit Ghosh, et autres
Publié: (2023)
par: Chowdhury, Arijit Ghosh, et autres
Publié: (2023)
Discrepancy Detection at the Data Level: Toward Consistent Multilingual Question Answering
par: Calvo-Bartolomé, Lorena, et autres
Publié: (2025)
par: Calvo-Bartolomé, Lorena, et autres
Publié: (2025)
Towards Robust Extractive Question Answering Models: Rethinking the Training Methodology
par: Tran, Son Quoc, et autres
Publié: (2024)
par: Tran, Son Quoc, et autres
Publié: (2024)
Towards Question Answering over Large Semi-structured Tables
par: Wang, Yuxiang, et autres
Publié: (2025)
par: Wang, Yuxiang, et autres
Publié: (2025)
TQA-Bench: Evaluating LLMs for Multi-Table Question Answering with Scalable Context and Symbolic Extension
par: Qiu, Zipeng, et autres
Publié: (2024)
par: Qiu, Zipeng, et autres
Publié: (2024)
A Learn-Then-Reason Model Towards Generalization in Knowledge Base Question Answering
par: Zhang, Lingxi, et autres
Publié: (2024)
par: Zhang, Lingxi, et autres
Publié: (2024)
Towards Better Generalization in Open-Domain Question Answering by Mitigating Context Memorization
par: Zhang, Zixuan, et autres
Publié: (2024)
par: Zhang, Zixuan, et autres
Publié: (2024)
Towards Robust Evaluation: A Comprehensive Taxonomy of Datasets and Metrics for Open Domain Question Answering in the Era of Large Language Models
par: Srivastava, Akchay, et autres
Publié: (2024)
par: Srivastava, Akchay, et autres
Publié: (2024)
PRISM: Agentic Retrieval with LLMs for Multi-Hop Question Answering
par: Nahid, Md Mahadi Hasan, et autres
Publié: (2025)
par: Nahid, Md Mahadi Hasan, et autres
Publié: (2025)
Graph Neural Network Enhanced Retrieval for Question Answering of LLMs
par: Li, Zijian, et autres
Publié: (2024)
par: Li, Zijian, et autres
Publié: (2024)
Documents similaires
-
Automatic Evaluation of Healthcare LLMs Beyond Question-Answering
par: Arias-Duart, Anna, et autres
Publié: (2025) -
Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering
par: Prahallad, Lavanya, et autres
Publié: (2026) -
RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering
par: Um, Kaehyun, et autres
Publié: (2026) -
Aligning LLMs through Multi-perspective User Preference Ranking-based Feedback for Programming Question Answering
par: Yang, Hongyu, et autres
Publié: (2024) -
Knowledgeable Preference Alignment for LLMs in Domain-specific Question Answering
par: Zhang, Yichi, et autres
Publié: (2023)