YESciEval: Robust LLM-as-a-Judge for Scientific Question Answering
Fuente:
arXiv
Saved in:
| Main Authors: | D'Souza, Jennifer, Giglou, Hamed Babaei, Münch, Quentin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LLMs4Synthesis: Leveraging Large Language Models for Scientific Synthesis
by: Giglou, Hamed Babaei, et al.
Published: (2024)
by: Giglou, Hamed Babaei, et al.
Published: (2024)
LLMs4OL 2024 Overview: The 1st Large Language Models for Ontology Learning Challenge
by: Giglou, Hamed Babaei, et al.
Published: (2024)
by: Giglou, Hamed Babaei, et al.
Published: (2024)
OntoAligner: A Comprehensive Modular and Robust Python Toolkit for Ontology Alignment
by: Giglou, Hamed Babaei, et al.
Published: (2025)
by: Giglou, Hamed Babaei, et al.
Published: (2025)
Scholarly Question Answering using Large Language Models in the NFDI4DataScience Gateway
by: Giglou, Hamed Babaei, et al.
Published: (2024)
by: Giglou, Hamed Babaei, et al.
Published: (2024)
Homa at SemEval-2025 Task 5: Aligning Librarian Records with OntoAligner for Subject Tagging
by: Tekanlou, Hadi Bayrami Asl, et al.
Published: (2025)
by: Tekanlou, Hadi Bayrami Asl, et al.
Published: (2025)
DeepResearch$^{\text{Eco}}$: A Recursive Agentic Workflow for Complex Scientific Question Answering in Ecology
by: D'Souza, Jennifer, et al.
Published: (2025)
by: D'Souza, Jennifer, et al.
Published: (2025)
LLMs4SchemaDiscovery: A Human-in-the-Loop Workflow for Scientific Schema Mining with Large Language Models
by: Sadruddin, Sameer, et al.
Published: (2025)
by: Sadruddin, Sameer, et al.
Published: (2025)
LLMs4OM: Matching Ontologies with Large Language Models
by: Giglou, Hamed Babaei, et al.
Published: (2024)
by: Giglou, Hamed Babaei, et al.
Published: (2024)
OntoAligner Meets Knowledge Graph Embedding Aligners
by: Giglou, Hamed Babaei, et al.
Published: (2025)
by: Giglou, Hamed Babaei, et al.
Published: (2025)
Large Language Models as Evaluators for Scientific Synthesis
by: Evans, Julia, et al.
Published: (2024)
by: Evans, Julia, et al.
Published: (2024)
Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis
by: Tan, Zhiyin, et al.
Published: (2026)
by: Tan, Zhiyin, et al.
Published: (2026)
LLM Robustness Against Misinformation in Biomedical Question Answering
by: Bondarenko, Alexander, et al.
Published: (2024)
by: Bondarenko, Alexander, et al.
Published: (2024)
A FAIR and Free Prompt-based Research Assistant
by: Shamsabadi, Mahsa, et al.
Published: (2024)
by: Shamsabadi, Mahsa, et al.
Published: (2024)
Large Language Models for Scientific Information Extraction: An Empirical Study for Virology
by: Shamsabadi, Mahsa, et al.
Published: (2024)
by: Shamsabadi, Mahsa, et al.
Published: (2024)
SemEval-2025 Task 5: LLMs4Subjects -- LLM-based Automated Subject Tagging for a National Technical Library's Open-Access Catalog
by: D'Souza, Jennifer, et al.
Published: (2025)
by: D'Souza, Jennifer, et al.
Published: (2025)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
by: Yang, Langqi, et al.
Published: (2025)
by: Yang, Langqi, et al.
Published: (2025)
Multimodal Reranking for Knowledge-Intensive Visual Question Answering
by: Wen, Haoyang, et al.
Published: (2024)
by: Wen, Haoyang, et al.
Published: (2024)
Toward Purpose-oriented Topic Model Evaluation enabled by Large Language Models
by: Tan, Zhiyin, et al.
Published: (2025)
by: Tan, Zhiyin, et al.
Published: (2025)
Bridging the Evaluation Gap: Leveraging Large Language Models for Topic Model Evaluation
by: Tan, Zhiyin, et al.
Published: (2025)
by: Tan, Zhiyin, et al.
Published: (2025)
Can We Locate and Prevent Stereotypes in LLMs?
by: D'Souza, Alex
Published: (2026)
by: D'Souza, Alex
Published: (2026)
Exploring the Latest LLMs for Leaderboard Extraction
by: Kabongo, Salomon, et al.
Published: (2024)
by: Kabongo, Salomon, et al.
Published: (2024)
Learning from Natural Language Feedback for Personalized Question Answering
by: Salemi, Alireza, et al.
Published: (2025)
by: Salemi, Alireza, et al.
Published: (2025)
Improved LLM Agents for Financial Document Question Answering
by: Tan, Nelvin, et al.
Published: (2025)
by: Tan, Nelvin, et al.
Published: (2025)
Astro-NER -- Astronomy Named Entity Recognition: Is GPT a Good Domain Expert Annotator?
by: Evans, Julia, et al.
Published: (2024)
by: Evans, Julia, et al.
Published: (2024)
From Keywords to Structured Summaries: Streamlining Scholarly Information Access
by: Shamsabadi, Mahsa, et al.
Published: (2024)
by: Shamsabadi, Mahsa, et al.
Published: (2024)
SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark
by: Liang, Zhenwen, et al.
Published: (2024)
by: Liang, Zhenwen, et al.
Published: (2024)
Learning to Reason for Multi-Step Retrieval of Personal Context in Personalized Question Answering
by: Amirizaniani, Maryam, et al.
Published: (2026)
by: Amirizaniani, Maryam, et al.
Published: (2026)
EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
by: Mohammadi, Hadi, et al.
Published: (2025)
by: Mohammadi, Hadi, et al.
Published: (2025)
Evaluating Large Language Models for Structured Science Summarization in the Open Research Knowledge Graph
by: Nechakhin, Vladyslav, et al.
Published: (2024)
by: Nechakhin, Vladyslav, et al.
Published: (2024)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
by: Pramanick, Shraman, et al.
Published: (2024)
by: Pramanick, Shraman, et al.
Published: (2024)
Evaluating Consistencies in LLM responses through a Semantic Clustering of Question Answering
by: Lee, Yanggyu, et al.
Published: (2024)
by: Lee, Yanggyu, et al.
Published: (2024)
Towards Robust Extractive Question Answering Models: Rethinking the Training Methodology
by: Tran, Son Quoc, et al.
Published: (2024)
by: Tran, Son Quoc, et al.
Published: (2024)
Optimized Biomedical Question-Answering Services with LLM and Multi-BERT Integration
by: Qian, Cheng, et al.
Published: (2024)
by: Qian, Cheng, et al.
Published: (2024)
Improving LLM Reliability with RAG in Religious Question-Answering: MufassirQAS
by: Alan, Ahmet Yusuf, et al.
Published: (2024)
by: Alan, Ahmet Yusuf, et al.
Published: (2024)
DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering
by: Chen, Haotian, et al.
Published: (2026)
by: Chen, Haotian, et al.
Published: (2026)
Mining for Species, Locations, Habitats, and Ecosystems from Scientific Papers in Invasion Biology: A Large-Scale Exploratory Study with Large Language Models
by: D'Souza, Jennifer, et al.
Published: (2025)
by: D'Souza, Jennifer, et al.
Published: (2025)
Token Constraint Decoding Improves Robustness on Question Answering for Large Language Models
by: Yao, Jui-Ming, et al.
Published: (2025)
by: Yao, Jui-Ming, et al.
Published: (2025)
Exploring the Robustness of Language Models for Tabular Question Answering via Attention Analysis
by: Bhandari, Kushal Raj, et al.
Published: (2024)
by: Bhandari, Kushal Raj, et al.
Published: (2024)
Generative Data Augmentation using LLMs improves Distributional Robustness in Question Answering
by: Chowdhury, Arijit Ghosh, et al.
Published: (2023)
by: Chowdhury, Arijit Ghosh, et al.
Published: (2023)
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
by: Baumgärtner, Tim, et al.
Published: (2025)
by: Baumgärtner, Tim, et al.
Published: (2025)
Similar Items
-
LLMs4Synthesis: Leveraging Large Language Models for Scientific Synthesis
by: Giglou, Hamed Babaei, et al.
Published: (2024) -
LLMs4OL 2024 Overview: The 1st Large Language Models for Ontology Learning Challenge
by: Giglou, Hamed Babaei, et al.
Published: (2024) -
OntoAligner: A Comprehensive Modular and Robust Python Toolkit for Ontology Alignment
by: Giglou, Hamed Babaei, et al.
Published: (2025) -
Scholarly Question Answering using Large Language Models in the NFDI4DataScience Gateway
by: Giglou, Hamed Babaei, et al.
Published: (2024) -
Homa at SemEval-2025 Task 5: Aligning Librarian Records with OntoAligner for Subject Tagging
by: Tekanlou, Hadi Bayrami Asl, et al.
Published: (2025)