MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Yongqi, Wang, Yating, Wang, Guandong, Zhai, Jie, Liu, Jingping, Ye, Qi, Ruan, Tong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LINKAGE: Listwise Ranking among Varied-Quality References for Non-Factoid QA Evaluation via LLMs
di: Yang, Sihui, et al.
Pubblicazione: (2024)
di: Yang, Sihui, et al.
Pubblicazione: (2024)
Continual Memorization of Factoids in Language Models
di: Chen, Howard, et al.
Pubblicazione: (2024)
di: Chen, Howard, et al.
Pubblicazione: (2024)
Multilingual Non-Factoid Question Answering with Answer Paragraph Selection
di: Mishra, Ritwik, et al.
Pubblicazione: (2024)
di: Mishra, Ritwik, et al.
Pubblicazione: (2024)
Typed-RAG: Type-Aware Decomposition of Non-Factoid Questions for Retrieval-Augmented Generation
di: Lee, DongGeon, et al.
Pubblicazione: (2025)
di: Lee, DongGeon, et al.
Pubblicazione: (2025)
A Benchmark Dataset with Larger Context for Non-Factoid Question Answering over Islamic Text
di: Qamar, Faiza, et al.
Pubblicazione: (2024)
di: Qamar, Faiza, et al.
Pubblicazione: (2024)
TriviaHG: A Dataset for Automatic Hint Generation from Factoid Questions
di: Mozafari, Jamshid, et al.
Pubblicazione: (2024)
di: Mozafari, Jamshid, et al.
Pubblicazione: (2024)
A Machine Learning Approach for Factoid Question Answering
di: David Dominguez-Sal
Pubblicazione: (2006)
di: David Dominguez-Sal
Pubblicazione: (2006)
CMQCIC-Bench: A Chinese Benchmark for Evaluating Large Language Models in Medical Quality Control Indicator Calculation
di: Yu, Guangya, et al.
Pubblicazione: (2025)
di: Yu, Guangya, et al.
Pubblicazione: (2025)
Compound-QA: A Benchmark for Evaluating LLMs on Compound Questions
di: Hou, Yutao, et al.
Pubblicazione: (2024)
di: Hou, Yutao, et al.
Pubblicazione: (2024)
CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset
di: Libovický, Jindřich, et al.
Pubblicazione: (2025)
di: Libovický, Jindřich, et al.
Pubblicazione: (2025)
DPDisc: From Factoid Questions to Data Product Requests for Open-World Data Product Discovery over Tables and Text
di: Zhang, Liangliang, et al.
Pubblicazione: (2025)
di: Zhang, Liangliang, et al.
Pubblicazione: (2025)
An Answer is just the Start: Related Insight Generation for Open-Ended Document-Grounded QA
di: Sharma, Saransh, et al.
Pubblicazione: (2026)
di: Sharma, Saransh, et al.
Pubblicazione: (2026)
KG-o1: Enhancing Multi-hop Question Answering in Large Language Models via Knowledge Graph Integration
di: Wang, Nan, et al.
Pubblicazione: (2025)
di: Wang, Nan, et al.
Pubblicazione: (2025)
Soda-Eval: Open-Domain Dialogue Evaluation in the age of LLMs
di: Mendonça, John, et al.
Pubblicazione: (2024)
di: Mendonça, John, et al.
Pubblicazione: (2024)
Reverse-Engineered Reasoning for Open-Ended Generation
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
AF Adapter: Continual Pretraining for Building Chinese Biomedical Language Model
di: Yan, Yongyu, et al.
Pubblicazione: (2022)
di: Yan, Yongyu, et al.
Pubblicazione: (2022)
Team Anotheroption at SemEval-2025 Task 8: Bridging the Gap Between Open-Source and Proprietary LLMs in Table QA
di: Evkarpidi, Nikolas, et al.
Pubblicazione: (2025)
di: Evkarpidi, Nikolas, et al.
Pubblicazione: (2025)
MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K Tokens
di: Fan, Yongqi, et al.
Pubblicazione: (2024)
di: Fan, Yongqi, et al.
Pubblicazione: (2024)
Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2024)
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2024)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
OpenEP: Open-Ended Future Event Prediction
di: Guan, Yong, et al.
Pubblicazione: (2024)
di: Guan, Yong, et al.
Pubblicazione: (2024)
AutoEvoEval: An Automated Framework for Evolving Close-Ended LLM Evaluation Data
di: Wu, JiaRu, et al.
Pubblicazione: (2025)
di: Wu, JiaRu, et al.
Pubblicazione: (2025)
CQA-Eval: Designing Reliable Evaluations of Multi-paragraph Clinical QA under Resource Constraints
di: Bologna, Federica, et al.
Pubblicazione: (2025)
di: Bologna, Federica, et al.
Pubblicazione: (2025)
Beyond MCQ: An Open-Ended Arabic Cultural QA Benchmark with Dialect Variants
di: Bhatti, Hunzalah Hassan, et al.
Pubblicazione: (2025)
di: Bhatti, Hunzalah Hassan, et al.
Pubblicazione: (2025)
Generating Planning Feedback for Open-Ended Programming Exercises with LLMs
di: Demirtaş, Mehmet Arif, et al.
Pubblicazione: (2025)
di: Demirtaş, Mehmet Arif, et al.
Pubblicazione: (2025)
UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities
di: Jia, Qi, et al.
Pubblicazione: (2026)
di: Jia, Qi, et al.
Pubblicazione: (2026)
MCU: An Evaluation Framework for Open-Ended Game Agents
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
di: Tong, Yongqi, et al.
Pubblicazione: (2024)
di: Tong, Yongqi, et al.
Pubblicazione: (2024)
BIT.UA-AAUBS at ArchEHR-QA 2026: Evaluating Open-Source and Proprietary LLMs via Prompting in Low-Resource QA
di: Jonker, Richard A. A., et al.
Pubblicazione: (2026)
di: Jonker, Richard A. A., et al.
Pubblicazione: (2026)
Can LLMs Evaluate Complex Attribution in QA? Automatic Benchmarking using Knowledge Graphs
di: Hu, Nan, et al.
Pubblicazione: (2024)
di: Hu, Nan, et al.
Pubblicazione: (2024)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
di: Carlsson, Fredrik, et al.
Pubblicazione: (2024)
di: Carlsson, Fredrik, et al.
Pubblicazione: (2024)
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
di: Zhao, Yu, et al.
Pubblicazione: (2024)
di: Zhao, Yu, et al.
Pubblicazione: (2024)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
di: Dineen, Jacob, et al.
Pubblicazione: (2025)
di: Dineen, Jacob, et al.
Pubblicazione: (2025)
OpenHuEval: Evaluating Large Language Model on Hungarian Specifics
di: Yang, Haote, et al.
Pubblicazione: (2025)
di: Yang, Haote, et al.
Pubblicazione: (2025)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
di: Li, Yu, et al.
Pubblicazione: (2024)
di: Li, Yu, et al.
Pubblicazione: (2024)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
di: He, Chaoqun, et al.
Pubblicazione: (2024)
di: He, Chaoqun, et al.
Pubblicazione: (2024)
A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
di: Wang, Zhanliang, et al.
Pubblicazione: (2026)
di: Wang, Zhanliang, et al.
Pubblicazione: (2026)
Improving Open-Ended Text Generation via Adaptive Decoding
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
OpenSIR: Open-Ended Self-Improving Reasoner
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2025)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LINKAGE: Listwise Ranking among Varied-Quality References for Non-Factoid QA Evaluation via LLMs
di: Yang, Sihui, et al.
Pubblicazione: (2024) -
Continual Memorization of Factoids in Language Models
di: Chen, Howard, et al.
Pubblicazione: (2024) -
Multilingual Non-Factoid Question Answering with Answer Paragraph Selection
di: Mishra, Ritwik, et al.
Pubblicazione: (2024) -
Typed-RAG: Type-Aware Decomposition of Non-Factoid Questions for Retrieval-Augmented Generation
di: Lee, DongGeon, et al.
Pubblicazione: (2025) -
A Benchmark Dataset with Larger Context for Non-Factoid Question Answering over Islamic Text
di: Qamar, Faiza, et al.
Pubblicazione: (2024)