ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Molfese, Francesco Maria, Moroni, Luca, Porcaro, Ciro, Conia, Simone, Navigli, Roberto |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ZEBRA: Zero-Shot Example-Based Retrieval Augmentation for Commonsense Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2024)
par: Molfese, Francesco Maria, et autres
Publié: (2024)
Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2025)
par: Molfese, Francesco Maria, et autres
Publié: (2025)
LiteraryQA: Towards Effective Evaluation of Long-document Narrative QA
par: Bonomo, Tommaso, et autres
Publié: (2025)
par: Bonomo, Tommaso, et autres
Publié: (2025)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
par: Quan, Yinzhu, et autres
Publié: (2024)
par: Quan, Yinzhu, et autres
Publié: (2024)
Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question Answering
par: Toroghi, Armin, et autres
Publié: (2024)
par: Toroghi, Armin, et autres
Publié: (2024)
Meronymic Ontology Extraction via Large Language Models
par: Zhang, Dekai, et autres
Publié: (2025)
par: Zhang, Dekai, et autres
Publié: (2025)
RephQA: Evaluating Readability of Large Language Models in Public Health Question Answering
par: Qiu, Weikang, et autres
Publié: (2025)
par: Qiu, Weikang, et autres
Publié: (2025)
DebateQA: Evaluating Question Answering on Debatable Knowledge
par: Xu, Rongwu, et autres
Publié: (2024)
par: Xu, Rongwu, et autres
Publié: (2024)
GRS-QA -- Graph Reasoning-Structured Question Answering Dataset
par: Pahilajani, Anish, et autres
Publié: (2024)
par: Pahilajani, Anish, et autres
Publié: (2024)
ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
par: Zhang, Yindong, et autres
Publié: (2026)
par: Zhang, Yindong, et autres
Publié: (2026)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
par: Shafayat, Sheikh, et autres
Publié: (2024)
par: Shafayat, Sheikh, et autres
Publié: (2024)
ARK-V1: An LLM-Agent for Knowledge Graph Question Answering Requiring Commonsense Reasoning
par: Klein, Jan-Felix, et autres
Publié: (2025)
par: Klein, Jan-Felix, et autres
Publié: (2025)
QA-prompting: Improving Summarization with Large Language Models using Question-Answering
par: Sinha, Neelabh
Publié: (2025)
par: Sinha, Neelabh
Publié: (2025)
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
par: Li, Guangwei, et autres
Publié: (2025)
par: Li, Guangwei, et autres
Publié: (2025)
JDocQA: Japanese Document Question Answering Dataset for Generative Language Models
par: Onami, Eri, et autres
Publié: (2024)
par: Onami, Eri, et autres
Publié: (2024)
Question-Answering (QA) Model for a Personalized Learning Assistant for Arabic Language
par: Sammoudi, Mohammad, et autres
Publié: (2024)
par: Sammoudi, Mohammad, et autres
Publié: (2024)
Multimodal Commonsense Knowledge Distillation for Visual Question Answering
par: Yang, Shuo, et autres
Publié: (2024)
par: Yang, Shuo, et autres
Publié: (2024)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
par: Mastrokostas, Charalampos, et autres
Publié: (2026)
par: Mastrokostas, Charalampos, et autres
Publié: (2026)
DiscoTrace: Representing and Comparing Answering Strategies of Humans and LLMs in Information-Seeking Question Answering
par: Srikanth, Neha, et autres
Publié: (2026)
par: Srikanth, Neha, et autres
Publié: (2026)
Reporting and Analysing the Environmental Impact of Language Models on the Example of Commonsense Question Answering with External Knowledge
par: Usmanova, Aida, et autres
Publié: (2024)
par: Usmanova, Aida, et autres
Publié: (2024)
PolQA: Polish Question Answering Dataset
par: Rybak, Piotr, et autres
Publié: (2022)
par: Rybak, Piotr, et autres
Publié: (2022)
BUCA: A Binary Classification Approach to Unsupervised Commonsense Question Answering
par: He, Jie, et autres
Publié: (2023)
par: He, Jie, et autres
Publié: (2023)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
par: Alonso, Iñigo, et autres
Publié: (2024)
par: Alonso, Iñigo, et autres
Publié: (2024)
ScholarChemQA: Unveiling the Power of Language Models in Chemical Research Question Answering
par: Chen, Xiuying, et autres
Publié: (2024)
par: Chen, Xiuying, et autres
Publié: (2024)
Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards
par: Pisano, Raffaele, et autres
Publié: (2026)
par: Pisano, Raffaele, et autres
Publié: (2026)
CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question Answering
par: Liu, Yu, et autres
Publié: (2026)
par: Liu, Yu, et autres
Publié: (2026)
DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management
par: Chen, Zhitong, et autres
Publié: (2026)
par: Chen, Zhitong, et autres
Publié: (2026)
Do Large Language Models Understand Word Senses?
par: Meconi, Domenico, et autres
Publié: (2025)
par: Meconi, Domenico, et autres
Publié: (2025)
LittiChoQA: Literary Texts in Indic Languages Chosen for Question Answering
par: Khandelwal, Aarya, et autres
Publié: (2026)
par: Khandelwal, Aarya, et autres
Publié: (2026)
MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
Do Large Language Models Have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMs
par: Guo, Yanzhu, et autres
Publié: (2024)
par: Guo, Yanzhu, et autres
Publié: (2024)
In Their Own Words: Reasoning Traces Tailored for Small Models Make Them Better Reasoners
par: Kim, Jaehoon, et autres
Publié: (2025)
par: Kim, Jaehoon, et autres
Publié: (2025)
FENICE: Factuality Evaluation of summarization based on Natural language Inference and Claim Extraction
par: Scirè, Alessandro, et autres
Publié: (2024)
par: Scirè, Alessandro, et autres
Publié: (2024)
MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
par: Bahaj, Adil, et autres
Publié: (2025)
par: Bahaj, Adil, et autres
Publié: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
par: Wang, Yanling, et autres
Publié: (2025)
par: Wang, Yanling, et autres
Publié: (2025)
Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering
par: Ferguson, Nick, et autres
Publié: (2025)
par: Ferguson, Nick, et autres
Publié: (2025)
M2QA: Multi-domain Multilingual Question Answering
par: Engländer, Leon, et autres
Publié: (2024)
par: Engländer, Leon, et autres
Publié: (2024)
Tracing Uncertainty in Language Model "Reasoning"
par: Grünefeld, Nils, et autres
Publié: (2026)
par: Grünefeld, Nils, et autres
Publié: (2026)
RetinaQA: A Robust Knowledge Base Question Answering Model for both Answerable and Unanswerable Questions
par: Faldu, Prayushi, et autres
Publié: (2024)
par: Faldu, Prayushi, et autres
Publié: (2024)
AgREE: Agentic Reasoning for Knowledge Graph Completion on Emerging Entities
par: Zhao, Ruochen, et autres
Publié: (2025)
par: Zhao, Ruochen, et autres
Publié: (2025)
Documents similaires
-
ZEBRA: Zero-Shot Example-Based Retrieval Augmentation for Commonsense Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2024) -
Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2025) -
LiteraryQA: Towards Effective Evaluation of Long-document Narrative QA
par: Bonomo, Tommaso, et autres
Publié: (2025) -
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
par: Quan, Yinzhu, et autres
Publié: (2024) -
Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question Answering
par: Toroghi, Armin, et autres
Publié: (2024)