CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Toroghi, Armin, Kalarde, Faeze Moradi, Sanner, Scott |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoLoTa: A Dataset for Entity-based Commonsense Reasoning over Long-Tail Knowledge
por: Toroghi, Armin, et al.
Publicado: (2025)
por: Toroghi, Armin, et al.
Publicado: (2025)
CR-LT-KGQA: A Knowledge Graph Question Answering Dataset Requiring Commonsense Reasoning and Long-Tail Knowledge
por: Guo, Willis, et al.
Publicado: (2024)
por: Guo, Willis, et al.
Publicado: (2024)
Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question Answering
por: Toroghi, Armin, et al.
Publicado: (2024)
por: Toroghi, Armin, et al.
Publicado: (2024)
Goal-Oriented Reasoning for RAG-based Memory in Conversational Agentic LLM Systems
por: Liang, Jiazhou, et al.
Publicado: (2026)
por: Liang, Jiazhou, et al.
Publicado: (2026)
Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation
por: Austin, David Eric, et al.
Publicado: (2024)
por: Austin, David Eric, et al.
Publicado: (2024)
Semantic XPath: Structured Agentic Memory Access for Conversational AI
por: Liu, Yifan Simon, et al.
Publicado: (2026)
por: Liu, Yifan Simon, et al.
Publicado: (2026)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
por: Xiong, Kai, et al.
Publicado: (2025)
por: Xiong, Kai, et al.
Publicado: (2025)
Zero-Shot Commonsense Validation and Reasoning with Large Language Models: An Evaluation on SemEval-2020 Task 4 Dataset
por: Alfugaha, Rawand, et al.
Publicado: (2025)
por: Alfugaha, Rawand, et al.
Publicado: (2025)
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
por: Do, Quyet V., et al.
Publicado: (2024)
por: Do, Quyet V., et al.
Publicado: (2024)
Commonsense Generation and Evaluation for Dialogue Systems using Large Language Models
por: Estecha-Garitagoitia, Marcos, et al.
Publicado: (2025)
por: Estecha-Garitagoitia, Marcos, et al.
Publicado: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Doing Good or Doing Right? Exploring the Weakness of Commonsense Causal Reasoning Models
por: Han, Mingyue, et al.
Publicado: (2021)
por: Han, Mingyue, et al.
Publicado: (2021)
Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not
por: Karakaş, Sercan
Publicado: (2026)
por: Karakaş, Sercan
Publicado: (2026)
BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
por: Tang, Yuzhe
Publicado: (2026)
por: Tang, Yuzhe
Publicado: (2026)
PizzaCommonSense: Learning to Model Commonsense Reasoning about Intermediate Steps in Cooking Recipes
por: Diallo, Aissatou, et al.
Publicado: (2024)
por: Diallo, Aissatou, et al.
Publicado: (2024)
CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense Reasoning
por: Wang, Weiqi, et al.
Publicado: (2024)
por: Wang, Weiqi, et al.
Publicado: (2024)
ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoning
por: Zhang, Liyu, et al.
Publicado: (2024)
por: Zhang, Liyu, et al.
Publicado: (2024)
Global PIQA: Evaluating Commonsense Reasoning Across 100+ Languages and Cultures
por: Chang, Tyler A., et al.
Publicado: (2025)
por: Chang, Tyler A., et al.
Publicado: (2025)
LINKED: Eliciting, Filtering and Integrating Knowledge in Large Language Model for Commonsense Reasoning
por: Li, Jiachun, et al.
Publicado: (2024)
por: Li, Jiachun, et al.
Publicado: (2024)
The Odyssey of Commonsense Causality: From Foundational Benchmarks to Cutting-Edge Reasoning
por: Cui, Shaobo, et al.
Publicado: (2024)
por: Cui, Shaobo, et al.
Publicado: (2024)
ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
por: Molfese, Francesco Maria, et al.
Publicado: (2025)
por: Molfese, Francesco Maria, et al.
Publicado: (2025)
From Data to Commonsense Reasoning: The Use of Large Language Models for Explainable AI
por: Krause, Stefanie, et al.
Publicado: (2024)
por: Krause, Stefanie, et al.
Publicado: (2024)
GRASP: A Grid-Based Benchmark for Evaluating Commonsense Spatial Reasoning
por: Tang, Zhisheng, et al.
Publicado: (2024)
por: Tang, Zhisheng, et al.
Publicado: (2024)
Modelling Commonsense Commonalities with Multi-Facet Concept Embeddings
por: Kteich, Hanane, et al.
Publicado: (2024)
por: Kteich, Hanane, et al.
Publicado: (2024)
ACORN: Aspect-wise Commonsense Reasoning Explanation Evaluation
por: Brassard, Ana, et al.
Publicado: (2024)
por: Brassard, Ana, et al.
Publicado: (2024)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
por: Zhou, Kaiwen, et al.
Publicado: (2023)
por: Zhou, Kaiwen, et al.
Publicado: (2023)
Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context
por: Choi, Dasol, et al.
Publicado: (2025)
por: Choi, Dasol, et al.
Publicado: (2025)
Understanding the Capabilities and Limitations of Large Language Models for Cultural Commonsense
por: Shen, Siqi, et al.
Publicado: (2024)
por: Shen, Siqi, et al.
Publicado: (2024)
mCSQA: Multilingual Commonsense Reasoning Dataset with Unified Creation Strategy by Language Models and Humans
por: Sakai, Yusuke, et al.
Publicado: (2024)
por: Sakai, Yusuke, et al.
Publicado: (2024)
BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models
por: Xie, Tian, et al.
Publicado: (2025)
por: Xie, Tian, et al.
Publicado: (2025)
Q-STRUM Debate: Query-Driven Contrastive Summarization for Recommendation Comparison
por: Saad, George-Kirollos, et al.
Publicado: (2025)
por: Saad, George-Kirollos, et al.
Publicado: (2025)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
por: Li, Xiaoyuan, et al.
Publicado: (2025)
por: Li, Xiaoyuan, et al.
Publicado: (2025)
The Box is in the Pen: Evaluating Commonsense Reasoning in Neural Machine Translation
por: He, Jie, et al.
Publicado: (2025)
por: He, Jie, et al.
Publicado: (2025)
Archer: A Human-Labeled Text-to-SQL Dataset with Arithmetic, Commonsense and Hypothetical Reasoning
por: Zheng, Danna, et al.
Publicado: (2024)
por: Zheng, Danna, et al.
Publicado: (2024)
Commonsense Reasoning in Arab Culture
por: Sadallah, Abdelrahman, et al.
Publicado: (2025)
por: Sadallah, Abdelrahman, et al.
Publicado: (2025)
RESPONSE: Benchmarking the Ability of Language Models to Undertake Commonsense Reasoning in Crisis Situation
por: Diallo, Aissatou, et al.
Publicado: (2025)
por: Diallo, Aissatou, et al.
Publicado: (2025)
Bias Mitigation or Cultural Commonsense? Evaluating LLMs with a Japanese Dataset
por: Yamamoto, Taisei, et al.
Publicado: (2025)
por: Yamamoto, Taisei, et al.
Publicado: (2025)
Common to Whom? Regional Cultural Commonsense and LLM Bias in India
por: Madhusudan, Sangmitra, et al.
Publicado: (2026)
por: Madhusudan, Sangmitra, et al.
Publicado: (2026)
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
por: Tu, Ruibo, et al.
Publicado: (2024)
por: Tu, Ruibo, et al.
Publicado: (2024)
Reasoning Up the Instruction Ladder for Controllable Language Models
por: Zheng, Zishuo, et al.
Publicado: (2025)
por: Zheng, Zishuo, et al.
Publicado: (2025)
Ejemplares similares
-
CoLoTa: A Dataset for Entity-based Commonsense Reasoning over Long-Tail Knowledge
por: Toroghi, Armin, et al.
Publicado: (2025) -
CR-LT-KGQA: A Knowledge Graph Question Answering Dataset Requiring Commonsense Reasoning and Long-Tail Knowledge
por: Guo, Willis, et al.
Publicado: (2024) -
Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question Answering
por: Toroghi, Armin, et al.
Publicado: (2024) -
Goal-Oriented Reasoning for RAG-based Memory in Conversational Agentic LLM Systems
por: Liang, Jiazhou, et al.
Publicado: (2026) -
Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation
por: Austin, David Eric, et al.
Publicado: (2024)