RESPONSE: Benchmarking the Ability of Language Models to Undertake Commonsense Reasoning in Crisis Situation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Diallo, Aissatou, Bikakis, Antonis, Dickens, Luke, Hunter, Anthony, Miller, Rob |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PizzaCommonSense: Learning to Model Commonsense Reasoning about Intermediate Steps in Cooking Recipes
par: Diallo, Aissatou, et autres
Publié: (2024)
par: Diallo, Aissatou, et autres
Publié: (2024)
Rule-Guided Feedback: Enhancing Reasoning by Enforcing Rule Adherence in Large Language Models
par: Diallo, Aissatou, et autres
Publié: (2025)
par: Diallo, Aissatou, et autres
Publié: (2025)
IAO Prompting: Making Knowledge Flow Explicit in LLMs through Structured Reasoning Templates
par: Diallo, Aissatou, et autres
Publié: (2025)
par: Diallo, Aissatou, et autres
Publié: (2025)
Unsupervised Learning of Graph from Recipes
par: Diallo, Aissatou, et autres
Publié: (2024)
par: Diallo, Aissatou, et autres
Publié: (2024)
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions
par: Cohn, Anthony G, et autres
Publié: (2024)
par: Cohn, Anthony G, et autres
Publié: (2024)
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited
par: Cohn, Anthony G, et autres
Publié: (2025)
par: Cohn, Anthony G, et autres
Publié: (2025)
SCoRE: Benchmarking Long-Chain Reasoning in Commonsense Scenarios
par: Zhan, Weidong, et autres
Publié: (2025)
par: Zhan, Weidong, et autres
Publié: (2025)
Thai Winograd Schemas: A Benchmark for Thai Commonsense Reasoning
par: Artkaew, Phakphum
Publié: (2024)
par: Artkaew, Phakphum
Publié: (2024)
LOGICAL-COMMONSENSEQA: A Benchmark for Logical Commonsense Reasoning
par: Junias, Obed, et autres
Publié: (2026)
par: Junias, Obed, et autres
Publié: (2026)
Benchmarking Chinese Commonsense Reasoning with a Multi-hop Reasoning Perspective
par: You, Wangjie, et autres
Publié: (2025)
par: You, Wangjie, et autres
Publié: (2025)
The Odyssey of Commonsense Causality: From Foundational Benchmarks to Cutting-Edge Reasoning
par: Cui, Shaobo, et autres
Publié: (2024)
par: Cui, Shaobo, et autres
Publié: (2024)
Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization Correlations
par: Sun, Jiaxing, et autres
Publié: (2024)
par: Sun, Jiaxing, et autres
Publié: (2024)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
par: Xiong, Kai, et autres
Publié: (2025)
par: Xiong, Kai, et autres
Publié: (2025)
Plausibly Problematic Questions in Multiple-Choice Benchmarks for Commonsense Reasoning
par: Palta, Shramay, et autres
Publié: (2024)
par: Palta, Shramay, et autres
Publié: (2024)
Commonsense Reasoning in Arab Culture
par: Sadallah, Abdelrahman, et autres
Publié: (2025)
par: Sadallah, Abdelrahman, et autres
Publié: (2025)
Beyond Chains of Thought: Benchmarking Latent-Space Reasoning Abilities in Large Language Models
par: Hagendorff, Thilo, et autres
Publié: (2025)
par: Hagendorff, Thilo, et autres
Publié: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
par: Wang, Yuqing, et autres
Publié: (2023)
par: Wang, Yuqing, et autres
Publié: (2023)
Lost in the Middle, and In-Between: Enhancing Language Models' Ability to Reason Over Long Contexts in Multi-Hop QA
par: Baker, George Arthur, et autres
Publié: (2024)
par: Baker, George Arthur, et autres
Publié: (2024)
Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not
par: Karakaş, Sercan
Publié: (2026)
par: Karakaş, Sercan
Publié: (2026)
BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
par: Tang, Yuzhe
Publié: (2026)
par: Tang, Yuzhe
Publié: (2026)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
par: Gui, Jiayi, et autres
Publié: (2024)
par: Gui, Jiayi, et autres
Publié: (2024)
MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset
par: Wang, Weiqi, et autres
Publié: (2024)
par: Wang, Weiqi, et autres
Publié: (2024)
CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense Reasoning
par: Wang, Weiqi, et autres
Publié: (2024)
par: Wang, Weiqi, et autres
Publié: (2024)
ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoning
par: Zhang, Liyu, et autres
Publié: (2024)
par: Zhang, Liyu, et autres
Publié: (2024)
GRASP: A Grid-Based Benchmark for Evaluating Commonsense Spatial Reasoning
par: Tang, Zhisheng, et autres
Publié: (2024)
par: Tang, Zhisheng, et autres
Publié: (2024)
Global PIQA: Evaluating Commonsense Reasoning Across 100+ Languages and Cultures
par: Chang, Tyler A., et autres
Publié: (2025)
par: Chang, Tyler A., et autres
Publié: (2025)
Synthetic Data Generation for Training Diversified Commonsense Reasoning Models
par: Zhang, Tianhui, et autres
Publié: (2026)
par: Zhang, Tianhui, et autres
Publié: (2026)
LINKED: Eliciting, Filtering and Integrating Knowledge in Large Language Model for Commonsense Reasoning
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2025)
par: Molfese, Francesco Maria, et autres
Publié: (2025)
Measuring Error Alignment for Decision-Making Systems
par: Xu, Binxia, et autres
Publié: (2024)
par: Xu, Binxia, et autres
Publié: (2024)
Optimizing Language Model's Reasoning Abilities with Weak Supervision
par: Tong, Yongqi, et autres
Publié: (2024)
par: Tong, Yongqi, et autres
Publié: (2024)
Disentangling Memory and Reasoning Ability in Large Language Models
par: Jin, Mingyu, et autres
Publié: (2024)
par: Jin, Mingyu, et autres
Publié: (2024)
From Data to Commonsense Reasoning: The Use of Large Language Models for Explainable AI
par: Krause, Stefanie, et autres
Publié: (2024)
par: Krause, Stefanie, et autres
Publié: (2024)
Physical Commonsense Reasoning for Lower-Resourced Languages and Dialects: a Study on Basque
par: Bengoetxea, Jaione, et autres
Publié: (2026)
par: Bengoetxea, Jaione, et autres
Publié: (2026)
CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
par: Toroghi, Armin, et autres
Publié: (2026)
par: Toroghi, Armin, et autres
Publié: (2026)
Leveraging Explicit Reasoning for Inference Integration in Commonsense-Augmented Dialogue Models
par: Finch, Sarah E., et autres
Publié: (2024)
par: Finch, Sarah E., et autres
Publié: (2024)
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
par: Do, Quyet V., et autres
Publié: (2024)
par: Do, Quyet V., et autres
Publié: (2024)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
par: Zhou, Kaiwen, et autres
Publié: (2023)
par: Zhou, Kaiwen, et autres
Publié: (2023)
LLM-Powered Automatic Translation and Urgency in Crisis Scenarios
par: Ticona, Belu, et autres
Publié: (2026)
par: Ticona, Belu, et autres
Publié: (2026)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2025)
par: Li, Xiaoyuan, et autres
Publié: (2025)
Documents similaires
-
PizzaCommonSense: Learning to Model Commonsense Reasoning about Intermediate Steps in Cooking Recipes
par: Diallo, Aissatou, et autres
Publié: (2024) -
Rule-Guided Feedback: Enhancing Reasoning by Enforcing Rule Adherence in Large Language Models
par: Diallo, Aissatou, et autres
Publié: (2025) -
IAO Prompting: Making Knowledge Flow Explicit in LLMs through Structured Reasoning Templates
par: Diallo, Aissatou, et autres
Publié: (2025) -
Unsupervised Learning of Graph from Recipes
par: Diallo, Aissatou, et autres
Publié: (2024) -
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions
par: Cohn, Anthony G, et autres
Publié: (2024)