Benchmarking Defeasible Reasoning with Large Language Models -- Initial Experiments and Future Directions
Fuente:
arXiv
Saved in:
| Main Authors: | Tachmazidis, Ilias, Batsakis, Sotiris, Antoniou, Grigoris |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Generalised Approach for Encoding and Reasoning with Qualitative Theories in Answer Set Programming
by: Baryannis, George, et al.
Published: (2020)
by: Baryannis, George, et al.
Published: (2020)
Defeasible Reasoning on Concepts
by: Ding, Yiwen, et al.
Published: (2024)
by: Ding, Yiwen, et al.
Published: (2024)
Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events
by: Chinchure, Aditya, et al.
Published: (2024)
by: Chinchure, Aditya, et al.
Published: (2024)
Exploring Large Language Models for Multimodal Sentiment Analysis: Challenges, Benchmarks, and Future Directions
by: Song, Shezheng
Published: (2024)
by: Song, Shezheng
Published: (2024)
Benchmarking Reasoning Robustness in Large Language Models
by: Yu, Tong, et al.
Published: (2025)
by: Yu, Tong, et al.
Published: (2025)
Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
(Im)possibility of Automated Hallucination Detection in Large Language Models
by: Karbasi, Amin, et al.
Published: (2025)
by: Karbasi, Amin, et al.
Published: (2025)
Towards Propositional KLM-Style Defeasible Standpoint Logics
by: Leisegang, Nicholas, et al.
Published: (2024)
by: Leisegang, Nicholas, et al.
Published: (2024)
A Defeasible Deontic Calculus for Resolving Norm Conflicts
by: Olson, Taylor, et al.
Published: (2024)
by: Olson, Taylor, et al.
Published: (2024)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
by: Hu, Yuwei, et al.
Published: (2025)
by: Hu, Yuwei, et al.
Published: (2025)
Do Multimodal Language Models Really Understand Direction? A Benchmark for Compass Direction Reasoning
by: Yin, Hang, et al.
Published: (2024)
by: Yin, Hang, et al.
Published: (2024)
Extending Defeasibility for Propositional Standpoint Logics
by: Leisegang, Nicholas, et al.
Published: (2025)
by: Leisegang, Nicholas, et al.
Published: (2025)
A Survey of Personalized Large Language Models: Progress and Future Directions
by: Liu, Jiahong, et al.
Published: (2025)
by: Liu, Jiahong, et al.
Published: (2025)
Privacy in Fine-tuning Large Language Models: Attacks, Defenses, and Future Directions
by: Du, Hao, et al.
Published: (2024)
by: Du, Hao, et al.
Published: (2024)
Defeasible Conditionals using Answer Set Programming
by: Dennison, Racquel, et al.
Published: (2026)
by: Dennison, Racquel, et al.
Published: (2026)
AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions
by: Chen, Chen, et al.
Published: (2024)
by: Chen, Chen, et al.
Published: (2024)
Large Language Models for Causal Discovery: Current Landscape and Future Directions
by: Wan, Guangya, et al.
Published: (2024)
by: Wan, Guangya, et al.
Published: (2024)
Privacy-Preserving Large Language Models: Mechanisms, Applications, and Future Directions
by: Zhao, Guoshenghui, et al.
Published: (2024)
by: Zhao, Guoshenghui, et al.
Published: (2024)
Federated Large Language Models: Feasibility, Robustness, Security and Future Directions
by: Jiang, Wenhao, et al.
Published: (2025)
by: Jiang, Wenhao, et al.
Published: (2025)
Relative Expressiveness of Defeasible Logics II
by: Maher, Michael J.
Published: (2021)
by: Maher, Michael J.
Published: (2021)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
by: Ding, Jiayu, et al.
Published: (2025)
by: Ding, Jiayu, et al.
Published: (2025)
SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
by: Miao, Zhongjian, et al.
Published: (2025)
by: Miao, Zhongjian, et al.
Published: (2025)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
by: Zhu, Yakun, et al.
Published: (2025)
by: Zhu, Yakun, et al.
Published: (2025)
Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions
by: Zhang, Kun, et al.
Published: (2025)
by: Zhang, Kun, et al.
Published: (2025)
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
by: Fan, Mingyuan, et al.
Published: (2026)
by: Fan, Mingyuan, et al.
Published: (2026)
Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods
by: Liu, Weichen, et al.
Published: (2025)
by: Liu, Weichen, et al.
Published: (2025)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
by: Zhang, Junkai, et al.
Published: (2025)
by: Zhang, Junkai, et al.
Published: (2025)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
by: Tang, Weizhi, et al.
Published: (2024)
by: Tang, Weizhi, et al.
Published: (2024)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
by: Yu, Zhouliang, et al.
Published: (2025)
by: Yu, Zhouliang, et al.
Published: (2025)
Defeasible Reasoning via Datalog$^\neg$
by: Maher, Michael J.
Published: (2021)
by: Maher, Michael J.
Published: (2021)
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
by: Liu, Jiacai, et al.
Published: (2024)
by: Liu, Jiacai, et al.
Published: (2024)
Initial Steps in Integrating Large Reasoning and Action Models for Service Composition
by: Georgievski, Ilche, et al.
Published: (2025)
by: Georgievski, Ilche, et al.
Published: (2025)
Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
by: Yu, Wenhan, et al.
Published: (2025)
by: Yu, Wenhan, et al.
Published: (2025)
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
by: Yin, Qiyue, et al.
Published: (2025)
by: Yin, Qiyue, et al.
Published: (2025)
LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends
by: Cui, Can, et al.
Published: (2024)
by: Cui, Can, et al.
Published: (2024)
What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models
by: Yun, Tian, et al.
Published: (2025)
by: Yun, Tian, et al.
Published: (2025)
Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation
by: Tang, Weiliang, et al.
Published: (2025)
by: Tang, Weiliang, et al.
Published: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
by: Gui, Jiayi, et al.
Published: (2024)
by: Gui, Jiayi, et al.
Published: (2024)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
by: Amjad, Husnain, et al.
Published: (2026)
by: Amjad, Husnain, et al.
Published: (2026)
SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models
by: Yang, Wanqi, et al.
Published: (2025)
by: Yang, Wanqi, et al.
Published: (2025)
Similar Items
-
A Generalised Approach for Encoding and Reasoning with Qualitative Theories in Answer Set Programming
by: Baryannis, George, et al.
Published: (2020) -
Defeasible Reasoning on Concepts
by: Ding, Yiwen, et al.
Published: (2024) -
Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events
by: Chinchure, Aditya, et al.
Published: (2024) -
Exploring Large Language Models for Multimodal Sentiment Analysis: Challenges, Benchmarks, and Future Directions
by: Song, Shezheng
Published: (2024) -
Benchmarking Reasoning Robustness in Large Language Models
by: Yu, Tong, et al.
Published: (2025)