CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Yuefei, Singh, Vivek K., Ma, Jing, Tang, Ruixiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Evaluating Counterfactual Strategic Reasoning in Large Language Models
von: Georgousis, Dimitrios, et al.
Veröffentlicht: (2026)
von: Georgousis, Dimitrios, et al.
Veröffentlicht: (2026)
TextReasoningBench: Does Reasoning Really Improve Text Classification in Large Language Models?
von: Guo, Xinyu, et al.
Veröffentlicht: (2026)
von: Guo, Xinyu, et al.
Veröffentlicht: (2026)
Where Fake Citations Are Made: Tracing Field-Level Hallucination to Specific Neurons in LLMs
von: Chen, Yuefei, et al.
Veröffentlicht: (2026)
von: Chen, Yuefei, et al.
Veröffentlicht: (2026)
Decoding Knowledge in Large Language Models: A Framework for Categorization and Comprehension
von: Fang, Yanbo, et al.
Veröffentlicht: (2025)
von: Fang, Yanbo, et al.
Veröffentlicht: (2025)
MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction
von: Yang, Zhichao, et al.
Veröffentlicht: (2026)
von: Yang, Zhichao, et al.
Veröffentlicht: (2026)
BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
von: Tang, Yuzhe
Veröffentlicht: (2026)
von: Tang, Yuzhe
Veröffentlicht: (2026)
HealthBench: Evaluating Large Language Models Towards Improved Human Health
von: Arora, Rahul K., et al.
Veröffentlicht: (2025)
von: Arora, Rahul K., et al.
Veröffentlicht: (2025)
Disentangling Memory and Reasoning Ability in Large Language Models
von: Jin, Mingyu, et al.
Veröffentlicht: (2024)
von: Jin, Mingyu, et al.
Veröffentlicht: (2024)
Using Counterfactual Tasks to Evaluate the Generality of Analogical Reasoning in Large Language Models
von: Lewis, Martha, et al.
Veröffentlicht: (2024)
von: Lewis, Martha, et al.
Veröffentlicht: (2024)
SafetyBench: Evaluating the Safety of Large Language Models
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
Measuring and Improving Attentiveness to Partial Inputs with Counterfactuals
von: Elazar, Yanai, et al.
Veröffentlicht: (2023)
von: Elazar, Yanai, et al.
Veröffentlicht: (2023)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
von: Huang, Junquan, et al.
Veröffentlicht: (2025)
von: Huang, Junquan, et al.
Veröffentlicht: (2025)
MalAlgoQA: Pedagogical Evaluation of Counterfactual Reasoning in Large Language Models and Implications for AI in Education
von: Liu, Naiming, et al.
Veröffentlicht: (2024)
von: Liu, Naiming, et al.
Veröffentlicht: (2024)
Medical Reasoning with Large Language Models: A Survey and MR-Bench
von: Ren, Xiaohan, et al.
Veröffentlicht: (2026)
von: Ren, Xiaohan, et al.
Veröffentlicht: (2026)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
von: Zhang, Yazhou, et al.
Veröffentlicht: (2024)
von: Zhang, Yazhou, et al.
Veröffentlicht: (2024)
Re-Reading Improves Reasoning in Large Language Models
von: Xu, Xiaohan, et al.
Veröffentlicht: (2023)
von: Xu, Xiaohan, et al.
Veröffentlicht: (2023)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
von: Tang, Yuqi, et al.
Veröffentlicht: (2025)
von: Tang, Yuqi, et al.
Veröffentlicht: (2025)
Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning
von: You, Zhiwen, et al.
Veröffentlicht: (2026)
von: You, Zhiwen, et al.
Veröffentlicht: (2026)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models
von: Shi, Zeru, et al.
Veröffentlicht: (2026)
von: Shi, Zeru, et al.
Veröffentlicht: (2026)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
von: Lv, Weijiang, et al.
Veröffentlicht: (2026)
von: Lv, Weijiang, et al.
Veröffentlicht: (2026)
LR^2Bench: Evaluating Long-chain Reflective Reasoning Capabilities of Large Language Models via Constraint Satisfaction Problems
von: Chen, Jianghao, et al.
Veröffentlicht: (2025)
von: Chen, Jianghao, et al.
Veröffentlicht: (2025)
GCoder: Improving Large Language Model for Generalized Graph Problem Solving
von: Zhang, Qifan, et al.
Veröffentlicht: (2024)
von: Zhang, Qifan, et al.
Veröffentlicht: (2024)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
von: Zhang, Yiran, et al.
Veröffentlicht: (2025)
von: Zhang, Yiran, et al.
Veröffentlicht: (2025)
Outcome-Constrained Large Language Models for Countering Hate Speech
von: Hong, Lingzi, et al.
Veröffentlicht: (2024)
von: Hong, Lingzi, et al.
Veröffentlicht: (2024)
CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization
von: Li, Junyi, et al.
Veröffentlicht: (2026)
von: Li, Junyi, et al.
Veröffentlicht: (2026)
A Multi-Aspect Framework for Counter Narrative Evaluation using Large Language Models
von: Jones, Jaylen, et al.
Veröffentlicht: (2024)
von: Jones, Jaylen, et al.
Veröffentlicht: (2024)
Evaluating Accounting Reasoning Capabilities of Large Language Models
von: Zhou, Jie, et al.
Veröffentlicht: (2026)
von: Zhou, Jie, et al.
Veröffentlicht: (2026)
HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats
von: Hicks, Rebecca Soskin, et al.
Veröffentlicht: (2026)
von: Hicks, Rebecca Soskin, et al.
Veröffentlicht: (2026)
Think$^{2}$: Grounded Metacognitive Reasoning in Large Language Models
von: Elenjical, Abraham Paul, et al.
Veröffentlicht: (2026)
von: Elenjical, Abraham Paul, et al.
Veröffentlicht: (2026)
THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models
von: Li, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2025)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
von: Que, Haoran, et al.
Veröffentlicht: (2024)
von: Que, Haoran, et al.
Veröffentlicht: (2024)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
von: Poppi, Tobia, et al.
Veröffentlicht: (2026)
von: Poppi, Tobia, et al.
Veröffentlicht: (2026)
LTD-Bench: Evaluating Large Language Models by Letting Them Draw
von: Lin, Liuhao, et al.
Veröffentlicht: (2025)
von: Lin, Liuhao, et al.
Veröffentlicht: (2025)
E-Bench: Towards Evaluating the Ease-of-Use of Large Language Models
von: Zhang, Zhenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Zhenyu, et al.
Veröffentlicht: (2024)
Measuring and Improving Persuasiveness of Large Language Models
von: Singh, Somesh, et al.
Veröffentlicht: (2024)
von: Singh, Somesh, et al.
Veröffentlicht: (2024)
CharacterBench: Benchmarking Character Customization of Large Language Models
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2024)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2024)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Evaluating Counterfactual Strategic Reasoning in Large Language Models
von: Georgousis, Dimitrios, et al.
Veröffentlicht: (2026) -
TextReasoningBench: Does Reasoning Really Improve Text Classification in Large Language Models?
von: Guo, Xinyu, et al.
Veröffentlicht: (2026) -
Where Fake Citations Are Made: Tracing Field-Level Hallucination to Specific Neurons in LLMs
von: Chen, Yuefei, et al.
Veröffentlicht: (2026) -
Decoding Knowledge in Large Language Models: A Framework for Categorization and Comprehension
von: Fang, Yanbo, et al.
Veröffentlicht: (2025) -
MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction
von: Yang, Zhichao, et al.
Veröffentlicht: (2026)