A Comprehensive Evaluation on Event Reasoning of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tao, Zhengwei, Jin, Zhi, Zhang, Yifan, Chen, Xiancai, Zhao, Haiyan, Li, Jia, Liang, Bing, Tao, Chongyang, Liu, Qun, Wong, Kam-Fai |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EVIT: Event-Oriented Instruction Tuning for Event Reasoning
by: Tao, Zhengwei, et al.
Published: (2024)
by: Tao, Zhengwei, et al.
Published: (2024)
MEEL: Multi-Modal Event Evolution Learning
by: Tao, Zhengwei, et al.
Published: (2024)
by: Tao, Zhengwei, et al.
Published: (2024)
PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation
by: Tao, Zhengwei, et al.
Published: (2025)
by: Tao, Zhengwei, et al.
Published: (2025)
A Survey on Self-Evolution of Large Language Models
by: Tao, Zhengwei, et al.
Published: (2024)
by: Tao, Zhengwei, et al.
Published: (2024)
Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models
by: Wang, Rui, et al.
Published: (2025)
by: Wang, Rui, et al.
Published: (2025)
Dual-Density Inference for Efficient Language Model Reasoning
by: Zhao, Zhengyi, et al.
Published: (2025)
by: Zhao, Zhengyi, et al.
Published: (2025)
MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models
by: Xue, Boyang, et al.
Published: (2024)
by: Xue, Boyang, et al.
Published: (2024)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
by: Xue, Boyang, et al.
Published: (2025)
by: Xue, Boyang, et al.
Published: (2025)
Leveraging Large Language Models for NLG Evaluation: Advances and Challenges
by: Li, Zhen, et al.
Published: (2024)
by: Li, Zhen, et al.
Published: (2024)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
by: Kwan, Wai-Chung, et al.
Published: (2024)
by: Kwan, Wai-Chung, et al.
Published: (2024)
MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models
by: Xue, Boyang, et al.
Published: (2024)
by: Xue, Boyang, et al.
Published: (2024)
IndiVec: An Exploration of Leveraging Large Language Models for Media Bias Detection with Fine-Grained Bias Indicators
by: Lin, Luyang, et al.
Published: (2024)
by: Lin, Luyang, et al.
Published: (2024)
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
by: Chen, Liang, et al.
Published: (2025)
by: Chen, Liang, et al.
Published: (2025)
Integrating Physician Diagnostic Logic into Large Language Models: Preference Learning from Process Feedback
by: Dou, Chengfeng, et al.
Published: (2024)
by: Dou, Chengfeng, et al.
Published: (2024)
M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models
by: Kwan, Wai-Chung, et al.
Published: (2023)
by: Kwan, Wai-Chung, et al.
Published: (2023)
Re-Reading Improves Reasoning in Large Language Models
by: Xu, Xiaohan, et al.
Published: (2023)
by: Xu, Xiaohan, et al.
Published: (2023)
Selective Forgetting: Advancing Machine Unlearning Techniques and Evaluation in Language Models
by: Wang, Lingzhi, et al.
Published: (2024)
by: Wang, Lingzhi, et al.
Published: (2024)
Self-Reasoning Language Models: Unfold Hidden Reasoning Chains with Few Reasoning Catalyst
by: Wang, Hongru, et al.
Published: (2025)
by: Wang, Hongru, et al.
Published: (2025)
Mitigating Biases of Large Language Models in Stance Detection with Counterfactual Augmented Calibration
by: Li, Ang, et al.
Published: (2024)
by: Li, Ang, et al.
Published: (2024)
Exploring LLM-based Data Annotation Strategies for Medical Dialogue Preference Alignment
by: Dou, Chengfeng, et al.
Published: (2024)
by: Dou, Chengfeng, et al.
Published: (2024)
EventWeave: A Dynamic Framework for Capturing Core and Supporting Events in Dialogue Systems
by: Zhao, Zhengyi, et al.
Published: (2025)
by: Zhao, Zhengyi, et al.
Published: (2025)
OSPC: Detecting Harmful Memes with Large Language Model as a Catalyst
by: Cao, Jingtao, et al.
Published: (2024)
by: Cao, Jingtao, et al.
Published: (2024)
A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting
by: Chang, He, et al.
Published: (2024)
by: Chang, He, et al.
Published: (2024)
FReM: A Flexible Reasoning Mechanism for Balancing Quick and Slow Thinking in Long-Context Question Answering
by: Zhao, Zhengyi, et al.
Published: (2025)
by: Zhao, Zhengyi, et al.
Published: (2025)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
Enhancing Large Language Models Against Inductive Instructions with Dual-critique Prompting
by: Wang, Rui, et al.
Published: (2023)
by: Wang, Rui, et al.
Published: (2023)
DAST: Difficulty-Aware Self-Training on Large Language Models
by: Xue, Boyang, et al.
Published: (2025)
by: Xue, Boyang, et al.
Published: (2025)
Enhancing LLM Generation with Knowledge Hypergraph for Evidence-Based Medicine
by: Dou, Chengfeng, et al.
Published: (2025)
by: Dou, Chengfeng, et al.
Published: (2025)
ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning
by: Du, Yiming, et al.
Published: (2025)
by: Du, Yiming, et al.
Published: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
by: Chu, Zheng, et al.
Published: (2023)
by: Chu, Zheng, et al.
Published: (2023)
WHERE and WHICH: Iterative Debate for Biomedical Synthetic Data Augmentation
by: Zhao, Zhengyi, et al.
Published: (2025)
by: Zhao, Zhengyi, et al.
Published: (2025)
A Survey of the Evolution of Language Model-Based Dialogue Systems: Data, Task and Models
by: Wang, Hongru, et al.
Published: (2023)
by: Wang, Hongru, et al.
Published: (2023)
Role Prompting Guided Domain Adaptation with General Capability Preserve for Large Language Models
by: Wang, Rui, et al.
Published: (2024)
by: Wang, Rui, et al.
Published: (2024)
A Survey on Knowledge Distillation of Large Language Models
by: Xu, Xiaohan, et al.
Published: (2024)
by: Xu, Xiaohan, et al.
Published: (2024)
PEARL: Towards Permutation-Resilient LLMs
by: Chen, Liang, et al.
Published: (2025)
by: Chen, Liang, et al.
Published: (2025)
Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models
by: Zou, Shun, et al.
Published: (2026)
by: Zou, Shun, et al.
Published: (2026)
Meta-Task Prompting Elicits Embeddings from Large Language Models
by: Lei, Yibin, et al.
Published: (2024)
by: Lei, Yibin, et al.
Published: (2024)
LLMs are Also Effective Embedding Models: An In-depth Overview
by: Tao, Chongyang, et al.
Published: (2024)
by: Tao, Chongyang, et al.
Published: (2024)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
by: Wang, Zezhong, et al.
Published: (2025)
by: Wang, Zezhong, et al.
Published: (2025)
Large Language Models as an Indirect Reasoner: Contrapositive and Contradiction for Automated Reasoning
by: Zhang, Yanfang, et al.
Published: (2024)
by: Zhang, Yanfang, et al.
Published: (2024)
Similar Items
-
EVIT: Event-Oriented Instruction Tuning for Event Reasoning
by: Tao, Zhengwei, et al.
Published: (2024) -
MEEL: Multi-Modal Event Evolution Learning
by: Tao, Zhengwei, et al.
Published: (2024) -
PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation
by: Tao, Zhengwei, et al.
Published: (2025) -
A Survey on Self-Evolution of Large Language Models
by: Tao, Zhengwei, et al.
Published: (2024) -
Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models
by: Wang, Rui, et al.
Published: (2025)