SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Miao, Zhongjian, Fu, Hao, Wei, Chen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking Real-Time Question Answering via Executable Code Workflows
par: Zhou, Wenjie, et autres
Publié: (2026)
par: Zhou, Wenjie, et autres
Publié: (2026)
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
par: Chen, Hao-Yuan
Publié: (2026)
par: Chen, Hao-Yuan
Publié: (2026)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
par: Tang, Weizhi, et autres
Publié: (2024)
par: Tang, Weizhi, et autres
Publié: (2024)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
par: Hu, Yuwei, et autres
Publié: (2025)
par: Hu, Yuwei, et autres
Publié: (2025)
Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank
par: Liu, Jiayu, et autres
Publié: (2025)
par: Liu, Jiayu, et autres
Publié: (2025)
Benchmarking Reasoning Robustness in Large Language Models
par: Yu, Tong, et autres
Publié: (2025)
par: Yu, Tong, et autres
Publié: (2025)
Narrative-of-Thought: Improving Temporal Reasoning of Large Language Models via Recounted Narratives
par: Zhang, Xinliang Frederick, et autres
Publié: (2024)
par: Zhang, Xinliang Frederick, et autres
Publié: (2024)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
par: Ding, Jiayu, et autres
Publié: (2025)
par: Ding, Jiayu, et autres
Publié: (2025)
SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models
par: Yang, Wanqi, et autres
Publié: (2025)
par: Yang, Wanqi, et autres
Publié: (2025)
Improving Arithmetic Reasoning Ability of Large Language Models through Relation Tuples, Verification and Dynamic Feedback
par: Miao, Zhongtao, et autres
Publié: (2024)
par: Miao, Zhongtao, et autres
Publié: (2024)
AdapTime: Enabling Adaptive Temporal Reasoning in Large Language Models
par: Deng, Yimin, et autres
Publié: (2026)
par: Deng, Yimin, et autres
Publié: (2026)
Hypothesis Testing Prompting Improves Deductive Reasoning in Large Language Models
par: Li, Yitian, et autres
Publié: (2024)
par: Li, Yitian, et autres
Publié: (2024)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
Towards Explainable Temporal Reasoning in Large Language Models: A Structure-Aware Generative Framework
par: Jiang, Zihao, et autres
Publié: (2025)
par: Jiang, Zihao, et autres
Publié: (2025)
Enhance Reasoning for Large Language Models in the Game Werewolf
par: Wu, Shuang, et autres
Publié: (2024)
par: Wu, Shuang, et autres
Publié: (2024)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
par: Zhu, Yakun, et autres
Publié: (2025)
par: Zhu, Yakun, et autres
Publié: (2025)
Large Language Models-guided Dynamic Adaptation for Temporal Knowledge Graph Reasoning
par: Wang, Jiapu, et autres
Publié: (2024)
par: Wang, Jiapu, et autres
Publié: (2024)
CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models
par: Zhang, Yongheng, et autres
Publié: (2025)
par: Zhang, Yongheng, et autres
Publié: (2025)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
par: Fu, Ling, et autres
Publié: (2024)
par: Fu, Ling, et autres
Publié: (2024)
Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods
par: Liu, Weichen, et autres
Publié: (2025)
par: Liu, Weichen, et autres
Publié: (2025)
Multi-Agents Based on Large Language Models for Knowledge-based Visual Question Answering
par: Hu, Zhongjian, et autres
Publié: (2024)
par: Hu, Zhongjian, et autres
Publié: (2024)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
par: Li, Jingyao, et autres
Publié: (2025)
par: Li, Jingyao, et autres
Publié: (2025)
Oedipus and the Sphinx: Benchmarking and Improving Visual Language Models for Complex Graphic Reasoning
par: Zhang, Jianyi, et autres
Publié: (2025)
par: Zhang, Jianyi, et autres
Publié: (2025)
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
par: Fan, Mingyuan, et autres
Publié: (2026)
par: Fan, Mingyuan, et autres
Publié: (2026)
What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?
par: Bhatia, Gagan, et autres
Publié: (2026)
par: Bhatia, Gagan, et autres
Publié: (2026)
EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning
par: Wei, Mingyang, et autres
Publié: (2026)
par: Wei, Mingyang, et autres
Publié: (2026)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
par: Xie, Zhifei, et autres
Publié: (2025)
par: Xie, Zhifei, et autres
Publié: (2025)
A Survey of Scaling in Large Language Model Reasoning
par: Chen, Zihan, et autres
Publié: (2025)
par: Chen, Zihan, et autres
Publié: (2025)
A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models
par: Chang, Ching, et autres
Publié: (2025)
par: Chang, Ching, et autres
Publié: (2025)
Toward Graph-Tokenizing Large Language Models with Reconstructive Graph Instruction Tuning
par: Zhang, Zhongjian, et autres
Publié: (2026)
par: Zhang, Zhongjian, et autres
Publié: (2026)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
par: Chu, Zheng, et autres
Publié: (2023)
par: Chu, Zheng, et autres
Publié: (2023)
Position: Theory of Mind Benchmarks are Broken for Large Language Models
par: Riemer, Matthew, et autres
Publié: (2024)
par: Riemer, Matthew, et autres
Publié: (2024)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
par: Yao, Xuan, et autres
Publié: (2025)
par: Yao, Xuan, et autres
Publié: (2025)
Data-centric Federated Graph Learning with Large Language Models
par: Yan, Bo, et autres
Publié: (2025)
par: Yan, Bo, et autres
Publié: (2025)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
par: Chen, Andong, et autres
Publié: (2024)
par: Chen, Andong, et autres
Publié: (2024)
Benchmarking Defeasible Reasoning with Large Language Models -- Initial Experiments and Future Directions
par: Tachmazidis, Ilias, et autres
Publié: (2024)
par: Tachmazidis, Ilias, et autres
Publié: (2024)
QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi
par: Cohn, Anthony G., et autres
Publié: (2026)
par: Cohn, Anthony G., et autres
Publié: (2026)
DateLogicQA: Benchmarking Temporal Biases in Large Language Models
par: Bhatia, Gagan, et autres
Publié: (2024)
par: Bhatia, Gagan, et autres
Publié: (2024)
Can Large Language Models Improve the Adversarial Robustness of Graph Neural Networks?
par: Zhang, Zhongjian, et autres
Publié: (2024)
par: Zhang, Zhongjian, et autres
Publié: (2024)
PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning
par: Zhang, Qiran, et autres
Publié: (2026)
par: Zhang, Qiran, et autres
Publié: (2026)
Documents similaires
-
Benchmarking Real-Time Question Answering via Executable Code Workflows
par: Zhou, Wenjie, et autres
Publié: (2026) -
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
par: Chen, Hao-Yuan
Publié: (2026) -
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
par: Tang, Weizhi, et autres
Publié: (2024) -
Rethinking and Benchmarking Large Language Models for Graph Reasoning
par: Hu, Yuwei, et autres
Publié: (2025) -
Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank
par: Liu, Jiayu, et autres
Publié: (2025)