TRAM: Benchmarking Temporal Reasoning for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yuqing, Zhao, Yun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2024)
por: Wang, Yuqing, et al.
Publicado: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Metacognitive Prompting Improves Understanding in Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
SportQA: A Benchmark for Sports Understanding in Large Language Models
por: Xia, Haotian, et al.
Publicado: (2024)
por: Xia, Haotian, et al.
Publicado: (2024)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
por: Tang, Weizhi, et al.
Publicado: (2024)
por: Tang, Weizhi, et al.
Publicado: (2024)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
por: Chen, Jiangxi, et al.
Publicado: (2026)
por: Chen, Jiangxi, et al.
Publicado: (2026)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
por: Xu, Zixiang, et al.
Publicado: (2025)
por: Xu, Zixiang, et al.
Publicado: (2025)
Knowledge Distillation for Temporal Knowledge Graph Reasoning with Large Language Models
por: Xing, Wang, et al.
Publicado: (2026)
por: Xing, Wang, et al.
Publicado: (2026)
Large Language Models Can Learn Temporal Reasoning
por: Xiong, Siheng, et al.
Publicado: (2024)
por: Xiong, Siheng, et al.
Publicado: (2024)
AdapTime: Enabling Adaptive Temporal Reasoning in Large Language Models
por: Deng, Yimin, et al.
Publicado: (2026)
por: Deng, Yimin, et al.
Publicado: (2026)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
por: Xue, Boyang, et al.
Publicado: (2025)
por: Xue, Boyang, et al.
Publicado: (2025)
Large Language Models with Temporal Reasoning for Longitudinal Clinical Summarization and Prediction
por: Kruse, Maya, et al.
Publicado: (2025)
por: Kruse, Maya, et al.
Publicado: (2025)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
por: Sun, Haoxiang, et al.
Publicado: (2025)
por: Sun, Haoxiang, et al.
Publicado: (2025)
Ebisu: Benchmarking Large Language Models in Japanese Finance
por: Peng, Xueqing, et al.
Publicado: (2026)
por: Peng, Xueqing, et al.
Publicado: (2026)
BeHonest: Benchmarking Honesty in Large Language Models
por: Chern, Steffi, et al.
Publicado: (2024)
por: Chern, Steffi, et al.
Publicado: (2024)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
por: Chen, Nan, et al.
Publicado: (2024)
por: Chen, Nan, et al.
Publicado: (2024)
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
por: Lee, Donggyu, et al.
Publicado: (2025)
por: Lee, Donggyu, et al.
Publicado: (2025)
Unveiling and Mitigating Bias in Mental Health Analysis with Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2024)
por: Wang, Yuqing, et al.
Publicado: (2024)
TRAM: Bridging Trust Regions and Sharpness Aware Minimization
por: Sherborne, Tom, et al.
Publicado: (2023)
por: Sherborne, Tom, et al.
Publicado: (2023)
Benchmarking Large Language Models for Math Reasoning Tasks
por: Seßler, Kathrin, et al.
Publicado: (2024)
por: Seßler, Kathrin, et al.
Publicado: (2024)
What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?
por: Bhatia, Gagan, et al.
Publicado: (2026)
por: Bhatia, Gagan, et al.
Publicado: (2026)
MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models
por: Cai, Yuanqing, et al.
Publicado: (2026)
por: Cai, Yuanqing, et al.
Publicado: (2026)
Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?
por: Su, Zhaochen, et al.
Publicado: (2024)
por: Su, Zhaochen, et al.
Publicado: (2024)
MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning
por: Tan, Xingyu, et al.
Publicado: (2025)
por: Tan, Xingyu, et al.
Publicado: (2025)
Analyzing Temporal Complex Events with Large Language Models? A Benchmark towards Temporal, Long Context Understanding
por: Zhang, Zhihan, et al.
Publicado: (2024)
por: Zhang, Zhihan, et al.
Publicado: (2024)
CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis
por: Xu, Xinzhe, et al.
Publicado: (2025)
por: Xu, Xinzhe, et al.
Publicado: (2025)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
por: Ding, Jiayu, et al.
Publicado: (2025)
por: Ding, Jiayu, et al.
Publicado: (2025)
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges
por: Yan, Yibo, et al.
Publicado: (2024)
por: Yan, Yibo, et al.
Publicado: (2024)
Benchmarking Temporal Reasoning and Alignment Across Chinese Dynasties
por: Wang, Zhenglin, et al.
Publicado: (2025)
por: Wang, Zhenglin, et al.
Publicado: (2025)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
por: Wang, Jiayin, et al.
Publicado: (2024)
por: Wang, Jiayin, et al.
Publicado: (2024)
When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation
por: Jiang, Xunyi, et al.
Publicado: (2025)
por: Jiang, Xunyi, et al.
Publicado: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Rosetta-PL: Propositional Logic as a Benchmark for Large Language Model Reasoning
por: Baek, Shaun, et al.
Publicado: (2025)
por: Baek, Shaun, et al.
Publicado: (2025)
D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models
por: Krishna, Satyapriya, et al.
Publicado: (2025)
por: Krishna, Satyapriya, et al.
Publicado: (2025)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
por: Zhu, Yakun, et al.
Publicado: (2025)
por: Zhu, Yakun, et al.
Publicado: (2025)
DateLogicQA: Benchmarking Temporal Biases in Large Language Models
por: Bhatia, Gagan, et al.
Publicado: (2024)
por: Bhatia, Gagan, et al.
Publicado: (2024)
Large Language Models-guided Dynamic Adaptation for Temporal Knowledge Graph Reasoning
por: Wang, Jiapu, et al.
Publicado: (2024)
por: Wang, Jiapu, et al.
Publicado: (2024)
NeSTR: A Neuro-Symbolic Abductive Framework for Temporal Reasoning in Large Language Models
por: Liang, Feng, et al.
Publicado: (2025)
por: Liang, Feng, et al.
Publicado: (2025)
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
por: Zhou, Hongli, et al.
Publicado: (2025)
por: Zhou, Hongli, et al.
Publicado: (2025)
Unlocking Temporal Question Answering for Large Language Models with Tailor-Made Reasoning Logic
por: Li, Xingxuan, et al.
Publicado: (2023)
por: Li, Xingxuan, et al.
Publicado: (2023)
Ejemplares similares
-
RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2024) -
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023) -
Metacognitive Prompting Improves Understanding in Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023) -
SportQA: A Benchmark for Sports Understanding in Large Language Models
por: Xia, Haotian, et al.
Publicado: (2024) -
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
por: Tang, Weizhi, et al.
Publicado: (2024)