Evaluating List Construction and Temporal Understanding capabilities of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Dumitru, Alexandru, Venktesh, V, Jatowt, Adam, Anand, Avishek |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Trust but Verify! A Survey on Verification Design for Test-time Scaling
by: Venktesh, V, et al.
Published: (2025)
by: Venktesh, V, et al.
Published: (2025)
QuanTemp: A real-world open-domain benchmark for fact-checking numerical claims
by: V, Venktesh, et al.
Published: (2024)
by: V, Venktesh, et al.
Published: (2024)
Temporal Blind Spots in Large Language Models
by: Wallat, Jonas, et al.
Published: (2024)
by: Wallat, Jonas, et al.
Published: (2024)
Understanding the User: An Intent-Based Ranking Dataset
by: Anand, Abhijit, et al.
Published: (2024)
by: Anand, Abhijit, et al.
Published: (2024)
Temporal Validity Change Prediction
by: Wenzel, Georg, et al.
Published: (2024)
by: Wenzel, Georg, et al.
Published: (2024)
LiveFC: A System for Live Fact-Checking of Audio Streams
by: V, Venktesh, et al.
Published: (2024)
by: V, Venktesh, et al.
Published: (2024)
A Benchmark for Open-Domain Numerical Fact-Checking Enhanced by Claim Decomposition
by: Venktesh, V, et al.
Published: (2025)
by: Venktesh, V, et al.
Published: (2025)
DEXTER: A Benchmark for open-domain Complex Question Answering using LLMs
by: Prabhu, Venktesh V. Deepali, et al.
Published: (2024)
by: Prabhu, Venktesh V. Deepali, et al.
Published: (2024)
Evaluating Spatial Understanding of Large Language Models
by: Yamada, Yutaro, et al.
Published: (2023)
by: Yamada, Yutaro, et al.
Published: (2023)
A Study into Investigating Temporal Robustness of LLMs
by: Wallat, Jonas, et al.
Published: (2025)
by: Wallat, Jonas, et al.
Published: (2025)
The Surprising Effectiveness of Rankers Trained on Expanded Queries
by: Anand, Abhijit, et al.
Published: (2024)
by: Anand, Abhijit, et al.
Published: (2024)
Counterfactual-Consistency Prompting for Relative Temporal Understanding in Large Language Models
by: Kim, Jongho, et al.
Published: (2025)
by: Kim, Jongho, et al.
Published: (2025)
Understanding Data Temporality Impact on Large Language Models Pre-training
by: Pilchen, Hippolyte, et al.
Published: (2026)
by: Pilchen, Hippolyte, et al.
Published: (2026)
It's High Time: A Survey of Temporal Question Answering
by: Piryani, Bhawna, et al.
Published: (2025)
by: Piryani, Bhawna, et al.
Published: (2025)
TempRetriever: Fusion-based Temporal Dense Passage Retrieval for Time-Sensitive Questions
by: Abdallah, Abdelrahman, et al.
Published: (2025)
by: Abdallah, Abdelrahman, et al.
Published: (2025)
Multi-hop Question Answering
by: Mavi, Vaibhav, et al.
Published: (2022)
by: Mavi, Vaibhav, et al.
Published: (2022)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
by: Tang, Weizhi, et al.
Published: (2024)
by: Tang, Weizhi, et al.
Published: (2024)
Assessing SPARQL capabilities of Large Language Models
by: Meyer, Lars-Peter, et al.
Published: (2024)
by: Meyer, Lars-Peter, et al.
Published: (2024)
RomanSetu: Efficiently unlocking multilingual capabilities of Large Language Models via Romanization
by: Husain, Jaavid Aktar, et al.
Published: (2024)
by: Husain, Jaavid Aktar, et al.
Published: (2024)
Think Right, Not More: Test-Time Scaling for Numerical Claim Verification
by: Chungkham, Primakov, et al.
Published: (2025)
by: Chungkham, Primakov, et al.
Published: (2025)
Towards Effective Time-Aware Language Representation: Exploring Enhanced Temporal Understanding in Language Models
by: Wang, Jiexin, et al.
Published: (2024)
by: Wang, Jiexin, et al.
Published: (2024)
Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems
by: Maclean, Hendrika, et al.
Published: (2026)
by: Maclean, Hendrika, et al.
Published: (2026)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
by: Zhang, Yazhou, et al.
Published: (2024)
by: Zhang, Yazhou, et al.
Published: (2024)
Mathify: Evaluating Large Language Models on Mathematical Problem Solving Tasks
by: Anand, Avinash, et al.
Published: (2024)
by: Anand, Avinash, et al.
Published: (2024)
MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph
by: Zhang, Duzhen, et al.
Published: (2025)
by: Zhang, Duzhen, et al.
Published: (2025)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
by: Zhu, Jie, et al.
Published: (2024)
by: Zhu, Jie, et al.
Published: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
by: Chu, Zheng, et al.
Published: (2023)
by: Chu, Zheng, et al.
Published: (2023)
Potemkin Understanding in Large Language Models
by: Mancoridis, Marina, et al.
Published: (2025)
by: Mancoridis, Marina, et al.
Published: (2025)
Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models
by: Zhou, Kevin, et al.
Published: (2025)
by: Zhou, Kevin, et al.
Published: (2025)
Do They Understand Them? An Updated Evaluation on Nonbinary Pronoun Handling in Large Language Models
by: Tang, Xushuo, et al.
Published: (2025)
by: Tang, Xushuo, et al.
Published: (2025)
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
by: Chetan, Aditya, et al.
Published: (2026)
by: Chetan, Aditya, et al.
Published: (2026)
Language Models Learn Constructional Semantics, Not To Mention Syntax: Investigating LM Understanding of Paired-Focus Constructions
by: Scivetti, Wesley, et al.
Published: (2026)
by: Scivetti, Wesley, et al.
Published: (2026)
A non-ergodic framework for understanding emergent capabilities in Large Language Models
by: Marín, Javier
Published: (2025)
by: Marín, Javier
Published: (2025)
Understanding the Dilemma of Unlearning for Large Language Models
by: Zhang, Qingjie, et al.
Published: (2025)
by: Zhang, Qingjie, et al.
Published: (2025)
Mechanistic Indicators of Understanding in Large Language Models
by: Beckmann, Pierre, et al.
Published: (2025)
by: Beckmann, Pierre, et al.
Published: (2025)
Assessing and Understanding Creativity in Large Language Models
by: Zhao, Yunpu, et al.
Published: (2024)
by: Zhao, Yunpu, et al.
Published: (2024)
AutoRD: An Automatic and End-to-End System for Rare Disease Knowledge Graph Construction Based on Ontologies-enhanced Large Language Models
by: Cao, Lang, et al.
Published: (2024)
by: Cao, Lang, et al.
Published: (2024)
Mechanistic Decoding of Cognitive Constructs in Large Language Models
by: Shou, Yitong, et al.
Published: (2026)
by: Shou, Yitong, et al.
Published: (2026)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
by: Yu, Yongan, et al.
Published: (2025)
by: Yu, Yongan, et al.
Published: (2025)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
by: Doris, Anna C., et al.
Published: (2024)
by: Doris, Anna C., et al.
Published: (2024)
Similar Items
-
Trust but Verify! A Survey on Verification Design for Test-time Scaling
by: Venktesh, V, et al.
Published: (2025) -
QuanTemp: A real-world open-domain benchmark for fact-checking numerical claims
by: V, Venktesh, et al.
Published: (2024) -
Temporal Blind Spots in Large Language Models
by: Wallat, Jonas, et al.
Published: (2024) -
Understanding the User: An Intent-Based Ranking Dataset
by: Anand, Abhijit, et al.
Published: (2024) -
Temporal Validity Change Prediction
by: Wenzel, Georg, et al.
Published: (2024)