Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fatemi, Bahare, Kazemi, Mehran, Tsitsulin, Anton, Malkan, Karishma, Yim, Jinyeong, Palowitch, John, Seo, Sungyong, Halcrow, Jonathan, Perozzi, Bryan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Let Your Graph Do the Talking: Encoding Structured Data for LLMs
par: Perozzi, Bryan, et autres
Publié: (2024)
par: Perozzi, Bryan, et autres
Publié: (2024)
Understanding Transformer Reasoning Capabilities via Graph Algorithms
par: Sanford, Clayton, et autres
Publié: (2024)
par: Sanford, Clayton, et autres
Publié: (2024)
Don't Forget to Connect! Improving RAG with Graph-based Reranking
par: Dong, Jialin, et autres
Publié: (2024)
par: Dong, Jialin, et autres
Publié: (2024)
Text-space Graph Foundation Models: Comprehensive Benchmarks and New Insights
par: Chen, Zhikai, et autres
Publié: (2024)
par: Chen, Zhikai, et autres
Publié: (2024)
Differentially Private Graph Learning via Sensitivity-Bounded Personalized PageRank
par: Epasto, Alessandro, et autres
Publié: (2022)
par: Epasto, Alessandro, et autres
Publié: (2022)
Multi-Turn Puzzles: Evaluating Interactive Reasoning and Strategic Dialogue in LLMs
par: Badola, Kartikeya, et autres
Publié: (2025)
par: Badola, Kartikeya, et autres
Publié: (2025)
CausalGraph2LLM: Evaluating LLMs for Causal Queries
par: Sheth, Ivaxi, et autres
Publié: (2024)
par: Sheth, Ivaxi, et autres
Publié: (2024)
SocialQuotes: Learning Contextual Roles of Social Media Quotes on the Web
par: Palowitch, John, et autres
Publié: (2024)
par: Palowitch, John, et autres
Publié: (2024)
ReMI: A Dataset for Reasoning with Multiple Images
par: Kazemi, Mehran, et autres
Publié: (2024)
par: Kazemi, Mehran, et autres
Publié: (2024)
AgentsNet: Coordination and Collaborative Reasoning in Multi-Agent LLMs
par: Grötschla, Florian, et autres
Publié: (2025)
par: Grötschla, Florian, et autres
Publié: (2025)
Transfer Learning for Temporal Link Prediction
par: Chatterjee, Ayan, et autres
Publié: (2025)
par: Chatterjee, Ayan, et autres
Publié: (2025)
ULTRASTRUCTURAL FEATURES OF THE FUNNEL OF GAMMARUS OCEANICUS (AMPHIPODA)
par: Halcrow, K
Publié: (2001)
par: Halcrow, K
Publié: (2001)
Causal Temporal Reasoning for Markov Decision Processes
par: Kazemi, Milad, et autres
Publié: (2022)
par: Kazemi, Milad, et autres
Publié: (2022)
Using Agentic AI to Achieve Full CI/CD: A Semantic Reasoning Framework for Microservices Delivery at Scale
par: Karishma Verma
Publié: (2026)
par: Karishma Verma
Publié: (2026)
BIG-Bench Extra Hard
par: Kazemi, Mehran, et autres
Publié: (2025)
par: Kazemi, Mehran, et autres
Publié: (2025)
Efecto del agua del embalse De la Vega en la lipoperoxidación y los niveles de la acetilcolinesterasa en el hígado y en el músculo de Xiphophorus helleri
par: Liliana Favari Perozzi
Publié: (2003)
par: Liliana Favari Perozzi
Publié: (2003)
Chaotic mixing in plane Couette turbulence
par: Elton, John R., et autres
Publié: (2024)
par: Elton, John R., et autres
Publié: (2024)
Large-Scale Graph Building in Dynamic Environments: Low Latency and High Quality
par: de Almeida, Filipe Miguel Gonçalves, et autres
Publié: (2025)
par: de Almeida, Filipe Miguel Gonçalves, et autres
Publié: (2025)
BiasEdit: A Training-Free Bias-Detect-and-Edit Framework for Learning Fair Visual Classifiers
par: Seo, Jungwook, et autres
Publié: (2026)
par: Seo, Jungwook, et autres
Publié: (2026)
Evaluating the Role of Verifiers in Test-Time Scaling for Legal Reasoning Tasks
par: Romano, Davide, et autres
Publié: (2025)
par: Romano, Davide, et autres
Publié: (2025)
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
par: Bhattacharya, Debarpan, et autres
Publié: (2025)
par: Bhattacharya, Debarpan, et autres
Publié: (2025)
Quantization of skyrmions using instantons
par: Cork, Josh, et autres
Publié: (2024)
par: Cork, Josh, et autres
Publié: (2024)
Fractional Skyrme lines in ferroelectric barium titanate
par: Halcrow, Chris, et autres
Publié: (2023)
par: Halcrow, Chris, et autres
Publié: (2023)
Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Analyzing Dialectical Biases in LLMs for Knowledge and Reasoning Benchmarks
par: Pan, Eileen, et autres
Publié: (2025)
par: Pan, Eileen, et autres
Publié: (2025)
A inteligibilidade dos discursos que constroem o etanol como um “produto sustentável” no Brasil
par: Mariana Bombo Perozzi Gameiro
Publié: (2016)
par: Mariana Bombo Perozzi Gameiro
Publié: (2016)
O pulsar do centro da terra: interpretação do apoio zapatista à candidatura presidencial
par: Bruno Perozzi da Silveira
Publié: (2018)
par: Bruno Perozzi da Silveira
Publié: (2018)
O desenvolvimento rural sob regime de verdade: o discurso do Banco Mundial
par: Mariana Bombo Perozzi Gameiro
Publié: (2018)
par: Mariana Bombo Perozzi Gameiro
Publié: (2018)
Effectiveness of different maternal positions during Non Stress Test on selected physiological parameters of fetus and mothers admitted in antenatal ward of selected hospitals
par: Karishma Thoke, Leena Aswale
Publié: (2026)
par: Karishma Thoke, Leena Aswale
Publié: (2026)
Test of Time: Rethinking Temporal Signal of Benchmark Contamination
par: Zhang, Terry Jingchen, et autres
Publié: (2025)
par: Zhang, Terry Jingchen, et autres
Publié: (2025)
Benchmarking Transferability: A Framework for Fair and Robust Evaluation
par: Kazemi, Alireza, et autres
Publié: (2025)
par: Kazemi, Alireza, et autres
Publié: (2025)
The Task-oriented Queries Benchmark (ToQB)
par: Yim, Keun Soo
Publié: (2024)
par: Yim, Keun Soo
Publié: (2024)
Mind Map of Database
par: Shaw, Karishma
Publié: (2026)
par: Shaw, Karishma
Publié: (2026)
Cardiometabolic Risk Factors in South Asians: An Epidemiological and Anthropological Study in an Urban Populace of Eastern India
par: Yasmin, Karishma
Publié: (2024)
par: Yasmin, Karishma
Publié: (2024)
DynaGRAG | Exploring the Topology of Information for Advancing Language Understanding and Generation in Graph Retrieval-Augmented Generation
par: Thakrar, Karishma
Publié: (2024)
par: Thakrar, Karishma
Publié: (2024)
Evaluating the Test Adequacy of Benchmarks for LLMs on Code Generation
par: Xiangyue Liu, et autres
Publié: (2025)
par: Xiangyue Liu, et autres
Publié: (2025)
Lost in Time: A New Temporal Benchmark for VideoLLMs
par: Cores, Daniel, et autres
Publié: (2024)
par: Cores, Daniel, et autres
Publié: (2024)
Quantum binding energies in the Skyrme model
par: Gudnason, Sven Bjarke, et autres
Publié: (2023)
par: Gudnason, Sven Bjarke, et autres
Publié: (2023)
Ranking Reasoning LLMs under Test-Time Scaling
par: Hariri, Mohsen, et autres
Publié: (2026)
par: Hariri, Mohsen, et autres
Publié: (2026)
FaMTEB: Massive Text Embedding Benchmark in Persian Language
par: Zinvandi, Erfan, et autres
Publié: (2025)
par: Zinvandi, Erfan, et autres
Publié: (2025)
Documents similaires
-
Let Your Graph Do the Talking: Encoding Structured Data for LLMs
par: Perozzi, Bryan, et autres
Publié: (2024) -
Understanding Transformer Reasoning Capabilities via Graph Algorithms
par: Sanford, Clayton, et autres
Publié: (2024) -
Don't Forget to Connect! Improving RAG with Graph-based Reranking
par: Dong, Jialin, et autres
Publié: (2024) -
Text-space Graph Foundation Models: Comprehensive Benchmarks and New Insights
par: Chen, Zhikai, et autres
Publié: (2024) -
Differentially Private Graph Learning via Sensitivity-Bounded Personalized PageRank
par: Epasto, Alessandro, et autres
Publié: (2022)