TimeSeriesExamAgent: Creating Time Series Reasoning Benchmarks at Scale
Fuente:
arXiv
Saved in:
| Main Authors: | Gwiazda, Malgorzata, Cai, Yifu, Goswami, Mononito, Choudhry, Arjun, Dubrawski, Artur |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TimeSeriesExam: A time series understanding exam
by: Cai, Yifu, et al.
Published: (2024)
by: Cai, Yifu, et al.
Published: (2024)
TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents
by: Cai, Yifu, et al.
Published: (2025)
by: Cai, Yifu, et al.
Published: (2025)
MOMENT: A Family of Open Time-series Foundation Models
by: Goswami, Mononito, et al.
Published: (2024)
by: Goswami, Mononito, et al.
Published: (2024)
Implicit Reasoning in Deep Time Series Forecasting
by: Potosnak, Willa, et al.
Published: (2024)
by: Potosnak, Willa, et al.
Published: (2024)
Non-Stationarity in the Embedding Space of Time Series Foundation Models
by: Choi, Jinmyeong, et al.
Published: (2026)
by: Choi, Jinmyeong, et al.
Published: (2026)
Exploring Representations and Interventions in Time Series Foundation Models
by: Wiliński, Michał, et al.
Published: (2024)
by: Wiliński, Michał, et al.
Published: (2024)
Towards Long-Context Time Series Foundation Models
by: Żukowska, Nina, et al.
Published: (2024)
by: Żukowska, Nina, et al.
Published: (2024)
AQuA: A Benchmarking Tool for Label Quality Assessment
by: Goswami, Mononito, et al.
Published: (2023)
by: Goswami, Mononito, et al.
Published: (2023)
Investigating Compositional Reasoning in Time Series Foundation Models
by: Potosnak, Willa, et al.
Published: (2025)
by: Potosnak, Willa, et al.
Published: (2025)
STAMP: Spatial-Temporal Adapter with Multi-Head Pooling
by: Shook, Brad, et al.
Published: (2025)
by: Shook, Brad, et al.
Published: (2025)
MICA: Multivariate Infini Compressive Attention for Time Series Forecasting
by: Potosnak, Willa, et al.
Published: (2026)
by: Potosnak, Willa, et al.
Published: (2026)
HEARTS: Benchmarking LLM Reasoning on Health Time Series
by: Li, Sirui, et al.
Published: (2026)
by: Li, Sirui, et al.
Published: (2026)
TS-Reasoner: Domain-Oriented Time Series Inference Agents for Reasoning and Automated Analysis
by: Ye, Wen, et al.
Published: (2024)
by: Ye, Wen, et al.
Published: (2024)
KairosAgent: Agentic Time Series Forecasting with Fused Semantic Reasoning
by: Feng, Kun, et al.
Published: (2026)
by: Feng, Kun, et al.
Published: (2026)
Training-Free Time Series Classification via In-Context Reasoning with LLM Agents
by: Sui, Songyuan, et al.
Published: (2025)
by: Sui, Songyuan, et al.
Published: (2025)
Toward Reasoning-Centric Time-Series Analysis
by: Wang, Xinlei, et al.
Published: (2025)
by: Wang, Xinlei, et al.
Published: (2025)
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
by: Kong, Yaxuan, et al.
Published: (2026)
by: Kong, Yaxuan, et al.
Published: (2026)
Visual Reasoning over Time Series via Multi-Agent System
by: Ruan, Weilin, et al.
Published: (2026)
by: Ruan, Weilin, et al.
Published: (2026)
Scaling Law for Time Series Forecasting
by: Shi, Jingzhe, et al.
Published: (2024)
by: Shi, Jingzhe, et al.
Published: (2024)
MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering
by: Chen, Jialin, et al.
Published: (2025)
by: Chen, Jialin, et al.
Published: (2025)
TSAQA: Time Series Analysis Question And Answering Benchmark
by: Jing, Baoyu, et al.
Published: (2026)
by: Jing, Baoyu, et al.
Published: (2026)
TSI-Bench: Benchmarking Time Series Imputation
by: Du, Wenjie, et al.
Published: (2024)
by: Du, Wenjie, et al.
Published: (2024)
Reasoning-Aware Training for Time Series Forecasting
by: Ahamed, Md Atik, et al.
Published: (2026)
by: Ahamed, Md Atik, et al.
Published: (2026)
TS-Agent: Understanding and Reasoning Over Raw Time Series via Iterative Insight Gathering
by: Liu, Penghang, et al.
Published: (2025)
by: Liu, Penghang, et al.
Published: (2025)
TimeClaw: A Time-Series AI Agent with Exploratory Execution Learning
by: Liu, Hangchen, et al.
Published: (2026)
by: Liu, Hangchen, et al.
Published: (2026)
Empowering Time Series Forecasting with LLM-Agents
by: Yeh, Chin-Chia Michael, et al.
Published: (2025)
by: Yeh, Chin-Chia Michael, et al.
Published: (2025)
mTSBench: Benchmarking Multivariate Time Series Anomaly Detection and Model Selection at Scale
by: Zhou, Xiaona, et al.
Published: (2025)
by: Zhou, Xiaona, et al.
Published: (2025)
When LLM Meets Time Series: Can LLMs Perform Multi-Step Time Series Reasoning and Inference
by: Ye, Wen, et al.
Published: (2025)
by: Ye, Wen, et al.
Published: (2025)
KairosVL: Orchestrating Time Series and Semantics for Unified Reasoning
by: Si, Haotian, et al.
Published: (2026)
by: Si, Haotian, et al.
Published: (2026)
TailedTS: Benchmark Dataset for Heavy-Tailed Time Series Prediction and Periodicity Quantification
by: Chen, Xinyu, et al.
Published: (2026)
by: Chen, Xinyu, et al.
Published: (2026)
Class-incremental Learning for Time Series: Benchmark and Evaluation
by: Qiao, Zhongzheng, et al.
Published: (2024)
by: Qiao, Zhongzheng, et al.
Published: (2024)
Bridging the Last Mile of Time Series Forecasting with LLM Agents
by: Liao, Yuhua, et al.
Published: (2026)
by: Liao, Yuhua, et al.
Published: (2026)
NuTime: Numerically Multi-Scaled Embedding for Large-Scale Time-Series Pretraining
by: Lin, Chenguo, et al.
Published: (2023)
by: Lin, Chenguo, et al.
Published: (2023)
A Comprehensive Benchmark for Electrocardiogram Time-Series
by: Tang, Zhijiang, et al.
Published: (2025)
by: Tang, Zhijiang, et al.
Published: (2025)
A SAT-based approach to rigorous verification of Bayesian networks
by: Stępka, Ignacy, et al.
Published: (2024)
by: Stępka, Ignacy, et al.
Published: (2024)
TACTiS-2: Better, Faster, Simpler Attentional Copulas for Multivariate Time Series
by: Ashok, Arjun, et al.
Published: (2023)
by: Ashok, Arjun, et al.
Published: (2023)
Benchmarking LLM Summaries of Multimodal Clinical Time Series for Remote Monitoring
by: Shukla, Aditya, et al.
Published: (2026)
by: Shukla, Aditya, et al.
Published: (2026)
Impermanent: A Live Benchmark for Temporal Generalization in Time Series Forecasting
by: Garza, Azul, et al.
Published: (2026)
by: Garza, Azul, et al.
Published: (2026)
TimeMKG: Knowledge-Infused Causal Reasoning for Multivariate Time Series Modeling
by: Sun, Yifei, et al.
Published: (2025)
by: Sun, Yifei, et al.
Published: (2025)
Diversified Scaling Inference in Time Series Foundation Models
by: Hua, Ruijin, et al.
Published: (2026)
by: Hua, Ruijin, et al.
Published: (2026)
Similar Items
-
TimeSeriesExam: A time series understanding exam
by: Cai, Yifu, et al.
Published: (2024) -
TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents
by: Cai, Yifu, et al.
Published: (2025) -
MOMENT: A Family of Open Time-series Foundation Models
by: Goswami, Mononito, et al.
Published: (2024) -
Implicit Reasoning in Deep Time Series Forecasting
by: Potosnak, Willa, et al.
Published: (2024) -
Non-Stationarity in the Embedding Space of Time Series Foundation Models
by: Choi, Jinmyeong, et al.
Published: (2026)