WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yen, Thomson, Poeltl, Julian, Gear, Harshith Srinivas, Meng, Yilin, Fan, Joshua, Shen, Adam, Liu, Yili, Bauyrzhan, Ali, Du, Siri, Liu, Haoyang, Guetta, Daniel, Namkoong, Hongseok |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking In-context Experiential Learning Through Repeated Product Recommendations
par: Yang, Gilbert, et autres
Publié: (2025)
par: Yang, Gilbert, et autres
Publié: (2025)
Data Mixture Optimization: A Multi-fidelity Multi-scale Bayesian Framework
par: Yen, Thomson, et autres
Publié: (2025)
par: Yen, Thomson, et autres
Publié: (2025)
Architectural and Inferential Inductive Biases For Exchangeable Sequence Modeling
par: Mittal, Daksh, et autres
Publié: (2025)
par: Mittal, Daksh, et autres
Publié: (2025)
Empirical Likelihood for Nonsmooth Functionals
par: Namkoong, Hongseok
Publié: (2026)
par: Namkoong, Hongseok
Publié: (2026)
Exchangeable Sequence Models Quantify Uncertainty Over Latent Concepts
par: Ye, Naimeng, et autres
Publié: (2024)
par: Ye, Naimeng, et autres
Publié: (2024)
SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation
par: Zhu, Ruiyan, et autres
Publié: (2025)
par: Zhu, Ruiyan, et autres
Publié: (2025)
SynthTools: A Framework for Scaling Synthetic Tools for Agent Development
par: Castellani, Tommaso, et autres
Publié: (2025)
par: Castellani, Tommaso, et autres
Publié: (2025)
Rethinking Distribution Shifts: Empirical Analysis and Inductive Modeling for Tabular Data
par: Wang, Tianyu, et autres
Publié: (2023)
par: Wang, Tianyu, et autres
Publié: (2023)
LLM Embeddings Improve Test-time Adaptation to Tabular $Y|X$-Shifts
par: Zeng, Yibo, et autres
Publié: (2024)
par: Zeng, Yibo, et autres
Publié: (2024)
Design and Scheduling of an AI-based Queueing System
par: Lee, Jiung, et autres
Publié: (2024)
par: Lee, Jiung, et autres
Publié: (2024)
Distilled Thompson Sampling: Practical and Efficient Thompson Sampling via Imitation Learning
par: Namkoong, Hongseok, et autres
Publié: (2020)
par: Namkoong, Hongseok, et autres
Publié: (2020)
A Broader View of Thompson Sampling
par: Qu, Yanlin, et autres
Publié: (2025)
par: Qu, Yanlin, et autres
Publié: (2025)
Differentiable Discrete Event Simulation for Queuing Network Control
par: Che, Ethan, et autres
Publié: (2024)
par: Che, Ethan, et autres
Publié: (2024)
A Sensitivity Approach to Causal Inference Under Limited Overlap
par: Ma, Yuanzhe, et autres
Publié: (2025)
par: Ma, Yuanzhe, et autres
Publié: (2025)
Leverage Cross-Attention for End-to-End Open-Vocabulary Panoptic Reconstruction
par: Yu, Xuan, et autres
Publié: (2025)
par: Yu, Xuan, et autres
Publié: (2025)
Minimax Optimal Estimation of Stability Under Distribution Shift
par: Namkoong, Hongseok, et autres
Publié: (2022)
par: Namkoong, Hongseok, et autres
Publié: (2022)
Transformers Get Stable: An End-to-End Signal Propagation Theory for Language Models
par: Kedia, Akhil, et autres
Publié: (2024)
par: Kedia, Akhil, et autres
Publié: (2024)
Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
par: Dong, Haoyu, et autres
Publié: (2025)
par: Dong, Haoyu, et autres
Publié: (2025)
Cambridge preparation for the TOEFL Test / Jolene Gear, Robert Gear
par: Gear, Jolene
Publié: (2002)
par: Gear, Jolene
Publié: (2002)
SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation
par: Ma, Zeyao, et autres
Publié: (2024)
par: Ma, Zeyao, et autres
Publié: (2024)
WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild
par: Zhang, Linhao, et autres
Publié: (2025)
par: Zhang, Linhao, et autres
Publié: (2025)
DRO: A Python Library for Distributionally Robust Optimization in Machine Learning
par: Liu, Jiashuo, et autres
Publié: (2025)
par: Liu, Jiashuo, et autres
Publié: (2025)
Efficient Fusion and Task Guided Embedding for End-to-end Autonomous Driving
par: Guo, Yipin, et autres
Publié: (2024)
par: Guo, Yipin, et autres
Publié: (2024)
Evaluating Model Performance Under Worst-case Subpopulations
par: Li, Mike, et autres
Publié: (2024)
par: Li, Mike, et autres
Publié: (2024)
Data-Driven Stochastic Modeling Using Autoregressive Sequence Models: Translating Event Tables to Queueing Dynamics
par: Mittal, Daksh, et autres
Publié: (2025)
par: Mittal, Daksh, et autres
Publié: (2025)
LLM Generated Persona is a Promise with a Catch
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Adaptive Elicitation of Latent Information Using Natural Language
par: Wang, Jimmy, et autres
Publié: (2025)
par: Wang, Jimmy, et autres
Publié: (2025)
A Planning Framework for Adaptive Labeling
par: Mittal, Daksh, et autres
Publié: (2025)
par: Mittal, Daksh, et autres
Publié: (2025)
Optimization-Driven Adaptive Experimentation
par: Che, Ethan, et autres
Publié: (2024)
par: Che, Ethan, et autres
Publié: (2024)
From Models to Systems: A Comprehensive Fairness Framework for Compositional Recommender Systems
par: Hsu, Brian, et autres
Publié: (2024)
par: Hsu, Brian, et autres
Publié: (2024)
AExGym: Benchmarks and Environments for Adaptive Experimentation
par: Wang, Jimmy, et autres
Publié: (2024)
par: Wang, Jimmy, et autres
Publié: (2024)
C-Learner: Constrained Learning for Causal Inference
par: Cai, Tiffany Tianhui, et autres
Publié: (2024)
par: Cai, Tiffany Tianhui, et autres
Publié: (2024)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
par: Lu, Pengrui, et autres
Publié: (2026)
par: Lu, Pengrui, et autres
Publié: (2026)
DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation
par: jiao, Jiajun, et autres
Publié: (2026)
par: jiao, Jiajun, et autres
Publié: (2026)
The Paradox of Spreadsheet Self-Efficacy: Social Incentives for Informal Knowledge Sharing in End-User Programming
par: Xia, Qing Nancy, et autres
Publié: (2024)
par: Xia, Qing Nancy, et autres
Publié: (2024)
Bridging Perception and Planning: Towards End-to-End Planning for Signal Temporal Logic Tasks
par: Ye, Bowen, et autres
Publié: (2025)
par: Ye, Bowen, et autres
Publié: (2025)
BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows
par: Lau, Elaine, et autres
Publié: (2026)
par: Lau, Elaine, et autres
Publié: (2026)
Active Exploration via Autoregressive Generation of Missing Data
par: Cai, Tiffany Tianhui, et autres
Publié: (2024)
par: Cai, Tiffany Tianhui, et autres
Publié: (2024)
Contextual Thompson Sampling via Generation of Missing Data
par: Zhang, Kelly W., et autres
Publié: (2025)
par: Zhang, Kelly W., et autres
Publié: (2025)
ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
par: Jin, Tengjun, et autres
Publié: (2025)
par: Jin, Tengjun, et autres
Publié: (2025)
Documents similaires
-
Benchmarking In-context Experiential Learning Through Repeated Product Recommendations
par: Yang, Gilbert, et autres
Publié: (2025) -
Data Mixture Optimization: A Multi-fidelity Multi-scale Bayesian Framework
par: Yen, Thomson, et autres
Publié: (2025) -
Architectural and Inferential Inductive Biases For Exchangeable Sequence Modeling
par: Mittal, Daksh, et autres
Publié: (2025) -
Empirical Likelihood for Nonsmooth Functionals
par: Namkoong, Hongseok
Publié: (2026) -
Exchangeable Sequence Models Quantify Uncertainty Over Latent Concepts
par: Ye, Naimeng, et autres
Publié: (2024)