AvalancheBench: Evaluating Enterprise Data Agents Through Latent World Recovery
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kleczek, Darek, Zhao, Fuheng, Lee, Alexander W., Tissier, Julien, Liskowski, Pawel, Cetintemel, Ugur, Datta, Anupam |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evergreen: Efficient Claim Verification for Semantic Aggregates
par: Lee, Alexander W., et autres
Publié: (2026)
par: Lee, Alexander W., et autres
Publié: (2026)
Streaming Model Cascades for Semantic SQL
par: Liskowski, Paweł, et autres
Publié: (2026)
par: Liskowski, Paweł, et autres
Publié: (2026)
Continuous Prompts: LLM-Augmented Pipeline Processing over Unstructured Streams
par: Chen, Shu, et autres
Publié: (2025)
par: Chen, Shu, et autres
Publié: (2025)
VectraFlow: Long-Horizon Semantic Processing over Data and Event Streams with LLMs
par: Chen, Shu, et autres
Publié: (2026)
par: Chen, Shu, et autres
Publié: (2026)
Credo: Declarative Control of LLM Pipelines via Beliefs and Policies
par: Lu, Duo, et autres
Publié: (2026)
par: Lu, Duo, et autres
Publié: (2026)
Semantic Integrity Constraints: Declarative Guardrails for AI-Augmented Data Processing Systems
par: Lee, Alexander W., et autres
Publié: (2025)
par: Lee, Alexander W., et autres
Publié: (2025)
Making Prompts First-Class Citizens for Adaptive LLM Pipelines
par: Cetintemel, Ugur, et autres
Publié: (2025)
par: Cetintemel, Ugur, et autres
Publié: (2025)
Unveiling Challenges for LLMs in Enterprise Data Engineering
par: Bodensohn, Jan-Micha, et autres
Publié: (2025)
par: Bodensohn, Jan-Micha, et autres
Publié: (2025)
Cortex AISQL: A Production SQL Engine for Unstructured Data
par: Liskowski, Paweł, et autres
Publié: (2025)
par: Liskowski, Paweł, et autres
Publié: (2025)
UniDataBench: Evaluating Data Analytics Agents Across Structured and Unstructured Data
par: Weng, Han, et autres
Publié: (2025)
par: Weng, Han, et autres
Publié: (2025)
Access Paths for Efficient Ordering with Large Language Models
par: Zhao, Fuheng, et autres
Publié: (2025)
par: Zhao, Fuheng, et autres
Publié: (2025)
Hybrid Querying Over Relational Databases and Large Language Models
par: Zhao, Fuheng, et autres
Publié: (2024)
par: Zhao, Fuheng, et autres
Publié: (2024)
ChARLES: Change-Aware Recovery of Latent Evolution Semantics in Relational Data
par: He, Shiyi, et autres
Publié: (2024)
par: He, Shiyi, et autres
Publié: (2024)
Structuring the Processing Frameworks for Data Stream Evaluation and Application
par: Komorniczak, Joanna, et autres
Publié: (2024)
par: Komorniczak, Joanna, et autres
Publié: (2024)
The SpaceSaving$\pm$ Family of Algorithms for Data Streams with Bounded Deletions
par: Zhao, Fuheng, et autres
Publié: (2023)
par: Zhao, Fuheng, et autres
Publié: (2023)
Enterprise Data Science Platform: A Unified Architecture for Federated Data Access
par: Miyamoto, Ryoto, et autres
Publié: (2025)
par: Miyamoto, Ryoto, et autres
Publié: (2025)
ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
par: Jin, Tengjun, et autres
Publié: (2025)
par: Jin, Tengjun, et autres
Publié: (2025)
Publication and Maintenance of Relational Data in Enterprise Knowledge Graphs (Revised Version)
par: Vidal, Vânia Maria Ponte, et autres
Publié: (2026)
par: Vidal, Vânia Maria Ponte, et autres
Publié: (2026)
PersonalHomeBench: Evaluating Agents in Personalized Smart Homes
par: Bharadwaj, Manasa, et autres
Publié: (2026)
par: Bharadwaj, Manasa, et autres
Publié: (2026)
DP-Bench: A Benchmark for Evaluating Data Product Creation Systems
par: Chowdhury, Faisal, et autres
Publié: (2025)
par: Chowdhury, Faisal, et autres
Publié: (2025)
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
par: Lei, Fangyu, et autres
Publié: (2024)
par: Lei, Fangyu, et autres
Publié: (2024)
PLANSIEVE: Real-time Suboptimal Query Plan Detection Through Incremental Refinements
par: Datta, Asoke, et autres
Publié: (2025)
par: Datta, Asoke, et autres
Publié: (2025)
Relational Database Data Lineage Ontology
par: Dutkiewicz, Jakub, et autres
Publié: (2026)
par: Dutkiewicz, Jakub, et autres
Publié: (2026)
LLM-SQL-Solver: Can LLMs Determine SQL Equivalence?
par: Zhao, Fuheng, et autres
Publié: (2023)
par: Zhao, Fuheng, et autres
Publié: (2023)
ResBench: A Comprehensive Framework for Evaluating Database Resilience
par: Hu, Puyun, et autres
Publié: (2025)
par: Hu, Puyun, et autres
Publié: (2025)
RAG-Driven Data Quality Governance for Enterprise ERP Systems
par: Vedat, Sedat Bin, et autres
Publié: (2025)
par: Vedat, Sedat Bin, et autres
Publié: (2025)
LLM and Agent-Driven Data Analysis: A Systematic Approach for Enterprise Applications and System-level Deployment
par: Wang, Xi, et autres
Publié: (2025)
par: Wang, Xi, et autres
Publié: (2025)
Autumn: A Scalable Read Optimized LSM-tree based Key-Value Stores with Fast Point and Range Read Speed
par: Zhao, Fuheng, et autres
Publié: (2023)
par: Zhao, Fuheng, et autres
Publié: (2023)
DriftBench: Defining and Generating Data and Query Workload Drift for Benchmarking
par: Liu, Guanli, et autres
Publié: (2025)
par: Liu, Guanli, et autres
Publié: (2025)
Making LLMs Work for Enterprise Data Tasks
par: Demiralp, Çağatay, et autres
Publié: (2024)
par: Demiralp, Çağatay, et autres
Publié: (2024)
Orchestrating Agents and Data for Enterprise: A Blueprint Architecture for Compound AI
par: Kandogan, Eser, et autres
Publié: (2025)
par: Kandogan, Eser, et autres
Publié: (2025)
Mind the Data Gap: Bridging LLMs to Enterprise Data Integration
par: Kayali, Moe, et autres
Publié: (2024)
par: Kayali, Moe, et autres
Publié: (2024)
LatentTune: Efficient Tuning of High Dimensional Database Parameters via Latent Representation Learning
par: Kwon, Sein, et autres
Publié: (2026)
par: Kwon, Sein, et autres
Publié: (2026)
Data Caching for Enterprise-Grade Petabyte-Scale OLAP
par: Tang, Chunxu, et autres
Publié: (2024)
par: Tang, Chunxu, et autres
Publié: (2024)
Large-Scale Aspect-Based Sentiment Analysis with Reasoning-Infused LLMs
par: Liskowski, Paweł, et autres
Publié: (2026)
par: Liskowski, Paweł, et autres
Publié: (2026)
Can AI Agents Answer Your Data Questions? A Benchmark for Data Agents
par: Ma, Ruiying, et autres
Publié: (2026)
par: Ma, Ruiying, et autres
Publié: (2026)
ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilities
par: Zanoli, Christopher, et autres
Publié: (2026)
par: Zanoli, Christopher, et autres
Publié: (2026)
Text-to-SQL for Enterprise Data Analytics
par: Chen, Albert, et autres
Publié: (2025)
par: Chen, Albert, et autres
Publié: (2025)
DataClaw: An Autonomous Data Agent with Instant Messaging Integration
par: Li, Huahang, et autres
Publié: (2026)
par: Li, Huahang, et autres
Publié: (2026)
DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning
par: Ahmed, Ahmed G. A. H, et autres
Publié: (2026)
par: Ahmed, Ahmed G. A. H, et autres
Publié: (2026)
Documents similaires
-
Evergreen: Efficient Claim Verification for Semantic Aggregates
par: Lee, Alexander W., et autres
Publié: (2026) -
Streaming Model Cascades for Semantic SQL
par: Liskowski, Paweł, et autres
Publié: (2026) -
Continuous Prompts: LLM-Augmented Pipeline Processing over Unstructured Streams
par: Chen, Shu, et autres
Publié: (2025) -
VectraFlow: Long-Horizon Semantic Processing over Data and Event Streams with LLMs
par: Chen, Shu, et autres
Publié: (2026) -
Credo: Declarative Control of LLM Pipelines via Beliefs and Policies
par: Lu, Duo, et autres
Publié: (2026)