Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Ruisheng, Lei, Fangyu, Wu, Haoyuan, Chen, Jixuan, Fu, Yeqiao, Gao, Hongcheng, Xiong, Xinzhuang, Zhang, Hanchong, Mao, Yuchen, Hu, Wenjing, Xie, Tianbao, Xu, Hongshen, Zhang, Danyang, Wang, Sida, Sun, Ruoxi, Yin, Pengcheng, Xiong, Caiming, Ni, Ansong, Liu, Qian, Zhong, Victor, Chen, Lu, Yu, Kai, Yu, Tao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
par: Lei, Fangyu, et autres
Publié: (2024)
par: Lei, Fangyu, et autres
Publié: (2024)
CoE-SQL: In-Context Learning for Multi-Turn Text-to-SQL with Chain-of-Editions
par: Zhang, Hanchong, et autres
Publié: (2024)
par: Zhang, Hanchong, et autres
Publié: (2024)
A BiRGAT Model for Multi-intent Spoken Language Understanding with Hierarchical Semantic Frames
par: Xu, Hongshen, et autres
Publié: (2024)
par: Xu, Hongshen, et autres
Publié: (2024)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
par: Xie, Tianbao, et autres
Publié: (2024)
par: Xie, Tianbao, et autres
Publié: (2024)
Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction
par: Zhang, Danyang, et autres
Publié: (2023)
par: Zhang, Danyang, et autres
Publié: (2023)
Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
par: Xie, Tianbao, et autres
Publié: (2025)
par: Xie, Tianbao, et autres
Publié: (2025)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
par: Xu, Hongshen, et autres
Publié: (2024)
par: Xu, Hongshen, et autres
Publié: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)
par: Dong, Hanze, et autres
Publié: (2024)
ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards
par: Li, Fanxing, et autres
Publié: (2025)
par: Li, Fanxing, et autres
Publié: (2025)
VisFly: An Efficient and Versatile Simulator for Training Vision-based Flight
par: Li, Fanxing, et autres
Publié: (2024)
par: Li, Fanxing, et autres
Publié: (2024)
NeuSym-RAG: Hybrid Neural Symbolic Retrieval with Multiview Structuring for PDF Question Answering
par: Cao, Ruisheng, et autres
Publié: (2025)
par: Cao, Ruisheng, et autres
Publié: (2025)
Turning Conversations into Workflows: A Framework to Extract and Evaluate Dialog Workflows for Service AI Agents
par: Choubey, Prafulla Kumar, et autres
Publié: (2025)
par: Choubey, Prafulla Kumar, et autres
Publié: (2025)
StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification
par: He, Yichen, et autres
Publié: (2024)
par: He, Yichen, et autres
Publié: (2024)
Multicast Capacity of XL-RIS Assisted Hybrid Near- and Far-Field mmWave Communications
par: Chen, Hui, et autres
Publié: (2026)
par: Chen, Hui, et autres
Publié: (2026)
Mamba-based Light Field Super-Resolution with Efficient Subspace Scanning
par: Gao, Ruisheng, et autres
Publié: (2024)
par: Gao, Ruisheng, et autres
Publié: (2024)
ProgRM: Build Better GUI Agents with Progress Rewards
par: Zhang, Danyang, et autres
Publié: (2025)
par: Zhang, Danyang, et autres
Publié: (2025)
Agentic Confidence Calibration
par: Zhang, Jiaxin, et autres
Publié: (2026)
par: Zhang, Jiaxin, et autres
Publié: (2026)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
par: Xu, Yiheng, et autres
Publié: (2024)
par: Xu, Yiheng, et autres
Publié: (2024)
AGILE: A Novel Reinforcement Learning Framework of LLM Agents
par: Feng, Peiyuan, et autres
Publié: (2024)
par: Feng, Peiyuan, et autres
Publié: (2024)
Sea–Land Segmentation Dataset Sources
par: Zhang, Jixuan
Publié: (2025)
par: Zhang, Jixuan
Publié: (2025)
Projected Holstein-Primakoff boson representation of quantum spins for spin wave theory
par: Liu, Ke, et autres
Publié: (2025)
par: Liu, Ke, et autres
Publié: (2025)
Reducing Tool Hallucination via Reliability Alignment
par: Xu, Hongshen, et autres
Publié: (2024)
par: Xu, Hongshen, et autres
Publié: (2024)
Spider minor ampullate silk protein nanoparticles: an effective protein delivery system capable of enhancing systemic immune responses
par: Hairui Yu, et autres
Publié: (2024)
par: Hairui Yu, et autres
Publié: (2024)
ReCast: Reliability-aware Codebook Assisted Lightweight Time Series Forecasting
par: Ma, Xiang, et autres
Publié: (2025)
par: Ma, Xiang, et autres
Publié: (2025)
From Model Choice to Model Belief: Establishing a New Measure for LLM-Based Research
par: Sun, Hongshen, et autres
Publié: (2025)
par: Sun, Hongshen, et autres
Publié: (2025)
Convomem Benchmark: Why Your First 150 Conversations Don't Need RAG
par: Pakhomov, Egor, et autres
Publié: (2025)
par: Pakhomov, Egor, et autres
Publié: (2025)
Multilingual Brain Surgeon: Large Language Models Can be Compressed Leaving No Language Behind
par: Zeng, Hongchuan, et autres
Publié: (2024)
par: Zeng, Hongchuan, et autres
Publié: (2024)
GNNs as Predictors of Agentic Workflow Performances
par: Zhang, Yuanshuo, et autres
Publié: (2025)
par: Zhang, Yuanshuo, et autres
Publié: (2025)
Subject or Style: Adaptive and Training-Free Mixture of LoRAs
par: Zhang, Jia-Chen, et autres
Publié: (2025)
par: Zhang, Jia-Chen, et autres
Publié: (2025)
Diffusion-based Light Field Synthesis
par: Gao, Ruisheng, et autres
Publié: (2024)
par: Gao, Ruisheng, et autres
Publié: (2024)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
par: Chen, Yuxuan, et autres
Publié: (2025)
par: Chen, Yuxuan, et autres
Publié: (2025)
Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)
par: Zhang, Tianbao
Publié: (2026)
par: Zhang, Tianbao
Publié: (2026)
On an Identity by Bruckman and Good
par: Chua, Hongshen
Publié: (2025)
par: Chua, Hongshen
Publié: (2025)
A Study of Second-Order Linear Recurrence Sequences via Continuants
par: Chua, Hongshen
Publié: (2025)
par: Chua, Hongshen
Publié: (2025)
A priori and a posteriori error estimates of a really pressure-robust virtual element method for the incompressible Brinkman problem
par: Xiong, Yu, et autres
Publié: (2024)
par: Xiong, Yu, et autres
Publié: (2024)
AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
par: Xu, Yiheng, et autres
Publié: (2024)
par: Xu, Yiheng, et autres
Publié: (2024)
VisFly-Lab: Unified Differentiable Framework for First-Order Reinforcement Learning of Quadrotor Control
par: Li, Fanxing, et autres
Publié: (2026)
par: Li, Fanxing, et autres
Publié: (2026)
A deep neural network model for optimizing traditional Chinese medicine prescriptions with data augmentation
par: Xiaohan Mao, et autres
Publié: (2025)
par: Xiaohan Mao, et autres
Publié: (2025)
Enhancing Physicochemical Characteristics of Donkey Meat through High‐Voltage Electrostatic Stimulation during Acid Excretion
par: Xinzhuang Zhang, et autres
Publié: (2024)
par: Xinzhuang Zhang, et autres
Publié: (2024)
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation
par: Zhang, Jiaxin, et autres
Publié: (2026)
par: Zhang, Jiaxin, et autres
Publié: (2026)
Documents similaires
-
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
par: Lei, Fangyu, et autres
Publié: (2024) -
CoE-SQL: In-Context Learning for Multi-Turn Text-to-SQL with Chain-of-Editions
par: Zhang, Hanchong, et autres
Publié: (2024) -
A BiRGAT Model for Multi-intent Spoken Language Understanding with Hierarchical Semantic Frames
par: Xu, Hongshen, et autres
Publié: (2024) -
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
par: Xie, Tianbao, et autres
Publié: (2024) -
Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction
par: Zhang, Danyang, et autres
Publié: (2023)