DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jing, Liqiang, Huang, Zhehui, Wang, Xiaoyang, Yao, Wenlin, Yu, Wenhao, Ma, Kaixin, Zhang, Hongming, Du, Xinya, Yu, Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
par: He, Hongliang, et autres
Publié: (2024)
par: He, Hongliang, et autres
Publié: (2024)
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
par: He, Hongliang, et autres
Publié: (2024)
par: He, Hongliang, et autres
Publié: (2024)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
par: Zhang, Zhisong, et autres
Publié: (2025)
par: Zhang, Zhisong, et autres
Publié: (2025)
Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
par: Cao, Ruisheng, et autres
Publié: (2024)
par: Cao, Ruisheng, et autres
Publié: (2024)
Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
par: Yu, Wenhao, et autres
Publié: (2023)
par: Yu, Wenhao, et autres
Publié: (2023)
Retrieval-augmented GUI Agents with Generative Guidelines
par: Xu, Ran, et autres
Publié: (2025)
par: Xu, Ran, et autres
Publié: (2025)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
LASER: LLM Agent with State-Space Exploration for Web Navigation
par: Ma, Kaixin, et autres
Publié: (2023)
par: Ma, Kaixin, et autres
Publié: (2023)
AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions
par: Li, Ziming, et autres
Publié: (2024)
par: Li, Ziming, et autres
Publié: (2024)
Benchmarking Data Science Agents
par: Zhang, Yuge, et autres
Publié: (2024)
par: Zhang, Yuge, et autres
Publié: (2024)
Dense X Retrieval: What Retrieval Granularity Should We Use?
par: Chen, Tong, et autres
Publié: (2023)
par: Chen, Tong, et autres
Publié: (2023)
LDC: Learning to Generate Research Idea with Dynamic Control
par: Li, Ruochen, et autres
Publié: (2024)
par: Li, Ruochen, et autres
Publié: (2024)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
par: Jing, Liqiang, et autres
Publié: (2024)
par: Jing, Liqiang, et autres
Publié: (2024)
DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems
par: Sun, Maojun, et autres
Publié: (2026)
par: Sun, Maojun, et autres
Publié: (2026)
\$OneMillion-Bench: How Far are Language Agents from Human Experts?
par: Yang, Qianyu, et autres
Publié: (2026)
par: Yang, Qianyu, et autres
Publié: (2026)
Cognitive Kernel: An Open-source Agent System towards Generalist Autopilots
par: Zhang, Hongming, et autres
Publié: (2024)
par: Zhang, Hongming, et autres
Publié: (2024)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
par: Fang, Tianqing, et autres
Publié: (2025)
par: Fang, Tianqing, et autres
Publié: (2025)
HDFlow: Enhancing LLM Complex Problem-Solving with Hybrid Thinking and Dynamic Workflows
par: Yao, Wenlin, et autres
Publié: (2024)
par: Yao, Wenlin, et autres
Publié: (2024)
DataSciBench: An LLM Agent Benchmark for Data Science
par: Zhang, Dan, et autres
Publié: (2025)
par: Zhang, Dan, et autres
Publié: (2025)
DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation
par: You, Ziming, et autres
Publié: (2025)
par: You, Ziming, et autres
Publié: (2025)
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
par: Ouyang, Siru, et autres
Publié: (2024)
par: Ouyang, Siru, et autres
Publié: (2024)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
par: Huang, Yiming, et autres
Publié: (2024)
par: Huang, Yiming, et autres
Publié: (2024)
AI-Driven Automation Can Become the Foundation of Next-Era Science of Science Research
par: Chen, Renqi, et autres
Publié: (2025)
par: Chen, Renqi, et autres
Publié: (2025)
ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery
par: Chen, Ziru, et autres
Publié: (2024)
par: Chen, Ziru, et autres
Publié: (2024)
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
par: Wu, Xuansheng, et autres
Publié: (2023)
par: Wu, Xuansheng, et autres
Publié: (2023)
SciDFM: A Large Language Model with Mixture-of-Experts for Science
par: Sun, Liangtai, et autres
Publié: (2024)
par: Sun, Liangtai, et autres
Publié: (2024)
MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)
par: Liu, Fuxiao, et autres
Publié: (2023)
DeFine: Decision-Making with Analogical Reasoning over Factor Profiles
par: Hu, Yebowen, et autres
Publié: (2024)
par: Hu, Yebowen, et autres
Publié: (2024)
When Reasoning Meets Information Aggregation: A Case Study with Sports Narratives
par: Hu, Yebowen, et autres
Publié: (2024)
par: Hu, Yebowen, et autres
Publié: (2024)
Understanding and Enhancing Mamba-Transformer Hybrids for Memory Recall and Language Modeling
par: Lee, Hyunji, et autres
Publié: (2025)
par: Lee, Hyunji, et autres
Publié: (2025)
Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training
par: Fang, Tianqing, et autres
Publié: (2025)
par: Fang, Tianqing, et autres
Publié: (2025)
OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas
par: Wang, Xiaoyang, et autres
Publié: (2025)
par: Wang, Xiaoyang, et autres
Publié: (2025)
BioDSA-1K: Benchmarking Data Science Agents for Biomedical Research
par: Wang, Zifeng, et autres
Publié: (2025)
par: Wang, Zifeng, et autres
Publié: (2025)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
par: Yue, Murong, et autres
Publié: (2024)
par: Yue, Murong, et autres
Publié: (2024)
How Far Can In-Context Alignment Go? Exploring the State of In-Context Alignment
par: Huang, Heyan, et autres
Publié: (2024)
par: Huang, Heyan, et autres
Publié: (2024)
Do Retrieval-Augmented Language Models Adapt to Varying User Needs?
par: Wu, Peilin, et autres
Publié: (2025)
par: Wu, Peilin, et autres
Publié: (2025)
AutoMind: Adaptive Knowledgeable Agent for Automated Data Science
par: Ou, Yixin, et autres
Publié: (2025)
par: Ou, Yixin, et autres
Publié: (2025)
DeepAnalyze: Agentic Large Language Models for Autonomous Data Science
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
LLM-Based Data Science Agents: A Survey of Capabilities, Challenges, and Future Directions
par: Rahman, Mizanur, et autres
Publié: (2025)
par: Rahman, Mizanur, et autres
Publié: (2025)
Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents
par: Testini, Irene, et autres
Publié: (2025)
par: Testini, Irene, et autres
Publié: (2025)
Documents similaires
-
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
par: He, Hongliang, et autres
Publié: (2024) -
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
par: He, Hongliang, et autres
Publié: (2024) -
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
par: Zhang, Zhisong, et autres
Publié: (2025) -
Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
par: Cao, Ruisheng, et autres
Publié: (2024) -
Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
par: Yu, Wenhao, et autres
Publié: (2023)