DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Yiming, Luo, Jianwen, Yu, Yan, Zhang, Yitong, Lei, Fangyu, Wei, Yifan, He, Shizhu, Huang, Lifu, Liu, Xiao, Zhao, Jun, Liu, Kang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models
par: Lei, Fangyu, et autres
Publié: (2023)
par: Lei, Fangyu, et autres
Publié: (2023)
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
par: Lei, Fangyu, et autres
Publié: (2025)
par: Lei, Fangyu, et autres
Publié: (2025)
S$^3$HQA: A Three-Stage Approach for Multi-hop Text-Table Hybrid Question Answering
par: Lei, Fangyu, et autres
Publié: (2023)
par: Lei, Fangyu, et autres
Publié: (2023)
GATE: Graph-based Adaptive Tool Evolution Across Diverse Tasks
par: Luo, Jianwen, et autres
Publié: (2025)
par: Luo, Jianwen, et autres
Publié: (2025)
MoELoRA: Contrastive Learning Guided Mixture of Experts on Parameter-Efficient Fine-Tuning for Large Language Models
par: Luo, Tongxu, et autres
Publié: (2024)
par: Luo, Tongxu, et autres
Publié: (2024)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
par: Meng, Jinxiang, et autres
Publié: (2026)
par: Meng, Jinxiang, et autres
Publié: (2026)
Reasoning-Table: Exploring Reinforcement Learning for Table Reasoning
par: Lei, Fangyu, et autres
Publié: (2025)
par: Lei, Fangyu, et autres
Publié: (2025)
Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language Models
par: Tan, Yuqiao, et autres
Publié: (2025)
par: Tan, Yuqiao, et autres
Publié: (2025)
SC-Taxo: Hierarchical Taxonomy Generation under Semantic Consistency Constraints using Large Language Models
par: Cai, Shiqiang, et autres
Publié: (2026)
par: Cai, Shiqiang, et autres
Publié: (2026)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
par: He, Yibo, et autres
Publié: (2025)
par: He, Yibo, et autres
Publié: (2025)
LLaSA: Large Language and Structured Data Assistant
par: Xu, Yao, et autres
Publié: (2024)
par: Xu, Yao, et autres
Publié: (2024)
ExpNote: Black-box Large Language Models are Better Task Solvers with Experience Notebook
par: Sun, Wangtao, et autres
Publié: (2023)
par: Sun, Wangtao, et autres
Publié: (2023)
Awakening Augmented Generation: Learning to Awaken Internal Knowledge of Large Language Models for Question Answering
par: Liao, Huanxuan, et autres
Publié: (2024)
par: Liao, Huanxuan, et autres
Publié: (2024)
Neeko: Leveraging Dynamic LoRA for Efficient Multi-Character Role-Playing Agent
par: Yu, Xiaoyan, et autres
Publié: (2024)
par: Yu, Xiaoyan, et autres
Publié: (2024)
DSCodeBench: A Realistic Benchmark for Data Science Code Generation
par: Ouyang, Shuyin, et autres
Publié: (2025)
par: Ouyang, Shuyin, et autres
Publié: (2025)
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
par: Zhao, Songwen, et autres
Publié: (2025)
par: Zhao, Songwen, et autres
Publié: (2025)
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
par: Wang, Jiexin, et autres
Publié: (2024)
par: Wang, Jiexin, et autres
Publié: (2024)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
par: Guo, Chengquan, et autres
Publié: (2024)
par: Guo, Chengquan, et autres
Publié: (2024)
ControlLM: Crafting Diverse Personalities for Language Models
par: Weng, Yixuan, et autres
Publié: (2024)
par: Weng, Yixuan, et autres
Publié: (2024)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
par: Chou, Jason, et autres
Publié: (2025)
par: Chou, Jason, et autres
Publié: (2025)
Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages
par: Wu, Fan, et autres
Publié: (2026)
par: Wu, Fan, et autres
Publié: (2026)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
par: Yan, Kaiwen, et autres
Publié: (2025)
par: Yan, Kaiwen, et autres
Publié: (2025)
Where Is Self-admitted Code Generated by Large Language Models on GitHub?
par: Yu, Xiao, et autres
Publié: (2024)
par: Yu, Xiao, et autres
Publié: (2024)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
par: Zhang, Alexander, et autres
Publié: (2025)
par: Zhang, Alexander, et autres
Publié: (2025)
Seeker: Towards Exception Safety Code Generation with Intermediate Language Agents Framework
par: Zhang, Xuanming, et autres
Publié: (2024)
par: Zhang, Xuanming, et autres
Publié: (2024)
MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems
par: Li, Kaixin, et autres
Publié: (2024)
par: Li, Kaixin, et autres
Publié: (2024)
Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
par: Du, Mingzhe, et autres
Publié: (2024)
par: Du, Mingzhe, et autres
Publié: (2024)
Dynamic Parametric Retrieval Augmented Generation for Test-time Knowledge Enhancement
par: Tan, Yuqiao, et autres
Publié: (2025)
par: Tan, Yuqiao, et autres
Publié: (2025)
Large Language Model-Powered Evolutionary Code Optimization on a Phylogenetic Tree
par: Zhao, Leyi, et autres
Publié: (2026)
par: Zhao, Leyi, et autres
Publié: (2026)
Efficient Data Learning for Open Information Extraction with Pre-trained Language Models
par: Fan, Zhiyuan, et autres
Publié: (2023)
par: Fan, Zhiyuan, et autres
Publié: (2023)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
par: Fu, Lingyue, et autres
Publié: (2023)
par: Fu, Lingyue, et autres
Publié: (2023)
The Zero-Step Thinking: An Empirical Study of Mode Selection as Harder Early Exit in Reasoning Models
par: Tan, Yuqiao, et autres
Publié: (2025)
par: Tan, Yuqiao, et autres
Publié: (2025)
From Chain to Tree: Refining Chain-like Rules into Tree-like Rules on Knowledge Graphs
par: Sun, Wangtao, et autres
Publié: (2024)
par: Sun, Wangtao, et autres
Publié: (2024)
Find Parent then Label Children: A Two-stage Taxonomy Completion Method with Pre-trained Language Model
par: Xia, Fei, et autres
Publié: (2024)
par: Xia, Fei, et autres
Publié: (2024)
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
par: Peng, Zhiyuan, et autres
Publié: (2025)
par: Peng, Zhiyuan, et autres
Publié: (2025)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
par: Chang, Yaoyao, et autres
Publié: (2024)
par: Chang, Yaoyao, et autres
Publié: (2024)
Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN
par: Xu, Yao, et autres
Publié: (2025)
par: Xu, Yao, et autres
Publié: (2025)
CodeMirage: Hallucinations in Code Generated by Large Language Models
par: Agarwal, Vibhor, et autres
Publié: (2024)
par: Agarwal, Vibhor, et autres
Publié: (2024)
Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
par: Li, Chengze, et autres
Publié: (2025)
par: Li, Chengze, et autres
Publié: (2025)
Documents similaires
-
S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models
par: Lei, Fangyu, et autres
Publié: (2023) -
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
par: Lei, Fangyu, et autres
Publié: (2025) -
S$^3$HQA: A Three-Stage Approach for Multi-hop Text-Table Hybrid Question Answering
par: Lei, Fangyu, et autres
Publié: (2023) -
GATE: Graph-based Adaptive Tool Evolution Across Diverse Tasks
par: Luo, Jianwen, et autres
Publié: (2025) -
MoELoRA: Contrastive Learning Guided Mixture of Experts on Parameter-Efficient Fine-Tuning for Large Language Models
par: Luo, Tongxu, et autres
Publié: (2024)