DSCodeBench: A Realistic Benchmark for Data Science Code Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Ouyang, Shuyin, Huang, Dong, Guo, Jingwen, Sun, Zeyu, Zhu, Qihao, Zhang, Jie M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Knowledge-Enhanced Program Repair for Data Science Code
por: Ouyang, Shuyin, et al.
Publicado: (2025)
por: Ouyang, Shuyin, et al.
Publicado: (2025)
An Empirical Study of the Non-determinism of ChatGPT in Code Generation
por: Ouyang, Shuyin, et al.
Publicado: (2023)
por: Ouyang, Shuyin, et al.
Publicado: (2023)
Lyra: A Benchmark for Turducken-Style Code Generation
por: Liang, Qingyuan, et al.
Publicado: (2021)
por: Liang, Qingyuan, et al.
Publicado: (2021)
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
por: Huang, Dong, et al.
Publicado: (2024)
por: Huang, Dong, et al.
Publicado: (2024)
Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
por: Ouyang, Shuyin, et al.
Publicado: (2026)
por: Ouyang, Shuyin, et al.
Publicado: (2026)
DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models
por: Kumarappan, Adarsh, et al.
Publicado: (2026)
por: Kumarappan, Adarsh, et al.
Publicado: (2026)
QuanBench: Benchmarking Quantum Code Generation with Large Language Models
por: Guo, Xiaoyu, et al.
Publicado: (2025)
por: Guo, Xiaoyu, et al.
Publicado: (2025)
CupCleaner: A Hybrid Data Cleaning Approach for Comment Updating
por: Liang, Qingyuan, et al.
Publicado: (2023)
por: Liang, Qingyuan, et al.
Publicado: (2023)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
Directional Diffusion-Style Code Editing Pre-training
por: Liang, Qingyuan, et al.
Publicado: (2025)
por: Liang, Qingyuan, et al.
Publicado: (2025)
TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation
por: Gong, Zhihao, et al.
Publicado: (2026)
por: Gong, Zhihao, et al.
Publicado: (2026)
TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation
por: Gong, Zhihao, et al.
Publicado: (2025)
por: Gong, Zhihao, et al.
Publicado: (2025)
SciReplicate-Bench: Benchmarking LLMs in Agent-driven Algorithmic Reproduction from Research Papers
por: Xiang, Yanzheng, et al.
Publicado: (2025)
por: Xiang, Yanzheng, et al.
Publicado: (2025)
HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation
por: Zheng, Dewu, et al.
Publicado: (2024)
por: Zheng, Dewu, et al.
Publicado: (2024)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
por: Chou, Jason, et al.
Publicado: (2025)
por: Chou, Jason, et al.
Publicado: (2025)
Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation
por: Garg, Spandan, et al.
Publicado: (2025)
por: Garg, Spandan, et al.
Publicado: (2025)
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
Contextualized Code Pretraining for Code Generation
por: Liu, Chen, et al.
Publicado: (2026)
por: Liu, Chen, et al.
Publicado: (2026)
CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation
por: Chen, Zaoyu, et al.
Publicado: (2026)
por: Chen, Zaoyu, et al.
Publicado: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
Benchmarking and Evaluating VLMs for Software Architecture Diagram Understanding
por: Ouyang, Shuyin, et al.
Publicado: (2026)
por: Ouyang, Shuyin, et al.
Publicado: (2026)
OSS-Bench: Benchmark Generator for Coding LLMs
por: Jiang, Yuancheng, et al.
Publicado: (2025)
por: Jiang, Yuancheng, et al.
Publicado: (2025)
CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects
por: Guo, Hanyang, et al.
Publicado: (2025)
por: Guo, Hanyang, et al.
Publicado: (2025)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
por: Aleithan, Reem, et al.
Publicado: (2024)
por: Aleithan, Reem, et al.
Publicado: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
por: Wang, Sizhe, et al.
Publicado: (2025)
por: Wang, Sizhe, et al.
Publicado: (2025)
Learning to Guarantee Type Correctness in Code Generation through Type-Guided Program Synthesis
por: Huang, Zhechong, et al.
Publicado: (2025)
por: Huang, Zhechong, et al.
Publicado: (2025)
GramTrans: A Better Code Representation Approach in Code Generation
por: Zhang, Zhao, et al.
Publicado: (2025)
por: Zhang, Zhao, et al.
Publicado: (2025)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
por: He, Yibo, et al.
Publicado: (2025)
por: He, Yibo, et al.
Publicado: (2025)
RubberDuckBench: A Benchmark for AI Coding Assistants
por: Mohammed, Ferida, et al.
Publicado: (2026)
por: Mohammed, Ferida, et al.
Publicado: (2026)
Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces
por: Merrill, Mike A., et al.
Publicado: (2026)
por: Merrill, Mike A., et al.
Publicado: (2026)
SWE Context Bench: A Benchmark for Context Learning in Coding
por: Zhu, Jiayuan, et al.
Publicado: (2026)
por: Zhu, Jiayuan, et al.
Publicado: (2026)
LAURA: Enhancing Code Review Generation with Context-Enriched Retrieval-Augmented LLM
por: Zhang, Yuxin, et al.
Publicado: (2025)
por: Zhang, Yuxin, et al.
Publicado: (2025)
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
por: Xie, Yiqing, et al.
Publicado: (2024)
por: Xie, Yiqing, et al.
Publicado: (2024)
AICD Bench: A Challenging Benchmark for AI-Generated Code Detection
por: Orel, Daniil, et al.
Publicado: (2026)
por: Orel, Daniil, et al.
Publicado: (2026)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
por: Zhang, Zhe, et al.
Publicado: (2025)
por: Zhang, Zhe, et al.
Publicado: (2025)
FeatBench: Towards More Realistic Evaluation of Feature-level Code Generation
por: Chen, Haorui, et al.
Publicado: (2025)
por: Chen, Haorui, et al.
Publicado: (2025)
A Survey of Large Language Models for Code: Evolution, Benchmarking, and Future Trends
por: Zheng, Zibin, et al.
Publicado: (2023)
por: Zheng, Zibin, et al.
Publicado: (2023)
AL-Bench: A Benchmark for Automatic Logging
por: Tan, Boyin, et al.
Publicado: (2025)
por: Tan, Boyin, et al.
Publicado: (2025)
Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling
por: Zhao, Qianhui, et al.
Publicado: (2025)
por: Zhao, Qianhui, et al.
Publicado: (2025)
Ejemplares similares
-
Knowledge-Enhanced Program Repair for Data Science Code
por: Ouyang, Shuyin, et al.
Publicado: (2025) -
An Empirical Study of the Non-determinism of ChatGPT in Code Generation
por: Ouyang, Shuyin, et al.
Publicado: (2023) -
Lyra: A Benchmark for Turducken-Style Code Generation
por: Liang, Qingyuan, et al.
Publicado: (2021) -
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
por: Huang, Dong, et al.
Publicado: (2024) -
Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
por: Ouyang, Shuyin, et al.
Publicado: (2026)