ML-Dev-Bench: Comparative Analysis of AI Agents on ML development workflows
Fuente:
arXiv
Salvato in:
| Autori principali: | Padigela, Harshith, Shah, Chintan, Juyal, Dinkar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
di: Lu, Pengrui, et al.
Pubblicazione: (2026)
di: Lu, Pengrui, et al.
Pubblicazione: (2026)
DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle
di: Tang, Yuheng, et al.
Pubblicazione: (2026)
di: Tang, Yuheng, et al.
Pubblicazione: (2026)
LoCoML: A Framework for Real-World ML Inference Pipelines
di: Maddireddy, Kritin, et al.
Pubblicazione: (2025)
di: Maddireddy, Kritin, et al.
Pubblicazione: (2025)
AutoDev: Automated AI-Driven Development
di: Tufano, Michele, et al.
Pubblicazione: (2024)
di: Tufano, Michele, et al.
Pubblicazione: (2024)
Using AI/ML to Find and Remediate Enterprise Secrets in Code & Document Sharing Platforms
di: Kerr, Gregor, et al.
Pubblicazione: (2024)
di: Kerr, Gregor, et al.
Pubblicazione: (2024)
AI for DevSecOps: A Landscape and Future Opportunities
di: Fu, Michael, et al.
Pubblicazione: (2024)
di: Fu, Michael, et al.
Pubblicazione: (2024)
ML Code Smells: From Specification to Detection
di: Mahmoudi, Brahim, et al.
Pubblicazione: (2025)
di: Mahmoudi, Brahim, et al.
Pubblicazione: (2025)
DREAM: Debugging and Repairing AutoML Pipelines
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2023)
daVinci-Dev: Agent-native Mid-training for Software Engineering
di: Zeng, Ji, et al.
Pubblicazione: (2026)
di: Zeng, Ji, et al.
Pubblicazione: (2026)
Maintainability Challenges in ML: A Systematic Literature Review
di: Shivashankar, Karthik, et al.
Pubblicazione: (2024)
di: Shivashankar, Karthik, et al.
Pubblicazione: (2024)
GameDevBench: Evaluating Agentic Capabilities Through Game Development
di: Chi, Wayne, et al.
Pubblicazione: (2026)
di: Chi, Wayne, et al.
Pubblicazione: (2026)
MLScent A tool for Anti-pattern detection in ML projects
di: Shivashankar, Karthik, et al.
Pubblicazione: (2025)
di: Shivashankar, Karthik, et al.
Pubblicazione: (2025)
Define-ML: An Approach to Ideate Machine Learning-Enabled Systems
di: Alonso, Silvio, et al.
Pubblicazione: (2025)
di: Alonso, Silvio, et al.
Pubblicazione: (2025)
DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models
di: Kumarappan, Adarsh, et al.
Pubblicazione: (2026)
di: Kumarappan, Adarsh, et al.
Pubblicazione: (2026)
DevLicOps: A Framework for Mitigating Licensing Risks in AI-Generated Code
di: Sharma, Pratyush Nidhi, et al.
Pubblicazione: (2025)
di: Sharma, Pratyush Nidhi, et al.
Pubblicazione: (2025)
PBT-Bench: Benchmarking AI Agents on Property-Based Testing
di: Jing, Lucas, et al.
Pubblicazione: (2026)
di: Jing, Lucas, et al.
Pubblicazione: (2026)
Navigating Fairness: Practitioners' Understanding, Challenges, and Strategies in AI/ML Development
di: Pant, Aastha, et al.
Pubblicazione: (2024)
di: Pant, Aastha, et al.
Pubblicazione: (2024)
EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
di: Liu, Junwei, et al.
Pubblicazione: (2025)
di: Liu, Junwei, et al.
Pubblicazione: (2025)
Kotlin ML Pack: Technical Report
di: Titov, Sergey, et al.
Pubblicazione: (2024)
di: Titov, Sergey, et al.
Pubblicazione: (2024)
Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents
di: Yang, Zonghan, et al.
Pubblicazione: (2025)
di: Yang, Zonghan, et al.
Pubblicazione: (2025)
Multi-Robot System Architecture design in SysML and BPMN
di: Sadik, Ahmed R., et al.
Pubblicazione: (2024)
di: Sadik, Ahmed R., et al.
Pubblicazione: (2024)
A Framework to Model ML Engineering Processes
di: Morales, Sergio, et al.
Pubblicazione: (2024)
di: Morales, Sergio, et al.
Pubblicazione: (2024)
Snakemaker: Seamlessly transforming ad-hoc analyses into sustainable Snakemake workflows with generative AI
di: Masera, Marco, et al.
Pubblicazione: (2025)
di: Masera, Marco, et al.
Pubblicazione: (2025)
GeoAnalystBench: A GeoAI benchmark for assessing large language models for spatial analysis workflow and code generation
di: Zhang, Qianheng, et al.
Pubblicazione: (2025)
di: Zhang, Qianheng, et al.
Pubblicazione: (2025)
Analyzing the Evolution and Maintenance of ML Models on Hugging Face
di: Castaño, Joel, et al.
Pubblicazione: (2023)
di: Castaño, Joel, et al.
Pubblicazione: (2023)
Fairness Is Not Just Ethical: Performance Trade-Off via Data Correlation Tuning to Mitigate Bias in ML Software
di: Xiao, Ying, et al.
Pubblicazione: (2025)
di: Xiao, Ying, et al.
Pubblicazione: (2025)
WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
di: Li, Chunyang, et al.
Pubblicazione: (2025)
di: Li, Chunyang, et al.
Pubblicazione: (2025)
CrackMeBench: Binary Reverse Engineering for Agents
di: David, Isaac, et al.
Pubblicazione: (2026)
di: David, Isaac, et al.
Pubblicazione: (2026)
Enhancing Educational Efficiency: Generative AI Chatbots and DevOps in Education 4.0
di: Mekić, Edis, et al.
Pubblicazione: (2024)
di: Mekić, Edis, et al.
Pubblicazione: (2024)
On the Security Risks of ML-based Malware Detection Systems: A Survey
di: He, Ping, et al.
Pubblicazione: (2025)
di: He, Ping, et al.
Pubblicazione: (2025)
Using Quality Attribute Scenarios for ML Model Test Case Generation
di: Brower-Sinning, Rachel, et al.
Pubblicazione: (2024)
di: Brower-Sinning, Rachel, et al.
Pubblicazione: (2024)
Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild
di: Zhao, Zhimin, et al.
Pubblicazione: (2026)
di: Zhao, Zhimin, et al.
Pubblicazione: (2026)
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
di: Qiu, Jielin, et al.
Pubblicazione: (2025)
di: Qiu, Jielin, et al.
Pubblicazione: (2025)
An Exploratory Study of ML Sketches and Visual Code Assistants
di: Gomes, Luís F., et al.
Pubblicazione: (2024)
di: Gomes, Luís F., et al.
Pubblicazione: (2024)
Predicting Fairness of ML Software Configurations
di: Herrera, Salvador Robles, et al.
Pubblicazione: (2024)
di: Herrera, Salvador Robles, et al.
Pubblicazione: (2024)
Consolidating TinyML Lifecycle with Large Language Models: Reality, Illusion, or Opportunity?
di: Wu, Guanghan, et al.
Pubblicazione: (2025)
di: Wu, Guanghan, et al.
Pubblicazione: (2025)
Towards a Classification of Open-Source ML Models and Datasets for Software Engineering
di: González, Alexandra, et al.
Pubblicazione: (2024)
di: González, Alexandra, et al.
Pubblicazione: (2024)
A Large-Scale Study of Model Integration in ML-Enabled Software Systems
di: Sens, Yorick, et al.
Pubblicazione: (2024)
di: Sens, Yorick, et al.
Pubblicazione: (2024)
The Enhancement of Software Delivery Performance through Enterprise DevSecOps and Generative Artificial Intelligence in Chinese Technology Firms
di: Cui, Jun
Pubblicazione: (2024)
di: Cui, Jun
Pubblicazione: (2024)
Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation
di: Garg, Spandan, et al.
Pubblicazione: (2025)
di: Garg, Spandan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
di: Lu, Pengrui, et al.
Pubblicazione: (2026) -
DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle
di: Tang, Yuheng, et al.
Pubblicazione: (2026) -
LoCoML: A Framework for Real-World ML Inference Pipelines
di: Maddireddy, Kritin, et al.
Pubblicazione: (2025) -
AutoDev: Automated AI-Driven Development
di: Tufano, Michele, et al.
Pubblicazione: (2024) -
Using AI/ML to Find and Remediate Enterprise Secrets in Code & Document Sharing Platforms
di: Kerr, Gregor, et al.
Pubblicazione: (2024)