CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bhargava, Vaishnavi, Ghosh, Rajat, Dutta, Debojyoti |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SWE-Tester: Training Open-Source LLMs for Issue Reproduction in Real-World Repositories
par: Soni, Aditya Bharat, et autres
Publié: (2026)
par: Soni, Aditya Bharat, et autres
Publié: (2026)
Go-UT-Bench: A Fine-Tuning Dataset for LLM-Based Unit Test Generation in Go
par: Pipalani, Yashshi, et autres
Publié: (2025)
par: Pipalani, Yashshi, et autres
Publié: (2025)
RANGER -- Repository-Level Agent for Graph-Enhanced Retrieval
par: Shah, Pratik, et autres
Publié: (2025)
par: Shah, Pratik, et autres
Publié: (2025)
A Multi-Agent Framework for Stateful Inference-Time Search
par: Lalan, Arshika, et autres
Publié: (2025)
par: Lalan, Arshika, et autres
Publié: (2025)
CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents
par: Pereira, Kristen, et autres
Publié: (2026)
par: Pereira, Kristen, et autres
Publié: (2026)
KernelBench: Can LLMs Write Efficient GPU Kernels?
par: Ouyang, Anne, et autres
Publié: (2025)
par: Ouyang, Anne, et autres
Publié: (2025)
AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion Generation
par: Pulavarthi, Vaishnavi, et autres
Publié: (2024)
par: Pulavarthi, Vaishnavi, et autres
Publié: (2024)
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
par: Ahmed, Toufique, et autres
Publié: (2024)
par: Ahmed, Toufique, et autres
Publié: (2024)
BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning
par: Zhou, Jinan, et autres
Publié: (2025)
par: Zhou, Jinan, et autres
Publié: (2025)
Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models
par: Nimmaturi, Datta, et autres
Publié: (2025)
par: Nimmaturi, Datta, et autres
Publié: (2025)
OSS-Bench: Benchmark Generator for Coding LLMs
par: Jiang, Yuancheng, et autres
Publié: (2025)
par: Jiang, Yuancheng, et autres
Publié: (2025)
ThrowBench: Benchmarking LLMs by Predicting Runtime Exceptions
par: Prenner, Julian Aron, et autres
Publié: (2025)
par: Prenner, Julian Aron, et autres
Publié: (2025)
RM -RF: Reward Model for Run-Free Unit Test Evaluation
par: Bruches, Elena, et autres
Publié: (2026)
par: Bruches, Elena, et autres
Publié: (2026)
PrismaDV: Automated Task-Aware Data Unit Test Generation
par: Chen, Hao, et autres
Publié: (2026)
par: Chen, Hao, et autres
Publié: (2026)
Can LLMs Find Bugs in Code? An Evaluation from Beginner Errors to Security Vulnerabilities in Python and C++
par: Mhatre, Akshay, et autres
Publié: (2025)
par: Mhatre, Akshay, et autres
Publié: (2025)
Reinforcement Learning from Automatic Feedback for High-Quality Unit Test Generation
par: Steenhoek, Benjamin, et autres
Publié: (2024)
par: Steenhoek, Benjamin, et autres
Publié: (2024)
Reinforcement Learning from Automatic Feedback for High-Quality Unit Test Generation
par: Steenhoek, Benjamin, et autres
Publié: (2023)
par: Steenhoek, Benjamin, et autres
Publié: (2023)
Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought
par: Xie, Zichen, et autres
Publié: (2026)
par: Xie, Zichen, et autres
Publié: (2026)
SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?
par: Miserendino, Samuel, et autres
Publié: (2025)
par: Miserendino, Samuel, et autres
Publié: (2025)
Enabling Global, Human-Centered Explanations for LLMs:From Tokens to Interpretable Code and Test Generation
par: Khati, Dipin, et autres
Publié: (2025)
par: Khati, Dipin, et autres
Publié: (2025)
CoCoNUT: Structural Code Understanding does not fall out of a tree
par: Beger, Claas, et autres
Publié: (2025)
par: Beger, Claas, et autres
Publié: (2025)
PostTrainBench: Can LLM Agents Automate LLM Post-Training?
par: Rank, Ben, et autres
Publié: (2026)
par: Rank, Ben, et autres
Publié: (2026)
Action Shapley: A Training Data Selection Metric for World Model in Reinforcement Learning
par: Ghosh, Rajat, et autres
Publié: (2026)
par: Ghosh, Rajat, et autres
Publié: (2026)
RepairBench: Leaderboard of Frontier Models for Program Repair
par: Silva, André, et autres
Publié: (2024)
par: Silva, André, et autres
Publié: (2024)
EnvBench: A Benchmark for Automated Environment Setup
par: Eliseeva, Aleksandra, et autres
Publié: (2025)
par: Eliseeva, Aleksandra, et autres
Publié: (2025)
SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents
par: Mündler, Niels, et autres
Publié: (2024)
par: Mündler, Niels, et autres
Publié: (2024)
Operational Robustness of LLMs on Code Generation
par: Paul, Debalina Ghosh, et autres
Publié: (2026)
par: Paul, Debalina Ghosh, et autres
Publié: (2026)
TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications
par: Gajjar, Pranshav, et autres
Publié: (2026)
par: Gajjar, Pranshav, et autres
Publié: (2026)
AICD Bench: A Challenging Benchmark for AI-Generated Code Detection
par: Orel, Daniil, et autres
Publié: (2026)
par: Orel, Daniil, et autres
Publié: (2026)
Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?
par: Sorokin, Lev, et autres
Publié: (2024)
par: Sorokin, Lev, et autres
Publié: (2024)
Parameter-Efficient Fine-Tuning of Large Language Models for Unit Test Generation: An Empirical Study
par: Storhaug, André, et autres
Publié: (2024)
par: Storhaug, André, et autres
Publié: (2024)
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
par: Li, Linyi, et autres
Publié: (2024)
par: Li, Linyi, et autres
Publié: (2024)
CoDocBench: A Dataset for Code-Documentation Alignment in Software Maintenance
par: Pai, Kunal, et autres
Publié: (2025)
par: Pai, Kunal, et autres
Publié: (2025)
MobileDev-Bench: A Benchmark for Issue Resolution in Mobile Application Development
par: Fakorede, Moshood A., et autres
Publié: (2026)
par: Fakorede, Moshood A., et autres
Publié: (2026)
Can LLMs Generate Architectural Design Decisions? -An Exploratory Empirical study
par: Dhar, Rudra, et autres
Publié: (2024)
par: Dhar, Rudra, et autres
Publié: (2024)
CodeTaste: Can LLMs Generate Human-Level Code Refactorings?
par: Thillen, Alex, et autres
Publié: (2026)
par: Thillen, Alex, et autres
Publié: (2026)
Learning to Generate Unit Tests for Automated Debugging
par: Prasad, Archiki, et autres
Publié: (2025)
par: Prasad, Archiki, et autres
Publié: (2025)
CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
par: Khatry, Anirudh, et autres
Publié: (2025)
par: Khatry, Anirudh, et autres
Publié: (2025)
IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks
par: Mateega, Spencer, et autres
Publié: (2026)
par: Mateega, Spencer, et autres
Publié: (2026)
Disproving Program Equivalence with LLMs
par: Allamanis, Miltiadis, et autres
Publié: (2025)
par: Allamanis, Miltiadis, et autres
Publié: (2025)
Documents similaires
-
SWE-Tester: Training Open-Source LLMs for Issue Reproduction in Real-World Repositories
par: Soni, Aditya Bharat, et autres
Publié: (2026) -
Go-UT-Bench: A Fine-Tuning Dataset for LLM-Based Unit Test Generation in Go
par: Pipalani, Yashshi, et autres
Publié: (2025) -
RANGER -- Repository-Level Agent for Graph-Enhanced Retrieval
par: Shah, Pratik, et autres
Publié: (2025) -
A Multi-Agent Framework for Stateful Inference-Time Search
par: Lalan, Arshika, et autres
Publié: (2025) -
CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents
par: Pereira, Kristen, et autres
Publié: (2026)