Codehacks: A Dataset of Adversarial Tests for Competitive Programming Problems Obtained from Codeforces
Fuente:
arXiv
Saved in:
| Main Authors: | Hort, Max, Moonen, Leon |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Art of Repair: Optimizing Iterative Program Repair with Instruction-Tuned Models
by: Ruiz, Fernando Vallecillos, et al.
Published: (2025)
by: Ruiz, Fernando Vallecillos, et al.
Published: (2025)
Semantic-Preserving Transformations as Mutation Operators: A Study on Their Effectiveness in Defect Detection
by: Hort, Max, et al.
Published: (2025)
by: Hort, Max, et al.
Published: (2025)
The Impact of Fine-tuning Large Language Models on Automated Program Repair
by: Macháček, Roman, et al.
Published: (2025)
by: Macháček, Roman, et al.
Published: (2025)
Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation
by: Ruiz, Fernando Vallecillos, et al.
Published: (2024)
by: Ruiz, Fernando Vallecillos, et al.
Published: (2024)
Wisdom and Delusion of LLM Ensembles for Code Generation and Repair
by: Vallecillos-Ruiz, Fernando, et al.
Published: (2025)
by: Vallecillos-Ruiz, Fernando, et al.
Published: (2025)
A Comparative Study on Large Language Models for Log Parsing
by: Astekin, Merve, et al.
Published: (2024)
by: Astekin, Merve, et al.
Published: (2024)
LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?
by: Zheng, Zihan, et al.
Published: (2025)
by: Zheng, Zihan, et al.
Published: (2025)
Fully Autonomous Programming using Iterative Multi-Agent Debugging with Large Language Models
by: Grishina, Anastasiia, et al.
Published: (2025)
by: Grishina, Anastasiia, et al.
Published: (2025)
Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems
by: Cao, Yuhan, et al.
Published: (2025)
by: Cao, Yuhan, et al.
Published: (2025)
UniTSyn: A Large-Scale Dataset Capable of Enhancing the Prowess of Large Language Models for Program Testing
by: He, Yifeng, et al.
Published: (2024)
by: He, Yifeng, et al.
Published: (2024)
AutoCode: LLMs as Problem Setters for Competitive Programming
by: Zhou, Shang, et al.
Published: (2025)
by: Zhou, Shang, et al.
Published: (2025)
StRuCom: A Novel Dataset of Structured Code Comments in Russian
by: Dziuba, Maria, et al.
Published: (2025)
by: Dziuba, Maria, et al.
Published: (2025)
CP-Agent: Agentic Constraint Programming
by: Szeider, Stefan
Published: (2025)
by: Szeider, Stefan
Published: (2025)
Rethinking Repetition Problems of LLMs in Code Generation
by: Dong, Yihong, et al.
Published: (2025)
by: Dong, Yihong, et al.
Published: (2025)
Learning to Generate Unit Tests for Automated Debugging
by: Prasad, Archiki, et al.
Published: (2025)
by: Prasad, Archiki, et al.
Published: (2025)
Scaling Test-Time Compute for Agentic Coding
by: Kim, Joongwon, et al.
Published: (2026)
by: Kim, Joongwon, et al.
Published: (2026)
On Problems of Implicit Context Compression for Software Engineering Agents
by: Gelvan, Kirill, et al.
Published: (2026)
by: Gelvan, Kirill, et al.
Published: (2026)
Applying Large Language Models API to Issue Classification Problem
by: Aracena, Gabriel, et al.
Published: (2024)
by: Aracena, Gabriel, et al.
Published: (2024)
APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
by: Liu, Zuxin, et al.
Published: (2024)
by: Liu, Zuxin, et al.
Published: (2024)
MCP-Solver: Integrating Language Models with Constraint Programming Systems
by: Szeider, Stefan
Published: (2024)
by: Szeider, Stefan
Published: (2024)
Do LLMs Consider Security? An Empirical Study on Responses to Programming Questions
by: Sajadi, Amirali, et al.
Published: (2025)
by: Sajadi, Amirali, et al.
Published: (2025)
What Is Wrong with My Model? Identifying Systematic Problems with Semantic Data Slicing
by: Yang, Chenyang, et al.
Published: (2024)
by: Yang, Chenyang, et al.
Published: (2024)
LLMEffiChecker: Understanding and Testing Efficiency Degradation of Large Language Models
by: Feng, Xiaoning, et al.
Published: (2022)
by: Feng, Xiaoning, et al.
Published: (2022)
AlgoTune: Can Language Models Speed Up General-Purpose Numerical Programs?
by: Press, Ori, et al.
Published: (2025)
by: Press, Ori, et al.
Published: (2025)
A Systematic Approach to Predict the Impact of Cybersecurity Vulnerabilities Using LLMs
by: Høst, Anders Mølmen, et al.
Published: (2025)
by: Høst, Anders Mølmen, et al.
Published: (2025)
Is Programming by Example solved by LLMs?
by: Li, Wen-Ding, et al.
Published: (2024)
by: Li, Wen-Ding, et al.
Published: (2024)
ReGAL: Refactoring Programs to Discover Generalizable Abstractions
by: Stengel-Eskin, Elias, et al.
Published: (2024)
by: Stengel-Eskin, Elias, et al.
Published: (2024)
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
by: Wei, Anjiang, et al.
Published: (2025)
by: Wei, Anjiang, et al.
Published: (2025)
$\textbf{PLUM}$: Improving Code LMs with Execution-Guided On-Policy Preference Learning Driven By Synthetic Test Cases
by: Zhang, Dylan, et al.
Published: (2024)
by: Zhang, Dylan, et al.
Published: (2024)
SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories
by: Wang, Lilin, et al.
Published: (2025)
by: Wang, Lilin, et al.
Published: (2025)
Automated Knowledge Component Generation for Interpretable Knowledge Tracing in Coding Problems
by: Duan, Zhangqi, et al.
Published: (2025)
by: Duan, Zhangqi, et al.
Published: (2025)
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
by: Xie, Zichen, et al.
Published: (2026)
by: Xie, Zichen, et al.
Published: (2026)
MILE: A Mutation Testing Framework of In-Context Learning Systems
by: Wei, Zeming, et al.
Published: (2024)
by: Wei, Zeming, et al.
Published: (2024)
A Survey on Code Generation with LLM-based Agents
by: Dong, Yihong, et al.
Published: (2025)
by: Dong, Yihong, et al.
Published: (2025)
Automated Unity Game Template Generation from GDDs via NLP and Multi-Modal LLMs
by: Hassan, Amna
Published: (2025)
by: Hassan, Amna
Published: (2025)
Step Rejection Fine-Tuning: A Practical Distillation Recipe
by: Slinko, Igor, et al.
Published: (2026)
by: Slinko, Igor, et al.
Published: (2026)
Bridging AI Innovation and Healthcare Needs: Lessons Learned from Incorporating Modern NLP at The BC Cancer Registry
by: Gondara, Lovedeep, et al.
Published: (2025)
by: Gondara, Lovedeep, et al.
Published: (2025)
DocAgent: A Multi-Agent System for Automated Code Documentation Generation
by: Yang, Dayu, et al.
Published: (2025)
by: Yang, Dayu, et al.
Published: (2025)
ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs
by: Ding, Peng, et al.
Published: (2025)
by: Ding, Peng, et al.
Published: (2025)
CIDRe: A Reference-Free Multi-Aspect Criterion for Code Comment Quality Measurement
by: Dziuba, Maria, et al.
Published: (2025)
by: Dziuba, Maria, et al.
Published: (2025)
Similar Items
-
The Art of Repair: Optimizing Iterative Program Repair with Instruction-Tuned Models
by: Ruiz, Fernando Vallecillos, et al.
Published: (2025) -
Semantic-Preserving Transformations as Mutation Operators: A Study on Their Effectiveness in Defect Detection
by: Hort, Max, et al.
Published: (2025) -
The Impact of Fine-tuning Large Language Models on Automated Program Repair
by: Macháček, Roman, et al.
Published: (2025) -
Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation
by: Ruiz, Fernando Vallecillos, et al.
Published: (2024) -
Wisdom and Delusion of LLM Ensembles for Code Generation and Repair
by: Vallecillos-Ruiz, Fernando, et al.
Published: (2025)