Promise and Peril of Collaborative Code Generation Models: Balancing Effectiveness and Memorization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Zhi, Jiang, Lingxiao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios
par: Chen, Zhi, et autres
Publié: (2024)
par: Chen, Zhi, et autres
Publié: (2024)
Are Large Language Models Memorizing Bug Benchmarks?
par: Ramos, Daniel, et autres
Publié: (2024)
par: Ramos, Daniel, et autres
Publié: (2024)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
par: Dong, Yihong, et autres
Publié: (2024)
par: Dong, Yihong, et autres
Publié: (2024)
Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios
par: Chen, Zhi, et autres
Publié: (2025)
par: Chen, Zhi, et autres
Publié: (2025)
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
Rethinking Repetition Problems of LLMs in Code Generation
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
CodeFuse-13B: A Pretrained Multi-lingual Code Large Language Model
par: Di, Peng, et autres
Publié: (2023)
par: Di, Peng, et autres
Publié: (2023)
A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models
par: Wu, Yixi, et autres
Publié: (2024)
par: Wu, Yixi, et autres
Publié: (2024)
Code Generation by Differential Test Time Scaling
par: He, Yifeng, et autres
Publié: (2026)
par: He, Yifeng, et autres
Publié: (2026)
Supersonic: Learning to Generate Source Code Optimizations in C/C++
par: Chen, Zimin, et autres
Publié: (2023)
par: Chen, Zimin, et autres
Publié: (2023)
CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X
par: Zheng, Qinkai, et autres
Publié: (2023)
par: Zheng, Qinkai, et autres
Publié: (2023)
Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation
par: Jacopin, Éric
Publié: (2026)
par: Jacopin, Éric
Publié: (2026)
A Survey on Code Generation with LLM-based Agents
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
CodeTaste: Can LLMs Generate Human-Level Code Refactorings?
par: Thillen, Alex, et autres
Publié: (2026)
par: Thillen, Alex, et autres
Publié: (2026)
The Counterfeit Conundrum: Can Code Language Models Grasp the Nuances of Their Incorrect Generations?
par: Gu, Alex, et autres
Publié: (2024)
par: Gu, Alex, et autres
Publié: (2024)
DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models
par: Kumarappan, Adarsh, et autres
Publié: (2026)
par: Kumarappan, Adarsh, et autres
Publié: (2026)
Optimizing AI-Assisted Code Generation
par: Torka, Simon, et autres
Publié: (2024)
par: Torka, Simon, et autres
Publié: (2024)
Operational Robustness of LLMs on Code Generation
par: Paul, Debalina Ghosh, et autres
Publié: (2026)
par: Paul, Debalina Ghosh, et autres
Publié: (2026)
Can Coding Agents Be General Agents?
par: Ivanov, Maksim, et autres
Publié: (2026)
par: Ivanov, Maksim, et autres
Publié: (2026)
Large Language Models Should Ask Clarifying Questions to Increase Confidence in Generated Code
par: Wu, Jie JW
Publié: (2023)
par: Wu, Jie JW
Publié: (2023)
Clover: Closed-Loop Verifiable Code Generation
par: Sun, Chuyue, et autres
Publié: (2023)
par: Sun, Chuyue, et autres
Publié: (2023)
Functional Overlap Reranking for Neural Code Generation
par: To, Hung Quoc, et autres
Publié: (2023)
par: To, Hung Quoc, et autres
Publié: (2023)
Protocode: Prototype-Driven Interpretability for Code Generation in LLMs
par: Bodla, Krishna Vamshi, et autres
Publié: (2025)
par: Bodla, Krishna Vamshi, et autres
Publié: (2025)
A Theoretical Analysis of Test-Driven Code Generation
par: Menet, Nicolas, et autres
Publié: (2026)
par: Menet, Nicolas, et autres
Publié: (2026)
Drawing Pandas: A Benchmark for LLMs in Generating Plotting Code
par: Galimzyanov, Timur, et autres
Publié: (2024)
par: Galimzyanov, Timur, et autres
Publié: (2024)
Enhancing LLM-Based Test Generation by Eliminating Covered Code
par: Xu, WeiZhe, et autres
Publié: (2026)
par: Xu, WeiZhe, et autres
Publié: (2026)
Deep-Bench: Deep Learning Benchmark Dataset for Code Generation
par: Daghighfarsoodeh, Alireza, et autres
Publié: (2025)
par: Daghighfarsoodeh, Alireza, et autres
Publié: (2025)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
par: Li, Xin-Ye, et autres
Publié: (2026)
par: Li, Xin-Ye, et autres
Publié: (2026)
Relative Positioning Based Code Chunking Method For Rich Context Retrieval In Repository Level Code Completion Task With Code Language Model
par: Rahman, Imranur, et autres
Publié: (2025)
par: Rahman, Imranur, et autres
Publié: (2025)
Analyzing Latent Concepts in Code Language Models
par: Sharma, Arushi, et autres
Publié: (2025)
par: Sharma, Arushi, et autres
Publié: (2025)
Automatic Detection of LLM-Generated Code: A Comparative Case Study of Contemporary Models Across Function and Class Granularities
par: Rahman, Musfiqur, et autres
Publié: (2024)
par: Rahman, Musfiqur, et autres
Publié: (2024)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
par: Li, Yuangang, et autres
Publié: (2026)
par: Li, Yuangang, et autres
Publié: (2026)
LiCoEval: Evaluating LLMs on License Compliance in Code Generation
par: Xu, Weiwei, et autres
Publié: (2024)
par: Xu, Weiwei, et autres
Publié: (2024)
An Initial Exploration of Contrastive Prompt Tuning to Generate Energy-Efficient Code
par: Weidmann, Sophie, et autres
Publié: (2026)
par: Weidmann, Sophie, et autres
Publié: (2026)
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
par: Bai, Yifan, et autres
Publié: (2026)
par: Bai, Yifan, et autres
Publié: (2026)
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
par: Xie, Zichen, et autres
Publié: (2026)
par: Xie, Zichen, et autres
Publié: (2026)
Redundancy and Concept Analysis for Code-trained Language Models
par: Sharma, Arushi, et autres
Publié: (2023)
par: Sharma, Arushi, et autres
Publié: (2023)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
par: Chen, Jie, et autres
Publié: (2024)
par: Chen, Jie, et autres
Publié: (2024)
Data Wrangling Task Automation Using Code-Generating Language Models
par: Akella, Ashlesha, et autres
Publié: (2025)
par: Akella, Ashlesha, et autres
Publié: (2025)
How Efficient is LLM-Generated Code? A Rigorous & High-Standard Benchmark
par: Qiu, Ruizhong, et autres
Publié: (2024)
par: Qiu, Ruizhong, et autres
Publié: (2024)
Documents similaires
-
Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios
par: Chen, Zhi, et autres
Publié: (2024) -
Are Large Language Models Memorizing Bug Benchmarks?
par: Ramos, Daniel, et autres
Publié: (2024) -
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
par: Dong, Yihong, et autres
Publié: (2024) -
Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios
par: Chen, Zhi, et autres
Publié: (2025) -
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
par: Jiang, Shan, et autres
Publié: (2026)