An Exploratory Investigation into Code License Infringements in Large Language Model Training Datasets
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Katzy, Jonathan, Popescu, Răzvan-Mihai, van Deursen, Arie, Izadi, Maliheh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language Models for Code Completion: A Practical Evaluation
par: Izadi, Maliheh, et autres
Publié: (2024)
par: Izadi, Maliheh, et autres
Publié: (2024)
Automated Attention Pattern Discovery at Scale in Large Language Models
par: Katzy, Jonathan, et autres
Publié: (2026)
par: Katzy, Jonathan, et autres
Publié: (2026)
The Heap: A Contamination-Free Multilingual Code Dataset for Evaluating Large Language Models
par: Katzy, Jonathan, et autres
Publié: (2025)
par: Katzy, Jonathan, et autres
Publié: (2025)
A Transformer-Based Approach for Smart Invocation of Automatic Code Completion
par: de Moor, Aral, et autres
Publié: (2024)
par: de Moor, Aral, et autres
Publié: (2024)
Traces of Memorisation in Large Language Models for Code
par: Al-Kaswan, Ali, et autres
Publié: (2023)
par: Al-Kaswan, Ali, et autres
Publié: (2023)
Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time
par: Popescu, Razvan Mihai, et autres
Publié: (2026)
par: Popescu, Razvan Mihai, et autres
Publié: (2026)
A Qualitative Investigation into LLM-Generated Multilingual Code Comments and Automatic Evaluation Metrics
par: Katzy, Jonathan, et autres
Publié: (2025)
par: Katzy, Jonathan, et autres
Publié: (2025)
Code Red! On the Harmfulness of Applying Off-the-shelf Large Language Models to Programming Tasks
par: Al-Kaswan, Ali, et autres
Publié: (2025)
par: Al-Kaswan, Ali, et autres
Publié: (2025)
TreeRanker: Fast and Model-agnostic Ranking System for Code Suggestions in IDEs
par: Cipollone, Daniele, et autres
Publié: (2025)
par: Cipollone, Daniele, et autres
Publié: (2025)
Evaluating Non-English Developer Support in Machine Learning for Software Engineering
par: Katzy, Jonathan, et autres
Publié: (2026)
par: Katzy, Jonathan, et autres
Publié: (2026)
Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs
par: Al-Kaswan, Ali, et autres
Publié: (2026)
par: Al-Kaswan, Ali, et autres
Publié: (2026)
AST-PAC: AST-guided Membership Inference for Code
par: Koohestani, Roham, et autres
Publié: (2026)
par: Koohestani, Roham, et autres
Publié: (2026)
Long Code Arena: a Set of Benchmarks for Long-Context Code Models
par: Bogomolov, Egor, et autres
Publié: (2024)
par: Bogomolov, Egor, et autres
Publié: (2024)
Data vs. Model Machine Learning Fairness Testing: An Empirical Study
par: Shome, Arumoy, et autres
Publié: (2024)
par: Shome, Arumoy, et autres
Publié: (2024)
McUDI: Model-Centric Unsupervised Degradation Indicator for Failure Prediction AIOps Solutions
par: Poenaru-Olaru, Lorena, et autres
Publié: (2024)
par: Poenaru-Olaru, Lorena, et autres
Publié: (2024)
Is Your Anomaly Detector Ready for Change? Adapting AIOps Solutions to the Real World
par: Poenaru-Olaru, Lorena, et autres
Publié: (2023)
par: Poenaru-Olaru, Lorena, et autres
Publié: (2023)
Evaluating Large Language Models for Functional and Maintainable Code in Industrial Settings: A Case Study at ASML
par: Mundhra, Yash, et autres
Publié: (2025)
par: Mundhra, Yash, et autres
Publié: (2025)
Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture the Flag Challenges
par: Al-Kaswan, Ali, et autres
Publié: (2026)
par: Al-Kaswan, Ali, et autres
Publié: (2026)
Sustainable Machine Learning Retraining: Optimizing Energy Efficiency Without Compromising Accuracy
par: Poenaru-Olaru, Lorena, et autres
Publié: (2025)
par: Poenaru-Olaru, Lorena, et autres
Publié: (2025)
A Multi-agent Onboarding Assistant based on Large Language Models, Retrieval Augmented Generation, and Chain-of-Thought
par: Ionescu, Andrei Cristian, et autres
Publié: (2025)
par: Ionescu, Andrei Cristian, et autres
Publié: (2025)
Trained Without My Consent: Detecting Code Inclusion In Language Models Trained on Code
par: Majdinasab, Vahid, et autres
Publié: (2024)
par: Majdinasab, Vahid, et autres
Publié: (2024)
In-IDE Human-AI Experience in the Era of Large Language Models; A Literature Review
par: Sergeyuk, Agnia, et autres
Publié: (2024)
par: Sergeyuk, Agnia, et autres
Publié: (2024)
An Empirical Analysis of Machine Learning Model and Dataset Documentation, Supply Chain, and Licensing Challenges on Hugging Face
par: Stalnaker, Trevor, et autres
Publié: (2025)
par: Stalnaker, Trevor, et autres
Publié: (2025)
Towards Automatic Translation of Machine Learning Visual Insights to Analytical Assertions
par: Shome, Arumoy, et autres
Publié: (2024)
par: Shome, Arumoy, et autres
Publié: (2024)
Leveraging Large Language Models for Enhancing the Understandability of Generated Unit Tests
par: Deljouyi, Amirhossein, et autres
Publié: (2024)
par: Deljouyi, Amirhossein, et autres
Publié: (2024)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
par: Yan, Kaiwen, et autres
Publié: (2025)
par: Yan, Kaiwen, et autres
Publié: (2025)
Rethinking IDE Customization for Enhanced HAX: A Hyperdimensional Perspective
par: Koohestani, Roham, et autres
Publié: (2025)
par: Koohestani, Roham, et autres
Publié: (2025)
CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding Preferences
par: Weyssow, Martin, et autres
Publié: (2024)
par: Weyssow, Martin, et autres
Publié: (2024)
Enhancing Large Language Models with Faster Code Preprocessing for Vulnerability Detection
par: Gonçalves, José, et autres
Publié: (2025)
par: Gonçalves, José, et autres
Publié: (2025)
LiCoEval: Evaluating LLMs on License Compliance in Code Generation
par: Xu, Weiwei, et autres
Publié: (2024)
par: Xu, Weiwei, et autres
Publié: (2024)
LEANCODE: Understanding Models Better for Code Simplification of Pre-trained Large Language Models
par: Wang, Yan, et autres
Publié: (2025)
par: Wang, Yan, et autres
Publié: (2025)
Unlearning Trojans in Large Language Models: A Comparison Between Natural Language and Source Code
par: Kazemi, Mahdi, et autres
Publié: (2024)
par: Kazemi, Mahdi, et autres
Publié: (2024)
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
par: Li, Linyi, et autres
Publié: (2024)
par: Li, Linyi, et autres
Publié: (2024)
Correctness Assessment of Code Generated by Large Language Models Using Internal Representations
par: Bui, Tuan-Dung, et autres
Publié: (2025)
par: Bui, Tuan-Dung, et autres
Publié: (2025)
iML: Executable, Problem-Grounded, and Broadly Exploratory Code-Driven AutoML
par: Le, Dat, et autres
Publié: (2026)
par: Le, Dat, et autres
Publié: (2026)
LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs
par: Xia, Yunhui, et autres
Publié: (2025)
par: Xia, Yunhui, et autres
Publié: (2025)
Understanding Feedback Mechanisms in Machine Learning Jupyter Notebooks
par: Shome, Arumoy, et autres
Publié: (2024)
par: Shome, Arumoy, et autres
Publié: (2024)
HyperSeq: A Hyper-Adaptive Representation for Predictive Sequencing of States
par: Koohestani, Roham, et autres
Publié: (2025)
par: Koohestani, Roham, et autres
Publié: (2025)
Applying the Chinese Wall Reverse Engineering Technique to Large Language Model Code Editing
par: Hanmongkolchai, Manatsawin
Publié: (2025)
par: Hanmongkolchai, Manatsawin
Publié: (2025)
Investigating the Efficacy of Large Language Models for Code Clone Detection
par: Khajezade, Mohamad, et autres
Publié: (2024)
par: Khajezade, Mohamad, et autres
Publié: (2024)
Documents similaires
-
Language Models for Code Completion: A Practical Evaluation
par: Izadi, Maliheh, et autres
Publié: (2024) -
Automated Attention Pattern Discovery at Scale in Large Language Models
par: Katzy, Jonathan, et autres
Publié: (2026) -
The Heap: A Contamination-Free Multilingual Code Dataset for Evaluating Large Language Models
par: Katzy, Jonathan, et autres
Publié: (2025) -
A Transformer-Based Approach for Smart Invocation of Automatic Code Completion
par: de Moor, Aral, et autres
Publié: (2024) -
Traces of Memorisation in Large Language Models for Code
par: Al-Kaswan, Ali, et autres
Publié: (2023)