LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Xin, Weyssow, Martin, Widyasari, Ratnadira, Zhang, Ting, He, Junda, Lyu, Yunbo, Chang, Jianming, Zhang, Beiqi, Huang, Dan, Lo, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond ChatGPT: Enhancing Software Quality Assurance Tasks with Diverse LLMs and Validation Techniques
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2024)
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2024)
A Functional Software Reference Architecture for LLM-Integrated Systems
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025)
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025)
Artificial Intelligence for Software Architecture: Literature Review and the Road Ahead
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025)
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025)
Evaluating SZZ Implementations: An Empirical Study on the Linux Kernel
di: Lyu, Yunbo, et al.
Pubblicazione: (2023)
di: Lyu, Yunbo, et al.
Pubblicazione: (2023)
Explaining Explanation: An Empirical Study on Explanation in Code Reviews
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2023)
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2023)
AgentSZZ: Teaching the LLM Agent to Play Detective with Bug-Inducing Commits
di: Lyu, Yunbo, et al.
Pubblicazione: (2026)
di: Lyu, Yunbo, et al.
Pubblicazione: (2026)
A Systematic Literature Review on Explainability for Machine/Deep Learning-based Software Engineering Research
di: Cao, Sicong, et al.
Pubblicazione: (2024)
di: Cao, Sicong, et al.
Pubblicazione: (2024)
Demystifying Faulty Code with LLM: Step-by-Step Reasoning for Explainable Fault Localization
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2024)
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2024)
Let the Trial Begin: A Mock-Court Approach to Vulnerability Detection using LLM-Based Agents
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2025)
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2025)
R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation
di: Weyssow, Martin, et al.
Pubblicazione: (2025)
di: Weyssow, Martin, et al.
Pubblicazione: (2025)
Debt Behind the AI Boom: A Large-Scale Empirical Study of AI-Generated Code in the Wild
di: Liu, Yue, et al.
Pubblicazione: (2026)
di: Liu, Yue, et al.
Pubblicazione: (2026)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
di: Hu, Xing, et al.
Pubblicazione: (2025)
di: Hu, Xing, et al.
Pubblicazione: (2025)
LLM-Based Multi-Agent Systems for Software Engineering: Literature Review, Vision and the Road Ahead
di: He, Junda, et al.
Pubblicazione: (2024)
di: He, Junda, et al.
Pubblicazione: (2024)
VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering
di: Wang, Youting, et al.
Pubblicazione: (2026)
di: Wang, Youting, et al.
Pubblicazione: (2026)
LeakDojo: Decoding the Leakage Threats of RAG Systems
di: Zhang, Maosen, et al.
Pubblicazione: (2026)
di: Zhang, Maosen, et al.
Pubblicazione: (2026)
Benchmarking Large Language Models for Multi-Language Software Vulnerability Detection
di: Zhang, Ting, et al.
Pubblicazione: (2025)
di: Zhang, Ting, et al.
Pubblicazione: (2025)
Using LLMs in Generating Design Rationale for Software Architecture Decisions
di: Zhou, Xiyu, et al.
Pubblicazione: (2025)
di: Zhou, Xiyu, et al.
Pubblicazione: (2025)
"My productivity is boosted, but ..." Demystifying Users' Perception on AI Coding Assistants
di: Lyu, Yunbo, et al.
Pubblicazione: (2025)
di: Lyu, Yunbo, et al.
Pubblicazione: (2025)
SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
di: Chen, Junkai, et al.
Pubblicazione: (2025)
di: Chen, Junkai, et al.
Pubblicazione: (2025)
Style4D-Bench: A Benchmark Suite for 4D Stylization
di: Chen, Beiqi, et al.
Pubblicazione: (2025)
di: Chen, Beiqi, et al.
Pubblicazione: (2025)
Revisiting Vulnerability Patch Identification on Data in the Wild
di: Irsan, Ivana Clairine, et al.
Pubblicazione: (2026)
di: Irsan, Ivana Clairine, et al.
Pubblicazione: (2026)
LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks
di: Panebianco, Francesco, et al.
Pubblicazione: (2025)
di: Panebianco, Francesco, et al.
Pubblicazione: (2025)
How Agentic AI Coding Assistants Become the Attacker's Shell
di: Liu, Yue, et al.
Pubblicazione: (2026)
di: Liu, Yue, et al.
Pubblicazione: (2026)
"Your AI, My Shell": Demystifying Prompt Injection Attacks on Agentic AI Coding Editors
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
CleanVul: Automatic Function-Level Vulnerability Detection in Code Commits Using LLM Heuristics
di: Li, Yikun, et al.
Pubblicazione: (2024)
di: Li, Yikun, et al.
Pubblicazione: (2024)
Revisiting Sentiment Analysis for Software Engineering in the Era of Large Language Models
di: Zhang, Ting, et al.
Pubblicazione: (2023)
di: Zhang, Ting, et al.
Pubblicazione: (2023)
AgentLeak: A Full-Stack Benchmark for Privacy Leakage in Multi-Agent LLM Systems
di: Yagoubi, Faouzi El, et al.
Pubblicazione: (2026)
di: Yagoubi, Faouzi El, et al.
Pubblicazione: (2026)
DialogBench: Evaluating LLMs as Human-like Dialogue Systems
di: Ou, Jiao, et al.
Pubblicazione: (2023)
di: Ou, Jiao, et al.
Pubblicazione: (2023)
S-Leak: Leakage-Abuse Attack Against Efficient Conjunctive SSE via s-term Leakage
di: Su, Yue, et al.
Pubblicazione: (2025)
di: Su, Yue, et al.
Pubblicazione: (2025)
Mapping NVD Records to Their Vulnerability-fixing Commits: How Hard is It?
di: Nguyen, Huu Hung, et al.
Pubblicazione: (2025)
di: Nguyen, Huu Hung, et al.
Pubblicazione: (2025)
LastingBench: Defend Benchmarks Against Knowledge Leakage
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
When Benchmarks Leak: Inference-Time Decontamination for LLMs
di: Chai, Jianzhe, et al.
Pubblicazione: (2026)
di: Chai, Jianzhe, et al.
Pubblicazione: (2026)
From Code to Courtroom: LLMs as the New Software Judges
di: He, Junda, et al.
Pubblicazione: (2025)
di: He, Junda, et al.
Pubblicazione: (2025)
APIDocBooster: An Extract-Then-Abstract Framework Leveraging Large Language Models for Augmenting API Documentation
di: Yang, Chengran, et al.
Pubblicazione: (2023)
di: Yang, Chengran, et al.
Pubblicazione: (2023)
Back to the Basics: Rethinking Issue-Commit Linking with LLM-Assisted Retrieval
di: Huang, Huihui, et al.
Pubblicazione: (2025)
di: Huang, Huihui, et al.
Pubblicazione: (2025)
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2024)
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2024)
Hidden Leaks in Time Series Forecasting: How Data Leakage Affects LSTM Evaluation Across Configurations and Validation Strategies
di: Albelali, Salma, et al.
Pubblicazione: (2025)
di: Albelali, Salma, et al.
Pubblicazione: (2025)
ContextLeak: Auditing Leakage in Private In-Context Learning Methods
di: Choi, Jacob, et al.
Pubblicazione: (2025)
di: Choi, Jacob, et al.
Pubblicazione: (2025)
Towards Comprehensive Benchmarking Infrastructure for LLMs In Software Engineering
di: Rodriguez-Cardenas, Daniel, et al.
Pubblicazione: (2026)
di: Rodriguez-Cardenas, Daniel, et al.
Pubblicazione: (2026)
SLICEMATE: Accurate and Scalable Static Program Slicing via LLM-Powered Agents
di: Chang, Jianming, et al.
Pubblicazione: (2025)
di: Chang, Jianming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond ChatGPT: Enhancing Software Quality Assurance Tasks with Diverse LLMs and Validation Techniques
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2024) -
A Functional Software Reference Architecture for LLM-Integrated Systems
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025) -
Artificial Intelligence for Software Architecture: Literature Review and the Road Ahead
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025) -
Evaluating SZZ Implementations: An Empirical Study on the Linux Kernel
di: Lyu, Yunbo, et al.
Pubblicazione: (2023) -
Explaining Explanation: An Empirical Study on Explanation in Code Reviews
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2023)