Benchmarking Large Language Models for Multi-Language Software Vulnerability Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Ting, Yang, Chengran, Su, Yindu, Weyssow, Martin, Nguyen, Hung, Bui, Tan, Kang, Hong Jin, Li, Yikun, Ouh, Eng Lieh, Shar, Lwin Khin, Lo, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
di: Li, Yikun, et al.
Pubblicazione: (2026)
di: Li, Yikun, et al.
Pubblicazione: (2026)
R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation
di: Weyssow, Martin, et al.
Pubblicazione: (2025)
di: Weyssow, Martin, et al.
Pubblicazione: (2025)
PenForge: On-the-Fly Expert Agent Construction for Automated Penetration Testing
di: Huang, Huihui, et al.
Pubblicazione: (2026)
di: Huang, Huihui, et al.
Pubblicazione: (2026)
VulCoCo: A Simple Yet Effective Method for Detecting Vulnerable Code Clones
di: Bui, Tan, et al.
Pubblicazione: (2025)
di: Bui, Tan, et al.
Pubblicazione: (2025)
Let the Trial Begin: A Mock-Court Approach to Vulnerability Detection using LLM-Based Agents
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2025)
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2025)
Revisiting Vulnerability Patch Identification on Data in the Wild
di: Irsan, Ivana Clairine, et al.
Pubblicazione: (2026)
di: Irsan, Ivana Clairine, et al.
Pubblicazione: (2026)
Semantics-Aligned, Curriculum-Driven, and Reasoning-Enhanced Vulnerability Repair Framework
di: Yang, Chengran, et al.
Pubblicazione: (2025)
di: Yang, Chengran, et al.
Pubblicazione: (2025)
Mapping NVD Records to Their Vulnerability-fixing Commits: How Hard is It?
di: Nguyen, Huu Hung, et al.
Pubblicazione: (2025)
di: Nguyen, Huu Hung, et al.
Pubblicazione: (2025)
CleanVul: Automatic Function-Level Vulnerability Detection in Code Commits Using LLM Heuristics
di: Li, Yikun, et al.
Pubblicazione: (2024)
di: Li, Yikun, et al.
Pubblicazione: (2024)
PatchSeeker: Mapping NVD Records to their Vulnerability-fixing Commits with LLM Generated Commits and Embeddings
di: Nguyen, Huu Hung, et al.
Pubblicazione: (2025)
di: Nguyen, Huu Hung, et al.
Pubblicazione: (2025)
Beyond Function-Level Analysis: Context-Aware Reasoning for Inter-Procedural Vulnerability Detection
di: Li, Yikun, et al.
Pubblicazione: (2026)
di: Li, Yikun, et al.
Pubblicazione: (2026)
Out of Distribution, Out of Luck: How Well Can LLMs Trained on Vulnerability Datasets Detect Top 25 CWE Weaknesses?
di: Li, Yikun, et al.
Pubblicazione: (2025)
di: Li, Yikun, et al.
Pubblicazione: (2025)
Back to the Basics: Rethinking Issue-Commit Linking with LLM-Assisted Retrieval
di: Huang, Huihui, et al.
Pubblicazione: (2025)
di: Huang, Huihui, et al.
Pubblicazione: (2025)
Fixseeker: An Empirical Driven Graph-based Approach for Detecting Silent Vulnerability Fixes in Open Source Software
di: Cheng, Yiran, et al.
Pubblicazione: (2025)
di: Cheng, Yiran, et al.
Pubblicazione: (2025)
VERCATION: Precise Vulnerable Open-source Software Version Identification based on Static Analysis and LLM
di: Cheng, Yiran, et al.
Pubblicazione: (2024)
di: Cheng, Yiran, et al.
Pubblicazione: (2024)
VLM-Fuzz: Vision Language Model Assisted Recursive Depth-first Search Exploration for Effective UI Testing of Android Apps
di: Demissie, Biniam Fisseha, et al.
Pubblicazione: (2025)
di: Demissie, Biniam Fisseha, et al.
Pubblicazione: (2025)
ACECode: A Reinforcement Learning Framework for Aligning Code Efficiency and Correctness in Code Language Models
di: Yang, Chengran, et al.
Pubblicazione: (2024)
di: Yang, Chengran, et al.
Pubblicazione: (2024)
Runtime Anomaly Detection for Drones: An Integrated Rule-Mining and Unsupervised-Learning Approach
di: Tan, Ivan, et al.
Pubblicazione: (2025)
di: Tan, Ivan, et al.
Pubblicazione: (2025)
Towards Reliable LLM-Driven Fuzz Testing: Vision and Road Ahead
di: Cheng, Yiran, et al.
Pubblicazione: (2025)
di: Cheng, Yiran, et al.
Pubblicazione: (2025)
JavaVFC: Java Vulnerability Fixing Commits from Open-source Software
di: Bui, Tan, et al.
Pubblicazione: (2024)
di: Bui, Tan, et al.
Pubblicazione: (2024)
LIDL: LLM Integration Defect Localization via Knowledge Graph-Enhanced Multi-Agent Analysis
di: Tan, Gou, et al.
Pubblicazione: (2026)
di: Tan, Gou, et al.
Pubblicazione: (2026)
CovAgent: Overcoming the 30% Curse of Mobile Application Coverage with Agentic AI and Dynamic Instrumentation
di: Minn, Wei, et al.
Pubblicazione: (2026)
di: Minn, Wei, et al.
Pubblicazione: (2026)
TitanCA: Lessons from Orchestrating LLM Agents to Discover 100+ CVEs
di: Zhang, Ting, et al.
Pubblicazione: (2026)
di: Zhang, Ting, et al.
Pubblicazione: (2026)
Virtualization-based Penetration Testing Study for Detecting Accessibility Abuse Vulnerabilities in Banking Apps in East and Southeast Asia
di: Minn, Wei, et al.
Pubblicazione: (2026)
di: Minn, Wei, et al.
Pubblicazione: (2026)
Bamboo: LLM-Driven Discovery of API-Permission Mappings in the Android Framework
di: Hu, Han, et al.
Pubblicazione: (2025)
di: Hu, Han, et al.
Pubblicazione: (2025)
A Functional Software Reference Architecture for LLM-Integrated Systems
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025)
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025)
Artificial Intelligence for Software Architecture: Literature Review and the Road Ahead
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025)
di: Bucaioni, Alessio, et al.
Pubblicazione: (2025)
Think Like Human Developers: Harnessing Community Knowledge for Structured Code Reasoning
di: Yang, Chengran, et al.
Pubblicazione: (2025)
di: Yang, Chengran, et al.
Pubblicazione: (2025)
BugsInPy: A Database of Existing Bugs in Python Programs to Enable Controlled Testing and Debugging Studies
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2024)
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2024)
Large Language Model for Vulnerability Detection: Emerging Results and Future Directions
di: Zhou, Xin, et al.
Pubblicazione: (2024)
di: Zhou, Xin, et al.
Pubblicazione: (2024)
On the Usage of Continual Learning for Out-of-Distribution Generalization in Pre-trained Language Models of Code
di: Weyssow, Martin, et al.
Pubblicazione: (2023)
di: Weyssow, Martin, et al.
Pubblicazione: (2023)
Harnessing Large Language Models for Curated Code Reviews
di: Sghaier, Oussama Ben, et al.
Pubblicazione: (2025)
di: Sghaier, Oussama Ben, et al.
Pubblicazione: (2025)
Exploring Parameter-Efficient Fine-Tuning Techniques for Code Generation with Large Language Models
di: Weyssow, Martin, et al.
Pubblicazione: (2023)
di: Weyssow, Martin, et al.
Pubblicazione: (2023)
SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
di: Chen, Junkai, et al.
Pubblicazione: (2025)
di: Chen, Junkai, et al.
Pubblicazione: (2025)
LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
Revisiting Sentiment Analysis for Software Engineering in the Era of Large Language Models
di: Zhang, Ting, et al.
Pubblicazione: (2023)
di: Zhang, Ting, et al.
Pubblicazione: (2023)
SAFE: Advancing Large Language Models in Leveraging Semantic and Syntactic Relationships for Software Vulnerability Detection
di: Nguyen, Van, et al.
Pubblicazione: (2024)
di: Nguyen, Van, et al.
Pubblicazione: (2024)
Beyond the Tip of the Iceberg: Understanding SATD in Dockerfiles through the Lens of Co-evolution
di: Minn, Wei, et al.
Pubblicazione: (2026)
di: Minn, Wei, et al.
Pubblicazione: (2026)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
di: Hu, Xing, et al.
Pubblicazione: (2025)
di: Hu, Xing, et al.
Pubblicazione: (2025)
Greening Large Language Models of Code
di: Shi, Jieke, et al.
Pubblicazione: (2023)
di: Shi, Jieke, et al.
Pubblicazione: (2023)
Documenti analoghi
-
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
di: Li, Yikun, et al.
Pubblicazione: (2026) -
R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation
di: Weyssow, Martin, et al.
Pubblicazione: (2025) -
PenForge: On-the-Fly Expert Agent Construction for Automated Penetration Testing
di: Huang, Huihui, et al.
Pubblicazione: (2026) -
VulCoCo: A Simple Yet Effective Method for Detecting Vulnerable Code Clones
di: Bui, Tan, et al.
Pubblicazione: (2025) -
Let the Trial Begin: A Mock-Court Approach to Vulnerability Detection using LLM-Based Agents
di: Widyasari, Ratnadira, et al.
Pubblicazione: (2025)