EvalSVA: Multi-Agent Evaluators for Next-Gen Software Vulnerability Assessment
Fuente:
arXiv
Salvato in:
| Autori principali: | Wen, Xin-Cheng, Ye, Jiaxin, Gao, Cuiyun, Wu, Lianwei, Liao, Qing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VulEval: Towards Repository-Level Evaluation of Software Vulnerability Detection
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
Game Rewards Vulnerabilities: Software Vulnerability Detection with Zero-Sum Game and Prototype Learning
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
Vul-R2: A Reasoning LLM for Automated Vulnerability Repair
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2025)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2025)
Boosting Vulnerability Detection of LLMs via Curriculum Preference Optimization with Synthetic Reasoning Data
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2025)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2025)
SVA-ICL: Improving LLM-based Software Vulnerability Assessment via In-Context Learning and Information Fusion
di: Gao, Chaoyang, et al.
Pubblicazione: (2025)
di: Gao, Chaoyang, et al.
Pubblicazione: (2025)
SWE-Fuse: Empowering Software Agents via Issue-free Trajectory Learning and Entropy-aware RLVR Training
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2026)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2026)
SCALE: Constructing Structured Natural Language Comment Trees for Software Vulnerability Detection
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
An Empirical Study of Knowledge Distillation for Code Understanding Tasks
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents
di: Hong, Sirui, et al.
Pubblicazione: (2026)
di: Hong, Sirui, et al.
Pubblicazione: (2026)
ReposVul: A Repository-Level High-Quality Vulnerability Dataset
di: Wang, Xinchen, et al.
Pubblicazione: (2024)
di: Wang, Xinchen, et al.
Pubblicazione: (2024)
Evaluating Repository-level Software Documentation via Question Answering and Feature-Driven Development
di: Wang, Xinchen, et al.
Pubblicazione: (2026)
di: Wang, Xinchen, et al.
Pubblicazione: (2026)
Repository-Level Graph Representation Learning for Enhanced Security Patch Detection
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
RepoMasterEval: Evaluating Code Completion via Real-World Repositories
di: Wu, Qinyun, et al.
Pubblicazione: (2024)
di: Wu, Qinyun, et al.
Pubblicazione: (2024)
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
di: Hu, Ruida, et al.
Pubblicazione: (2026)
di: Hu, Ruida, et al.
Pubblicazione: (2026)
SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement
di: Zhan, Zexun, et al.
Pubblicazione: (2025)
di: Zhan, Zexun, et al.
Pubblicazione: (2025)
AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
Software Vulnerability and Functionality Assessment using LLMs
di: Jensen, Rasmus Ingemann Tuffveson, et al.
Pubblicazione: (2024)
di: Jensen, Rasmus Ingemann Tuffveson, et al.
Pubblicazione: (2024)
MLLM-Based UI2Code Automation Guided by UI Layout Information
di: Wu, Fan, et al.
Pubblicazione: (2025)
di: Wu, Fan, et al.
Pubblicazione: (2025)
Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages
di: Wu, Fan, et al.
Pubblicazione: (2026)
di: Wu, Fan, et al.
Pubblicazione: (2026)
Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs
di: Chen, Yujia, et al.
Pubblicazione: (2026)
di: Chen, Yujia, et al.
Pubblicazione: (2026)
Weakly Supervised Vulnerability Localization via Multiple Instance Learning
di: Gu, Wenchao, et al.
Pubblicazione: (2025)
di: Gu, Wenchao, et al.
Pubblicazione: (2025)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
di: Feng, Jia, et al.
Pubblicazione: (2024)
di: Feng, Jia, et al.
Pubblicazione: (2024)
On the Replicability and Reproducibility of Deep Learning in Software Engineering
di: Liu, Chao, et al.
Pubblicazione: (2020)
di: Liu, Chao, et al.
Pubblicazione: (2020)
Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling
di: Trae Research Team, et al.
Pubblicazione: (2025)
di: Trae Research Team, et al.
Pubblicazione: (2025)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
di: Hu, Ruida, et al.
Pubblicazione: (2024)
di: Hu, Ruida, et al.
Pubblicazione: (2024)
Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice
di: Hu, Ruida, et al.
Pubblicazione: (2025)
di: Hu, Ruida, et al.
Pubblicazione: (2025)
AgentArcEval: An Architecture Evaluation Method for Foundation Model based Agents
di: Lu, Qinghua, et al.
Pubblicazione: (2025)
di: Lu, Qinghua, et al.
Pubblicazione: (2025)
The Current Challenges of Software Engineering in the Era of Large Language Models
di: Gao, Cuiyun, et al.
Pubblicazione: (2024)
di: Gao, Cuiyun, et al.
Pubblicazione: (2024)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
AEGIS: An Agent-based Framework for General Bug Reproduction from Issue Descriptions
di: Wang, Xinchen, et al.
Pubblicazione: (2024)
di: Wang, Xinchen, et al.
Pubblicazione: (2024)
Pros and Cons! Evaluating ChatGPT on Software Vulnerability
di: Yin, Xin
Pubblicazione: (2024)
di: Yin, Xin
Pubblicazione: (2024)
DevEval: Evaluating Code Generation in Practical Software Projects
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
di: Wang, Xinchen, et al.
Pubblicazione: (2025)
di: Wang, Xinchen, et al.
Pubblicazione: (2025)
Bridge and Hint: Extending Pre-trained Language Models for Long-Range Code
di: Chen, Yujia, et al.
Pubblicazione: (2024)
di: Chen, Yujia, et al.
Pubblicazione: (2024)
Explaining Software Vulnerabilities with Large Language Models
di: Johnson, Oshando, et al.
Pubblicazione: (2025)
di: Johnson, Oshando, et al.
Pubblicazione: (2025)
LLM-Based Test Case Generation in DBMS through Monte Carlo Tree Search
di: Chen, Yujia, et al.
Pubblicazione: (2026)
di: Chen, Yujia, et al.
Pubblicazione: (2026)
OSS-UAgent: An Agent-based Usability Evaluation Framework for Open Source Software
di: Meng, Lingkai, et al.
Pubblicazione: (2025)
di: Meng, Lingkai, et al.
Pubblicazione: (2025)
VulnLLMEval: A Framework for Evaluating Large Language Models in Software Vulnerability Detection and Patching
di: Zibaeirad, Arastoo, et al.
Pubblicazione: (2024)
di: Zibaeirad, Arastoo, et al.
Pubblicazione: (2024)
When Shared Worlds Break: Demystifying Defects in Multi-User Extended Reality Software Systems
di: Li, Shuqing, et al.
Pubblicazione: (2025)
di: Li, Shuqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VulEval: Towards Repository-Level Evaluation of Software Vulnerability Detection
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024) -
Game Rewards Vulnerabilities: Software Vulnerability Detection with Zero-Sum Game and Prototype Learning
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024) -
Vul-R2: A Reasoning LLM for Automated Vulnerability Repair
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2025) -
Boosting Vulnerability Detection of LLMs via Curriculum Preference Optimization with Synthetic Reasoning Data
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2025) -
SVA-ICL: Improving LLM-based Software Vulnerability Assessment via In-Context Learning and Information Fusion
di: Gao, Chaoyang, et al.
Pubblicazione: (2025)