An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Yikun, Jiang, Jinfeng, Zhang, Ting, Yang, Chengran, Zhong, Chenxing, Yide, Yin, Bin, Leow Wen, Ouh, Eng Lieh, Shar, Lwin Khin, Lo, David |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Function-Level Analysis: Context-Aware Reasoning for Inter-Procedural Vulnerability Detection
by: Li, Yikun, et al.
Published: (2026)
by: Li, Yikun, et al.
Published: (2026)
Semantics-Aligned, Curriculum-Driven, and Reasoning-Enhanced Vulnerability Repair Framework
by: Yang, Chengran, et al.
Published: (2025)
by: Yang, Chengran, et al.
Published: (2025)
PenForge: On-the-Fly Expert Agent Construction for Automated Penetration Testing
by: Huang, Huihui, et al.
Published: (2026)
by: Huang, Huihui, et al.
Published: (2026)
Benchmarking Large Language Models for Multi-Language Software Vulnerability Detection
by: Zhang, Ting, et al.
Published: (2025)
by: Zhang, Ting, et al.
Published: (2025)
VulCoCo: A Simple Yet Effective Method for Detecting Vulnerable Code Clones
by: Bui, Tan, et al.
Published: (2025)
by: Bui, Tan, et al.
Published: (2025)
PatchSeeker: Mapping NVD Records to their Vulnerability-fixing Commits with LLM Generated Commits and Embeddings
by: Nguyen, Huu Hung, et al.
Published: (2025)
by: Nguyen, Huu Hung, et al.
Published: (2025)
Revisiting Vulnerability Patch Identification on Data in the Wild
by: Irsan, Ivana Clairine, et al.
Published: (2026)
by: Irsan, Ivana Clairine, et al.
Published: (2026)
R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation
by: Weyssow, Martin, et al.
Published: (2025)
by: Weyssow, Martin, et al.
Published: (2025)
Let the Trial Begin: A Mock-Court Approach to Vulnerability Detection using LLM-Based Agents
by: Widyasari, Ratnadira, et al.
Published: (2025)
by: Widyasari, Ratnadira, et al.
Published: (2025)
Out of Distribution, Out of Luck: How Well Can LLMs Trained on Vulnerability Datasets Detect Top 25 CWE Weaknesses?
by: Li, Yikun, et al.
Published: (2025)
by: Li, Yikun, et al.
Published: (2025)
Back to the Basics: Rethinking Issue-Commit Linking with LLM-Assisted Retrieval
by: Huang, Huihui, et al.
Published: (2025)
by: Huang, Huihui, et al.
Published: (2025)
Mapping NVD Records to Their Vulnerability-fixing Commits: How Hard is It?
by: Nguyen, Huu Hung, et al.
Published: (2025)
by: Nguyen, Huu Hung, et al.
Published: (2025)
CleanVul: Automatic Function-Level Vulnerability Detection in Code Commits Using LLM Heuristics
by: Li, Yikun, et al.
Published: (2024)
by: Li, Yikun, et al.
Published: (2024)
TitanCA: Lessons from Orchestrating LLM Agents to Discover 100+ CVEs
by: Zhang, Ting, et al.
Published: (2026)
by: Zhang, Ting, et al.
Published: (2026)
VLM-Fuzz: Vision Language Model Assisted Recursive Depth-first Search Exploration for Effective UI Testing of Android Apps
by: Demissie, Biniam Fisseha, et al.
Published: (2025)
by: Demissie, Biniam Fisseha, et al.
Published: (2025)
Fixseeker: An Empirical Driven Graph-based Approach for Detecting Silent Vulnerability Fixes in Open Source Software
by: Cheng, Yiran, et al.
Published: (2025)
by: Cheng, Yiran, et al.
Published: (2025)
Runtime Anomaly Detection for Drones: An Integrated Rule-Mining and Unsupervised-Learning Approach
by: Tan, Ivan, et al.
Published: (2025)
by: Tan, Ivan, et al.
Published: (2025)
VERCATION: Precise Vulnerable Open-source Software Version Identification based on Static Analysis and LLM
by: Cheng, Yiran, et al.
Published: (2024)
by: Cheng, Yiran, et al.
Published: (2024)
CovAgent: Overcoming the 30% Curse of Mobile Application Coverage with Agentic AI and Dynamic Instrumentation
by: Minn, Wei, et al.
Published: (2026)
by: Minn, Wei, et al.
Published: (2026)
Bamboo: LLM-Driven Discovery of API-Permission Mappings in the Android Framework
by: Hu, Han, et al.
Published: (2025)
by: Hu, Han, et al.
Published: (2025)
Compiling Code LLMs into Lightweight Executables
by: Shi, Jieke, et al.
Published: (2026)
by: Shi, Jieke, et al.
Published: (2026)
LIDL: LLM Integration Defect Localization via Knowledge Graph-Enhanced Multi-Agent Analysis
by: Tan, Gou, et al.
Published: (2026)
by: Tan, Gou, et al.
Published: (2026)
Executing as You Generate: Hiding Execution Latency in LLM Code Generation
by: Sun, Zhensu, et al.
Published: (2026)
by: Sun, Zhensu, et al.
Published: (2026)
Autoregressive, Yet Revisable: In Decoding Revision for Secure Code Generation
by: Yang, Chengran, et al.
Published: (2026)
by: Yang, Chengran, et al.
Published: (2026)
Think Like Human Developers: Harnessing Community Knowledge for Structured Code Reasoning
by: Yang, Chengran, et al.
Published: (2025)
by: Yang, Chengran, et al.
Published: (2025)
ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
by: Tang, Lingxiao, et al.
Published: (2026)
by: Tang, Lingxiao, et al.
Published: (2026)
Towards Reliable LLM-Driven Fuzz Testing: Vision and Road Ahead
by: Cheng, Yiran, et al.
Published: (2025)
by: Cheng, Yiran, et al.
Published: (2025)
ACECode: A Reinforcement Learning Framework for Aligning Code Efficiency and Correctness in Code Language Models
by: Yang, Chengran, et al.
Published: (2024)
by: Yang, Chengran, et al.
Published: (2024)
Virtualization-based Penetration Testing Study for Detecting Accessibility Abuse Vulnerabilities in Banking Apps in East and Southeast Asia
by: Minn, Wei, et al.
Published: (2026)
by: Minn, Wei, et al.
Published: (2026)
SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
by: Chen, Junkai, et al.
Published: (2025)
by: Chen, Junkai, et al.
Published: (2025)
Token Sugar: Making Source Code Sweeter for LLMs through Token-Efficient Shorthand
by: Sun, Zhensu, et al.
Published: (2025)
by: Sun, Zhensu, et al.
Published: (2025)
Beyond the Tip of the Iceberg: Understanding SATD in Dockerfiles through the Lens of Co-evolution
by: Minn, Wei, et al.
Published: (2026)
by: Minn, Wei, et al.
Published: (2026)
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
by: Gu, Alex, et al.
Published: (2024)
by: Gu, Alex, et al.
Published: (2024)
Bridging Developer Instructions and Code Completion Through Instruction-Aware Fill-in-the-Middle Paradigm
by: Sun, Zhensu, et al.
Published: (2025)
by: Sun, Zhensu, et al.
Published: (2025)
MUCOCO: Automated Consistency Testing of Code LLMs
by: Chou, Chua Jin, et al.
Published: (2026)
by: Chou, Chua Jin, et al.
Published: (2026)
Towards Verified Code Reasoning by LLMs
by: Sistla, Meghana, et al.
Published: (2025)
by: Sistla, Meghana, et al.
Published: (2025)
BugsInPy: A Database of Existing Bugs in Python Programs to Enable Controlled Testing and Debugging Studies
by: Widyasari, Ratnadira, et al.
Published: (2024)
by: Widyasari, Ratnadira, et al.
Published: (2024)
CodeSense: a Real-World Benchmark and Dataset for Code Semantic Reasoning
by: Roy, Monoshi Kumar, et al.
Published: (2025)
by: Roy, Monoshi Kumar, et al.
Published: (2025)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
by: Guo, Chengquan, et al.
Published: (2024)
by: Guo, Chengquan, et al.
Published: (2024)
Talk Less, Verify More: Improving LLM Assistants with Semantic Checks and Execution Feedback
by: Sun, Yan, et al.
Published: (2026)
by: Sun, Yan, et al.
Published: (2026)
Similar Items
-
Beyond Function-Level Analysis: Context-Aware Reasoning for Inter-Procedural Vulnerability Detection
by: Li, Yikun, et al.
Published: (2026) -
Semantics-Aligned, Curriculum-Driven, and Reasoning-Enhanced Vulnerability Repair Framework
by: Yang, Chengran, et al.
Published: (2025) -
PenForge: On-the-Fly Expert Agent Construction for Automated Penetration Testing
by: Huang, Huihui, et al.
Published: (2026) -
Benchmarking Large Language Models for Multi-Language Software Vulnerability Detection
by: Zhang, Ting, et al.
Published: (2025) -
VulCoCo: A Simple Yet Effective Method for Detecting Vulnerable Code Clones
by: Bui, Tan, et al.
Published: (2025)