AutoBaxBuilder: Bootstrapping Code Security Benchmarking
Fuente:
arXiv
Guardado en:
| Autores principales: | von Arx, Tobias, Mündler, Niels, Vero, Mark, Baader, Maximilian, Vechev, Martin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BaxBench: Can LLMs Generate Correct and Secure Backends?
por: Vero, Mark, et al.
Publicado: (2025)
por: Vero, Mark, et al.
Publicado: (2025)
SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Black-Box Adversarial Attacks on LLM-Based Code Completion
por: Jenko, Slobodan, et al.
Publicado: (2024)
por: Jenko, Slobodan, et al.
Publicado: (2024)
Instruction Tuning for Secure Code Generation
por: He, Jingxuan, et al.
Publicado: (2024)
por: He, Jingxuan, et al.
Publicado: (2024)
Evading Data Contamination Detection for Language Models is (too) Easy
por: Dekoninck, Jasper, et al.
Publicado: (2024)
por: Dekoninck, Jasper, et al.
Publicado: (2024)
Large Language Models are Advanced Anonymizers
por: Staab, Robin, et al.
Publicado: (2024)
por: Staab, Robin, et al.
Publicado: (2024)
Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark
por: Gloaguen, Thibaud, et al.
Publicado: (2026)
por: Gloaguen, Thibaud, et al.
Publicado: (2026)
Ward: Provable RAG Dataset Inference via LLM Watermarks
por: Jovanović, Nikola, et al.
Publicado: (2024)
por: Jovanović, Nikola, et al.
Publicado: (2024)
Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning
por: Gloaguen, Thibaud, et al.
Publicado: (2025)
por: Gloaguen, Thibaud, et al.
Publicado: (2025)
Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation
por: De Muri, Giovanni, et al.
Publicado: (2025)
por: De Muri, Giovanni, et al.
Publicado: (2025)
Large Language Models for Code: Security Hardening and Adversarial Testing
por: He, Jingxuan, et al.
Publicado: (2023)
por: He, Jingxuan, et al.
Publicado: (2023)
Exploiting LLM Quantization
por: Egashira, Kazuki, et al.
Publicado: (2024)
por: Egashira, Kazuki, et al.
Publicado: (2024)
Fewer Weights, More Problems: A Practical Attack on LLM Pruning
por: Egashira, Kazuki, et al.
Publicado: (2025)
por: Egashira, Kazuki, et al.
Publicado: (2025)
Mind the Gap: A Practical Attack on GGUF Quantization
por: Egashira, Kazuki, et al.
Publicado: (2025)
por: Egashira, Kazuki, et al.
Publicado: (2025)
CrypTorch: PyTorch-based Auto-tuning Compiler for Machine Learning with Multi-party Computation
por: Liu, Jinyu, et al.
Publicado: (2025)
por: Liu, Jinyu, et al.
Publicado: (2025)
A Fast, Reliable, and Secure Programming Language for LLM Agents with Code Actions
por: Mell, Stephen, et al.
Publicado: (2025)
por: Mell, Stephen, et al.
Publicado: (2025)
How secure is AI-generated Code: A Large-Scale Comparison of Large Language Models
por: Tihanyi, Norbert, et al.
Publicado: (2024)
por: Tihanyi, Norbert, et al.
Publicado: (2024)
Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots
por: Vero, Mark, et al.
Publicado: (2026)
por: Vero, Mark, et al.
Publicado: (2026)
DeepCode AI Fix: Fixing Security Vulnerabilities with Large Language Models
por: Berabi, Berkay, et al.
Publicado: (2024)
por: Berabi, Berkay, et al.
Publicado: (2024)
CommandSans: Securing AI Agents with Surgical Precision Prompt Sanitization
por: Das, Debeshee, et al.
Publicado: (2025)
por: Das, Debeshee, et al.
Publicado: (2025)
INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness
por: Le, Hung, et al.
Publicado: (2024)
por: Le, Hung, et al.
Publicado: (2024)
Hound: Relation-First Knowledge Graphs for Complex-System Reasoning in Security Audits
por: Mueller, Bernhard
Publicado: (2025)
por: Mueller, Bernhard
Publicado: (2025)
AC4A: Access Control for Agents
por: Sharma, Reshabh K, et al.
Publicado: (2026)
por: Sharma, Reshabh K, et al.
Publicado: (2026)
Language-Based Agent Control
por: Zhou, Timothy, et al.
Publicado: (2026)
por: Zhou, Timothy, et al.
Publicado: (2026)
Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis
por: Wen, Hongbo, et al.
Publicado: (2026)
por: Wen, Hongbo, et al.
Publicado: (2026)
C2RUST-BENCH: A Minimized, Representative Dataset for C-to-Rust Transpilation Evaluation
por: Sirlanci, Melih, et al.
Publicado: (2025)
por: Sirlanci, Melih, et al.
Publicado: (2025)
PAuth - Precise Task-Scoped Authorization For Agents
por: Sharma, Reshabh K, et al.
Publicado: (2026)
por: Sharma, Reshabh K, et al.
Publicado: (2026)
SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
por: Chen, Junkai, et al.
Publicado: (2025)
por: Chen, Junkai, et al.
Publicado: (2025)
From Vulnerabilities to Remediation: A Systematic Literature Review of LLMs in Code Security
por: Basic, Enna, et al.
Publicado: (2024)
por: Basic, Enna, et al.
Publicado: (2024)
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
por: Wu, Tianyi, et al.
Publicado: (2026)
por: Wu, Tianyi, et al.
Publicado: (2026)
LLM for SoC Security: A Paradigm Shift
por: Saha, Dipayan, et al.
Publicado: (2023)
por: Saha, Dipayan, et al.
Publicado: (2023)
SecureCode: A Production-Grade Multi-Turn Dataset for Training Security-Aware Code Generation Models
por: Thornton, Scott
Publicado: (2025)
por: Thornton, Scott
Publicado: (2025)
SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories
por: Shen, Chihao, et al.
Publicado: (2025)
por: Shen, Chihao, et al.
Publicado: (2025)
Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security
por: Chua, Gabriel
Publicado: (2025)
por: Chua, Gabriel
Publicado: (2025)
SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters
por: Yang, Yan, et al.
Publicado: (2024)
por: Yang, Yan, et al.
Publicado: (2024)
SecRef*: Securely Sharing Mutable References Between Verified and Unverified Code in F*
por: Andrici, Cezar-Constantin, et al.
Publicado: (2025)
por: Andrici, Cezar-Constantin, et al.
Publicado: (2025)
HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation
por: Chen, Qirui, et al.
Publicado: (2026)
por: Chen, Qirui, et al.
Publicado: (2026)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
por: Liu, Yanjiang, et al.
Publicado: (2025)
por: Liu, Yanjiang, et al.
Publicado: (2025)
Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis
por: Gajjar, Jugal
Publicado: (2026)
por: Gajjar, Jugal
Publicado: (2026)
Benchmarking Prompt Engineering Techniques for Secure Code Generation with GPT Models
por: Bruni, Marc, et al.
Publicado: (2025)
por: Bruni, Marc, et al.
Publicado: (2025)
Ejemplares similares
-
BaxBench: Can LLMs Generate Correct and Secure Backends?
por: Vero, Mark, et al.
Publicado: (2025) -
SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization
por: Wang, Hao, et al.
Publicado: (2026) -
Black-Box Adversarial Attacks on LLM-Based Code Completion
por: Jenko, Slobodan, et al.
Publicado: (2024) -
Instruction Tuning for Secure Code Generation
por: He, Jingxuan, et al.
Publicado: (2024) -
Evading Data Contamination Detection for Language Models is (too) Easy
por: Dekoninck, Jasper, et al.
Publicado: (2024)