Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kaunismaa, Jackson, Griffin, Avery, Hughes, John, Knight, Christina Q., Sharma, Mrinank, Jones, Erik |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap
par: Huang, Feiyang, et autres
Publié: (2026)
par: Huang, Feiyang, et autres
Publié: (2026)
Retrieval-Augmented Few-Shot Prompting Versus Fine-Tuning for Code Vulnerability Detection
par: Trad, Fouad, et autres
Publié: (2025)
par: Trad, Fouad, et autres
Publié: (2025)
Fine-Tuning LLMs for Code Mutation: A New Era of Cyber Threats
par: Setak, Mohammad, et autres
Publié: (2024)
par: Setak, Mohammad, et autres
Publié: (2024)
Jailbreak Distillation: Renewable Safety Benchmarking
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
Accelerating Automatic Program Repair with Dual Retrieval-Augmented Fine-Tuning and Patch Generation on Large Language Models
par: Guo, Hanyang, et autres
Publié: (2025)
par: Guo, Hanyang, et autres
Publié: (2025)
Exploring ChatGPT's Capabilities on Vulnerability Management
par: Liu, Peiyu, et autres
Publié: (2023)
par: Liu, Peiyu, et autres
Publié: (2023)
Similar but Patched Code Considered Harmful -- The Impact of Similar but Patched Code on Recurring Vulnerability Detection and How to Remove Them
par: Tan, Zixuan, et autres
Publié: (2024)
par: Tan, Zixuan, et autres
Publié: (2024)
Auditing MCP Servers for Over-Privileged Tool Capabilities
par: Huang, Charoes, et autres
Publié: (2026)
par: Huang, Charoes, et autres
Publié: (2026)
PrimeGuard: Safe and Helpful LLMs through Tuning-Free Routing
par: Manczak, Blazej, et autres
Publié: (2024)
par: Manczak, Blazej, et autres
Publié: (2024)
Rust for Embedded Systems: Current State, Challenges and Open Problems (Extended Report)
par: Sharma, Ayushi, et autres
Publié: (2023)
par: Sharma, Ayushi, et autres
Publié: (2023)
VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities
par: Wang, Weizhe, et autres
Publié: (2025)
par: Wang, Weizhe, et autres
Publié: (2025)
On the Adversarial Robustness of Instruction-Tuned Large Language Models for Code
par: Hossen, Md Imran, et autres
Publié: (2024)
par: Hossen, Md Imran, et autres
Publié: (2024)
ProSec: Fortifying Code LLMs with Proactive Security Alignment
par: Xu, Xiangzhe, et autres
Publié: (2024)
par: Xu, Xiangzhe, et autres
Publié: (2024)
Static Deadlock Detection for Rust Programs
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
BackportBench: A Multilingual Benchmark for Automated Backporting of Patches
par: Zhong, Zhiqing, et autres
Publié: (2025)
par: Zhong, Zhiqing, et autres
Publié: (2025)
Demystifying Invariant Effectiveness for Securing Smart Contracts
par: Chen, Zhiyang, et autres
Publié: (2024)
par: Chen, Zhiyang, et autres
Publié: (2024)
HardTaint: Production-Run Dynamic Taint Analysis via Selective Hardware Tracing
par: Zhang, Yiyu, et autres
Publié: (2024)
par: Zhang, Yiyu, et autres
Publié: (2024)
AC4: Algebraic Computation Checker for Circuit Constraints in ZKPs
par: Yang, Qizhe, et autres
Publié: (2024)
par: Yang, Qizhe, et autres
Publié: (2024)
IRIS: LLM-Assisted Static Analysis for Detecting Security Vulnerabilities
par: Li, Ziyang, et autres
Publié: (2024)
par: Li, Ziyang, et autres
Publié: (2024)
Arguzz: Testing zkVMs for Soundness and Completeness Bugs
par: Hochrainer, Christoph, et autres
Publié: (2025)
par: Hochrainer, Christoph, et autres
Publié: (2025)
Yaksha-Prashna: Understanding eBPF Bytecode Network Function Behavior
par: Singh, Animesh, et autres
Publié: (2026)
par: Singh, Animesh, et autres
Publié: (2026)
SmartInv: Multimodal Learning for Smart Contract Invariant Inference
par: Wang, Sally Junsong, et autres
Publié: (2024)
par: Wang, Sally Junsong, et autres
Publié: (2024)
Dynamic Taint Tracking using Partial Instrumentation for Java Applications
par: Thakur, Manoj RameshChandra
Publié: (2024)
par: Thakur, Manoj RameshChandra
Publié: (2024)
Evaluation of the Programming Skills of Large Language Models
par: Heitz, Luc Bryan, et autres
Publié: (2024)
par: Heitz, Luc Bryan, et autres
Publié: (2024)
YASA: Scalable Multi-Language Taint Analysis on the Unified AST at Ant Group
par: Wang, Yayi, et autres
Publié: (2026)
par: Wang, Yayi, et autres
Publié: (2026)
Understanding the Effectiveness of Large Language Models in Detecting Security Vulnerabilities
par: Khare, Avishree, et autres
Publié: (2023)
par: Khare, Avishree, et autres
Publié: (2023)
PoLLMgraph: Unraveling Hallucinations in Large Language Models via State Transition Dynamics
par: Zhu, Derui, et autres
Publié: (2024)
par: Zhu, Derui, et autres
Publié: (2024)
Fuzzing Processing Pipelines for Zero-Knowledge Circuits
par: Hochrainer, Christoph, et autres
Publié: (2024)
par: Hochrainer, Christoph, et autres
Publié: (2024)
Extracting Protocol Format as State Machine via Controlled Static Loop Analysis
par: Shi, Qingkai, et autres
Publié: (2023)
par: Shi, Qingkai, et autres
Publié: (2023)
Automated Trustworthiness Oracle Generation for Machine Learning Text Classifiers
par: Tung, Lam Nguyen, et autres
Publié: (2024)
par: Tung, Lam Nguyen, et autres
Publié: (2024)
Beyond Imprecise Distance Metrics: Trace-Guided Directed Greybox Fuzzing via LLM-Predicted Call Stacks
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
AutoTestForge: A Multidimensional Automated Testing Framework for Natural Language Processing Models
par: Xing, Hengrui, et autres
Publié: (2025)
par: Xing, Hengrui, et autres
Publié: (2025)
The Secrets Must Not Flow: Scaling Security Verification to Large Codebases (extended version)
par: Arquint, Linard, et autres
Publié: (2025)
par: Arquint, Linard, et autres
Publié: (2025)
Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic Benchmark and Evaluation
par: Fei, Qingyuan, et autres
Publié: (2025)
par: Fei, Qingyuan, et autres
Publié: (2025)
A Broad Comparative Evaluation of Software Debloating Tools
par: Brown, Michael D., et autres
Publié: (2023)
par: Brown, Michael D., et autres
Publié: (2023)
Argus: Reorchestrating Static Analysis via a Multi-Agent Ensemble for Full-Chain Security Vulnerability Detection
par: Liang, Zi, et autres
Publié: (2026)
par: Liang, Zi, et autres
Publié: (2026)
QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities
par: Wang, Claire, et autres
Publié: (2025)
par: Wang, Claire, et autres
Publié: (2025)
iResolveX: Multi-Layered Indirect Call Resolution via Static Reasoning and Learning-Augmented Refinement
par: Santra, Monika, et autres
Publié: (2026)
par: Santra, Monika, et autres
Publié: (2026)
Hornet Node and the Hornet DSL: A Minimal, Executable Specification for Bitcoin Consensus
par: Sharp, Toby
Publié: (2025)
par: Sharp, Toby
Publié: (2025)
Accurate and Extensible Symbolic Execution of Binary Code based on Formal ISA Semantics
par: Tempel, Sören, et autres
Publié: (2024)
par: Tempel, Sören, et autres
Publié: (2024)
Documents similaires
-
Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap
par: Huang, Feiyang, et autres
Publié: (2026) -
Retrieval-Augmented Few-Shot Prompting Versus Fine-Tuning for Code Vulnerability Detection
par: Trad, Fouad, et autres
Publié: (2025) -
Fine-Tuning LLMs for Code Mutation: A New Era of Cyber Threats
par: Setak, Mohammad, et autres
Publié: (2024) -
Jailbreak Distillation: Renewable Safety Benchmarking
par: Zhang, Jingyu, et autres
Publié: (2025) -
Accelerating Automatic Program Repair with Dual Retrieval-Augmented Fine-Tuning and Patch Generation on Large Language Models
par: Guo, Hanyang, et autres
Publié: (2025)