RACC: Representation-Aware Coverage Criteria for LLM Safety Testing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wei, Zeming, Zhang, Zhixin, Wu, Chengcan, Zhang, Yihao, Luan, Xiaokun, Sun, Meng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Secure LLM Fine-Tuning via Safety-Aware Probing
par: Wu, Chengcan, et autres
Publié: (2025)
par: Wu, Chengcan, et autres
Publié: (2025)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
par: Luan, Xiaokun, et autres
Publié: (2025)
par: Luan, Xiaokun, et autres
Publié: (2025)
ClawWorm: Self-Propagating Attacks Across LLM Agent Ecosystems
par: Zhang, Yihao, et autres
Publié: (2026)
par: Zhang, Yihao, et autres
Publié: (2026)
ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction
par: Wei, Zeming, et autres
Publié: (2025)
par: Wei, Zeming, et autres
Publié: (2025)
MILE: A Mutation Testing Framework of In-Context Learning Systems
par: Wei, Zeming, et autres
Publié: (2024)
par: Wei, Zeming, et autres
Publié: (2024)
Absorber LLM: Harnessing Causal Synchronization for Test-Time Training
par: Zhang, Zhixin, et autres
Publié: (2026)
par: Zhang, Zhixin, et autres
Publié: (2026)
Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety
par: Chen, Xuan, et autres
Publié: (2026)
par: Chen, Xuan, et autres
Publié: (2026)
Protecting Deep Learning Model Copyrights with Adversarial Example-Free Reuse Detection
par: Luan, Xiaokun, et autres
Publié: (2024)
par: Luan, Xiaokun, et autres
Publié: (2024)
AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection
par: Zhao, Zijie, et autres
Publié: (2026)
par: Zhao, Zijie, et autres
Publié: (2026)
LeCov: Multi-level Testing Criteria for Large Language Models
par: Xie, Xuan, et autres
Publié: (2024)
par: Xie, Xuan, et autres
Publié: (2024)
Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing
par: Peng, Jiaren, et autres
Publié: (2026)
par: Peng, Jiaren, et autres
Publié: (2026)
Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking
par: Huang, Yifan, et autres
Publié: (2025)
par: Huang, Yifan, et autres
Publié: (2025)
Prompt Injection attack against LLM-integrated Applications
par: Liu, Yi, et autres
Publié: (2023)
par: Liu, Yi, et autres
Publié: (2023)
Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks
par: Chu, Junjie, et autres
Publié: (2026)
par: Chu, Junjie, et autres
Publié: (2026)
Differentiated Directional Intervention A Framework for Evading LLM Safety Alignment
par: Zhang, Peng, et autres
Publié: (2025)
par: Zhang, Peng, et autres
Publié: (2025)
Groot: Adversarial Testing for Generative Text-to-Image Models with Tree-based Semantic Transformation
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
LLM4Vuln: A Unified Evaluation Framework for Decoupling and Enhancing LLMs' Vulnerability Reasoning
par: Sun, Yuqiang, et autres
Publié: (2024)
par: Sun, Yuqiang, et autres
Publié: (2024)
Jailbreak Distillation: Renewable Safety Benchmarking
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design
par: Yang, Ruozhao, et autres
Publié: (2025)
par: Yang, Ruozhao, et autres
Publié: (2025)
Beyond Imprecise Distance Metrics: Trace-Guided Directed Greybox Fuzzing via LLM-Predicted Call Stacks
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications
par: Lu, Xiaoyue, et autres
Publié: (2026)
par: Lu, Xiaoyue, et autres
Publié: (2026)
SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs
par: Xia, Hongfei, et autres
Publié: (2025)
par: Xia, Hongfei, et autres
Publié: (2025)
AutoTestForge: A Multidimensional Automated Testing Framework for Natural Language Processing Models
par: Xing, Hengrui, et autres
Publié: (2025)
par: Xing, Hengrui, et autres
Publié: (2025)
Arbiter: Detecting Interference in LLM Agent System Prompts
par: Mason, Tony
Publié: (2026)
par: Mason, Tony
Publié: (2026)
AdaptiveGuard: Towards Adaptive Runtime Safety for LLM-Powered Software
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
Usability as a Weapon: Attacking the Safety of LLM-Based Code Generation via Usability Requirements
par: Li, Yue, et autres
Publié: (2026)
par: Li, Yue, et autres
Publié: (2026)
Can LLM Prompting Serve as a Proxy for Static Analysis in Vulnerability Detection
par: Ceka, Ira, et autres
Publié: (2024)
par: Ceka, Ira, et autres
Publié: (2024)
Agentic Specification Generator for Move Programs
par: Fu, Yu-Fu, et autres
Publié: (2025)
par: Fu, Yu-Fu, et autres
Publié: (2025)
LLM-enabled Applications Require System-Level Threat Monitoring
par: Zhang, Yedi, et autres
Publié: (2026)
par: Zhang, Yedi, et autres
Publié: (2026)
Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks
par: Qu, Yubin, et autres
Publié: (2026)
par: Qu, Yubin, et autres
Publié: (2026)
VULPO: Context-Aware Vulnerability Detection via On-Policy LLM Optimization
par: Li, Youpeng, et autres
Publié: (2025)
par: Li, Youpeng, et autres
Publié: (2025)
SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces
par: Hu, Qi, et autres
Publié: (2026)
par: Hu, Qi, et autres
Publié: (2026)
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale
par: Liu, Yi, et autres
Publié: (2026)
par: Liu, Yi, et autres
Publié: (2026)
Probing Privacy Leaks in LLM-based Code Generation via Test Generation
par: Ge, Yifei, et autres
Publié: (2026)
par: Ge, Yifei, et autres
Publié: (2026)
Semantic-Aware Fuzzing: An Empirical Framework for LLM-Guided, Reasoning-Driven Input Mutation
par: Lu, Mengdi, et autres
Publié: (2025)
par: Lu, Mengdi, et autres
Publié: (2025)
What Makes a Good LLM Agent for Real-world Penetration Testing?
par: Deng, Gelei, et autres
Publié: (2026)
par: Deng, Gelei, et autres
Publié: (2026)
Evaluating and Mitigating Linguistic Discrimination in Large Language Models
par: Dong, Guoliang, et autres
Publié: (2024)
par: Dong, Guoliang, et autres
Publié: (2024)
ContraFix: Agentic Vulnerability Repair via Differential Runtime Evidence and Skill Reuse
par: Liu, Simiao, et autres
Publié: (2026)
par: Liu, Simiao, et autres
Publié: (2026)
Implicit Patterns in LLM-Based Binary Analysis
par: Li, Qiang, et autres
Publié: (2026)
par: Li, Qiang, et autres
Publié: (2026)
Towards Secure and Explainable Smart Contract Generation with Security-Aware Group Relative Policy Optimization
par: Yu, Lei, et autres
Publié: (2025)
par: Yu, Lei, et autres
Publié: (2025)
Documents similaires
-
Secure LLM Fine-Tuning via Safety-Aware Probing
par: Wu, Chengcan, et autres
Publié: (2025) -
Automata-Based Steering of Large Language Models for Diverse Structured Generation
par: Luan, Xiaokun, et autres
Publié: (2025) -
ClawWorm: Self-Propagating Attacks Across LLM Agent Ecosystems
par: Zhang, Yihao, et autres
Publié: (2026) -
ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction
par: Wei, Zeming, et autres
Publié: (2025) -
MILE: A Mutation Testing Framework of In-Context Learning Systems
par: Wei, Zeming, et autres
Publié: (2024)