The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yihao, Wang, Kai, Wu, Jiangrong, Wu, Haolin, Zhou, Yuxuan, Wei, Zeming, Wu, Dongxian, Chen, Xun, Sun, Jun, Sun, Meng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ClawWorm: Self-Propagating Attacks Across LLM Agent Ecosystems
di: Zhang, Yihao, et al.
Pubblicazione: (2026)
di: Zhang, Yihao, et al.
Pubblicazione: (2026)
MILE: A Mutation Testing Framework of In-Context Learning Systems
di: Wei, Zeming, et al.
Pubblicazione: (2024)
di: Wei, Zeming, et al.
Pubblicazione: (2024)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
Secure LLM Fine-Tuning via Safety-Aware Probing
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
RACC: Representation-Aware Coverage Criteria for LLM Safety Testing
di: Wei, Zeming, et al.
Pubblicazione: (2026)
di: Wei, Zeming, et al.
Pubblicazione: (2026)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
Boosting Jailbreak Attack with Momentum
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models
di: Wang, Kai, et al.
Pubblicazione: (2025)
di: Wang, Kai, et al.
Pubblicazione: (2025)
Control at Stake: Evaluating the Security Landscape of LLM-Driven Email Agents
di: Wu, Jiangrong, et al.
Pubblicazione: (2025)
di: Wu, Jiangrong, et al.
Pubblicazione: (2025)
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction
di: Wei, Zeming, et al.
Pubblicazione: (2025)
di: Wei, Zeming, et al.
Pubblicazione: (2025)
ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation
di: Wu, Yiran, et al.
Pubblicazione: (2025)
di: Wu, Yiran, et al.
Pubblicazione: (2025)
Conversations Risk Detection LLMs in Financial Agents via Multi-Stage Generative Rollout
di: Jiang, Xiaotong, et al.
Pubblicazione: (2026)
di: Jiang, Xiaotong, et al.
Pubblicazione: (2026)
The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis
di: Wang, Peiran, et al.
Pubblicazione: (2026)
di: Wang, Peiran, et al.
Pubblicazione: (2026)
Security Attacks on LLM-based Code Completion Tools
di: Cheng, Wen, et al.
Pubblicazione: (2024)
di: Cheng, Wen, et al.
Pubblicazione: (2024)
ChainFuzzer: Greybox Fuzzing for Workflow-Level Multi-Tool Vulnerabilities in LLM Agents
di: Wu, Jiangrong, et al.
Pubblicazione: (2026)
di: Wu, Jiangrong, et al.
Pubblicazione: (2026)
LRCTI: A Large Language Model-Based Framework for Multi-Step Evidence Retrieval and Reasoning in Cyber Threat Intelligence Credibility Verification
di: Tang, Fengxiao, et al.
Pubblicazione: (2025)
di: Tang, Fengxiao, et al.
Pubblicazione: (2025)
From Retrieval to Reasoning: A Framework for Cyber Threat Intelligence NER with Explicit and Adaptive Instructions
di: Peng, Jiaren, et al.
Pubblicazione: (2025)
di: Peng, Jiaren, et al.
Pubblicazione: (2025)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
di: Jia, Xiaojun, et al.
Pubblicazione: (2025)
di: Jia, Xiaojun, et al.
Pubblicazione: (2025)
Is the Digital Forensics and Incident Response Pipeline Ready for Text-Based Threats in LLM Era?
di: Bhandarkar, Avanti, et al.
Pubblicazione: (2024)
di: Bhandarkar, Avanti, et al.
Pubblicazione: (2024)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
Self-Disguise Attack: Induce the LLM to disguise itself for AIGT detection evasion
di: Zhou, Yinghan, et al.
Pubblicazione: (2025)
di: Zhou, Yinghan, et al.
Pubblicazione: (2025)
HackWorld: Evaluating Computer-Use Agents on Exploiting Web Application Vulnerabilities
di: Ren, Xiaoxue, et al.
Pubblicazione: (2025)
di: Ren, Xiaoxue, et al.
Pubblicazione: (2025)
Exploit the Leak: Understanding Risks in Biometric Matchers
di: Durbet, Axel, et al.
Pubblicazione: (2023)
di: Durbet, Axel, et al.
Pubblicazione: (2023)
Can LLM Infer Risk Information From MCP Server System Logs?
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
On the Hidden Costs of Counterfactual Knowledge Training in LLM Unlearning
di: Ye, Xiaotian, et al.
Pubblicazione: (2026)
di: Ye, Xiaotian, et al.
Pubblicazione: (2026)
The Obvious Invisible Threat: LLM-Powered GUI Agents' Vulnerability to Fine-Print Injections
di: Chen, Chaoran, et al.
Pubblicazione: (2025)
di: Chen, Chaoran, et al.
Pubblicazione: (2025)
MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
di: Wen, Rui, et al.
Pubblicazione: (2026)
di: Wen, Rui, et al.
Pubblicazione: (2026)
BraveGuard: From Open-World Threats to Safer Computer-Use Agents
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
Exploring the Robustness of In-Context Learning with Noisy Labels
di: Cheng, Chen, et al.
Pubblicazione: (2024)
di: Cheng, Chen, et al.
Pubblicazione: (2024)
Watermarking LLM Agent Trajectories
di: Meng, Wenlong, et al.
Pubblicazione: (2026)
di: Meng, Wenlong, et al.
Pubblicazione: (2026)
Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures
di: Zhou, Yukai, et al.
Pubblicazione: (2025)
di: Zhou, Yukai, et al.
Pubblicazione: (2025)
RoMA: Robust Malware Attribution via Byte-level Adversarial Training with Global Perturbations and Adversarial Consistency Regularization
di: Sun, Yuxia, et al.
Pubblicazione: (2025)
di: Sun, Yuxia, et al.
Pubblicazione: (2025)
Generalized Security-Preserving Refinement for Concurrent Systems
di: Sun, Huan, et al.
Pubblicazione: (2025)
di: Sun, Huan, et al.
Pubblicazione: (2025)
Calibrated Adversarial Sampling: Multi-Armed Bandit-Guided Generalization Against Unforeseen Attacks
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Triaging Threats to Specialized Guardrails
di: Mo, Wenjie Jacky, et al.
Pubblicazione: (2026)
di: Mo, Wenjie Jacky, et al.
Pubblicazione: (2026)
Resource Consumption Threats in Large Language Models
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?
di: Chen, Xiangsen, et al.
Pubblicazione: (2026)
di: Chen, Xiangsen, et al.
Pubblicazione: (2026)
From Perception to Protection: A Developer-Centered Study of Security and Privacy Threats in Extended Reality (XR)
di: Cai, Kunlin, et al.
Pubblicazione: (2025)
di: Cai, Kunlin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ClawWorm: Self-Propagating Attacks Across LLM Agent Ecosystems
di: Zhang, Yihao, et al.
Pubblicazione: (2026) -
MILE: A Mutation Testing Framework of In-Context Learning Systems
di: Wei, Zeming, et al.
Pubblicazione: (2024) -
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
di: Zhang, Yihao, et al.
Pubblicazione: (2024) -
Secure LLM Fine-Tuning via Safety-Aware Probing
di: Wu, Chengcan, et al.
Pubblicazione: (2025) -
RACC: Representation-Aware Coverage Criteria for LLM Safety Testing
di: Wei, Zeming, et al.
Pubblicazione: (2026)