TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Zhen, Shi, Shanghao, Li, Hao, Yazdani, Shamim, Zhang, Ning, Tourani, Reza |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DarkMind: Latent Chain-of-Thought Backdoor in Customized LLMs
por: Guo, Zhen, et al.
Publicado: (2025)
por: Guo, Zhen, et al.
Publicado: (2025)
Persistent Backdoor Attacks in Continual Learning
por: Guo, Zhen, et al.
Publicado: (2024)
por: Guo, Zhen, et al.
Publicado: (2024)
TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol
por: Nguyen, Khanh Linh, et al.
Publicado: (2026)
por: Nguyen, Khanh Linh, et al.
Publicado: (2026)
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
por: Hua, Peichun, et al.
Publicado: (2025)
por: Hua, Peichun, et al.
Publicado: (2025)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Prototype-Guided Robust Learning against Backdoor Attacks
por: Guo, Wei, et al.
Publicado: (2025)
por: Guo, Wei, et al.
Publicado: (2025)
PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
por: Zhao, Jiawei, et al.
Publicado: (2025)
por: Zhao, Jiawei, et al.
Publicado: (2025)
AgentDyn: Are Your Agent Security Defenses Deployable in Real-World Dynamic Environments?
por: Li, Hao, et al.
Publicado: (2026)
por: Li, Hao, et al.
Publicado: (2026)
Unveiling the Unseen: Exploring Whitebox Membership Inference through the Lens of Explainability
por: Li, Chenxi, et al.
Publicado: (2024)
por: Li, Chenxi, et al.
Publicado: (2024)
ProFLingo: A Fingerprinting-based Intellectual Property Protection Scheme for Large Language Models
por: Jin, Heng, et al.
Publicado: (2024)
por: Jin, Heng, et al.
Publicado: (2024)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
por: Yuan, Zenghui, et al.
Publicado: (2025)
por: Yuan, Zenghui, et al.
Publicado: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
Combinational Backdoor Attack against Customized Text-to-Image Models
por: Jiang, Wenbo, et al.
Publicado: (2024)
por: Jiang, Wenbo, et al.
Publicado: (2024)
BoBa: Boosting Backdoor Detection through Data Distribution Inference in Federated Learning
por: Jiang, Zhengyuan, et al.
Publicado: (2024)
por: Jiang, Zhengyuan, et al.
Publicado: (2024)
Physical Backdoor Attack can Jeopardize Driving with Vision-Large-Language Models
por: Ni, Zhenyang, et al.
Publicado: (2024)
por: Ni, Zhenyang, et al.
Publicado: (2024)
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
por: Truong, Vu Tuan, et al.
Publicado: (2026)
por: Truong, Vu Tuan, et al.
Publicado: (2026)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Stealthy Targeted Backdoor Attacks against Image Captioning
por: Fan, Wenshu, et al.
Publicado: (2024)
por: Fan, Wenshu, et al.
Publicado: (2024)
Firewalls to Secure Dynamic LLM Agentic Networks
por: Abdelnabi, Sahar, et al.
Publicado: (2025)
por: Abdelnabi, Sahar, et al.
Publicado: (2025)
Transferring Backdoors between Large Language Models by Knowledge Distillation
por: Cheng, Pengzhou, et al.
Publicado: (2024)
por: Cheng, Pengzhou, et al.
Publicado: (2024)
Low Rank Adaptation for Adversarial Perturbation
por: Liu, Han, et al.
Publicado: (2026)
por: Liu, Han, et al.
Publicado: (2026)
SmartGuard: Leveraging Large Language Models for Network Attack Detection through Audit Log Analysis and Summarization
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
Backdoor Attacks against Hybrid Classical-Quantum Neural Networks
por: Guo, Ji, et al.
Publicado: (2024)
por: Guo, Ji, et al.
Publicado: (2024)
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
por: Guan, Shaowei, et al.
Publicado: (2025)
por: Guan, Shaowei, et al.
Publicado: (2025)
Cross-Modal Backdoors in Multimodal Large Language Models
por: Wang, Runhe, et al.
Publicado: (2026)
por: Wang, Runhe, et al.
Publicado: (2026)
BadToken: Token-level Backdoor Attacks to Multi-modal Large Language Models
por: Yuan, Zenghui, et al.
Publicado: (2025)
por: Yuan, Zenghui, et al.
Publicado: (2025)
Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
por: Fu, Hang, et al.
Publicado: (2026)
por: Fu, Hang, et al.
Publicado: (2026)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
por: Xiang, Zhen, et al.
Publicado: (2024)
por: Xiang, Zhen, et al.
Publicado: (2024)
PoseGuard: Pose-Guided Generation with Safety Guardrails
por: Wang, Kongxin, et al.
Publicado: (2025)
por: Wang, Kongxin, et al.
Publicado: (2025)
ProtoGuard-SL: Prototype Consistency Based Backdoor Defense for Vertical Split Learning
por: Shui, Yuhan, et al.
Publicado: (2026)
por: Shui, Yuhan, et al.
Publicado: (2026)
CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Backdooring Bias in Large Language Models
por: Das, Anudeep, et al.
Publicado: (2026)
por: Das, Anudeep, et al.
Publicado: (2026)
BadDLM: Backdooring Diffusion Language Models with Diverse Targets
por: Zhai, Shengfang, et al.
Publicado: (2026)
por: Zhai, Shengfang, et al.
Publicado: (2026)
WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents
por: Chen, Yulin, et al.
Publicado: (2026)
por: Chen, Yulin, et al.
Publicado: (2026)
Guarding the Gate: ConceptGuard Battles Concept-Level Backdoors in Concept Bottleneck Models
por: Lai, Songning, et al.
Publicado: (2024)
por: Lai, Songning, et al.
Publicado: (2024)
Concept-Guided Backdoor Attack on Vision Language Models
por: Shen, Haoyu, et al.
Publicado: (2025)
por: Shen, Haoyu, et al.
Publicado: (2025)
Double Backdoored: Converting Code Large Language Model Backdoors to Traditional Malware via Adversarial Instruction Tuning Attacks
por: Hossen, Md Imran, et al.
Publicado: (2024)
por: Hossen, Md Imran, et al.
Publicado: (2024)
Backdoor Attacks and Countermeasures in Natural Language Processing Models: A Comprehensive Security Review
por: Cheng, Pengzhou, et al.
Publicado: (2023)
por: Cheng, Pengzhou, et al.
Publicado: (2023)
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
por: Zhu, Zhenhao, et al.
Publicado: (2026)
por: Zhu, Zhenhao, et al.
Publicado: (2026)
Ejemplares similares
-
DarkMind: Latent Chain-of-Thought Backdoor in Customized LLMs
por: Guo, Zhen, et al.
Publicado: (2025) -
Persistent Backdoor Attacks in Continual Learning
por: Guo, Zhen, et al.
Publicado: (2024) -
TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol
por: Nguyen, Khanh Linh, et al.
Publicado: (2026) -
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
por: Li, Hao, et al.
Publicado: (2025) -
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
por: Hua, Peichun, et al.
Publicado: (2025)