Guardado en:
| Autores principales: | Li, Ting, Yang, Yang, Yu, Yipeng, Yao, Liang, Chao, Guoqing, Xu, Ruifeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.11584 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
por: Li, Ziqiang, et al.
Publicado: (2024)
por: Li, Ziqiang, et al.
Publicado: (2024)
Denial-of-Service Poisoning Attacks against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Imperceptible Jailbreaking against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2025)
por: Gao, Kuofeng, et al.
Publicado: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
por: Jiang, Tanqiu, et al.
Publicado: (2024)
por: Jiang, Tanqiu, et al.
Publicado: (2024)
KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs
por: Liang, Buyun, et al.
Publicado: (2025)
por: Liang, Buyun, et al.
Publicado: (2025)
No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents
por: Yang, Tiankai, et al.
Publicado: (2026)
por: Yang, Tiankai, et al.
Publicado: (2026)
ToDA: Target-oriented Diffusion Attacker against Recommendation System
por: Liu, Xiaohao, et al.
Publicado: (2024)
por: Liu, Xiaohao, et al.
Publicado: (2024)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
por: Li, Haoran, et al.
Publicado: (2024)
por: Li, Haoran, et al.
Publicado: (2024)
Towards Label-Only Membership Inference Attack against Pre-trained Large Language Models
por: He, Yu, et al.
Publicado: (2025)
por: He, Yu, et al.
Publicado: (2025)
The First VoicePrivacy Attacker Challenge
por: Tomashenko, Natalia, et al.
Publicado: (2025)
por: Tomashenko, Natalia, et al.
Publicado: (2025)
Prompt Stealing Attacks Against Large Language Models
por: Sha, Zeyang, et al.
Publicado: (2024)
por: Sha, Zeyang, et al.
Publicado: (2024)
Actionable Cyber Threat Intelligence using Knowledge Graphs and Large Language Models
por: Fieblinger, Romy, et al.
Publicado: (2024)
por: Fieblinger, Romy, et al.
Publicado: (2024)
Privacy-Preserving Instructions for Aligning Large Language Models
por: Yu, Da, et al.
Publicado: (2024)
por: Yu, Da, et al.
Publicado: (2024)
CR-UTP: Certified Robustness against Universal Text Perturbations on Large Language Models
por: Lou, Qian, et al.
Publicado: (2024)
por: Lou, Qian, et al.
Publicado: (2024)
FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks
por: Xu, Naen, et al.
Publicado: (2026)
por: Xu, Naen, et al.
Publicado: (2026)
SoK: Large Language Model Copyright Auditing via Fingerprinting
por: Shao, Shuo, et al.
Publicado: (2025)
por: Shao, Shuo, et al.
Publicado: (2025)
EmMark: Robust Watermarks for IP Protection of Embedded Quantized Large Language Models
por: Zhang, Ruisi, et al.
Publicado: (2024)
por: Zhang, Ruisi, et al.
Publicado: (2024)
Yet Another Watermark for Large Language Models
por: Bao, Siyuan, et al.
Publicado: (2025)
por: Bao, Siyuan, et al.
Publicado: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
Proactive defense against LLM Jailbreak
por: Zhao, Weiliang, et al.
Publicado: (2025)
por: Zhao, Weiliang, et al.
Publicado: (2025)
CATMark: A Context-Aware Thresholding Framework for Robust Cross-Task Watermarking in Large Language Models
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
por: Yi, Biao, et al.
Publicado: (2025)
por: Yi, Biao, et al.
Publicado: (2025)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
por: Yu, Zhiyuan, et al.
Publicado: (2024)
por: Yu, Zhiyuan, et al.
Publicado: (2024)
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Watermarks for Embeddings-as-a-Service Large Language Models
por: Shetty, Anudeex
Publicado: (2025)
por: Shetty, Anudeex
Publicado: (2025)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
The First VoicePrivacy Attacker Challenge Evaluation Plan
por: Tomashenko, Natalia, et al.
Publicado: (2024)
por: Tomashenko, Natalia, et al.
Publicado: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
por: Yi, Biao, et al.
Publicado: (2025)
por: Yi, Biao, et al.
Publicado: (2025)
Separator Injection Attack: Uncovering Dialogue Biases in Large Language Models Caused by Role Separators
por: Li, Xitao, et al.
Publicado: (2025)
por: Li, Xitao, et al.
Publicado: (2025)
Privacy-Preserving Parameter-Efficient Fine-Tuning for Large Language Model Services
por: Li, Yansong, et al.
Publicado: (2023)
por: Li, Yansong, et al.
Publicado: (2023)
BAIT: Boundary-Guided Disclosure Escalation via Self-Conditioned Reasoning
por: Luo, Xuan, et al.
Publicado: (2026)
por: Luo, Xuan, et al.
Publicado: (2026)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
por: Gu, Tianle, et al.
Publicado: (2024)
por: Gu, Tianle, et al.
Publicado: (2024)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
por: Jia, Xiaojun, et al.
Publicado: (2024)
por: Jia, Xiaojun, et al.
Publicado: (2024)
DiDOTS: Knowledge Distillation from Large-Language-Models for Dementia Obfuscation in Transcribed Speech
por: Woszczyk, Dominika, et al.
Publicado: (2024)
por: Woszczyk, Dominika, et al.
Publicado: (2024)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
por: Yang, Guangyu, et al.
Publicado: (2025)
por: Yang, Guangyu, et al.
Publicado: (2025)
How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework
por: Liang, Zi, et al.
Publicado: (2025)
por: Liang, Zi, et al.
Publicado: (2025)
Majority Bit-Aware Watermarking For Large Language Models
por: Xu, Jiahao, et al.
Publicado: (2025)
por: Xu, Jiahao, et al.
Publicado: (2025)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
por: Wang, Yanbo, et al.
Publicado: (2025)
por: Wang, Yanbo, et al.
Publicado: (2025)
Quantifying and Defending against Privacy Threats on Federated Knowledge Graph Embedding
por: Hu, Yuke, et al.
Publicado: (2023)
por: Hu, Yuke, et al.
Publicado: (2023)
Ejemplares similares
-
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
por: Li, Ziqiang, et al.
Publicado: (2024) -
Denial-of-Service Poisoning Attacks against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2024) -
Imperceptible Jailbreaking against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2025) -
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
por: Jiang, Tanqiu, et al.
Publicado: (2024) -
KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs
por: Liang, Buyun, et al.
Publicado: (2025)