Enregistré dans:
| Auteurs principaux: | Sun, Zhiyu, Luo, Minrui, Wang, Yu, Chen, Zhili, He, Tianxing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.10134 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering
par: Chen, Baicheng, et autres
Publié: (2026)
par: Chen, Baicheng, et autres
Publié: (2026)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
par: Zhang, Yihao, et autres
Publié: (2024)
par: Zhang, Yihao, et autres
Publié: (2024)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
par: Dong, Xiaoning, et autres
Publié: (2024)
par: Dong, Xiaoning, et autres
Publié: (2024)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
par: Wang, Yanbo, et autres
Publié: (2025)
par: Wang, Yanbo, et autres
Publié: (2025)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
par: Yu, Yongcan, et autres
Publié: (2025)
par: Yu, Yongcan, et autres
Publié: (2025)
The Fire Thief Is Also the Keeper: Balancing Usability and Privacy in Prompts
par: Shen, Zhili, et autres
Publié: (2024)
par: Shen, Zhili, et autres
Publié: (2024)
Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language Models
par: Ruzzetti, Elena Sofia, et autres
Publié: (2025)
par: Ruzzetti, Elena Sofia, et autres
Publié: (2025)
Resource Consumption Threats in Large Language Models
par: Zhang, Yuanhe, et autres
Publié: (2026)
par: Zhang, Yuanhe, et autres
Publié: (2026)
DePrompt: Desensitization and Evaluation of Personal Identifiable Information in Large Language Model Prompts
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
Activation-Guided Local Editing for Jailbreaking Attacks
par: Wang, Jiecong, et autres
Publié: (2025)
par: Wang, Jiecong, et autres
Publié: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
par: Liu, Yanjiang, et autres
Publié: (2025)
par: Liu, Yanjiang, et autres
Publié: (2025)
Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging
par: Cong, Tianshuo, et autres
Publié: (2024)
par: Cong, Tianshuo, et autres
Publié: (2024)
SoK: Large Language Model Copyright Auditing via Fingerprinting
par: Shao, Shuo, et autres
Publié: (2025)
par: Shao, Shuo, et autres
Publié: (2025)
REEF: Representation Encoding Fingerprints for Large Language Models
par: Zhang, Jie, et autres
Publié: (2024)
par: Zhang, Jie, et autres
Publié: (2024)
Building Intelligence Identification System via Large Language Model Watermarking: A Survey and Beyond
par: Wang, Xuhong, et autres
Publié: (2024)
par: Wang, Xuhong, et autres
Publié: (2024)
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
par: Yu, Ye, et autres
Publié: (2026)
par: Yu, Ye, et autres
Publié: (2026)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
par: Yan, Yu, et autres
Publié: (2025)
par: Yan, Yu, et autres
Publié: (2025)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
par: Ran, Delong, et autres
Publié: (2025)
par: Ran, Delong, et autres
Publié: (2025)
Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position
par: Xie, Zhixin, et autres
Publié: (2025)
par: Xie, Zhixin, et autres
Publié: (2025)
Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
par: Huang, Chung-ju, et autres
Publié: (2026)
par: Huang, Chung-ju, et autres
Publié: (2026)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models
par: Min, Nay Myat, et autres
Publié: (2026)
par: Min, Nay Myat, et autres
Publié: (2026)
Internal Safety Collapse in Frontier Large Language Models
par: Wu, Yutao, et autres
Publié: (2026)
par: Wu, Yutao, et autres
Publié: (2026)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
PRISON: Unmasking the Criminal Potential of Large Language Models
par: Wu, Xinyi, et autres
Publié: (2025)
par: Wu, Xinyi, et autres
Publié: (2025)
Text Embedding Inversion Security for Multilingual Language Models
par: Chen, Yiyi, et autres
Publié: (2024)
par: Chen, Yiyi, et autres
Publié: (2024)
Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage
par: Hoque, Shahinul, et autres
Publié: (2026)
par: Hoque, Shahinul, et autres
Publié: (2026)
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
par: Yi, Sibo, et autres
Publié: (2025)
par: Yi, Sibo, et autres
Publié: (2025)
FNF: Functional Network Fingerprint for Large Language Models
par: Liu, Yiheng, et autres
Publié: (2026)
par: Liu, Yiheng, et autres
Publié: (2026)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
par: Cheng, Siyang, et autres
Publié: (2025)
par: Cheng, Siyang, et autres
Publié: (2025)
Is the System Message Really Important to Jailbreaks in Large Language Models?
par: Zou, Xiaotian, et autres
Publié: (2024)
par: Zou, Xiaotian, et autres
Publié: (2024)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
par: Gu, Tianle, et autres
Publié: (2024)
par: Gu, Tianle, et autres
Publié: (2024)
Imperceptible Jailbreaking against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2025)
par: Gao, Kuofeng, et autres
Publié: (2025)
Efficient Detection of Toxic Prompts in Large Language Models
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
Citation: A Key to Building Responsible and Accountable Large Language Models
par: Huang, Jie, et autres
Publié: (2023)
par: Huang, Jie, et autres
Publié: (2023)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
par: Cao, Yuanpu, et autres
Publié: (2023)
par: Cao, Yuanpu, et autres
Publié: (2023)
Documents similaires
-
CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering
par: Chen, Baicheng, et autres
Publié: (2026) -
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
par: Zhang, Yihao, et autres
Publié: (2024) -
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
par: Dong, Xiaoning, et autres
Publié: (2024) -
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
par: Wang, Yanbo, et autres
Publié: (2025) -
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
par: Yu, Yongcan, et autres
Publié: (2025)