ProTransformer: Robustify Transformers via Plug-and-Play Paradigm
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hou, Zhichao, Gao, Weizhi, Shen, Yuchen, Wang, Feiyi, Liu, Xiaorui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Boosting Adversarial Robustness and Generalization with Structural Prior
par: Hou, Zhichao, et autres
Publié: (2025)
par: Hou, Zhichao, et autres
Publié: (2025)
Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation
par: Chen, Sixu, et autres
Publié: (2026)
par: Chen, Sixu, et autres
Publié: (2026)
SecFormer: Fast and Accurate Privacy-Preserving Inference for Transformer Models via SMPC
par: Luo, Jinglong, et autres
Publié: (2024)
par: Luo, Jinglong, et autres
Publié: (2024)
CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models
par: Zeng, Rui, et autres
Publié: (2024)
par: Zeng, Rui, et autres
Publié: (2024)
Privacy-Preserving Transformers: SwiftKey's Differential Privacy Implementation
par: Abouelenin, Abdelrahman, et autres
Publié: (2025)
par: Abouelenin, Abdelrahman, et autres
Publié: (2025)
WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation Watermarks
par: Shetty, Anudeex, et autres
Publié: (2024)
par: Shetty, Anudeex, et autres
Publié: (2024)
Network Traffic Classification Using Machine Learning, Transformer, and Large Language Models
par: Antari, Ahmad, et autres
Publié: (2025)
par: Antari, Ahmad, et autres
Publié: (2025)
Malware Classification from Memory Dumps Using Machine Learning, Transformers, and Large Language Models
par: Dweib, Areej, et autres
Publié: (2025)
par: Dweib, Areej, et autres
Publié: (2025)
A Curious Case of Searching for the Correlation between Training Data and Adversarial Robustness of Transformer Textual Models
par: Dang, Cuong, et autres
Publié: (2024)
par: Dang, Cuong, et autres
Publié: (2024)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
par: Fu, Wenjie, et autres
Publié: (2023)
par: Fu, Wenjie, et autres
Publié: (2023)
When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models
par: Liu, Xiaoze, et autres
Publié: (2025)
par: Liu, Xiaoze, et autres
Publié: (2025)
Decoupled Alignment for Robust Plug-and-Play Adaptation
par: Luo, Haozheng, et autres
Publié: (2024)
par: Luo, Haozheng, et autres
Publié: (2024)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
par: Fu, Wenjie, et autres
Publié: (2024)
par: Fu, Wenjie, et autres
Publié: (2024)
Fingerprint Vector: Enabling Scalable and Efficient Model Fingerprint Transfer via Vector Addition
par: Xu, Zhenhua, et autres
Publié: (2024)
par: Xu, Zhenhua, et autres
Publié: (2024)
Tracing Privacy Leakage of Language Models to Training Data via Adjusted Influence Functions
par: Liu, Jinxin, et autres
Publié: (2024)
par: Liu, Jinxin, et autres
Publié: (2024)
Cross-Entropy Attacks to Language Models via Rare Event Simulation
par: Ni, Mingze, et autres
Publié: (2025)
par: Ni, Mingze, et autres
Publié: (2025)
Token-Modification Adversarial Attacks for Natural Language Processing: A Survey
par: Roth, Tom, et autres
Publié: (2021)
par: Roth, Tom, et autres
Publié: (2021)
Proving membership in LLM pretraining data via data watermarks
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2024)
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2024)
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
par: Wang, Linlin, et autres
Publié: (2025)
par: Wang, Linlin, et autres
Publié: (2025)
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
par: Fu, Wenjie, et autres
Publié: (2025)
par: Fu, Wenjie, et autres
Publié: (2025)
AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
par: Li, Tung-Ling, et autres
Publié: (2025)
par: Li, Tung-Ling, et autres
Publié: (2025)
DP-MGTD: Privacy-Preserving Machine-Generated Text Detection via Adaptive Differentially Private Entity Sanitization
par: Wang, Lionel Z., et autres
Publié: (2026)
par: Wang, Lionel Z., et autres
Publié: (2026)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
par: He, Jiaming, et autres
Publié: (2024)
par: He, Jiaming, et autres
Publié: (2024)
How Different Tokenization Algorithms Impact LLMs and Transformer Models for Binary Code Analysis
par: Mostafa, Ahmed, et autres
Publié: (2025)
par: Mostafa, Ahmed, et autres
Publié: (2025)
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
par: Sun, Bowen, et autres
Publié: (2026)
par: Sun, Bowen, et autres
Publié: (2026)
On Calibration of LLM-based Guard Models for Reliable Content Moderation
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
Automated Software Vulnerability Static Code Analysis Using Generative Pre-Trained Transformer Models
par: Pelofske, Elijah, et autres
Publié: (2024)
par: Pelofske, Elijah, et autres
Publié: (2024)
Composite Backdoor Attacks Against Large Language Models
par: Huang, Hai, et autres
Publié: (2023)
par: Huang, Hai, et autres
Publié: (2023)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference
par: Fan, Mingyuan, et autres
Publié: (2026)
par: Fan, Mingyuan, et autres
Publié: (2026)
UCD: Unlearning in LLMs via Contrastive Decoding
par: Suriyakumar, Vinith M., et autres
Publié: (2025)
par: Suriyakumar, Vinith M., et autres
Publié: (2025)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm
par: Kim, Jaehan, et autres
Publié: (2024)
par: Kim, Jaehan, et autres
Publié: (2024)
De-Anonymization at Scale via Tournament-Style Attribution
par: Zhang, Lirui, et autres
Publié: (2026)
par: Zhang, Lirui, et autres
Publié: (2026)
FedSpy-LLM: Towards Scalable and Generalizable Data Reconstruction Attacks from Gradients on LLMs
par: Meerza, Syed Irfan Ali, et autres
Publié: (2026)
par: Meerza, Syed Irfan Ali, et autres
Publié: (2026)
Dashed Line Defense: Plug-And-Play Defense Against Adaptive Score-Based Query Attacks
par: Fu, Yanzhang, et autres
Publié: (2026)
par: Fu, Yanzhang, et autres
Publié: (2026)
MARAGE: Transferable Multi-Model Adversarial Attack for Retrieval-Augmented Generation Data Extraction
par: Hu, Xiao, et autres
Publié: (2025)
par: Hu, Xiao, et autres
Publié: (2025)
Differentially Private Knowledge Distillation via Synthetic Text Generation
par: Flemings, James, et autres
Publié: (2024)
par: Flemings, James, et autres
Publié: (2024)
Copyright-Protected Language Generation via Adaptive Model Fusion
par: Abad, Javier, et autres
Publié: (2024)
par: Abad, Javier, et autres
Publié: (2024)
Robust LLM safeguarding via refusal feature adversarial training
par: Yu, Lei, et autres
Publié: (2024)
par: Yu, Lei, et autres
Publié: (2024)
Documents similaires
-
Boosting Adversarial Robustness and Generalization with Structural Prior
par: Hou, Zhichao, et autres
Publié: (2025) -
Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation
par: Chen, Sixu, et autres
Publié: (2026) -
SecFormer: Fast and Accurate Privacy-Preserving Inference for Transformer Models via SMPC
par: Luo, Jinglong, et autres
Publié: (2024) -
CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models
par: Zeng, Rui, et autres
Publié: (2024) -
Privacy-Preserving Transformers: SwiftKey's Differential Privacy Implementation
par: Abouelenin, Abdelrahman, et autres
Publié: (2025)