Camouflage is all you need: Evaluating and Enhancing Language Model Robustness Against Camouflage Adversarial Attacks
Fuente:
arXiv
Salvato in:
| Autori principali: | Huertas-García, Álvaro, Martín, Alejandro, Huertas-Tato, Javier, Camacho, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PART: Pre-trained Authorship Representation Transformer
di: Huertas-Tato, Javier, et al.
Pubblicazione: (2022)
di: Huertas-Tato, Javier, et al.
Pubblicazione: (2022)
Not all tokens are created equal: Perplexity Attention Weighted Networks for AI generated text detection
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
Pushing the boundary on Natural Language Inference
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
Isolating authorship from content with semantic embeddings and contrastive learning
di: Huertas-Tato, Javier, et al.
Pubblicazione: (2024)
di: Huertas-Tato, Javier, et al.
Pubblicazione: (2024)
On the locality bias and results in the Long Range Arena
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
LLM one-shot style transfer for Authorship Attribution and Verification
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
xList-Hate: A Checklist-Based Framework for Interpretable and Generalizable Hate Speech Detection
di: Girón, Adrián, et al.
Pubblicazione: (2026)
di: Girón, Adrián, et al.
Pubblicazione: (2026)
Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent
di: Zhang, Yangshijie, et al.
Pubblicazione: (2025)
di: Zhang, Yangshijie, et al.
Pubblicazione: (2025)
Robustness of Large Language Models Against Adversarial Attacks
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
DisTrack: a new Tool for Semi-automatic Misinformation Tracking in Online Social Networks
di: Villar-Rodríguez, Guillermo, et al.
Pubblicazione: (2024)
di: Villar-Rodríguez, Guillermo, et al.
Pubblicazione: (2024)
Large Language Models aren't all that you need
di: Holla, Kiran Voderhobli, et al.
Pubblicazione: (2024)
di: Holla, Kiran Voderhobli, et al.
Pubblicazione: (2024)
Downstream bias mitigation is all you need
di: Baksi, Arkadeep, et al.
Pubblicazione: (2024)
di: Baksi, Arkadeep, et al.
Pubblicazione: (2024)
Adversarial Camouflage
di: Borsukiewicz, Paweł, et al.
Pubblicazione: (2026)
di: Borsukiewicz, Paweł, et al.
Pubblicazione: (2026)
Multimodal LLMs are not all you need for Pediatric Speech Language Pathology
di: Fürst, Darren, et al.
Pubblicazione: (2026)
di: Fürst, Darren, et al.
Pubblicazione: (2026)
Supervised Contrastive Learning for Few-Shot AI-Generated Image Detection and Attribution
di: Urueña, Jaime Álvarez, et al.
Pubblicazione: (2025)
di: Urueña, Jaime Álvarez, et al.
Pubblicazione: (2025)
Reddit is all you need: Authorship profiling for Romanian
di: Ştefănescu, Ecaterina, et al.
Pubblicazione: (2024)
di: Ştefănescu, Ecaterina, et al.
Pubblicazione: (2024)
Multilingual Natural Language Processing Model for Radiology Reports -- The Summary is all you need!
di: Lindo, Mariana, et al.
Pubblicazione: (2023)
di: Lindo, Mariana, et al.
Pubblicazione: (2023)
Honeyfile Camouflage: Hiding Fake Files in Plain Sight
di: Timmer, Roelien C., et al.
Pubblicazione: (2024)
di: Timmer, Roelien C., et al.
Pubblicazione: (2024)
Evaluation is all you need. Prompting Generative Large Language Models for Annotation Tasks in the Social Sciences. A Primer using Open Models
di: Weber, Maximilian, et al.
Pubblicazione: (2023)
di: Weber, Maximilian, et al.
Pubblicazione: (2023)
Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
di: Mu, Lin, et al.
Pubblicazione: (2025)
di: Mu, Lin, et al.
Pubblicazione: (2025)
Signformer is all you need: Towards Edge AI for Sign Language
di: Yang, Eta
Pubblicazione: (2024)
di: Yang, Eta
Pubblicazione: (2024)
BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
Steps are all you need: Rethinking STEM Education with Prompt Engineering
di: Addala, Krishnasai, et al.
Pubblicazione: (2024)
di: Addala, Krishnasai, et al.
Pubblicazione: (2024)
Knowledge Graphs are all you need: Leveraging KGs in Physics Question Answering
di: Addala, Krishnasai, et al.
Pubblicazione: (2024)
di: Addala, Krishnasai, et al.
Pubblicazione: (2024)
AUEB-Archimedes at RIRAG-2025: Is obligation concatenation really all you need?
di: Chasandras, Ioannis, et al.
Pubblicazione: (2024)
di: Chasandras, Ioannis, et al.
Pubblicazione: (2024)
AdvART: Adversarial Art for Camouflaged Object Detection Attacks
di: Guesmi, Amira, et al.
Pubblicazione: (2023)
di: Guesmi, Amira, et al.
Pubblicazione: (2023)
Enhance Robustness of Language Models Against Variation Attack through Graph Integration
di: Xiong, Zi, et al.
Pubblicazione: (2024)
di: Xiong, Zi, et al.
Pubblicazione: (2024)
Robust Vision-Language Models via Tensor Decomposition: A Defense Against Adversarial Attacks
di: Patel, Het, et al.
Pubblicazione: (2025)
di: Patel, Het, et al.
Pubblicazione: (2025)
Evaluate-and-Purify: Fortifying Code Language Models Against Adversarial Attacks Using LLM-as-a-Judge
di: Mu, Wenhan, et al.
Pubblicazione: (2025)
di: Mu, Wenhan, et al.
Pubblicazione: (2025)
Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
di: Kong, Dehong, et al.
Pubblicazione: (2025)
di: Kong, Dehong, et al.
Pubblicazione: (2025)
Good Parenting is all you need -- Multi-agentic LLM Hallucination Mitigation
di: Kwartler, Ted, et al.
Pubblicazione: (2024)
di: Kwartler, Ted, et al.
Pubblicazione: (2024)
Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following
di: Ren, Qingyu, et al.
Pubblicazione: (2025)
di: Ren, Qingyu, et al.
Pubblicazione: (2025)
Cross-Modal Safety Alignment: Is textual unlearning all you need?
di: Chakraborty, Trishna, et al.
Pubblicazione: (2024)
di: Chakraborty, Trishna, et al.
Pubblicazione: (2024)
Collaboration is all you need: LLM Assisted Safe Code Translation
di: Karanjai, Rabimba, et al.
Pubblicazione: (2025)
di: Karanjai, Rabimba, et al.
Pubblicazione: (2025)
RAUCA: A Novel Physical Adversarial Attack on Vehicle Detectors via Robust and Accurate Camouflage Generation
di: Zhou, Jiawei, et al.
Pubblicazione: (2024)
di: Zhou, Jiawei, et al.
Pubblicazione: (2024)
Adversarial Attack for Explanation Robustness of Rationalization Models
di: Zhang, Yuankai, et al.
Pubblicazione: (2024)
di: Zhang, Yuankai, et al.
Pubblicazione: (2024)
Toward Robust and Accurate Adversarial Camouflage Generation against Vehicle Detectors
di: Zhou, Jiawei, et al.
Pubblicazione: (2024)
di: Zhou, Jiawei, et al.
Pubblicazione: (2024)
Uncertainty Quantification for Transformer Models for Dark-Pattern Detection
di: Muñoz, Javier, et al.
Pubblicazione: (2024)
di: Muñoz, Javier, et al.
Pubblicazione: (2024)
Camouflage Adversarial Attacks on Multiple Agent Systems
di: Lu, Ziqing, et al.
Pubblicazione: (2024)
di: Lu, Ziqing, et al.
Pubblicazione: (2024)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
di: Brown, Hannah, et al.
Pubblicazione: (2024)
di: Brown, Hannah, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PART: Pre-trained Authorship Representation Transformer
di: Huertas-Tato, Javier, et al.
Pubblicazione: (2022) -
Not all tokens are created equal: Perplexity Attention Weighted Networks for AI generated text detection
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025) -
Pushing the boundary on Natural Language Inference
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025) -
Isolating authorship from content with semantic embeddings and contrastive learning
di: Huertas-Tato, Javier, et al.
Pubblicazione: (2024) -
On the locality bias and results in the Long Range Arena
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)