Learning Obfuscations Of LLM Embedding Sequences: Stained Glass Transform
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Roberts, Jay, Mylonakis, Kyle, Roy, Sidhartha, Kale, Kaan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DWFS-Obfuscation: Dynamic Weighted Feature Selection for Robust Malware Familial Classification under Obfuscation
par: Wei, Xingyuan, et autres
Publié: (2025)
par: Wei, Xingyuan, et autres
Publié: (2025)
sudoLLM: On Multi-role Alignment of Language Models
par: Saha, Soumadeep, et autres
Publié: (2025)
par: Saha, Soumadeep, et autres
Publié: (2025)
Defending against Backdoor Attacks via Module Switching
par: Li, Weijun, et autres
Publié: (2025)
par: Li, Weijun, et autres
Publié: (2025)
Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset
par: Palit, Sayon, et autres
Publié: (2025)
par: Palit, Sayon, et autres
Publié: (2025)
UniC-RAG: Universal Knowledge Corruption Attacks to Retrieval-Augmented Generation
par: Geng, Runpeng, et autres
Publié: (2025)
par: Geng, Runpeng, et autres
Publié: (2025)
Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)
par: Verma, Apurv, et autres
Publié: (2024)
par: Verma, Apurv, et autres
Publié: (2024)
Seeing the Forest through the Trees: Data Leakage from Partial Transformer Gradients
par: Li, Weijun, et autres
Publié: (2024)
par: Li, Weijun, et autres
Publié: (2024)
Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks
par: Young, Richard J.
Publié: (2025)
par: Young, Richard J.
Publié: (2025)
POISONCRAFT: Practical Poisoning of Retrieval-Augmented Generation for Large Language Models
par: Shao, Yangguang, et autres
Publié: (2025)
par: Shao, Yangguang, et autres
Publié: (2025)
MarkLLM: An Open-Source Toolkit for LLM Watermarking
par: Pan, Leyi, et autres
Publié: (2024)
par: Pan, Leyi, et autres
Publié: (2024)
Mitigating the Impact of Malware Evolution on API Sequence-based Windows Malware Detector
par: Wei, Xingyuan, et autres
Publié: (2024)
par: Wei, Xingyuan, et autres
Publié: (2024)
PromptSAM+: Malware Detection based on Prompt Segment Anything Model
par: Wei, Xingyuan, et autres
Publié: (2024)
par: Wei, Xingyuan, et autres
Publié: (2024)
Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption
par: Morales, Jaime, et autres
Publié: (2026)
par: Morales, Jaime, et autres
Publié: (2026)
SecEmb: Sparsity-Aware Secure Federated Learning of On-Device Recommender System with Large Embedding
par: Mai, Peihua, et autres
Publié: (2025)
par: Mai, Peihua, et autres
Publié: (2025)
Semantic Leakage from Image Embeddings
par: Chen, Yiyi, et autres
Publié: (2026)
par: Chen, Yiyi, et autres
Publié: (2026)
Mitigating Trojanized Prompt Chains in Educational LLM Use Cases: Experimental Findings and Detection Tool Design
par: Charles, Richard M., et autres
Publié: (2025)
par: Charles, Richard M., et autres
Publié: (2025)
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
par: Xin, Yuan, et autres
Publié: (2025)
par: Xin, Yuan, et autres
Publié: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
par: Zhang, Peiyan, et autres
Publié: (2025)
par: Zhang, Peiyan, et autres
Publié: (2025)
Terrarium: Revisiting the Blackboard for Multi-Agent Safety, Privacy, and Security Studies
par: Nakamura, Mason, et autres
Publié: (2025)
par: Nakamura, Mason, et autres
Publié: (2025)
Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems
par: Pai, Aaditya
Publié: (2026)
par: Pai, Aaditya
Publié: (2026)
Reducing Information Overload: Because Even Security Experts Need to Blink
par: Kuehn, Philipp, et autres
Publié: (2022)
par: Kuehn, Philipp, et autres
Publié: (2022)
Efficient LLM Safety Evaluation through Multi-Agent Debate
par: Lin, Dachuan, et autres
Publié: (2025)
par: Lin, Dachuan, et autres
Publié: (2025)
A Review of the Applications of Deep Learning-Based Emergent Communication
par: Boldt, Brendon, et autres
Publié: (2024)
par: Boldt, Brendon, et autres
Publié: (2024)
Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction
par: Garcia, Gabriel
Publié: (2026)
par: Garcia, Gabriel
Publié: (2026)
PoTS: Proof-of-Training-Steps for Backdoor Detection in Large Language Models
par: Seddik, Issam, et autres
Publié: (2025)
par: Seddik, Issam, et autres
Publié: (2025)
CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
Train to Defend: First Defense Against Cryptanalytic Neural Network Parameter Extraction Attacks
par: Kurian, Ashley, et autres
Publié: (2025)
par: Kurian, Ashley, et autres
Publié: (2025)
Ignore Me But Don't Replace Me: Utilizing Non-Linguistic Elements for Pretraining on the Cybersecurity Domain
par: Jang, Eugene, et autres
Publié: (2024)
par: Jang, Eugene, et autres
Publié: (2024)
Large Language Models are Advanced Anonymizers
par: Staab, Robin, et autres
Publié: (2024)
par: Staab, Robin, et autres
Publié: (2024)
Watermarking Degrades Alignment in Language Models: Analysis and Mitigation
par: Verma, Apurv, et autres
Publié: (2025)
par: Verma, Apurv, et autres
Publié: (2025)
Prompted Contextual Vectors for Spear-Phishing Detection
par: Nahmias, Daniel, et autres
Publié: (2024)
par: Nahmias, Daniel, et autres
Publié: (2024)
A Semantic Invariant Robust Watermark for Large Language Models
par: Liu, Aiwei, et autres
Publié: (2023)
par: Liu, Aiwei, et autres
Publié: (2023)
Can Watermarked LLMs be Identified by Users via Crafted Prompts?
par: Liu, Aiwei, et autres
Publié: (2024)
par: Liu, Aiwei, et autres
Publié: (2024)
Transformers Boost the Performance of Decision Trees on Tabular Data across Sample Sizes
par: Jayawardhana, Mayuka, et autres
Publié: (2025)
par: Jayawardhana, Mayuka, et autres
Publié: (2025)
BeamClean: Language Aware Embedding Reconstruction
par: Kale, Kaan, et autres
Publié: (2025)
par: Kale, Kaan, et autres
Publié: (2025)
Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults
par: Usman, Rana Muhammad
Publié: (2026)
par: Usman, Rana Muhammad
Publié: (2026)
XferBench: a Data-Driven Benchmark for Emergent Language
par: Boldt, Brendon, et autres
Publié: (2024)
par: Boldt, Brendon, et autres
Publié: (2024)
Searching for the Most Human-like Emergent Language
par: Boldt, Brendon, et autres
Publié: (2025)
par: Boldt, Brendon, et autres
Publié: (2025)
Morpheme Induction for Emergent Language
par: Boldt, Brendon, et autres
Publié: (2025)
par: Boldt, Brendon, et autres
Publié: (2025)
ELCC: the Emergent Language Corpus Collection
par: Boldt, Brendon, et autres
Publié: (2024)
par: Boldt, Brendon, et autres
Publié: (2024)
Documents similaires
-
DWFS-Obfuscation: Dynamic Weighted Feature Selection for Robust Malware Familial Classification under Obfuscation
par: Wei, Xingyuan, et autres
Publié: (2025) -
sudoLLM: On Multi-role Alignment of Language Models
par: Saha, Soumadeep, et autres
Publié: (2025) -
Defending against Backdoor Attacks via Module Switching
par: Li, Weijun, et autres
Publié: (2025) -
Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset
par: Palit, Sayon, et autres
Publié: (2025) -
UniC-RAG: Universal Knowledge Corruption Attacks to Retrieval-Augmented Generation
par: Geng, Runpeng, et autres
Publié: (2025)