Conversational Context Classification: A Representation Engineering Approach
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Pan, Jonathan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
In-Context Representation Hijacking
par: Yona, Itay, et autres
Publié: (2025)
par: Yona, Itay, et autres
Publié: (2025)
Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs
par: Kim, Jinhwa, et autres
Publié: (2025)
par: Kim, Jinhwa, et autres
Publié: (2025)
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
par: Das, Saswat, et autres
Publié: (2026)
par: Das, Saswat, et autres
Publié: (2026)
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
par: Ngong, Ivoline, et autres
Publié: (2025)
par: Ngong, Ivoline, et autres
Publié: (2025)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
Guarding Your Conversations: Privacy Gatekeepers for Secure Interactions with Cloud-Based AI Models
par: Uzor, GodsGift, et autres
Publié: (2025)
par: Uzor, GodsGift, et autres
Publié: (2025)
Reverse-Engineering Model Editing on Language Models
par: Sun, Zhiyu, et autres
Publié: (2026)
par: Sun, Zhiyu, et autres
Publié: (2026)
Universal and Context-Independent Triggers for Precise Control of LLM Outputs
par: Liang, Jiashuo, et autres
Publié: (2024)
par: Liang, Jiashuo, et autres
Publié: (2024)
CATMark: A Context-Aware Thresholding Framework for Robust Cross-Task Watermarking in Large Language Models
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
REEF: Representation Encoding Fingerprints for Large Language Models
par: Zhang, Jie, et autres
Publié: (2024)
par: Zhang, Jie, et autres
Publié: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
par: Zhou, Guanghao, et autres
Publié: (2025)
par: Zhou, Guanghao, et autres
Publié: (2025)
Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts
par: Uenal, Fatih
Publié: (2026)
par: Uenal, Fatih
Publié: (2026)
CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering
par: Chen, Baicheng, et autres
Publié: (2026)
par: Chen, Baicheng, et autres
Publié: (2026)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
par: Wang, Yanbo, et autres
Publié: (2026)
par: Wang, Yanbo, et autres
Publié: (2026)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
par: Xu, Huiyu, et autres
Publié: (2024)
par: Xu, Huiyu, et autres
Publié: (2024)
MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content
par: Guo, Ruoqi, et autres
Publié: (2026)
par: Guo, Ruoqi, et autres
Publié: (2026)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
Shadow Unlearning: A Neuro-Semantic Approach to Fidelity-Preserving Faceless Forgetting in LLMs
par: P, Dinesh Srivasthav, et autres
Publié: (2026)
par: P, Dinesh Srivasthav, et autres
Publié: (2026)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
par: Lee, Hong kyu, et autres
Publié: (2025)
par: Lee, Hong kyu, et autres
Publié: (2025)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
par: Lv, Lijia, et autres
Publié: (2024)
par: Lv, Lijia, et autres
Publié: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs
par: D'addario, Andrew Maranhão Ventura
Publié: (2025)
par: D'addario, Andrew Maranhão Ventura
Publié: (2025)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
par: Zhang, Junbo, et autres
Publié: (2026)
par: Zhang, Junbo, et autres
Publié: (2026)
PRISON: Unmasking the Criminal Potential of Large Language Models
par: Wu, Xinyi, et autres
Publié: (2025)
par: Wu, Xinyi, et autres
Publié: (2025)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
Can LLMs Infer Conversational Agent Users' Personality Traits from Chat History?
par: Cögendez, Derya, et autres
Publié: (2026)
par: Cögendez, Derya, et autres
Publié: (2026)
The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation
par: Xu, Rongwu, et autres
Publié: (2023)
par: Xu, Rongwu, et autres
Publié: (2023)
SWAN: Semantic Watermarking with Abstract Meaning Representation
par: Ye, Ziping, et autres
Publié: (2026)
par: Ye, Ziping, et autres
Publié: (2026)
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
par: Shen, Xinjie, et autres
Publié: (2026)
par: Shen, Xinjie, et autres
Publié: (2026)
Beyond Context: Large Language Models' Failure to Grasp Users' Intent
par: Hussain, Ahmed M., et autres
Publié: (2025)
par: Hussain, Ahmed M., et autres
Publié: (2025)
Federated In-Context LLM Agent Learning
par: Wu, Panlong, et autres
Publié: (2024)
par: Wu, Panlong, et autres
Publié: (2024)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
par: Zhang, Yihao, et autres
Publié: (2024)
par: Zhang, Yihao, et autres
Publié: (2024)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
par: Tong, Terry, et autres
Publié: (2024)
par: Tong, Terry, et autres
Publié: (2024)
RedSage: A Cybersecurity Generalist LLM
par: Suryanto, Naufal, et autres
Publié: (2026)
par: Suryanto, Naufal, et autres
Publié: (2026)
LLM for SoC Security: A Paradigm Shift
par: Saha, Dipayan, et autres
Publié: (2023)
par: Saha, Dipayan, et autres
Publié: (2023)
A Survey on Agentic Security: Applications, Threats and Defenses
par: Shahriar, Asif, et autres
Publié: (2025)
par: Shahriar, Asif, et autres
Publié: (2025)
Documents similaires
-
In-Context Representation Hijacking
par: Yona, Itay, et autres
Publié: (2025) -
Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs
par: Kim, Jinhwa, et autres
Publié: (2025) -
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
par: Das, Saswat, et autres
Publié: (2026) -
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
par: Ngong, Ivoline, et autres
Publié: (2025) -
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)