Conversational Context Classification: A Representation Engineering Approach
Fuente:
arXiv
Salvato in:
| Autore principale: | Pan, Jonathan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
In-Context Representation Hijacking
di: Yona, Itay, et al.
Pubblicazione: (2025)
di: Yona, Itay, et al.
Pubblicazione: (2025)
Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs
di: Kim, Jinhwa, et al.
Pubblicazione: (2025)
di: Kim, Jinhwa, et al.
Pubblicazione: (2025)
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
di: Das, Saswat, et al.
Pubblicazione: (2026)
di: Das, Saswat, et al.
Pubblicazione: (2026)
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
di: Ngong, Ivoline, et al.
Pubblicazione: (2025)
di: Ngong, Ivoline, et al.
Pubblicazione: (2025)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
Guarding Your Conversations: Privacy Gatekeepers for Secure Interactions with Cloud-Based AI Models
di: Uzor, GodsGift, et al.
Pubblicazione: (2025)
di: Uzor, GodsGift, et al.
Pubblicazione: (2025)
Reverse-Engineering Model Editing on Language Models
di: Sun, Zhiyu, et al.
Pubblicazione: (2026)
di: Sun, Zhiyu, et al.
Pubblicazione: (2026)
Universal and Context-Independent Triggers for Precise Control of LLM Outputs
di: Liang, Jiashuo, et al.
Pubblicazione: (2024)
di: Liang, Jiashuo, et al.
Pubblicazione: (2024)
CATMark: A Context-Aware Thresholding Framework for Robust Cross-Task Watermarking in Large Language Models
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
REEF: Representation Encoding Fingerprints for Large Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts
di: Uenal, Fatih
Pubblicazione: (2026)
di: Uenal, Fatih
Pubblicazione: (2026)
CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering
di: Chen, Baicheng, et al.
Pubblicazione: (2026)
di: Chen, Baicheng, et al.
Pubblicazione: (2026)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content
di: Guo, Ruoqi, et al.
Pubblicazione: (2026)
di: Guo, Ruoqi, et al.
Pubblicazione: (2026)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
Shadow Unlearning: A Neuro-Semantic Approach to Fidelity-Preserving Faceless Forgetting in LLMs
di: P, Dinesh Srivasthav, et al.
Pubblicazione: (2026)
di: P, Dinesh Srivasthav, et al.
Pubblicazione: (2026)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
di: Lee, Hong kyu, et al.
Pubblicazione: (2025)
di: Lee, Hong kyu, et al.
Pubblicazione: (2025)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
di: Lv, Lijia, et al.
Pubblicazione: (2024)
di: Lv, Lijia, et al.
Pubblicazione: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs
di: D'addario, Andrew Maranhão Ventura
Pubblicazione: (2025)
di: D'addario, Andrew Maranhão Ventura
Pubblicazione: (2025)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
PRISON: Unmasking the Criminal Potential of Large Language Models
di: Wu, Xinyi, et al.
Pubblicazione: (2025)
di: Wu, Xinyi, et al.
Pubblicazione: (2025)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
Can LLMs Infer Conversational Agent Users' Personality Traits from Chat History?
di: Cögendez, Derya, et al.
Pubblicazione: (2026)
di: Cögendez, Derya, et al.
Pubblicazione: (2026)
The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation
di: Xu, Rongwu, et al.
Pubblicazione: (2023)
di: Xu, Rongwu, et al.
Pubblicazione: (2023)
SWAN: Semantic Watermarking with Abstract Meaning Representation
di: Ye, Ziping, et al.
Pubblicazione: (2026)
di: Ye, Ziping, et al.
Pubblicazione: (2026)
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
di: Zhu, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Zhu, Xiaoyuan, et al.
Pubblicazione: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
di: Shen, Xinjie, et al.
Pubblicazione: (2026)
di: Shen, Xinjie, et al.
Pubblicazione: (2026)
Beyond Context: Large Language Models' Failure to Grasp Users' Intent
di: Hussain, Ahmed M., et al.
Pubblicazione: (2025)
di: Hussain, Ahmed M., et al.
Pubblicazione: (2025)
Federated In-Context LLM Agent Learning
di: Wu, Panlong, et al.
Pubblicazione: (2024)
di: Wu, Panlong, et al.
Pubblicazione: (2024)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
di: Tong, Terry, et al.
Pubblicazione: (2024)
di: Tong, Terry, et al.
Pubblicazione: (2024)
RedSage: A Cybersecurity Generalist LLM
di: Suryanto, Naufal, et al.
Pubblicazione: (2026)
di: Suryanto, Naufal, et al.
Pubblicazione: (2026)
LLM for SoC Security: A Paradigm Shift
di: Saha, Dipayan, et al.
Pubblicazione: (2023)
di: Saha, Dipayan, et al.
Pubblicazione: (2023)
A Survey on Agentic Security: Applications, Threats and Defenses
di: Shahriar, Asif, et al.
Pubblicazione: (2025)
di: Shahriar, Asif, et al.
Pubblicazione: (2025)
Documenti analoghi
-
In-Context Representation Hijacking
di: Yona, Itay, et al.
Pubblicazione: (2025) -
Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs
di: Kim, Jinhwa, et al.
Pubblicazione: (2025) -
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
di: Das, Saswat, et al.
Pubblicazione: (2026) -
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
di: Ngong, Ivoline, et al.
Pubblicazione: (2025) -
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)