Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Panpatil, Siddhant, Dingeto, Hiskias, Park, Haon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations
di: Dingeto, Hiskias, et al.
Pubblicazione: (2026)
di: Dingeto, Hiskias, et al.
Pubblicazione: (2026)
When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs
di: Dingeto, Hiskias, et al.
Pubblicazione: (2025)
di: Dingeto, Hiskias, et al.
Pubblicazione: (2025)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026)
di: Su, Yanghao, et al.
Pubblicazione: (2026)
Persona-Model Collapse in Emergent Misalignment
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
di: Hu, Xuhao, et al.
Pubblicazione: (2025)
di: Hu, Xuhao, et al.
Pubblicazione: (2025)
Large Language Models in Cybersecurity: State-of-the-Art
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
sudo rm -rf agentic_security
di: Lee, Sejin, et al.
Pubblicazione: (2025)
di: Lee, Sejin, et al.
Pubblicazione: (2025)
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
di: Betley, Jan, et al.
Pubblicazione: (2025)
di: Betley, Jan, et al.
Pubblicazione: (2025)
Mark My Words: Analyzing and Evaluating Language Model Watermarks
di: Piet, Julien, et al.
Pubblicazione: (2023)
di: Piet, Julien, et al.
Pubblicazione: (2023)
SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
Resource Consumption Threats in Large Language Models
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
Jailbreaking Large Language Models Through Content Concretization
di: Wahréus, Johan, et al.
Pubblicazione: (2025)
di: Wahréus, Johan, et al.
Pubblicazione: (2025)
PRISON: Unmasking the Criminal Potential of Large Language Models
di: Wu, Xinyi, et al.
Pubblicazione: (2025)
di: Wu, Xinyi, et al.
Pubblicazione: (2025)
REEF: Representation Encoding Fingerprints for Large Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
FNF: Functional Network Fingerprint for Large Language Models
di: Liu, Yiheng, et al.
Pubblicazione: (2026)
di: Liu, Yiheng, et al.
Pubblicazione: (2026)
Internal Safety Collapse in Frontier Large Language Models
di: Wu, Yutao, et al.
Pubblicazione: (2026)
di: Wu, Yutao, et al.
Pubblicazione: (2026)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents
di: Jones, Jaylen, et al.
Pubblicazione: (2026)
di: Jones, Jaylen, et al.
Pubblicazione: (2026)
Learnable Linguistic Watermarks for Tracing Model Extraction Attacks on Large Language Models
di: Bai, Minhao, et al.
Pubblicazione: (2024)
di: Bai, Minhao, et al.
Pubblicazione: (2024)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
SGuard-v1: Safety Guardrail for Large Language Models
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
Large Language Model Sentinel: LLM Agent for Adversarial Purification
di: Lin, Guang, et al.
Pubblicazione: (2024)
di: Lin, Guang, et al.
Pubblicazione: (2024)
Security and Privacy Challenges of Large Language Models: A Survey
di: Das, Badhan Chandra, et al.
Pubblicazione: (2024)
di: Das, Badhan Chandra, et al.
Pubblicazione: (2024)
Is the System Message Really Important to Jailbreaks in Large Language Models?
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
ForensicsData: A Digital Forensics Dataset for Large Language Models
di: Chakir, Youssef, et al.
Pubblicazione: (2025)
di: Chakir, Youssef, et al.
Pubblicazione: (2025)
SoK: Large Language Model Copyright Auditing via Fingerprinting
di: Shao, Shuo, et al.
Pubblicazione: (2025)
di: Shao, Shuo, et al.
Pubblicazione: (2025)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Goal-guided Generative Prompt Injection Attack on Large Language Models
di: Zhang, Chong, et al.
Pubblicazione: (2024)
di: Zhang, Chong, et al.
Pubblicazione: (2024)
Citation: A Key to Building Responsible and Accountable Large Language Models
di: Huang, Jie, et al.
Pubblicazione: (2023)
di: Huang, Jie, et al.
Pubblicazione: (2023)
Institutional Platform for Secure Self-Service Large Language Model Exploration
di: Bumgardner, V. K. Cody, et al.
Pubblicazione: (2024)
di: Bumgardner, V. K. Cody, et al.
Pubblicazione: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Advancing Beyond Identification: Multi-bit Watermark for Large Language Models
di: Yoo, KiYoon, et al.
Pubblicazione: (2023)
di: Yoo, KiYoon, et al.
Pubblicazione: (2023)
Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models
di: Min, Nay Myat, et al.
Pubblicazione: (2026)
di: Min, Nay Myat, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations
di: Dingeto, Hiskias, et al.
Pubblicazione: (2026) -
When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs
di: Dingeto, Hiskias, et al.
Pubblicazione: (2025) -
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026) -
Persona-Model Collapse in Emergent Misalignment
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026) -
LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
di: Hu, Xuhao, et al.
Pubblicazione: (2025)