Compromising Honesty and Harmlessness in Language Models via Deception Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vaugrante, Laurène, Carlon, Francesca, Menke, Maluna, Hagendorff, Thilo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PRIDE -- Parameter-Efficient Reduction of Identity Discrimination for Equality in LLMs
par: Menke, Maluna, et autres
Publié: (2025)
par: Menke, Maluna, et autres
Publié: (2025)
A Looming Replication Crisis in Evaluating Behavior in Language Models? Evidence and Solutions
par: Vaugrante, Laurène, et autres
Publié: (2024)
par: Vaugrante, Laurène, et autres
Publié: (2024)
Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment
par: Vaugrante, Laurène, et autres
Publié: (2026)
par: Vaugrante, Laurène, et autres
Publié: (2026)
Deception Abilities Emerged in Large Language Models
par: Hagendorff, Thilo
Publié: (2023)
par: Hagendorff, Thilo
Publié: (2023)
On the Inevitability of Left-Leaning Political Bias in Aligned Language Models
par: Hagendorff, Thilo
Publié: (2025)
par: Hagendorff, Thilo
Publié: (2025)
Mapping the Ethics of Generative AI: A Comprehensive Scoping Review
par: Hagendorff, Thilo
Publié: (2024)
par: Hagendorff, Thilo
Publié: (2024)
Fairness Hacking: The Malicious Practice of Shrouding Unfairness in Algorithms
par: Meding, Kristof, et autres
Publié: (2023)
par: Meding, Kristof, et autres
Publié: (2023)
Evaluation Awareness in Language Models Has Limited Effect on Behaviour
par: Knecht, Amelie, et autres
Publié: (2026)
par: Knecht, Amelie, et autres
Publié: (2026)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
par: Yang, Jinluan, et autres
Publié: (2025)
par: Yang, Jinluan, et autres
Publié: (2025)
Unmasking and Improving Data Credibility: A Study with Datasets for Training Harmless Language Models
par: Zhu, Zhaowei, et autres
Publié: (2023)
par: Zhu, Zhaowei, et autres
Publié: (2023)
Large Reasoning Models Are Autonomous Jailbreak Agents
par: Hagendorff, Thilo, et autres
Publié: (2025)
par: Hagendorff, Thilo, et autres
Publié: (2025)
Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models
par: Jotautaitė, Monika, et autres
Publié: (2025)
par: Jotautaitė, Monika, et autres
Publié: (2025)
The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
par: Ren, Richard, et autres
Publié: (2025)
par: Ren, Richard, et autres
Publié: (2025)
A Survey on the Honesty of Large Language Models
par: Li, Siheng, et autres
Publié: (2024)
par: Li, Siheng, et autres
Publié: (2024)
Why Agents Compromise Safety Under Pressure
par: Jiang, Hengle, et autres
Publié: (2026)
par: Jiang, Hengle, et autres
Publié: (2026)
BeHonest: Benchmarking Honesty in Large Language Models
par: Chern, Steffi, et autres
Publié: (2024)
par: Chern, Steffi, et autres
Publié: (2024)
Alignment for Honesty
par: Yang, Yuqing, et autres
Publié: (2023)
par: Yang, Yuqing, et autres
Publié: (2023)
"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior
par: Lulla, Roshni, et autres
Publié: (2026)
par: Lulla, Roshni, et autres
Publié: (2026)
Attacks on Third-Party APIs of Large Language Models
par: Zhao, Wanru, et autres
Publié: (2024)
par: Zhao, Wanru, et autres
Publié: (2024)
When Image Generation Goes Wrong: A Safety Analysis of Stable Diffusion Models
par: Schneider, Matthias, et autres
Publié: (2024)
par: Schneider, Matthias, et autres
Publié: (2024)
Beyond Chains of Thought: Benchmarking Latent-Space Reasoning Abilities in Large Language Models
par: Hagendorff, Thilo, et autres
Publié: (2025)
par: Hagendorff, Thilo, et autres
Publié: (2025)
Training-Free Cultural Alignment of Large Language Models via Persona Disagreement
par: Kiet, Huynh Trung, et autres
Publié: (2026)
par: Kiet, Huynh Trung, et autres
Publié: (2026)
Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing
par: Jiang, Han, et autres
Publié: (2024)
par: Jiang, Han, et autres
Publié: (2024)
Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation
par: Pang, Xianghe, et autres
Publié: (2024)
par: Pang, Xianghe, et autres
Publié: (2024)
Denevil: Towards Deciphering and Navigating the Ethical Values of Large Language Models via Instruction Learning
par: Duan, Shitong, et autres
Publié: (2023)
par: Duan, Shitong, et autres
Publié: (2023)
IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization
par: Bai, Yuzhuo, et autres
Publié: (2025)
par: Bai, Yuzhuo, et autres
Publié: (2025)
Cross-Language Bias Examination in Large Language Models
par: Liang, Yuxuan, et autres
Publié: (2025)
par: Liang, Yuxuan, et autres
Publié: (2025)
Smart Trial: Evaluating the Use of Large Language Models for Recruiting Clinical Trial Participants via Social Media
par: Zhou, Xiaofan, et autres
Publié: (2025)
par: Zhou, Xiaofan, et autres
Publié: (2025)
On the Creativity of Large Language Models
par: Franceschelli, Giorgio, et autres
Publié: (2023)
par: Franceschelli, Giorgio, et autres
Publié: (2023)
Evaluating Large Language Models for Detecting Antisemitism
par: Patel, Jay, et autres
Publié: (2025)
par: Patel, Jay, et autres
Publié: (2025)
How Large Language Models are Designed to Hallucinate
par: Ackermann, Richard, et autres
Publié: (2025)
par: Ackermann, Richard, et autres
Publié: (2025)
The Polite Liar: Epistemic Pathology in Language Models
par: DeVilling, Bentley
Publié: (2025)
par: DeVilling, Bentley
Publié: (2025)
Anticipating Innovation Using Large Language Models
par: Fenoaltea, Enrico Maria, et autres
Publié: (2026)
par: Fenoaltea, Enrico Maria, et autres
Publié: (2026)
Open-Ended Wargames with Large Language Models
par: Hogan, Daniel P., et autres
Publié: (2024)
par: Hogan, Daniel P., et autres
Publié: (2024)
Large Language Models for Education: A Survey
par: Xu, Hanyi, et autres
Publié: (2024)
par: Xu, Hanyi, et autres
Publié: (2024)
Large Language Models as Misleading Assistants in Conversation
par: Hou, Betty Li, et autres
Publié: (2024)
par: Hou, Betty Li, et autres
Publié: (2024)
Evaluating Psychological Safety of Large Language Models
par: Li, Xingxuan, et autres
Publié: (2022)
par: Li, Xingxuan, et autres
Publié: (2022)
Large Language Models for Medicine: A Survey
par: Zheng, Yanxin, et autres
Publié: (2024)
par: Zheng, Yanxin, et autres
Publié: (2024)
Are Large Language Models Good Essay Graders?
par: Kundu, Anindita, et autres
Publié: (2024)
par: Kundu, Anindita, et autres
Publié: (2024)
All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks
par: Takemoto, Kazuhiro
Publié: (2024)
par: Takemoto, Kazuhiro
Publié: (2024)
Documents similaires
-
PRIDE -- Parameter-Efficient Reduction of Identity Discrimination for Equality in LLMs
par: Menke, Maluna, et autres
Publié: (2025) -
A Looming Replication Crisis in Evaluating Behavior in Language Models? Evidence and Solutions
par: Vaugrante, Laurène, et autres
Publié: (2024) -
Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment
par: Vaugrante, Laurène, et autres
Publié: (2026) -
Deception Abilities Emerged in Large Language Models
par: Hagendorff, Thilo
Publié: (2023) -
On the Inevitability of Left-Leaning Political Bias in Aligned Language Models
par: Hagendorff, Thilo
Publié: (2025)