DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Yao, Sun, Yitong, Zhang, Yichi, Zhang, Ruochen, Dong, Yinpeng, Wei, Xingxing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
MESA: Improving MoE Safety Alignment via Decentralized Expertise
di: Sun, Yitong, et al.
Pubblicazione: (2026)
di: Sun, Yitong, et al.
Pubblicazione: (2026)
RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
di: Chaudhary, Maheep, et al.
Pubblicazione: (2025)
di: Chaudhary, Maheep, et al.
Pubblicazione: (2025)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
di: Yang, Chenghao, et al.
Pubblicazione: (2025)
di: Yang, Chenghao, et al.
Pubblicazione: (2025)
When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models
di: Wang, Kai, et al.
Pubblicazione: (2025)
di: Wang, Kai, et al.
Pubblicazione: (2025)
Deception Abilities Emerged in Large Language Models
di: Hagendorff, Thilo
Pubblicazione: (2023)
di: Hagendorff, Thilo
Pubblicazione: (2023)
Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant
di: Järviniemi, Olli, et al.
Pubblicazione: (2024)
di: Järviniemi, Olli, et al.
Pubblicazione: (2024)
OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation
di: Wu, Yichen, et al.
Pubblicazione: (2025)
di: Wu, Yichen, et al.
Pubblicazione: (2025)
Too Big to Fool: Resisting Deception in Language Models
di: Samsami, Mohammad Reza, et al.
Pubblicazione: (2024)
di: Samsami, Mohammad Reza, et al.
Pubblicazione: (2024)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Pooling Attention: Evaluating Pretrained Transformer Embeddings for Deception Classification
di: Mamtani, Sumit, et al.
Pubblicazione: (2025)
di: Mamtani, Sumit, et al.
Pubblicazione: (2025)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations
di: Kumar, Sachin
Pubblicazione: (2026)
di: Kumar, Sachin
Pubblicazione: (2026)
Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
di: Abdulhai, Marwa, et al.
Pubblicazione: (2025)
di: Abdulhai, Marwa, et al.
Pubblicazione: (2025)
An Assessment of Model-On-Model Deception
di: Heitkoetter, Julius, et al.
Pubblicazione: (2024)
di: Heitkoetter, Julius, et al.
Pubblicazione: (2024)
RAT-Bench: A Comprehensive Benchmark for Text Anonymization
di: Krčo, Nataša, et al.
Pubblicazione: (2026)
di: Krčo, Nataša, et al.
Pubblicazione: (2026)
Deception Detection from Linguistic and Physiological Data Streams Using Bimodal Convolutional Neural Networks
di: Li, Panfeng, et al.
Pubblicazione: (2023)
di: Li, Panfeng, et al.
Pubblicazione: (2023)
Unmasking the Shadows of AI: Investigating Deceptive Capabilities in Large Language Models
di: Guo, Linge
Pubblicazione: (2024)
di: Guo, Linge
Pubblicazione: (2024)
Deception at Scale: Deceptive Designs in 1K LLM-Generated Ecommerce Components
di: Chen, Ziwei, et al.
Pubblicazione: (2025)
di: Chen, Ziwei, et al.
Pubblicazione: (2025)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
di: Tang, Anke, et al.
Pubblicazione: (2024)
di: Tang, Anke, et al.
Pubblicazione: (2024)
AI Deception: Risks, Dynamics, and Controls
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
di: He, Wei, et al.
Pubblicazione: (2025)
di: He, Wei, et al.
Pubblicazione: (2025)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
di: Wu, Yao, et al.
Pubblicazione: (2026)
di: Wu, Yao, et al.
Pubblicazione: (2026)
ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities
di: Karger, Ezra, et al.
Pubblicazione: (2024)
di: Karger, Ezra, et al.
Pubblicazione: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
To Tell The Truth: Language of Deception and Language Models
di: Hazra, Sanchaita, et al.
Pubblicazione: (2023)
di: Hazra, Sanchaita, et al.
Pubblicazione: (2023)
DataSciBench: An LLM Agent Benchmark for Data Science
di: Zhang, Dan, et al.
Pubblicazione: (2025)
di: Zhang, Dan, et al.
Pubblicazione: (2025)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
di: Chen, Zixin, et al.
Pubblicazione: (2025)
di: Chen, Zixin, et al.
Pubblicazione: (2025)
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
di: Hubinger, Evan, et al.
Pubblicazione: (2024)
di: Hubinger, Evan, et al.
Pubblicazione: (2024)
Real-world Adversarial Defense against Patch Attacks based on Diffusion Model
di: Wei, Xingxing, et al.
Pubblicazione: (2024)
di: Wei, Xingxing, et al.
Pubblicazione: (2024)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
When Truthful Representations Flip Under Deceptive Instructions?
di: Long, Xianxuan, et al.
Pubblicazione: (2025)
di: Long, Xianxuan, et al.
Pubblicazione: (2025)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
di: Li, Lijun, et al.
Pubblicazione: (2024)
di: Li, Lijun, et al.
Pubblicazione: (2024)
VL-RouterBench: A Benchmark for Vision-Language Model Routing
di: Huang, Zhehao, et al.
Pubblicazione: (2025)
di: Huang, Zhehao, et al.
Pubblicazione: (2025)
Deceptive Exploration in Multi-armed Bandits
di: Vurankaya, I. Arda, et al.
Pubblicazione: (2025)
di: Vurankaya, I. Arda, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
di: Huang, Yao, et al.
Pubblicazione: (2025) -
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
di: Huang, Yao, et al.
Pubblicazione: (2025) -
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024) -
MESA: Improving MoE Safety Alignment via Decentralized Expertise
di: Sun, Yitong, et al.
Pubblicazione: (2026) -
RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability
di: Zhang, Yichi, et al.
Pubblicazione: (2025)