Information-theoretic Distinctions Between Deception and Confusion
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Young, Robin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Confusion is Real: GRAPHIC -- A Network Science Approach to Confusion Matrices in Deep Learning
par: Fröhlich, Johanna S., et autres
Publié: (2026)
par: Fröhlich, Johanna S., et autres
Publié: (2026)
Why Does RLAIF Work At All?
par: Young, Robin
Publié: (2026)
par: Young, Robin
Publié: (2026)
Exploring and Addressing Reward Confusion in Offline Preference Learning
par: Chen, Xin, et autres
Publié: (2024)
par: Chen, Xin, et autres
Publié: (2024)
Deceptive Exploration in Multi-armed Bandits
par: Vurankaya, I. Arda, et autres
Publié: (2025)
par: Vurankaya, I. Arda, et autres
Publié: (2025)
Automating Deception: Scalable Multi-Turn LLM Jailbreaks
par: Kumarappan, Adarsh, et autres
Publié: (2025)
par: Kumarappan, Adarsh, et autres
Publié: (2025)
When Truthful Representations Flip Under Deceptive Instructions?
par: Long, Xianxuan, et autres
Publié: (2025)
par: Long, Xianxuan, et autres
Publié: (2025)
Distribution-Level Memory Recall for Continual Learning: Preserving Knowledge and Avoiding Confusion
par: Cheng, Shaoxu, et autres
Publié: (2024)
par: Cheng, Shaoxu, et autres
Publié: (2024)
What Is the Alignment Tax?
par: Young, Robin
Publié: (2026)
par: Young, Robin
Publié: (2026)
Value of Information-based Deceptive Path Planning Under Adversarial Interventions
par: Suttle, Wesley A., et autres
Publié: (2025)
par: Suttle, Wesley A., et autres
Publié: (2025)
A Pre-training Framework for Relational Data with Information-theoretic Principles
par: Truong, Quang, et autres
Publié: (2025)
par: Truong, Quang, et autres
Publié: (2025)
Among Us: A Sandbox for Measuring and Detecting Agentic Deception
par: Golechha, Satvik, et autres
Publié: (2025)
par: Golechha, Satvik, et autres
Publié: (2025)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
Building Better Deception Probes Using Targeted Instruction Pairs
par: Natarajan, Vikram, et autres
Publié: (2026)
par: Natarajan, Vikram, et autres
Publié: (2026)
On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback
par: Williams, Marcus, et autres
Publié: (2024)
par: Williams, Marcus, et autres
Publié: (2024)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
par: Huang, Yao, et autres
Publié: (2025)
par: Huang, Yao, et autres
Publié: (2025)
Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts
par: Wu, Zhaomin, et autres
Publié: (2025)
par: Wu, Zhaomin, et autres
Publié: (2025)
The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes
par: Taufeeque, Mohammad, et autres
Publié: (2026)
par: Taufeeque, Mohammad, et autres
Publié: (2026)
GABRIL: Gaze-Based Regularization for Mitigating Causal Confusion in Imitation Learning
par: Banayeeanzade, Amin, et autres
Publié: (2025)
par: Banayeeanzade, Amin, et autres
Publié: (2025)
Reflect then Learn: Active Prompting for Information Extraction Guided by Introspective Confusion
par: Zhao, Dong, et autres
Publié: (2025)
par: Zhao, Dong, et autres
Publié: (2025)
Deception at Scale: Deceptive Designs in 1K LLM-Generated Ecommerce Components
par: Chen, Ziwei, et autres
Publié: (2025)
par: Chen, Ziwei, et autres
Publié: (2025)
Information-theoretic Bayesian Optimization: Survey and Tutorial
par: Garrido-Merchán, Eduardo C.
Publié: (2025)
par: Garrido-Merchán, Eduardo C.
Publié: (2025)
Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry
par: Zhang, Guoxi, et autres
Publié: (2026)
par: Zhang, Guoxi, et autres
Publié: (2026)
Contextual Chart Generation for Cyber Deception
par: Nguyen, David D., et autres
Publié: (2024)
par: Nguyen, David D., et autres
Publié: (2024)
A theoretical guarantee for SyncRank
par: Rao, Yang
Publié: (2025)
par: Rao, Yang
Publié: (2025)
Deception Abilities Emerged in Large Language Models
par: Hagendorff, Thilo
Publié: (2023)
par: Hagendorff, Thilo
Publié: (2023)
Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers
par: Ravindran, Santhosh Kumar
Publié: (2025)
par: Ravindran, Santhosh Kumar
Publié: (2025)
When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception
par: Zolfaghari, Vahideh
Publié: (2026)
par: Zolfaghari, Vahideh
Publié: (2026)
Too Big to Fool: Resisting Deception in Language Models
par: Samsami, Mohammad Reza, et autres
Publié: (2024)
par: Samsami, Mohammad Reza, et autres
Publié: (2024)
Deceptive Risk Minimization: Out-of-Distribution Generalization by Deceiving Distribution Shift Detectors
par: Majumdar, Anirudha
Publié: (2025)
par: Majumdar, Anirudha
Publié: (2025)
MLEM: Generative and Contrastive Learning as Distinct Modalities for Event Sequences
par: Moskvoretskii, Viktor, et autres
Publié: (2024)
par: Moskvoretskii, Viktor, et autres
Publié: (2024)
Preserving Node Distinctness in Graph Autoencoders via Similarity Distillation
par: Chen, Ge, et autres
Publié: (2024)
par: Chen, Ge, et autres
Publié: (2024)
Finding Kissing Numbers with Game-theoretic Reinforcement Learning
par: Ma, Chengdong, et autres
Publié: (2025)
par: Ma, Chengdong, et autres
Publié: (2025)
Game-theoretic Counterfactual Explanation for Graph Neural Networks
par: Chhablani, Chirag, et autres
Publié: (2024)
par: Chhablani, Chirag, et autres
Publié: (2024)
Pooling Attention: Evaluating Pretrained Transformer Embeddings for Deception Classification
par: Mamtani, Sumit, et autres
Publié: (2025)
par: Mamtani, Sumit, et autres
Publié: (2025)
TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
par: Choo, Jinho, et autres
Publié: (2026)
par: Choo, Jinho, et autres
Publié: (2026)
The Art of Deception: Robust Backdoor Attack using Dynamic Stacking of Triggers
par: Mengara, Orson
Publié: (2024)
par: Mengara, Orson
Publié: (2024)
Using Synthetic Data to estimate the True Error is theoretically and practically doable
par: Thanh, Hai Hoang, et autres
Publié: (2025)
par: Thanh, Hai Hoang, et autres
Publié: (2025)
The geometry of invariant learning: an information-theoretic analysis of data augmentation and generalization
par: Bouyahia, Abdelali, et autres
Publié: (2026)
par: Bouyahia, Abdelali, et autres
Publié: (2026)
An information theoretic approach to quantify the stability of feature selection and ranking algorithms
par: Alaiz-Rodriguez, et autres
Publié: (2024)
par: Alaiz-Rodriguez, et autres
Publié: (2024)
Spectral Clustering for Crowdsourcing with Inherently Distinct Task Types
par: Mandal, Saptarshi, et autres
Publié: (2023)
par: Mandal, Saptarshi, et autres
Publié: (2023)
Documents similaires
-
The Confusion is Real: GRAPHIC -- A Network Science Approach to Confusion Matrices in Deep Learning
par: Fröhlich, Johanna S., et autres
Publié: (2026) -
Why Does RLAIF Work At All?
par: Young, Robin
Publié: (2026) -
Exploring and Addressing Reward Confusion in Offline Preference Learning
par: Chen, Xin, et autres
Publié: (2024) -
Deceptive Exploration in Multi-armed Bandits
par: Vurankaya, I. Arda, et autres
Publié: (2025) -
Automating Deception: Scalable Multi-Turn LLM Jailbreaks
par: Kumarappan, Adarsh, et autres
Publié: (2025)