Unknown Unknowns: Why Hidden Intentions in LLMs Evade Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Srivastav, Devansh, Pape, David, Schönherr, Lea |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
No More, No Less: Task Alignment in Terminal Agents
par: Mavali, Sina, et autres
Publié: (2026)
par: Mavali, Sina, et autres
Publié: (2026)
The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility
par: Pape, David, et autres
Publié: (2026)
par: Pape, David, et autres
Publié: (2026)
tnGPS: Discovering Unknown Tensor Network Structure Search Algorithms via Large Language Models (LLMs)
par: Zeng, Junhua, et autres
Publié: (2024)
par: Zeng, Junhua, et autres
Publié: (2024)
Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation
par: Abdelnabi, Sahar, et autres
Publié: (2023)
par: Abdelnabi, Sahar, et autres
Publié: (2023)
Hidden or Inferred: Fair Learning-To-Rank with Unknown Demographics
par: Olulana, Oluseun, et autres
Publié: (2024)
par: Olulana, Oluseun, et autres
Publié: (2024)
Adversarial Robustness of AI-Generated Image Detectors in the Real World
par: Mavali, Sina, et autres
Publié: (2024)
par: Mavali, Sina, et autres
Publié: (2024)
Humanizing Machine-Generated Content: Evading AI-Text Detection through Adversarial Attack
par: Zhou, Ying, et autres
Publié: (2024)
par: Zhou, Ying, et autres
Publié: (2024)
Evading Data Contamination Detection for Language Models is (too) Easy
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
HexaCoder: Secure Code Generation via Oracle-Guided Synthetic Training Data
par: Hajipour, Hossein, et autres
Publié: (2024)
par: Hajipour, Hossein, et autres
Publié: (2024)
Use Sparse Autoencoders to Discover Unknown Concepts, Not to Act on Known Concepts
par: Peng, Kenny, et autres
Publié: (2025)
par: Peng, Kenny, et autres
Publié: (2025)
Don't Just Say "I don't know"! Self-aligning Large Language Models for Responding to Unknown Questions with Explanations
par: Deng, Yang, et autres
Publié: (2024)
par: Deng, Yang, et autres
Publié: (2024)
Prompt Obfuscation for Large Language Models
par: Pape, David, et autres
Publié: (2024)
par: Pape, David, et autres
Publié: (2024)
Why LLMs Cannot Think and How to Fix It
par: Jahrens, Marius, et autres
Publié: (2025)
par: Jahrens, Marius, et autres
Publié: (2025)
All You Need is "Leet": Evading Hate-speech Detection AI
par: Kahu, Sampanna Yashwant, et autres
Publié: (2025)
par: Kahu, Sampanna Yashwant, et autres
Publié: (2025)
Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
par: Kim, Jeonghye, et autres
Publié: (2026)
par: Kim, Jeonghye, et autres
Publié: (2026)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
par: Kao, Kuei-Chun, et autres
Publié: (2024)
par: Kao, Kuei-Chun, et autres
Publié: (2024)
Biomed-Enriched: A Biomedical Dataset Enriched with LLMs for Pretraining and Extracting Rare and Hidden Content
par: Touchent, Rian, et autres
Publié: (2025)
par: Touchent, Rian, et autres
Publié: (2025)
Editing Arbitrary Propositions in LLMs without Subject Labels
par: Feigenbaum, Itai, et autres
Publié: (2024)
par: Feigenbaum, Itai, et autres
Publié: (2024)
Hidden in Plain Text: Emergence & Mitigation of Steganographic Collusion in LLMs
par: Mathew, Yohan, et autres
Publié: (2024)
par: Mathew, Yohan, et autres
Publié: (2024)
Exploring the Hidden Capacity of LLMs for One-Step Text Generation
par: Mezentsev, Gleb, et autres
Publié: (2025)
par: Mezentsev, Gleb, et autres
Publié: (2025)
Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find
par: Bianchi, Owen, et autres
Publié: (2025)
par: Bianchi, Owen, et autres
Publié: (2025)
Why Are Web AI Agents More Vulnerable Than Standalone LLMs? A Security Analysis
par: Chiang, Jeffrey Yang Fan, et autres
Publié: (2025)
par: Chiang, Jeffrey Yang Fan, et autres
Publié: (2025)
Detecting Conceptual Abstraction in LLMs
par: Regneri, Michaela, et autres
Publié: (2024)
par: Regneri, Michaela, et autres
Publié: (2024)
Why is "Chicago" Predictive of Deceptive Reviews? Using LLMs to Discover Language Phenomena from Lexical Cues
par: Qu, Jiaming, et autres
Publié: (2025)
par: Qu, Jiaming, et autres
Publié: (2025)
Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
par: Turk, Matt
Publié: (2026)
par: Turk, Matt
Publié: (2026)
From Associations to Activations: Comparing Behavioral and Hidden-State Semantic Geometry in LLMs
par: Schiekiera, Louis, et autres
Publié: (2026)
par: Schiekiera, Louis, et autres
Publié: (2026)
RadPhi-3: Small Language Models for Radiology
par: Ranjit, Mercy, et autres
Publié: (2024)
par: Ranjit, Mercy, et autres
Publié: (2024)
Future Lens: Anticipating Subsequent Tokens from a Single Hidden State
par: Pal, Koyena, et autres
Publié: (2023)
par: Pal, Koyena, et autres
Publié: (2023)
Large Language Model Hacking: Quantifying the Hidden Risks of Using LLMs for Text Annotation
par: Baumann, Joachim, et autres
Publié: (2025)
par: Baumann, Joachim, et autres
Publié: (2025)
Discovering Hidden Gems in Model Repositories
par: Kahana, Jonathan, et autres
Publié: (2026)
par: Kahana, Jonathan, et autres
Publié: (2026)
Confidence-Credibility Aware Weighted Ensembles of Small LLMs Outperform Large LLMs in Emotion Detection
par: Elgabry, Menna, et autres
Publié: (2025)
par: Elgabry, Menna, et autres
Publié: (2025)
Why Code, Why Now: An Information-Theoretic Perspective on the Limits of Machine Learning
par: Zhao, Zhimin
Publié: (2026)
par: Zhao, Zhimin
Publié: (2026)
Few-Shot Graph Out-of-Distribution Detection with LLMs
par: Xu, Haoyan, et autres
Publié: (2025)
par: Xu, Haoyan, et autres
Publié: (2025)
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
par: Öncel, Fırat, et autres
Publié: (2024)
par: Öncel, Fırat, et autres
Publié: (2024)
Semantic Anchors in In-Context Learning: Why Small LLMs Cannot Flip Their Labels
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
Understanding Hidden Computations in Chain-of-Thought Reasoning
par: Bharadwaj, Aryasomayajula Ram
Publié: (2024)
par: Bharadwaj, Aryasomayajula Ram
Publié: (2024)
Can Multimodal LLMs Perform Time Series Anomaly Detection?
par: Xu, Xiongxiao, et autres
Publié: (2025)
par: Xu, Xiongxiao, et autres
Publié: (2025)
Why Should This Article Be Deleted? Transparent Stance Detection in Multilingual Wikipedia Editor Discussions
par: Kaffee, Lucie-Aimée, et autres
Publié: (2023)
par: Kaffee, Lucie-Aimée, et autres
Publié: (2023)
Cascading Unknown Detection with Known Classification for Open Set Recognition
par: Brignac, Daniel, et autres
Publié: (2024)
par: Brignac, Daniel, et autres
Publié: (2024)
Which LLMs are Difficult to Detect? A Detailed Analysis of Potential Factors Contributing to Difficulties in LLM Text Detection
par: Thorat, Shantanu, et autres
Publié: (2024)
par: Thorat, Shantanu, et autres
Publié: (2024)
Documents similaires
-
No More, No Less: Task Alignment in Terminal Agents
par: Mavali, Sina, et autres
Publié: (2026) -
The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility
par: Pape, David, et autres
Publié: (2026) -
tnGPS: Discovering Unknown Tensor Network Structure Search Algorithms via Large Language Models (LLMs)
par: Zeng, Junhua, et autres
Publié: (2024) -
Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation
par: Abdelnabi, Sahar, et autres
Publié: (2023) -
Hidden or Inferred: Fair Learning-To-Rank with Unknown Demographics
par: Olulana, Oluseun, et autres
Publié: (2024)