Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Gondil, Tanay |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Two LLMs Debate, Both Think They'll Win
par: Prasad, Pradyumna Shyama, et autres
Publié: (2025)
par: Prasad, Pradyumna Shyama, et autres
Publié: (2025)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
par: Pan, Wenbo, et autres
Publié: (2025)
par: Pan, Wenbo, et autres
Publié: (2025)
Do Retrieval Augmented Language Models Know When They Don't Know?
par: Zhou, Youchao, et autres
Publié: (2025)
par: Zhou, Youchao, et autres
Publié: (2025)
Emergent Introspective Awareness in Large Language Models
par: Lindsey, Jack
Publié: (2026)
par: Lindsey, Jack
Publié: (2026)
From Imitation to Introspection: Probing Self-Consciousness in Language Models
par: Chen, Sirui, et autres
Publié: (2024)
par: Chen, Sirui, et autres
Publié: (2024)
Do Language Models Know When They're Hallucinating References?
par: Agrawal, Ayush, et autres
Publié: (2023)
par: Agrawal, Ayush, et autres
Publié: (2023)
Do LLMs Know When to NOT Answer? Investigating Abstention Abilities of Large Language Models
par: Madhusudhan, Nishanth, et autres
Publié: (2024)
par: Madhusudhan, Nishanth, et autres
Publié: (2024)
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
par: Mei, Zhiting, et autres
Publié: (2025)
par: Mei, Zhiting, et autres
Publié: (2025)
STAIR: Improving Safety Alignment with Introspective Reasoning
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
Refusal Direction is Universal Across Safety-Aligned Languages
par: Wang, Xinpeng, et autres
Publié: (2025)
par: Wang, Xinpeng, et autres
Publié: (2025)
When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
par: Anonto, Riad Ahmed, et autres
Publié: (2025)
par: Anonto, Riad Ahmed, et autres
Publié: (2025)
Do LVLMs Know What They Know? A Systematic Study of Knowledge Boundary Perception in LVLMs
par: Ding, Zhikai, et autres
Publié: (2025)
par: Ding, Zhikai, et autres
Publié: (2025)
Do We Know What LLMs Don't Know? A Study of Consistency in Knowledge Probing
par: Zhao, Raoyuan, et autres
Publié: (2025)
par: Zhao, Raoyuan, et autres
Publié: (2025)
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
par: Ferrando, Javier, et autres
Publié: (2024)
par: Ferrando, Javier, et autres
Publié: (2024)
Thinking Out Loud: Do Reasoning Models Know When They're Right?
par: Zeng, Qingcheng, et autres
Publié: (2025)
par: Zeng, Qingcheng, et autres
Publié: (2025)
Language Models Fail to Introspect About Their Knowledge of Language
par: Song, Siyuan, et autres
Publié: (2025)
par: Song, Siyuan, et autres
Publié: (2025)
Large Language Models Know What To Say But Not When To Speak
par: Umair, Muhammad, et autres
Publié: (2024)
par: Umair, Muhammad, et autres
Publié: (2024)
Where Do Reasoning Models Refuse?
par: Yamaguchi, Kureha, et autres
Publié: (2025)
par: Yamaguchi, Kureha, et autres
Publié: (2025)
Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations
par: Wang, Haoran, et autres
Publié: (2026)
par: Wang, Haoran, et autres
Publié: (2026)
Do Large Language Models Know How Much They Know?
par: Prato, Gabriele, et autres
Publié: (2025)
par: Prato, Gabriele, et autres
Publié: (2025)
When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
par: Hadeliya, Tsimur, et autres
Publié: (2025)
par: Hadeliya, Tsimur, et autres
Publié: (2025)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
par: Zhang, Yue, et autres
Publié: (2026)
par: Zhang, Yue, et autres
Publié: (2026)
Knowing When Not to Answer: Abstention-Aware Scientific Reasoning
par: Abdaljalil, Samir, et autres
Publié: (2026)
par: Abdaljalil, Samir, et autres
Publié: (2026)
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
par: Duan, Ranjie, et autres
Publié: (2025)
par: Duan, Ranjie, et autres
Publié: (2025)
Do Large Language Models Know What They Are Capable Of?
par: Barkan, Casey O., et autres
Publié: (2025)
par: Barkan, Casey O., et autres
Publié: (2025)
When Models Know More Than They Say: Probing Analogical Reasoning in LLMs
par: McGovern, Hope, et autres
Publié: (2026)
par: McGovern, Hope, et autres
Publié: (2026)
Understanding Refusal in Language Models with Sparse Autoencoders
par: Yeo, Wei Jie, et autres
Publié: (2025)
par: Yeo, Wei Jie, et autres
Publié: (2025)
Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models
par: Wu, Cheng-Kuang, et autres
Publié: (2025)
par: Wu, Cheng-Kuang, et autres
Publié: (2025)
Do LLMs Know What Luxembourgish Borrows? Probing Lexical Neology in Low-Resource Multilingual Models
par: Hosseini-Kivanani, Nina
Publié: (2026)
par: Hosseini-Kivanani, Nina
Publié: (2026)
Large Language Models Often Know When They Are Being Evaluated
par: Needham, Joe, et autres
Publié: (2025)
par: Needham, Joe, et autres
Publié: (2025)
Knowing When to Ask -- Bridging Large Language Models and Data
par: Radhakrishnan, Prashanth, et autres
Publié: (2024)
par: Radhakrishnan, Prashanth, et autres
Publié: (2024)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
par: Si, Shengyun, et autres
Publié: (2025)
par: Si, Shengyun, et autres
Publié: (2025)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
par: Jain, Neel, et autres
Publié: (2024)
par: Jain, Neel, et autres
Publié: (2024)
Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification
par: Zhang, Anqi, et autres
Publié: (2025)
par: Zhang, Anqi, et autres
Publié: (2025)
Does It Make Sense to Speak of Introspection in Large Language Models?
par: Comsa, Iulia M., et autres
Publié: (2025)
par: Comsa, Iulia M., et autres
Publié: (2025)
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
par: Chae, Kyubyung, et autres
Publié: (2025)
par: Chae, Kyubyung, et autres
Publié: (2025)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
par: Yuan, Youliang, et autres
Publié: (2024)
par: Yuan, Youliang, et autres
Publié: (2024)
Language Specific Knowledge: Do Models Know Better in X than in English?
par: Agarwal, Ishika, et autres
Publié: (2025)
par: Agarwal, Ishika, et autres
Publié: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
Characterizing Selective Refusal Bias in Large Language Models
par: Khorramrouz, Adel, et autres
Publié: (2025)
par: Khorramrouz, Adel, et autres
Publié: (2025)
Documents similaires
-
When Two LLMs Debate, Both Think They'll Win
par: Prasad, Pradyumna Shyama, et autres
Publié: (2025) -
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
par: Pan, Wenbo, et autres
Publié: (2025) -
Do Retrieval Augmented Language Models Know When They Don't Know?
par: Zhou, Youchao, et autres
Publié: (2025) -
Emergent Introspective Awareness in Large Language Models
par: Lindsey, Jack
Publié: (2026) -
From Imitation to Introspection: Probing Self-Consciousness in Language Models
par: Chen, Sirui, et autres
Publié: (2024)