RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Muhamed, Aashiq, Ribeiro, Leonardo F. R., Dreyer, Markus, Smith, Virginia, Diab, Mona T. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
por: Muhamed, Aashiq, et al.
Publicado: (2024)
por: Muhamed, Aashiq, et al.
Publicado: (2024)
CoRAG: Collaborative Retrieval-Augmented Generation
por: Muhamed, Aashiq, et al.
Publicado: (2025)
por: Muhamed, Aashiq, et al.
Publicado: (2025)
DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment
por: Wedgwood, James, et al.
Publicado: (2026)
por: Wedgwood, James, et al.
Publicado: (2026)
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
por: Muhamed, Aashiq, et al.
Publicado: (2025)
por: Muhamed, Aashiq, et al.
Publicado: (2025)
CCRS: A Zero-Shot LLM-as-a-Judge Framework for Comprehensive RAG Evaluation
por: Muhamed, Aashiq
Publicado: (2025)
por: Muhamed, Aashiq
Publicado: (2025)
Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?
por: Zhong, Ziqian, et al.
Publicado: (2026)
por: Zhong, Ziqian, et al.
Publicado: (2026)
RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts
por: Weidener, Lukas, et al.
Publicado: (2026)
por: Weidener, Lukas, et al.
Publicado: (2026)
Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs
por: Song, Xiangchen, et al.
Publicado: (2025)
por: Song, Xiangchen, et al.
Publicado: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
por: Cui, Justin, et al.
Publicado: (2024)
por: Cui, Justin, et al.
Publicado: (2024)
Refusal in Language Models Is Mediated by a Single Direction
por: Arditi, Andy, et al.
Publicado: (2024)
por: Arditi, Andy, et al.
Publicado: (2024)
Where Do Reasoning Models Refuse?
por: Yamaguchi, Kureha, et al.
Publicado: (2025)
por: Yamaguchi, Kureha, et al.
Publicado: (2025)
Does Refusal Training in LLMs Generalize to the Past Tense?
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
por: Wollschläger, Tom, et al.
Publicado: (2025)
por: Wollschläger, Tom, et al.
Publicado: (2025)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
por: Hu, Xulin, et al.
Publicado: (2026)
por: Hu, Xulin, et al.
Publicado: (2026)
Programming Refusal with Conditional Activation Steering
por: Lee, Bruce W., et al.
Publicado: (2024)
por: Lee, Bruce W., et al.
Publicado: (2024)
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
por: Mazeika, Mantas, et al.
Publicado: (2024)
por: Mazeika, Mantas, et al.
Publicado: (2024)
Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails
por: Frank, Gregory N.
Publicado: (2026)
por: Frank, Gregory N.
Publicado: (2026)
Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language
por: Attia, Mena, et al.
Publicado: (2025)
por: Attia, Mena, et al.
Publicado: (2025)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
Grass: Compute Efficient Low-Memory LLM Training with Structured Sparse Gradients
por: Muhamed, Aashiq, et al.
Publicado: (2024)
por: Muhamed, Aashiq, et al.
Publicado: (2024)
Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal Mechanism
por: Cao, Lang
Publicado: (2023)
por: Cao, Lang
Publicado: (2023)
Linearly Decoding Refused Knowledge in Aligned Language Models
por: Shrivastava, Aryan, et al.
Publicado: (2025)
por: Shrivastava, Aryan, et al.
Publicado: (2025)
Measuring and Eliminating Refusals in Military Large Language Models
por: FitzGerald, Jack, et al.
Publicado: (2026)
por: FitzGerald, Jack, et al.
Publicado: (2026)
Personal Information Parroting in Language Models
por: Subramani, Nishant, et al.
Publicado: (2026)
por: Subramani, Nishant, et al.
Publicado: (2026)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
por: Si, Shengyun, et al.
Publicado: (2025)
por: Si, Shengyun, et al.
Publicado: (2025)
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
por: García-Ferrero, Iker, et al.
Publicado: (2025)
por: García-Ferrero, Iker, et al.
Publicado: (2025)
Emotion Classification in Low and Moderate Resource Languages
por: Tafreshi, Shabnam, et al.
Publicado: (2024)
por: Tafreshi, Shabnam, et al.
Publicado: (2024)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Refusal Behavior in Large Language Models: A Nonlinear Perspective
por: Hildebrandt, Fabian, et al.
Publicado: (2025)
por: Hildebrandt, Fabian, et al.
Publicado: (2025)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
por: Hu, Xiaomeng, et al.
Publicado: (2024)
por: Hu, Xiaomeng, et al.
Publicado: (2024)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
por: Yuan, Youliang, et al.
Publicado: (2024)
por: Yuan, Youliang, et al.
Publicado: (2024)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
por: Pan, Wenbo, et al.
Publicado: (2025)
por: Pan, Wenbo, et al.
Publicado: (2025)
When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
por: Hadeliya, Tsimur, et al.
Publicado: (2025)
por: Hadeliya, Tsimur, et al.
Publicado: (2025)
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
por: Cheng, Stephen, et al.
Publicado: (2026)
por: Cheng, Stephen, et al.
Publicado: (2026)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
por: Xie, Tinghao, et al.
Publicado: (2024)
por: Xie, Tinghao, et al.
Publicado: (2024)
COSMIC: Generalized Refusal Direction Identification in LLM Activations
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs
por: von Recum, Alexander, et al.
Publicado: (2024)
por: von Recum, Alexander, et al.
Publicado: (2024)
Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models
por: Wu, Cheng-Kuang, et al.
Publicado: (2025)
por: Wu, Cheng-Kuang, et al.
Publicado: (2025)
How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence
por: Du, Hongzhe, et al.
Publicado: (2025)
por: Du, Hongzhe, et al.
Publicado: (2025)
SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models
por: Dahir, Khalid Yusuf
Publicado: (2026)
por: Dahir, Khalid Yusuf
Publicado: (2026)
Ejemplares similares
-
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
por: Muhamed, Aashiq, et al.
Publicado: (2024) -
CoRAG: Collaborative Retrieval-Augmented Generation
por: Muhamed, Aashiq, et al.
Publicado: (2025) -
DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment
por: Wedgwood, James, et al.
Publicado: (2026) -
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
por: Muhamed, Aashiq, et al.
Publicado: (2025) -
CCRS: A Zero-Shot LLM-as-a-Judge Framework for Comprehensive RAG Evaluation
por: Muhamed, Aashiq
Publicado: (2025)