Models That Know How Evaluations Are Designed Score Safer
Fuente:
arXiv
Guardado en:
| Autores principales: | Deckenbach, Katharina, Puerto, Haritz, Geiping, Jonas, Abdelnabi, Sahar |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models
por: Puerto, Haritz, et al.
Publicado: (2024)
por: Puerto, Haritz, et al.
Publicado: (2024)
A Theory of Response Sampling in LLMs: Part Descriptive and Part Prescriptive
por: Sivaprasad, Sarath, et al.
Publicado: (2024)
por: Sivaprasad, Sarath, et al.
Publicado: (2024)
Efficiently Dispatching Flash Attention For Partially Filled Attention Masks
por: Sharma, Agniv, et al.
Publicado: (2024)
por: Sharma, Agniv, et al.
Publicado: (2024)
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
por: Puerto, Haritz, et al.
Publicado: (2026)
por: Puerto, Haritz, et al.
Publicado: (2026)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
por: Chandak, Nikhil, et al.
Publicado: (2025)
por: Chandak, Nikhil, et al.
Publicado: (2025)
Decomposing and Measuring Evaluation Awareness
por: Li, Changling, et al.
Publicado: (2026)
por: Li, Changling, et al.
Publicado: (2026)
Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers
por: Green, Tommaso, et al.
Publicado: (2025)
por: Green, Tommaso, et al.
Publicado: (2025)
C-SEO Bench: Does Conversational SEO Work?
por: Puerto, Haritz, et al.
Publicado: (2025)
por: Puerto, Haritz, et al.
Publicado: (2025)
The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness
por: Abdelnabi, Sahar, et al.
Publicado: (2025)
por: Abdelnabi, Sahar, et al.
Publicado: (2025)
Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts
por: Chen, Hongyu, et al.
Publicado: (2025)
por: Chen, Hongyu, et al.
Publicado: (2025)
Evaluating Austrian A-Level German Essays with Large Language Models for Automated Essay Scoring
por: Kubesch, Jonas, et al.
Publicado: (2026)
por: Kubesch, Jonas, et al.
Publicado: (2026)
What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"
por: Lee, Joosung, et al.
Publicado: (2026)
por: Lee, Joosung, et al.
Publicado: (2026)
GenKnowSub: Improving Modularity and Reusability of LLMs through General Knowledge Subtraction
por: Bagherifard, Mohammadtaha, et al.
Publicado: (2025)
por: Bagherifard, Mohammadtaha, et al.
Publicado: (2025)
Do Large Language Models Know How Much They Know?
por: Prato, Gabriele, et al.
Publicado: (2025)
por: Prato, Gabriele, et al.
Publicado: (2025)
InvThink: Premortem Reasoning for Safer Language Models
por: Kim, Yubin, et al.
Publicado: (2025)
por: Kim, Yubin, et al.
Publicado: (2025)
KnowRL: Teaching Language Models to Know What They Know
por: Kale, Sahil, et al.
Publicado: (2025)
por: Kale, Sahil, et al.
Publicado: (2025)
Safer-Instruct: Aligning Language Models with Automated Preference Data
por: Shi, Taiwei, et al.
Publicado: (2023)
por: Shi, Taiwei, et al.
Publicado: (2023)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
por: Boreiko, Valentyn, et al.
Publicado: (2024)
por: Boreiko, Valentyn, et al.
Publicado: (2024)
NanoKnow: How to Know What Your Language Model Knows
por: Gu, Lingwei, et al.
Publicado: (2026)
por: Gu, Lingwei, et al.
Publicado: (2026)
Large Language Models Often Know When They Are Being Evaluated
por: Needham, Joe, et al.
Publicado: (2025)
por: Needham, Joe, et al.
Publicado: (2025)
Capability-Based Scaling Trends for LLM-Based Red-Teaming
por: Panfilov, Alexander, et al.
Publicado: (2025)
por: Panfilov, Alexander, et al.
Publicado: (2025)
FutureSim: Replaying World Events to Evaluate Adaptive Agents
por: Goel, Shashwat, et al.
Publicado: (2026)
por: Goel, Shashwat, et al.
Publicado: (2026)
Beyond Questions: Evaluating What Large Language Models (Actually) Know
por: Giordano, Luca, et al.
Publicado: (2026)
por: Giordano, Luca, et al.
Publicado: (2026)
Knowing the Facts but Choosing the Shortcut: Understanding How Large Language Models Compare Entities
por: Lehmann, Hans Hergen, et al.
Publicado: (2025)
por: Lehmann, Hans Hergen, et al.
Publicado: (2025)
Colosseum: Auditing Collusion in Cooperative Multi-Agent Systems
por: Nakamura, Mason, et al.
Publicado: (2026)
por: Nakamura, Mason, et al.
Publicado: (2026)
Do Retrieval Augmented Language Models Know When They Don't Know?
por: Zhou, Youchao, et al.
Publicado: (2025)
por: Zhou, Youchao, et al.
Publicado: (2025)
Preventing Catastrophic Forgetting: Behavior-Aware Sampling for Safer Language Model Fine-Tuning
por: Pham, Anh, et al.
Publicado: (2025)
por: Pham, Anh, et al.
Publicado: (2025)
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
por: Mei, Zhiting, et al.
Publicado: (2025)
por: Mei, Zhiting, et al.
Publicado: (2025)
RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models
por: An, Bang, et al.
Publicado: (2025)
por: An, Bang, et al.
Publicado: (2025)
Deliberative Alignment: Reasoning Enables Safer Language Models
por: Guan, Melody Y., et al.
Publicado: (2024)
por: Guan, Melody Y., et al.
Publicado: (2024)
STAR-1: Safer Alignment of Reasoning LLMs with 1K Data
por: Wang, Zijun, et al.
Publicado: (2025)
por: Wang, Zijun, et al.
Publicado: (2025)
Can AI Assistants Know What They Don't Know?
por: Cheng, Qinyuan, et al.
Publicado: (2024)
por: Cheng, Qinyuan, et al.
Publicado: (2024)
Know More, Know Clearer: A Meta-Cognitive Framework for Knowledge Augmentation in Large Language Models
por: Chen, Hao, et al.
Publicado: (2026)
por: Chen, Hao, et al.
Publicado: (2026)
Truth Knows No Language: Evaluating Truthfulness Beyond English
por: Figueras, Blanca Calvo, et al.
Publicado: (2025)
por: Figueras, Blanca Calvo, et al.
Publicado: (2025)
A Primer in Post-Training Reasoning Data: What We Know About How It Works
por: Li, Yaoming, et al.
Publicado: (2026)
por: Li, Yaoming, et al.
Publicado: (2026)
SelfGoal: Your Language Agents Already Know How to Achieve High-level Goals
por: Yang, Ruihan, et al.
Publicado: (2024)
por: Yang, Ruihan, et al.
Publicado: (2024)
Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
por: Li, Ang, et al.
Publicado: (2025)
por: Li, Ang, et al.
Publicado: (2025)
Diffusion Language Models Know the Answer Before Decoding
por: Li, Pengxiang, et al.
Publicado: (2025)
por: Li, Pengxiang, et al.
Publicado: (2025)
Do Large Language Models Know What They Are Capable Of?
por: Barkan, Casey O., et al.
Publicado: (2025)
por: Barkan, Casey O., et al.
Publicado: (2025)
BertaQA: How Much Do Language Models Know About Local Culture?
por: Etxaniz, Julen, et al.
Publicado: (2024)
por: Etxaniz, Julen, et al.
Publicado: (2024)
Ejemplares similares
-
Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models
por: Puerto, Haritz, et al.
Publicado: (2024) -
A Theory of Response Sampling in LLMs: Part Descriptive and Part Prescriptive
por: Sivaprasad, Sarath, et al.
Publicado: (2024) -
Efficiently Dispatching Flash Attention For Partially Filled Attention Masks
por: Sharma, Agniv, et al.
Publicado: (2024) -
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
por: Puerto, Haritz, et al.
Publicado: (2026) -
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
por: Chandak, Nikhil, et al.
Publicado: (2025)