Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails
Fuente:
arXiv
Salvato in:
| Autore principale: | Frank, Gregory N. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models
di: Frank, Gregory N.
Pubblicazione: (2026)
di: Frank, Gregory N.
Pubblicazione: (2026)
When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
di: Hadeliya, Tsimur, et al.
Pubblicazione: (2025)
di: Hadeliya, Tsimur, et al.
Pubblicazione: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs
di: Kossen, Jannik, et al.
Pubblicazione: (2024)
di: Kossen, Jannik, et al.
Pubblicazione: (2024)
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
di: Öncel, Fırat, et al.
Pubblicazione: (2024)
di: Öncel, Fırat, et al.
Pubblicazione: (2024)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
di: Hu, Xulin, et al.
Pubblicazione: (2026)
di: Hu, Xulin, et al.
Pubblicazione: (2026)
Tools Fail: Detecting Silent Errors in Faulty Tools
di: Sun, Jimin, et al.
Pubblicazione: (2024)
di: Sun, Jimin, et al.
Pubblicazione: (2024)
Where Do Reasoning Models Refuse?
di: Yamaguchi, Kureha, et al.
Pubblicazione: (2025)
di: Yamaguchi, Kureha, et al.
Pubblicazione: (2025)
Programming Refusal with Conditional Activation Steering
di: Lee, Bruce W., et al.
Pubblicazione: (2024)
di: Lee, Bruce W., et al.
Pubblicazione: (2024)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
di: Wang, Zehong, et al.
Pubblicazione: (2026)
di: Wang, Zehong, et al.
Pubblicazione: (2026)
AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive
di: Guo, Taicheng, et al.
Pubblicazione: (2026)
di: Guo, Taicheng, et al.
Pubblicazione: (2026)
Universe Routing: Why Self-Evolving Agents Need Epistemic Control
di: Wang, Zhaohui Geoffrey
Pubblicazione: (2026)
di: Wang, Zhaohui Geoffrey
Pubblicazione: (2026)
Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs
di: Mamun, Md Abdullah Al, et al.
Pubblicazione: (2025)
di: Mamun, Md Abdullah Al, et al.
Pubblicazione: (2025)
Does Refusal Training in LLMs Generalize to the Past Tense?
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
Refusal in Language Models Is Mediated by a Single Direction
di: Arditi, Andy, et al.
Pubblicazione: (2024)
di: Arditi, Andy, et al.
Pubblicazione: (2024)
TARo: Token-level Adaptive Routing for LLM Test-time Alignment
di: Rai, Arushi, et al.
Pubblicazione: (2026)
di: Rai, Arushi, et al.
Pubblicazione: (2026)
RouteLLM: Learning to Route LLMs with Preference Data
di: Ong, Isaac, et al.
Pubblicazione: (2024)
di: Ong, Isaac, et al.
Pubblicazione: (2024)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
di: Wollschläger, Tom, et al.
Pubblicazione: (2025)
di: Wollschläger, Tom, et al.
Pubblicazione: (2025)
A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI
di: Karagoz, Atahan
Pubblicazione: (2026)
di: Karagoz, Atahan
Pubblicazione: (2026)
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
di: Cheng, Stephen, et al.
Pubblicazione: (2026)
di: Cheng, Stephen, et al.
Pubblicazione: (2026)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
Learning to Route LLMs with Confidence Tokens
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024)
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024)
AI Scientists Fail Without Strong Implementation Capability
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence
di: Du, Hongzhe, et al.
Pubblicazione: (2025)
di: Du, Hongzhe, et al.
Pubblicazione: (2025)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Current Agents Fail to Leverage World Model as Tool for Foresight
di: Qian, Cheng, et al.
Pubblicazione: (2026)
di: Qian, Cheng, et al.
Pubblicazione: (2026)
When Chain-of-Thought Fails, the Solution Hides in the Hidden States
di: Mehrafarin, Houman, et al.
Pubblicazione: (2026)
di: Mehrafarin, Houman, et al.
Pubblicazione: (2026)
Ask Again, Then Fail: Large Language Models' Vacillations in Judgment
di: Xie, Qiming, et al.
Pubblicazione: (2023)
di: Xie, Qiming, et al.
Pubblicazione: (2023)
Continual Learning with Global Alignment
di: Bai, Xueying, et al.
Pubblicazione: (2022)
di: Bai, Xueying, et al.
Pubblicazione: (2022)
Routoo: Learning to Route to Large Language Models Effectively
di: Mohammadshahi, Alireza, et al.
Pubblicazione: (2024)
di: Mohammadshahi, Alireza, et al.
Pubblicazione: (2024)
Learning to Route for Dynamic Adapter Composition in Continual Learning with Language Models
di: Araujo, Vladimir, et al.
Pubblicazione: (2024)
di: Araujo, Vladimir, et al.
Pubblicazione: (2024)
A Comprehensive Evaluation framework of Alignment Techniques for LLMs
di: Azmat, Muneeza, et al.
Pubblicazione: (2025)
di: Azmat, Muneeza, et al.
Pubblicazione: (2025)
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
di: Mazeika, Mantas, et al.
Pubblicazione: (2024)
di: Mazeika, Mantas, et al.
Pubblicazione: (2024)
Aligner: Efficient Alignment by Learning to Correct
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Why Larger Language Models Do In-context Learning Differently?
di: Shi, Zhenmei, et al.
Pubblicazione: (2024)
di: Shi, Zhenmei, et al.
Pubblicazione: (2024)
When LLM Judge Scores Look Good but Best-of-N Decisions Fail
di: Landesberg, Eddie
Pubblicazione: (2026)
di: Landesberg, Eddie
Pubblicazione: (2026)
Long-Form Information Alignment Evaluation Beyond Atomic Facts
di: Zheng, Danna, et al.
Pubblicazione: (2025)
di: Zheng, Danna, et al.
Pubblicazione: (2025)
Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory
di: Zhang, Haozhen, et al.
Pubblicazione: (2026)
di: Zhang, Haozhen, et al.
Pubblicazione: (2026)
Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook
di: Lee, Jaehyeok, et al.
Pubblicazione: (2026)
di: Lee, Jaehyeok, et al.
Pubblicazione: (2026)
Documenti analoghi
-
How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models
di: Frank, Gregory N.
Pubblicazione: (2026) -
When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
di: Hadeliya, Tsimur, et al.
Pubblicazione: (2025) -
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025) -
Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs
di: Kossen, Jannik, et al.
Pubblicazione: (2024) -
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
di: Öncel, Fırat, et al.
Pubblicazione: (2024)