AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sheshadri, Abhay, Ewart, Aidan, Fronsdal, Kai, Gupta, Isha, Bowman, Samuel R., Price, Sara, Marks, Samuel, Wang, Rowan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
par: Guo, Phillip, et autres
Publié: (2024)
par: Guo, Phillip, et autres
Publié: (2024)
Liars' Bench: Evaluating Lie Detectors for Language Models
par: Kretschmar, Kieron, et autres
Publié: (2025)
par: Kretschmar, Kieron, et autres
Publié: (2025)
DECOR: Auditing LLM Deception via Information Manipulation Theory
par: Cai, Linyue, et autres
Publié: (2026)
par: Cai, Linyue, et autres
Publié: (2026)
MISR: Measuring Instrumental Self-Reasoning in Frontier Models
par: Fronsdal, Kai, et autres
Publié: (2024)
par: Fronsdal, Kai, et autres
Publié: (2024)
Let's Think Dot by Dot: Hidden Computation in Transformer Language Models
par: Pfau, Jacob, et autres
Publié: (2024)
par: Pfau, Jacob, et autres
Publié: (2024)
Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs
par: Sheshadri, Abhay, et autres
Publié: (2024)
par: Sheshadri, Abhay, et autres
Publié: (2024)
Auditing language models for hidden objectives
par: Marks, Samuel, et autres
Publié: (2025)
par: Marks, Samuel, et autres
Publié: (2025)
Introspection Adapters: Training LLMs to Report Their Learned Behaviors
par: Shenoy, Keshav, et autres
Publié: (2026)
par: Shenoy, Keshav, et autres
Publié: (2026)
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
par: Sakhawat, Adib, et autres
Publié: (2026)
par: Sakhawat, Adib, et autres
Publié: (2026)
BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
par: Tu, Xinming, et autres
Publié: (2026)
par: Tu, Xinming, et autres
Publié: (2026)
AuditWen:An Open-Source Large Language Model for Audit
par: Huang, Jiajia, et autres
Publié: (2024)
par: Huang, Jiajia, et autres
Publié: (2024)
LLM Evaluators Recognize and Favor Their Own Generations
par: Panickssery, Arjun, et autres
Publié: (2024)
par: Panickssery, Arjun, et autres
Publié: (2024)
Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction
par: Bhattacharyya, Sumanta, et autres
Publié: (2025)
par: Bhattacharyya, Sumanta, et autres
Publié: (2025)
What Artificial Neural Networks Can Tell Us About Human Language Acquisition
par: Warstadt, Alex, et autres
Publié: (2022)
par: Warstadt, Alex, et autres
Publié: (2022)
An Audit on the Perspectives and Challenges of Hallucinations in NLP
par: Venkit, Pranav Narayanan, et autres
Publié: (2024)
par: Venkit, Pranav Narayanan, et autres
Publié: (2024)
Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics
par: Srivastava, Abhay, et autres
Publié: (2025)
par: Srivastava, Abhay, et autres
Publié: (2025)
Audit, Alignment, and Optimization of LM-Powered Subroutines with Application to Public Comment Processing
par: Raab, Reilly, et autres
Publié: (2025)
par: Raab, Reilly, et autres
Publié: (2025)
Eight Methods to Evaluate Robust Unlearning in LLMs
par: Lynch, Aengus, et autres
Publié: (2024)
par: Lynch, Aengus, et autres
Publié: (2024)
GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence
par: Krishna, Kundan, et autres
Publié: (2024)
par: Krishna, Kundan, et autres
Publié: (2024)
AuditGPT: Auditing Smart Contracts with ChatGPT
par: Xia, Shihao, et autres
Publié: (2024)
par: Xia, Shihao, et autres
Publié: (2024)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
par: Patel, Bhrij, et autres
Publié: (2024)
par: Patel, Bhrij, et autres
Publié: (2024)
Model Spec Midtraining: Improving How Alignment Training Generalizes
par: Li, Chloe, et autres
Publié: (2026)
par: Li, Chloe, et autres
Publié: (2026)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
par: Hua, Tim Tian, et autres
Publié: (2025)
par: Hua, Tim Tian, et autres
Publié: (2025)
Quantum-Audit: Evaluating the Reasoning Limits of LLMs on Quantum Computing
par: Afane, Mohamed, et autres
Publié: (2026)
par: Afane, Mohamed, et autres
Publié: (2026)
Auditing Rust Crates Effectively
par: Zoghbi, Lydia, et autres
Publié: (2026)
par: Zoghbi, Lydia, et autres
Publié: (2026)
BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture
par: Ridoy, Shahriyar Zaman, et autres
Publié: (2025)
par: Ridoy, Shahriyar Zaman, et autres
Publié: (2025)
Statistical Hypothesis Testing for Auditing Robustness in Language Models
par: Rauba, Paulius, et autres
Publié: (2025)
par: Rauba, Paulius, et autres
Publié: (2025)
Keeping Up with the Language Models: Systematic Benchmark Extension for Bias Auditing
par: Baldini, Ioana, et autres
Publié: (2023)
par: Baldini, Ioana, et autres
Publié: (2023)
Robustly Improving LLM Fairness in Realistic Settings via Interpretability
par: Karvonen, Adam, et autres
Publié: (2025)
par: Karvonen, Adam, et autres
Publié: (2025)
Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
par: Chen, Chaoran, et autres
Publié: (2026)
par: Chen, Chaoran, et autres
Publié: (2026)
Stage-Audit: Auditable Source-Frontier Discovery for Cross-Wiki Tables
par: Shen, Chen
Publié: (2026)
par: Shen, Chen
Publié: (2026)
Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks
par: Karvonen, Adam, et autres
Publié: (2024)
par: Karvonen, Adam, et autres
Publié: (2024)
Auditing Agent Harness Safety
par: Liu, Chengzhi, et autres
Publié: (2026)
par: Liu, Chengzhi, et autres
Publié: (2026)
Smart Audit System Empowered by LLM
par: Yao, Xu, et autres
Publié: (2024)
par: Yao, Xu, et autres
Publié: (2024)
Direction-Flipped Influence Audits Reveal Hidden Structure in Moral Choices of LLMs
par: Blandfort, Phil, et autres
Publié: (2026)
par: Blandfort, Phil, et autres
Publié: (2026)
Auditing the Use of Language Models to Guide Hiring Decisions
par: Gaebler, Johann D., et autres
Publié: (2024)
par: Gaebler, Johann D., et autres
Publié: (2024)
Auditing Prompt Caching in Language Model APIs
par: Gu, Chenchen, et autres
Publié: (2025)
par: Gu, Chenchen, et autres
Publié: (2025)
Distilling Bayesian Belief States into Language Models for Auditable Negotiation
par: Cui, Zongqi, et autres
Publié: (2026)
par: Cui, Zongqi, et autres
Publié: (2026)
Automated Benchmark Auditing for AI Agents and Large Language Models
par: Wang, Junlin, et autres
Publié: (2026)
par: Wang, Junlin, et autres
Publié: (2026)
CALM: Curiosity-Driven Auditing for Large Language Models
par: Zheng, Xiang, et autres
Publié: (2025)
par: Zheng, Xiang, et autres
Publié: (2025)
Documents similaires
-
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
par: Guo, Phillip, et autres
Publié: (2024) -
Liars' Bench: Evaluating Lie Detectors for Language Models
par: Kretschmar, Kieron, et autres
Publié: (2025) -
DECOR: Auditing LLM Deception via Information Manipulation Theory
par: Cai, Linyue, et autres
Publié: (2026) -
MISR: Measuring Instrumental Self-Reasoning in Frontier Models
par: Fronsdal, Kai, et autres
Publié: (2024) -
Let's Think Dot by Dot: Hidden Computation in Transformer Language Models
par: Pfau, Jacob, et autres
Publié: (2024)