Why Do Some Language Models Fake Alignment While Others Don't?
Fuente:
arXiv
Guardado en:
| Autores principales: | Sheshadri, Abhay, Hughes, John, Michael, Julian, Mallen, Alex, Jose, Arun, Janus, Roger, Fabien |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Why Some Nursing Students Sleep Soundly While Others Don't: Resilience, Reappraisal, and Hidden Profiles
por: Dongmei Chen, et al.
Publicado: (2026)
por: Dongmei Chen, et al.
Publicado: (2026)
Why Some Electric Fish Species Avoid the Moon While Others Don’t: Visual Capacity Shapes Risk Perception
por: Lok Poon, et al.
Publicado: (2025)
por: Lok Poon, et al.
Publicado: (2025)
Why They Don't Ask Questions
por: Horn, Roger
Publicado: (1974)
por: Horn, Roger
Publicado: (1974)
Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
por: Faria, Gonçalo, et al.
Publicado: (2025)
por: Faria, Gonçalo, et al.
Publicado: (2025)
Reasoning Models Don't Always Say What They Think
por: Chen, Yanda, et al.
Publicado: (2025)
por: Chen, Yanda, et al.
Publicado: (2025)
Do Unlearning Methods Remove Information from Language Model Weights?
por: Deeb, Aghyad, et al.
Publicado: (2024)
por: Deeb, Aghyad, et al.
Publicado: (2024)
Why Don't Prompt-Based Fairness Metrics Correlate?
por: Zayed, Abdelrahman, et al.
Publicado: (2024)
por: Zayed, Abdelrahman, et al.
Publicado: (2024)
The Geometry of Noise: Why Diffusion Models Don't Need Noise Conditioning
por: Sahraee-Ardakan, Mojtaba, et al.
Publicado: (2026)
por: Sahraee-Ardakan, Mojtaba, et al.
Publicado: (2026)
Why Diffusion Models Don't Memorize: The Role of Implicit Dynamical Regularization in Training
por: Bonnaire, Tony, et al.
Publicado: (2025)
por: Bonnaire, Tony, et al.
Publicado: (2025)
Do's and Don'ts: Learning Desirable Skills with Instruction Videos
por: Kim, Hyunseung, et al.
Publicado: (2024)
por: Kim, Hyunseung, et al.
Publicado: (2024)
Experts Don't Cheat: Learning What You Don't Know By Predicting Pairs
por: Johnson, Daniel D., et al.
Publicado: (2024)
por: Johnson, Daniel D., et al.
Publicado: (2024)
Balancing Label Quantity and Quality for Scalable Elicitation
por: Mallen, Alex, et al.
Publicado: (2024)
por: Mallen, Alex, et al.
Publicado: (2024)
A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task
por: Brinkmann, Jannik, et al.
Publicado: (2024)
por: Brinkmann, Jannik, et al.
Publicado: (2024)
Automatically Interpreting Millions of Features in Large Language Models
por: Paulo, Gonçalo, et al.
Publicado: (2024)
por: Paulo, Gonçalo, et al.
Publicado: (2024)
Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
por: Hariri, Mohsen, et al.
Publicado: (2025)
por: Hariri, Mohsen, et al.
Publicado: (2025)
Eliciting Latent Knowledge from Quirky Language Models
por: Mallen, Alex, et al.
Publicado: (2023)
por: Mallen, Alex, et al.
Publicado: (2023)
The Compliance Gap: Why AI Systems Promise to Follow Process Instructions but Don't
por: Shin, Kwan Soo
Publicado: (2026)
por: Shin, Kwan Soo
Publicado: (2026)
If You Don't Understand It, Don't Use It: Eliminating Trojans with Filters Between Layers
por: Hernandez, Adriano
Publicado: (2024)
por: Hernandez, Adriano
Publicado: (2024)
Why Customers Buy (And Why They Don't).
por: Moot, Robert C., et al.
Publicado: (1967)
por: Moot, Robert C., et al.
Publicado: (1967)
Prediction Bottlenecks Don't Discover Causal Structure (But Here's What They Actually Do)
por: Lade, Ankit Hemant, et al.
Publicado: (2026)
por: Lade, Ankit Hemant, et al.
Publicado: (2026)
Steering Language Models with Weight Arithmetic
por: Fierro, Constanza, et al.
Publicado: (2025)
por: Fierro, Constanza, et al.
Publicado: (2025)
Regress, Don't Guess -- A Regression-like Loss on Number Tokens for Language Models
por: Zausinger, Jonas, et al.
Publicado: (2024)
por: Zausinger, Jonas, et al.
Publicado: (2024)
Large Language Models Must Be Taught to Know What They Don't Know
por: Kapoor, Sanyam, et al.
Publicado: (2024)
por: Kapoor, Sanyam, et al.
Publicado: (2024)
When Models Don't Collapse: On the Consistency of Iterative MLE
por: Barzilai, Daniel, et al.
Publicado: (2025)
por: Barzilai, Daniel, et al.
Publicado: (2025)
Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment
por: Peng, Fred Zhangzhi, et al.
Publicado: (2026)
por: Peng, Fred Zhangzhi, et al.
Publicado: (2026)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
por: Guo, Phillip, et al.
Publicado: (2024)
por: Guo, Phillip, et al.
Publicado: (2024)
Why Don't You Read This?
por: Chesley, Robert E.
Publicado: (1970)
por: Chesley, Robert E.
Publicado: (1970)
Why Don't They Ask Questions?
por: Swope, Mary Jane, et al.
Publicado: (1972)
por: Swope, Mary Jane, et al.
Publicado: (1972)
Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds
por: Zhang, Jiefu, et al.
Publicado: (2026)
por: Zhang, Jiefu, et al.
Publicado: (2026)
Don't Outsource It. Do It!
por: Nuzzo, David
Publicado: (1999)
por: Nuzzo, David
Publicado: (1999)
Don't Forget Imagination!
por: Vityaev, Evgenii E., et al.
Publicado: (2025)
por: Vityaev, Evgenii E., et al.
Publicado: (2025)
Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation
por: Dasgupta, Sayantan, et al.
Publicado: (2026)
por: Dasgupta, Sayantan, et al.
Publicado: (2026)
Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions
por: Pal, Arka, et al.
Publicado: (2025)
por: Pal, Arka, et al.
Publicado: (2025)
Don't Stop Me Now: Embedding Based Scheduling for LLMs
por: Shahout, Rana, et al.
Publicado: (2024)
por: Shahout, Rana, et al.
Publicado: (2024)
Learn and Don't Forget: Adding a New Language to ASR Foundation Models
por: Qian, Mengjie, et al.
Publicado: (2024)
por: Qian, Mengjie, et al.
Publicado: (2024)
Reasoning Models Don't Just Think Longer, They Move Differently
por: Gjølbye, Anders, et al.
Publicado: (2026)
por: Gjølbye, Anders, et al.
Publicado: (2026)
I Don't Know: Explicit Modeling of Uncertainty with an [IDK] Token
por: Cohen, Roi, et al.
Publicado: (2024)
por: Cohen, Roi, et al.
Publicado: (2024)
Attention Is All You Need But You Don't Need All Of It For Inference of Large Language Models
por: Tyukin, Georgy, et al.
Publicado: (2024)
por: Tyukin, Georgy, et al.
Publicado: (2024)
Don't Play Favorites: Minority Guidance for Diffusion Models
por: Um, Soobin, et al.
Publicado: (2023)
por: Um, Soobin, et al.
Publicado: (2023)
Lips Don't Lie: A Case Report
por: Mallika Reddy, et al.
Publicado: (2025)
por: Mallika Reddy, et al.
Publicado: (2025)
Ejemplares similares
-
Why Some Nursing Students Sleep Soundly While Others Don't: Resilience, Reappraisal, and Hidden Profiles
por: Dongmei Chen, et al.
Publicado: (2026) -
Why Some Electric Fish Species Avoid the Moon While Others Don’t: Visual Capacity Shapes Risk Perception
por: Lok Poon, et al.
Publicado: (2025) -
Why They Don't Ask Questions
por: Horn, Roger
Publicado: (1974) -
Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
por: Faria, Gonçalo, et al.
Publicado: (2025) -
Reasoning Models Don't Always Say What They Think
por: Chen, Yanda, et al.
Publicado: (2025)