Why Do Some Language Models Fake Alignment While Others Don't?
Fuente:
arXiv
Salvato in:
| Autori principali: | Sheshadri, Abhay, Hughes, John, Michael, Julian, Mallen, Alex, Jose, Arun, Janus, Roger, Fabien |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Why Some Nursing Students Sleep Soundly While Others Don't: Resilience, Reappraisal, and Hidden Profiles
di: Dongmei Chen, et al.
Pubblicazione: (2026)
di: Dongmei Chen, et al.
Pubblicazione: (2026)
Why Some Electric Fish Species Avoid the Moon While Others Don’t: Visual Capacity Shapes Risk Perception
di: Lok Poon, et al.
Pubblicazione: (2025)
di: Lok Poon, et al.
Pubblicazione: (2025)
Why They Don't Ask Questions
di: Horn, Roger
Pubblicazione: (1974)
di: Horn, Roger
Pubblicazione: (1974)
Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
di: Faria, Gonçalo, et al.
Pubblicazione: (2025)
di: Faria, Gonçalo, et al.
Pubblicazione: (2025)
Reasoning Models Don't Always Say What They Think
di: Chen, Yanda, et al.
Pubblicazione: (2025)
di: Chen, Yanda, et al.
Pubblicazione: (2025)
Do Unlearning Methods Remove Information from Language Model Weights?
di: Deeb, Aghyad, et al.
Pubblicazione: (2024)
di: Deeb, Aghyad, et al.
Pubblicazione: (2024)
Why Don't Prompt-Based Fairness Metrics Correlate?
di: Zayed, Abdelrahman, et al.
Pubblicazione: (2024)
di: Zayed, Abdelrahman, et al.
Pubblicazione: (2024)
The Geometry of Noise: Why Diffusion Models Don't Need Noise Conditioning
di: Sahraee-Ardakan, Mojtaba, et al.
Pubblicazione: (2026)
di: Sahraee-Ardakan, Mojtaba, et al.
Pubblicazione: (2026)
Why Diffusion Models Don't Memorize: The Role of Implicit Dynamical Regularization in Training
di: Bonnaire, Tony, et al.
Pubblicazione: (2025)
di: Bonnaire, Tony, et al.
Pubblicazione: (2025)
Do's and Don'ts: Learning Desirable Skills with Instruction Videos
di: Kim, Hyunseung, et al.
Pubblicazione: (2024)
di: Kim, Hyunseung, et al.
Pubblicazione: (2024)
Experts Don't Cheat: Learning What You Don't Know By Predicting Pairs
di: Johnson, Daniel D., et al.
Pubblicazione: (2024)
di: Johnson, Daniel D., et al.
Pubblicazione: (2024)
Balancing Label Quantity and Quality for Scalable Elicitation
di: Mallen, Alex, et al.
Pubblicazione: (2024)
di: Mallen, Alex, et al.
Pubblicazione: (2024)
A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task
di: Brinkmann, Jannik, et al.
Pubblicazione: (2024)
di: Brinkmann, Jannik, et al.
Pubblicazione: (2024)
Automatically Interpreting Millions of Features in Large Language Models
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
di: Hariri, Mohsen, et al.
Pubblicazione: (2025)
di: Hariri, Mohsen, et al.
Pubblicazione: (2025)
Eliciting Latent Knowledge from Quirky Language Models
di: Mallen, Alex, et al.
Pubblicazione: (2023)
di: Mallen, Alex, et al.
Pubblicazione: (2023)
The Compliance Gap: Why AI Systems Promise to Follow Process Instructions but Don't
di: Shin, Kwan Soo
Pubblicazione: (2026)
di: Shin, Kwan Soo
Pubblicazione: (2026)
If You Don't Understand It, Don't Use It: Eliminating Trojans with Filters Between Layers
di: Hernandez, Adriano
Pubblicazione: (2024)
di: Hernandez, Adriano
Pubblicazione: (2024)
Why Customers Buy (And Why They Don't).
di: Moot, Robert C., et al.
Pubblicazione: (1967)
di: Moot, Robert C., et al.
Pubblicazione: (1967)
Prediction Bottlenecks Don't Discover Causal Structure (But Here's What They Actually Do)
di: Lade, Ankit Hemant, et al.
Pubblicazione: (2026)
di: Lade, Ankit Hemant, et al.
Pubblicazione: (2026)
Steering Language Models with Weight Arithmetic
di: Fierro, Constanza, et al.
Pubblicazione: (2025)
di: Fierro, Constanza, et al.
Pubblicazione: (2025)
Regress, Don't Guess -- A Regression-like Loss on Number Tokens for Language Models
di: Zausinger, Jonas, et al.
Pubblicazione: (2024)
di: Zausinger, Jonas, et al.
Pubblicazione: (2024)
Large Language Models Must Be Taught to Know What They Don't Know
di: Kapoor, Sanyam, et al.
Pubblicazione: (2024)
di: Kapoor, Sanyam, et al.
Pubblicazione: (2024)
When Models Don't Collapse: On the Consistency of Iterative MLE
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment
di: Peng, Fred Zhangzhi, et al.
Pubblicazione: (2026)
di: Peng, Fred Zhangzhi, et al.
Pubblicazione: (2026)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
di: Guo, Phillip, et al.
Pubblicazione: (2024)
di: Guo, Phillip, et al.
Pubblicazione: (2024)
Why Don't You Read This?
di: Chesley, Robert E.
Pubblicazione: (1970)
di: Chesley, Robert E.
Pubblicazione: (1970)
Why Don't They Ask Questions?
di: Swope, Mary Jane, et al.
Pubblicazione: (1972)
di: Swope, Mary Jane, et al.
Pubblicazione: (1972)
Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds
di: Zhang, Jiefu, et al.
Pubblicazione: (2026)
di: Zhang, Jiefu, et al.
Pubblicazione: (2026)
Don't Outsource It. Do It!
di: Nuzzo, David
Pubblicazione: (1999)
di: Nuzzo, David
Pubblicazione: (1999)
Don't Forget Imagination!
di: Vityaev, Evgenii E., et al.
Pubblicazione: (2025)
di: Vityaev, Evgenii E., et al.
Pubblicazione: (2025)
Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation
di: Dasgupta, Sayantan, et al.
Pubblicazione: (2026)
di: Dasgupta, Sayantan, et al.
Pubblicazione: (2026)
Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions
di: Pal, Arka, et al.
Pubblicazione: (2025)
di: Pal, Arka, et al.
Pubblicazione: (2025)
Don't Stop Me Now: Embedding Based Scheduling for LLMs
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
Learn and Don't Forget: Adding a New Language to ASR Foundation Models
di: Qian, Mengjie, et al.
Pubblicazione: (2024)
di: Qian, Mengjie, et al.
Pubblicazione: (2024)
Reasoning Models Don't Just Think Longer, They Move Differently
di: Gjølbye, Anders, et al.
Pubblicazione: (2026)
di: Gjølbye, Anders, et al.
Pubblicazione: (2026)
I Don't Know: Explicit Modeling of Uncertainty with an [IDK] Token
di: Cohen, Roi, et al.
Pubblicazione: (2024)
di: Cohen, Roi, et al.
Pubblicazione: (2024)
Attention Is All You Need But You Don't Need All Of It For Inference of Large Language Models
di: Tyukin, Georgy, et al.
Pubblicazione: (2024)
di: Tyukin, Georgy, et al.
Pubblicazione: (2024)
Don't Play Favorites: Minority Guidance for Diffusion Models
di: Um, Soobin, et al.
Pubblicazione: (2023)
di: Um, Soobin, et al.
Pubblicazione: (2023)
Lips Don't Lie: A Case Report
di: Mallika Reddy, et al.
Pubblicazione: (2025)
di: Mallika Reddy, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Why Some Nursing Students Sleep Soundly While Others Don't: Resilience, Reappraisal, and Hidden Profiles
di: Dongmei Chen, et al.
Pubblicazione: (2026) -
Why Some Electric Fish Species Avoid the Moon While Others Don’t: Visual Capacity Shapes Risk Perception
di: Lok Poon, et al.
Pubblicazione: (2025) -
Why They Don't Ask Questions
di: Horn, Roger
Pubblicazione: (1974) -
Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
di: Faria, Gonçalo, et al.
Pubblicazione: (2025) -
Reasoning Models Don't Always Say What They Think
di: Chen, Yanda, et al.
Pubblicazione: (2025)