Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Denison, Carson, MacDiarmid, Monte, Barez, Fazl, Duvenaud, David, Kravec, Shauna, Marks, Samuel, Schiefer, Nicholas, Soklaski, Ryan, Tamkin, Alex, Kaplan, Jared, Shlegeris, Buck, Bowman, Samuel R., Perez, Ethan, Hubinger, Evan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Alignment faking in large language models
por: Greenblatt, Ryan, et al.
Publicado: (2024)
por: Greenblatt, Ryan, et al.
Publicado: (2024)
Sabotage Evaluations for Frontier Models
por: Benton, Joe, et al.
Publicado: (2024)
por: Benton, Joe, et al.
Publicado: (2024)
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
por: Hubinger, Evan, et al.
Publicado: (2024)
por: Hubinger, Evan, et al.
Publicado: (2024)
Towards Understanding Sycophancy in Language Models
por: Sharma, Mrinank, et al.
Publicado: (2023)
por: Sharma, Mrinank, et al.
Publicado: (2023)
Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders
por: Marks, Luke, et al.
Publicado: (2024)
por: Marks, Luke, et al.
Publicado: (2024)
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
por: Chaudhary, Maheep, et al.
Publicado: (2025)
por: Chaudhary, Maheep, et al.
Publicado: (2025)
Understanding Addition in Transformers
por: Quirke, Philip, et al.
Publicado: (2023)
por: Quirke, Philip, et al.
Publicado: (2023)
Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustness
por: Fu, Tingchen, et al.
Publicado: (2025)
por: Fu, Tingchen, et al.
Publicado: (2025)
A Post‐Pandemic Bail System: Lessons Learned From Supervising Accused During Covid‐19
por: Laura MacDiarmid, et al.
Publicado: (2025)
por: Laura MacDiarmid, et al.
Publicado: (2025)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
por: Oozeer, Narmeen, et al.
Publicado: (2025)
por: Oozeer, Narmeen, et al.
Publicado: (2025)
Natural Emergent Misalignment from Reward Hacking in Production RL
por: MacDiarmid, Monte, et al.
Publicado: (2025)
por: MacDiarmid, Monte, et al.
Publicado: (2025)
Query Circuits: Explaining How Language Models Answer User Prompts
por: Wu, Tung-Yu, et al.
Publicado: (2025)
por: Wu, Tung-Yu, et al.
Publicado: (2025)
Embodied AI: Emerging Risks and Opportunities for Policy Action
por: Perlo, Jared, et al.
Publicado: (2025)
por: Perlo, Jared, et al.
Publicado: (2025)
Scottish meat consumption survey (Feb–Jul 2023): attitudes, COM-B measures, and perceived effectiveness of meat-reduction policies (Best-Worst Scaling)
por: McBey, David, et al.
Publicado: (2026)
por: McBey, David, et al.
Publicado: (2026)
Rethinking AI Cultural Alignment
por: Bravansky, Michal, et al.
Publicado: (2025)
por: Bravansky, Michal, et al.
Publicado: (2025)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
por: Lan, Michael, et al.
Publicado: (2023)
por: Lan, Michael, et al.
Publicado: (2023)
Understanding Addition and Subtraction in Transformers
por: Quirke, Philip, et al.
Publicado: (2024)
por: Quirke, Philip, et al.
Publicado: (2024)
Pseudoscience, Subterfuge, and Civil Resistance
por: ALAN B. COHEN
Publicado: (2025)
por: ALAN B. COHEN
Publicado: (2025)
Token Taxes: mitigating AGI's economic risks
por: Irwin, Lucas, et al.
Publicado: (2026)
por: Irwin, Lucas, et al.
Publicado: (2026)
Large Language Models Relearn Removed Concepts
por: Lo, Michelle, et al.
Publicado: (2024)
por: Lo, Michelle, et al.
Publicado: (2024)
VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
por: Gupta, Aman, et al.
Publicado: (2025)
por: Gupta, Aman, et al.
Publicado: (2025)
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
por: Neo, Clement, et al.
Publicado: (2024)
por: Neo, Clement, et al.
Publicado: (2024)
Steering Language Models With Activation Engineering
por: Turner, Alexander Matt, et al.
Publicado: (2023)
por: Turner, Alexander Matt, et al.
Publicado: (2023)
Do Sparse Autoencoders Generalize? A Case Study of Answerability
por: Heindrich, Lovis, et al.
Publicado: (2025)
por: Heindrich, Lovis, et al.
Publicado: (2025)
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
por: Schrodi, Simon, et al.
Publicado: (2025)
por: Schrodi, Simon, et al.
Publicado: (2025)
Visualizing Neural Network Imagination
por: Wichers, Nevan, et al.
Publicado: (2024)
por: Wichers, Nevan, et al.
Publicado: (2024)
Interpreting Learned Feedback Patterns in Large Language Models
por: Marks, Luke, et al.
Publicado: (2023)
por: Marks, Luke, et al.
Publicado: (2023)
Reasoning Models Don't Always Say What They Think
por: Chen, Yanda, et al.
Publicado: (2025)
por: Chen, Yanda, et al.
Publicado: (2025)
Auditing language models for hidden objectives
por: Marks, Samuel, et al.
Publicado: (2025)
por: Marks, Samuel, et al.
Publicado: (2025)
Das Berlin Max Webers
por: Aldenhoff-Hübinger, Rita, et al.
Publicado: (2026)
por: Aldenhoff-Hübinger, Rita, et al.
Publicado: (2026)
AI Control: Improving Safety Despite Intentional Subversion
por: Greenblatt, Ryan, et al.
Publicado: (2023)
por: Greenblatt, Ryan, et al.
Publicado: (2023)
Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols
por: Griffin, Charlie, et al.
Publicado: (2024)
por: Griffin, Charlie, et al.
Publicado: (2024)
How to evaluate control measures for LLM agents? A trajectory from today to superintelligence
por: Korbak, Tomek, et al.
Publicado: (2025)
por: Korbak, Tomek, et al.
Publicado: (2025)
Trust Me, I'm Wrong: LLMs Hallucinate with Certainty Despite Knowing the Answer
por: Simhi, Adi, et al.
Publicado: (2025)
por: Simhi, Adi, et al.
Publicado: (2025)
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
por: Oldfield, James, et al.
Publicado: (2025)
por: Oldfield, James, et al.
Publicado: (2025)
Chain-of-Thought Hijacking
por: Zhao, Jianli, et al.
Publicado: (2025)
por: Zhao, Jianli, et al.
Publicado: (2025)
AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation
por: Li, Changyi, et al.
Publicado: (2026)
por: Li, Changyi, et al.
Publicado: (2026)
Scaling sparse feature circuit finding for in-context learning
por: Kharlapenko, Dmitrii, et al.
Publicado: (2025)
por: Kharlapenko, Dmitrii, et al.
Publicado: (2025)
Language models are better than humans at next-token prediction
por: Shlegeris, Buck, et al.
Publicado: (2022)
por: Shlegeris, Buck, et al.
Publicado: (2022)
Gradient-Based Language Model Red Teaming
por: Wichers, Nevan, et al.
Publicado: (2024)
por: Wichers, Nevan, et al.
Publicado: (2024)
Ejemplares similares
-
Alignment faking in large language models
por: Greenblatt, Ryan, et al.
Publicado: (2024) -
Sabotage Evaluations for Frontier Models
por: Benton, Joe, et al.
Publicado: (2024) -
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
por: Hubinger, Evan, et al.
Publicado: (2024) -
Towards Understanding Sycophancy in Language Models
por: Sharma, Mrinank, et al.
Publicado: (2023) -
Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders
por: Marks, Luke, et al.
Publicado: (2024)