When Language Models Lose Their Mind: The Consequences of Brain Misalignment
Fuente:
arXiv
Saved in:
| Main Authors: | Merlin, Gabriele, Toneva, Mariya |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Language models and brains align due to more than next-word prediction and word-level information
by: Merlin, Gabriele, et al.
Published: (2022)
by: Merlin, Gabriele, et al.
Published: (2022)
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
by: Moussa, Omer, et al.
Published: (2025)
by: Moussa, Omer, et al.
Published: (2025)
Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain
by: Moussa, Omer, et al.
Published: (2025)
by: Moussa, Omer, et al.
Published: (2025)
Improving Semantic Understanding in Speech Language Models via Brain-tuning
by: Moussa, Omer, et al.
Published: (2024)
by: Moussa, Omer, et al.
Published: (2024)
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
by: Proietti, Michela, et al.
Published: (2025)
by: Proietti, Michela, et al.
Published: (2025)
Tracking Equivalent Mechanistic Interpretations Across Neural Networks
by: Sun, Alan, et al.
Published: (2026)
by: Sun, Alan, et al.
Published: (2026)
Perturbed examples reveal invariances shared by language models
by: Rawal, Ruchit, et al.
Published: (2023)
by: Rawal, Ruchit, et al.
Published: (2023)
Positional Biases Shift as Inputs Approach Context Window Limits
by: Veseli, Blerta, et al.
Published: (2025)
by: Veseli, Blerta, et al.
Published: (2025)
Slimming Down LLMs Without Losing Their Minds
by: Qingda, et al.
Published: (2025)
by: Qingda, et al.
Published: (2025)
Speech language models lack important brain-relevant semantics
by: Oota, Subba Reddy, et al.
Published: (2023)
by: Oota, Subba Reddy, et al.
Published: (2023)
When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation
by: Jiang, Xunyi, et al.
Published: (2025)
by: Jiang, Xunyi, et al.
Published: (2025)
Are Aligned Large Language Models Still Misaligned?
by: Naseem, Usman, et al.
Published: (2026)
by: Naseem, Usman, et al.
Published: (2026)
When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment
by: Yan, Hanqi, et al.
Published: (2025)
by: Yan, Hanqi, et al.
Published: (2025)
Improving the Diproche CNL through Autoformalization via Large Language Models
by: Carl, Merlin
Published: (2023)
by: Carl, Merlin
Published: (2023)
When Attention Closes: How LLMs Lose the Thread in Multi-Turn Interaction
by: Dongre, Vardhan, et al.
Published: (2026)
by: Dongre, Vardhan, et al.
Published: (2026)
The One Where They Brain-Tune for Social Cognition: Multi-Modal Brain-Tuning on Friends
by: Policzer, Nico, et al.
Published: (2025)
by: Policzer, Nico, et al.
Published: (2025)
Using Large Language Models for (De-)Formalization and Natural Argumentation Exercises for Beginner's Students
by: Carl, Merlin
Published: (2023)
by: Carl, Merlin
Published: (2023)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
by: Lyu, Chenyang, et al.
Published: (2024)
by: Lyu, Chenyang, et al.
Published: (2024)
Thesis proposal: Are We Losing Textual Diversity to Natural Language Processing?
by: Jon, Josef
Published: (2024)
by: Jon, Josef
Published: (2024)
Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
by: Wu, Donghang, et al.
Published: (2025)
by: Wu, Donghang, et al.
Published: (2025)
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
by: Chen, Chen, et al.
Published: (2026)
by: Chen, Chen, et al.
Published: (2026)
Mind the Gap: Aligning the Brain with Language Models Requires a Nonlinear and Multimodal Approach
by: Han, Danny Dongyeop, et al.
Published: (2025)
by: Han, Danny Dongyeop, et al.
Published: (2025)
CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion
by: Braunstein, Cameron, et al.
Published: (2025)
by: Braunstein, Cameron, et al.
Published: (2025)
When Should Models Change Their Minds? Contextual Belief Management in Large Language Models
by: Xu, Haoming, et al.
Published: (2026)
by: Xu, Haoming, et al.
Published: (2026)
When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents
by: Ning, Yuting, et al.
Published: (2026)
by: Ning, Yuting, et al.
Published: (2026)
Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?
by: Zhu, Dawei, et al.
Published: (2024)
by: Zhu, Dawei, et al.
Published: (2024)
Beg to Differ: Understanding Reasoning-Answer Misalignment Across Languages
by: Ovalle, Anaelia, et al.
Published: (2025)
by: Ovalle, Anaelia, et al.
Published: (2025)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
by: Soligo, Anna, et al.
Published: (2026)
by: Soligo, Anna, et al.
Published: (2026)
Large Language Models as Model Organisms for Human Associative Learning
by: Kolling, Camila, et al.
Published: (2025)
by: Kolling, Camila, et al.
Published: (2025)
Mind the Motions: Benchmarking Theory-of-Mind in Everyday Body Language
by: Lee, Seungbeen, et al.
Published: (2025)
by: Lee, Seungbeen, et al.
Published: (2025)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
by: Sharma, Aditya, et al.
Published: (2024)
by: Sharma, Aditya, et al.
Published: (2024)
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
by: Shu, Dong, et al.
Published: (2025)
by: Shu, Dong, et al.
Published: (2025)
Don't Lose Focus: Activation Steering via Key-Orthogonal Projections
by: Luo, Haoyan, et al.
Published: (2026)
by: Luo, Haoyan, et al.
Published: (2026)
Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs
by: Vanmassenhove, Eva
Published: (2025)
by: Vanmassenhove, Eva
Published: (2025)
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
by: Fu, Tingchen, et al.
Published: (2025)
by: Fu, Tingchen, et al.
Published: (2025)
Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment
by: Vaugrante, Laurène, et al.
Published: (2026)
by: Vaugrante, Laurène, et al.
Published: (2026)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
by: Panpatil, Siddhant, et al.
Published: (2025)
by: Panpatil, Siddhant, et al.
Published: (2025)
Large Language Models Persuade Without Planning Theory of Mind
by: Moore, Jared, et al.
Published: (2026)
by: Moore, Jared, et al.
Published: (2026)
PsychoLex: Unveiling the Psychological Mind of Large Language Models
by: Abbasi, Mohammad Amin, et al.
Published: (2024)
by: Abbasi, Mohammad Amin, et al.
Published: (2024)
MATA: Mindful Assessment of the Telugu Abilities of Large Language Models
by: Kranti, Chalamalasetti, et al.
Published: (2025)
by: Kranti, Chalamalasetti, et al.
Published: (2025)
Similar Items
-
Language models and brains align due to more than next-word prediction and word-level information
by: Merlin, Gabriele, et al.
Published: (2022) -
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
by: Moussa, Omer, et al.
Published: (2025) -
Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain
by: Moussa, Omer, et al.
Published: (2025) -
Improving Semantic Understanding in Speech Language Models via Brain-tuning
by: Moussa, Omer, et al.
Published: (2024) -
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
by: Proietti, Michela, et al.
Published: (2025)