When Language Models Lose Their Mind: The Consequences of Brain Misalignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Merlin, Gabriele, Toneva, Mariya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Language models and brains align due to more than next-word prediction and word-level information
por: Merlin, Gabriele, et al.
Publicado: (2022)
por: Merlin, Gabriele, et al.
Publicado: (2022)
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
por: Moussa, Omer, et al.
Publicado: (2025)
por: Moussa, Omer, et al.
Publicado: (2025)
Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain
por: Moussa, Omer, et al.
Publicado: (2025)
por: Moussa, Omer, et al.
Publicado: (2025)
Improving Semantic Understanding in Speech Language Models via Brain-tuning
por: Moussa, Omer, et al.
Publicado: (2024)
por: Moussa, Omer, et al.
Publicado: (2024)
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
por: Proietti, Michela, et al.
Publicado: (2025)
por: Proietti, Michela, et al.
Publicado: (2025)
Tracking Equivalent Mechanistic Interpretations Across Neural Networks
por: Sun, Alan, et al.
Publicado: (2026)
por: Sun, Alan, et al.
Publicado: (2026)
Perturbed examples reveal invariances shared by language models
por: Rawal, Ruchit, et al.
Publicado: (2023)
por: Rawal, Ruchit, et al.
Publicado: (2023)
Positional Biases Shift as Inputs Approach Context Window Limits
por: Veseli, Blerta, et al.
Publicado: (2025)
por: Veseli, Blerta, et al.
Publicado: (2025)
Slimming Down LLMs Without Losing Their Minds
por: Qingda, et al.
Publicado: (2025)
por: Qingda, et al.
Publicado: (2025)
Speech language models lack important brain-relevant semantics
por: Oota, Subba Reddy, et al.
Publicado: (2023)
por: Oota, Subba Reddy, et al.
Publicado: (2023)
When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation
por: Jiang, Xunyi, et al.
Publicado: (2025)
por: Jiang, Xunyi, et al.
Publicado: (2025)
Are Aligned Large Language Models Still Misaligned?
por: Naseem, Usman, et al.
Publicado: (2026)
por: Naseem, Usman, et al.
Publicado: (2026)
When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment
por: Yan, Hanqi, et al.
Publicado: (2025)
por: Yan, Hanqi, et al.
Publicado: (2025)
Improving the Diproche CNL through Autoformalization via Large Language Models
por: Carl, Merlin
Publicado: (2023)
por: Carl, Merlin
Publicado: (2023)
When Attention Closes: How LLMs Lose the Thread in Multi-Turn Interaction
por: Dongre, Vardhan, et al.
Publicado: (2026)
por: Dongre, Vardhan, et al.
Publicado: (2026)
The One Where They Brain-Tune for Social Cognition: Multi-Modal Brain-Tuning on Friends
por: Policzer, Nico, et al.
Publicado: (2025)
por: Policzer, Nico, et al.
Publicado: (2025)
Using Large Language Models for (De-)Formalization and Natural Argumentation Exercises for Beginner's Students
por: Carl, Merlin
Publicado: (2023)
por: Carl, Merlin
Publicado: (2023)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
por: Lyu, Chenyang, et al.
Publicado: (2024)
por: Lyu, Chenyang, et al.
Publicado: (2024)
Thesis proposal: Are We Losing Textual Diversity to Natural Language Processing?
por: Jon, Josef
Publicado: (2024)
por: Jon, Josef
Publicado: (2024)
Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
por: Wu, Donghang, et al.
Publicado: (2025)
por: Wu, Donghang, et al.
Publicado: (2025)
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
por: Chen, Chen, et al.
Publicado: (2026)
por: Chen, Chen, et al.
Publicado: (2026)
Mind the Gap: Aligning the Brain with Language Models Requires a Nonlinear and Multimodal Approach
por: Han, Danny Dongyeop, et al.
Publicado: (2025)
por: Han, Danny Dongyeop, et al.
Publicado: (2025)
CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion
por: Braunstein, Cameron, et al.
Publicado: (2025)
por: Braunstein, Cameron, et al.
Publicado: (2025)
When Should Models Change Their Minds? Contextual Belief Management in Large Language Models
por: Xu, Haoming, et al.
Publicado: (2026)
por: Xu, Haoming, et al.
Publicado: (2026)
When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents
por: Ning, Yuting, et al.
Publicado: (2026)
por: Ning, Yuting, et al.
Publicado: (2026)
Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?
por: Zhu, Dawei, et al.
Publicado: (2024)
por: Zhu, Dawei, et al.
Publicado: (2024)
Beg to Differ: Understanding Reasoning-Answer Misalignment Across Languages
por: Ovalle, Anaelia, et al.
Publicado: (2025)
por: Ovalle, Anaelia, et al.
Publicado: (2025)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
por: Soligo, Anna, et al.
Publicado: (2026)
por: Soligo, Anna, et al.
Publicado: (2026)
Large Language Models as Model Organisms for Human Associative Learning
por: Kolling, Camila, et al.
Publicado: (2025)
por: Kolling, Camila, et al.
Publicado: (2025)
Mind the Motions: Benchmarking Theory-of-Mind in Everyday Body Language
por: Lee, Seungbeen, et al.
Publicado: (2025)
por: Lee, Seungbeen, et al.
Publicado: (2025)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
por: Sharma, Aditya, et al.
Publicado: (2024)
por: Sharma, Aditya, et al.
Publicado: (2024)
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
por: Shu, Dong, et al.
Publicado: (2025)
por: Shu, Dong, et al.
Publicado: (2025)
Don't Lose Focus: Activation Steering via Key-Orthogonal Projections
por: Luo, Haoyan, et al.
Publicado: (2026)
por: Luo, Haoyan, et al.
Publicado: (2026)
Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs
por: Vanmassenhove, Eva
Publicado: (2025)
por: Vanmassenhove, Eva
Publicado: (2025)
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
por: Fu, Tingchen, et al.
Publicado: (2025)
por: Fu, Tingchen, et al.
Publicado: (2025)
Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment
por: Vaugrante, Laurène, et al.
Publicado: (2026)
por: Vaugrante, Laurène, et al.
Publicado: (2026)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
por: Panpatil, Siddhant, et al.
Publicado: (2025)
por: Panpatil, Siddhant, et al.
Publicado: (2025)
Large Language Models Persuade Without Planning Theory of Mind
por: Moore, Jared, et al.
Publicado: (2026)
por: Moore, Jared, et al.
Publicado: (2026)
PsychoLex: Unveiling the Psychological Mind of Large Language Models
por: Abbasi, Mohammad Amin, et al.
Publicado: (2024)
por: Abbasi, Mohammad Amin, et al.
Publicado: (2024)
MATA: Mindful Assessment of the Telugu Abilities of Large Language Models
por: Kranti, Chalamalasetti, et al.
Publicado: (2025)
por: Kranti, Chalamalasetti, et al.
Publicado: (2025)
Ejemplares similares
-
Language models and brains align due to more than next-word prediction and word-level information
por: Merlin, Gabriele, et al.
Publicado: (2022) -
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
por: Moussa, Omer, et al.
Publicado: (2025) -
Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain
por: Moussa, Omer, et al.
Publicado: (2025) -
Improving Semantic Understanding in Speech Language Models via Brain-tuning
por: Moussa, Omer, et al.
Publicado: (2024) -
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
por: Proietti, Michela, et al.
Publicado: (2025)