"They parted illusions -- they parted disclaim marinade": Misalignment as structural fidelity in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Costa, Mariana Lins |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Misaligned by Reward: Socially Undesirable Preferences in LLMs
par: Ghazaryan, Gayane, et autres
Publié: (2026)
par: Ghazaryan, Gayane, et autres
Publié: (2026)
The Ghost in the Grammar: Methodological Anthropomorphism in AI Safety Evaluations
par: Costa, Mariana Lins
Publié: (2026)
par: Costa, Mariana Lins
Publié: (2026)
SteLLA: A Structured Grading System Using LLMs with RAG
par: Qiu, Hefei, et autres
Publié: (2025)
par: Qiu, Hefei, et autres
Publié: (2025)
Assessing the Performance of Human-Capable LLMs -- Are LLMs Coming for Your Job?
par: Mavi, John, et autres
Publié: (2024)
par: Mavi, John, et autres
Publié: (2024)
The simulation of judgment in LLMs
par: Loru, Edoardo, et autres
Publié: (2025)
par: Loru, Edoardo, et autres
Publié: (2025)
Measuring Teaching with LLMs
par: Hardy, Michael
Publié: (2025)
par: Hardy, Michael
Publié: (2025)
The Political Preferences of LLMs
par: Rozado, David
Publié: (2024)
par: Rozado, David
Publié: (2024)
Why are all LLMs Obsessed with Japanese Culture? On the Hidden Cultural and Regional Biases of LLMs
par: de Landa, Joseba Fernandez, et autres
Publié: (2026)
par: de Landa, Joseba Fernandez, et autres
Publié: (2026)
Moral Mazes in the Era of LLMs
par: Nguyen, Dang, et autres
Publié: (2026)
par: Nguyen, Dang, et autres
Publié: (2026)
Are LLMs (Really) Ideological? An IRT-based Analysis and Alignment Tool for Perceived Socio-Economic Bias in LLMs
par: Wachter, Jasmin, et autres
Publié: (2025)
par: Wachter, Jasmin, et autres
Publié: (2025)
Interpretability Framework for LLMs in Undergraduate Calculus
par: Dakshit, Sagnik, et autres
Publié: (2025)
par: Dakshit, Sagnik, et autres
Publié: (2025)
MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning
par: Ghosh, Rajarshi, et autres
Publié: (2025)
par: Ghosh, Rajarshi, et autres
Publié: (2025)
ELEPHANT: Measuring and understanding social sycophancy in LLMs
par: Cheng, Myra, et autres
Publié: (2025)
par: Cheng, Myra, et autres
Publié: (2025)
On the Credibility of Evaluating LLMs using Survey Questions
par: Libovický, Jindřich
Publié: (2026)
par: Libovický, Jindřich
Publié: (2026)
Verbalizing LLMs' assumptions to explain and control sycophancy
par: Cheng, Myra, et autres
Publié: (2026)
par: Cheng, Myra, et autres
Publié: (2026)
EtiCor++: Towards Understanding Etiquettical Bias in LLMs
par: Dwivedi, Ashutosh, et autres
Publié: (2025)
par: Dwivedi, Ashutosh, et autres
Publié: (2025)
EulerESG: Automating ESG Disclosure Analysis with LLMs
par: Ding, Yi, et autres
Publié: (2025)
par: Ding, Yi, et autres
Publié: (2025)
Large Language Models (LLMs) as Agents for Augmented Democracy
par: Gudiño-Rosero, Jairo, et autres
Publié: (2024)
par: Gudiño-Rosero, Jairo, et autres
Publié: (2024)
Automated Assessment of Students' Code Comprehension using LLMs
par: Oli, Priti, et autres
Publié: (2023)
par: Oli, Priti, et autres
Publié: (2023)
Evaluating the Capabilities of LLMs for Supporting Anticipatory Impact Assessment
par: Allaham, Mowafak, et autres
Publié: (2024)
par: Allaham, Mowafak, et autres
Publié: (2024)
Explore the Potential of LLMs in Misinformation Detection: An Empirical Study
par: Chen, Mengyang, et autres
Publié: (2023)
par: Chen, Mengyang, et autres
Publié: (2023)
Perceived Political Bias in LLMs Reduces Persuasive Abilities
par: DiGiuseppe, Matthew, et autres
Publié: (2026)
par: DiGiuseppe, Matthew, et autres
Publié: (2026)
Evaluating Cultural Awareness of LLMs for Yoruba, Malayalam, and English
par: Dawson, Fiifi, et autres
Publié: (2024)
par: Dawson, Fiifi, et autres
Publié: (2024)
Towards Measuring and Modeling "Culture" in LLMs: A Survey
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2024)
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2024)
Fluent but Foreign: Even Regional LLMs Lack Cultural Alignment
par: Agarwal, Dhruv, et autres
Publié: (2025)
par: Agarwal, Dhruv, et autres
Publié: (2025)
HugAgent: Benchmarking LLMs for Simulation of Individualized Human Reasoning
par: Li, Chance Jiajie, et autres
Publié: (2025)
par: Li, Chance Jiajie, et autres
Publié: (2025)
What Is The Political Content in LLMs' Pre- and Post-Training Data?
par: Ceron, Tanise, et autres
Publié: (2025)
par: Ceron, Tanise, et autres
Publié: (2025)
Mitigating Gender Bias via Fostering Exploratory Thinking in LLMs
par: Wei, Kangda, et autres
Publié: (2025)
par: Wei, Kangda, et autres
Publié: (2025)
HumT DumT: Measuring and controlling human-like language in LLMs
par: Cheng, Myra, et autres
Publié: (2025)
par: Cheng, Myra, et autres
Publié: (2025)
The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety
par: Rios-Sialer, Ian
Publié: (2026)
par: Rios-Sialer, Ian
Publié: (2026)
Empathy and the Right to Be an Exception: What LLMs Can and Cannot Do
par: Kidder, William, et autres
Publié: (2024)
par: Kidder, William, et autres
Publié: (2024)
Widespread Gender and Pronoun Bias in Moral Judgments Across LLMs
par: Fernandes, Gustavo Lúcius, et autres
Publié: (2026)
par: Fernandes, Gustavo Lúcius, et autres
Publié: (2026)
Are Rationales Necessary and Sufficient? Tuning LLMs for Explainable Misinformation Detection
par: Wang, Bing, et autres
Publié: (2026)
par: Wang, Bing, et autres
Publié: (2026)
Break the Checkbox: Challenging Closed-Style Evaluations of Cultural Alignment in LLMs
par: Kabir, Mohsinul, et autres
Publié: (2025)
par: Kabir, Mohsinul, et autres
Publié: (2025)
Are LLMs Court-Ready? Evaluating Frontier Models on Indian Legal Reasoning
par: Juvekar, Kush, et autres
Publié: (2025)
par: Juvekar, Kush, et autres
Publié: (2025)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
par: Gao, Zihan, et autres
Publié: (2025)
par: Gao, Zihan, et autres
Publié: (2025)
AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference
par: Yao, Jing, et autres
Publié: (2025)
par: Yao, Jing, et autres
Publié: (2025)
H-Neurons: On the Existence, Impact, and Origin of Hallucination-Associated Neurons in LLMs
par: Gao, Cheng, et autres
Publié: (2025)
par: Gao, Cheng, et autres
Publié: (2025)
Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs
par: Said, Muhammad Abdullahi, et autres
Publié: (2025)
par: Said, Muhammad Abdullahi, et autres
Publié: (2025)
Show, Don't Tell: Uncovering Implicit Character Portrayal using LLMs
par: Jaipersaud, Brandon, et autres
Publié: (2024)
par: Jaipersaud, Brandon, et autres
Publié: (2024)
Documents similaires
-
Misaligned by Reward: Socially Undesirable Preferences in LLMs
par: Ghazaryan, Gayane, et autres
Publié: (2026) -
The Ghost in the Grammar: Methodological Anthropomorphism in AI Safety Evaluations
par: Costa, Mariana Lins
Publié: (2026) -
SteLLA: A Structured Grading System Using LLMs with RAG
par: Qiu, Hefei, et autres
Publié: (2025) -
Assessing the Performance of Human-Capable LLMs -- Are LLMs Coming for Your Job?
par: Mavi, John, et autres
Publié: (2024) -
The simulation of judgment in LLMs
par: Loru, Edoardo, et autres
Publié: (2025)