Pressure Reveals Character: Behavioural Alignment Evaluation at Depth
Fuente:
arXiv
Salvato in:
| Autori principali: | Petrova, Nora, Burden, John |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Missing Red Line: How Commercial Pressure Erodes AI Safety Boundaries
di: Petrova, Nora, et al.
Pubblicazione: (2026)
di: Petrova, Nora, et al.
Pubblicazione: (2026)
Evaluating AI Evaluation: Perils and Prospects
di: Burden, John
Pubblicazione: (2024)
di: Burden, John
Pubblicazione: (2024)
Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework
di: Petrova, Nora, et al.
Pubblicazione: (2026)
di: Petrova, Nora, et al.
Pubblicazione: (2026)
I Spy With My Model's Eye: Visual Search as a Behavioural Test for MLLMs
di: Burden, John, et al.
Pubblicazione: (2025)
di: Burden, John, et al.
Pubblicazione: (2025)
Paradigms of AI Evaluation: Mapping Goals, Methodologies and Culture
di: Burden, John, et al.
Pubblicazione: (2025)
di: Burden, John, et al.
Pubblicazione: (2025)
Framing the Game: How Context Shapes LLM Decision-Making
di: Robinson, Isaac, et al.
Pubblicazione: (2025)
di: Robinson, Isaac, et al.
Pubblicazione: (2025)
Stress-Testing Model Specs Reveals Character Differences among Language Models
di: Zhang, Jifan, et al.
Pubblicazione: (2025)
di: Zhang, Jifan, et al.
Pubblicazione: (2025)
Empirical Evaluation of the Implicit Hitting Set Approach for Weighted CSPs
di: Petrova, Aleksandra, et al.
Pubblicazione: (2025)
di: Petrova, Aleksandra, et al.
Pubblicazione: (2025)
Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
di: Zhang, Jiawei, et al.
Pubblicazione: (2025)
di: Zhang, Jiawei, et al.
Pubblicazione: (2025)
Token Alignment via Character Matching for Subword Completion
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)
Conversational Complexity for Assessing Risk in Large Language Models
di: Burden, John, et al.
Pubblicazione: (2024)
di: Burden, John, et al.
Pubblicazione: (2024)
Behavioural Analysis of Alignment Faking
di: Hadida, Nathaniel Mitrani, et al.
Pubblicazione: (2026)
di: Hadida, Nathaniel Mitrani, et al.
Pubblicazione: (2026)
From Abstract to Actionable: Pairwise Shapley Values for Explainable AI
di: Xu, Jiaxin, et al.
Pubblicazione: (2025)
di: Xu, Jiaxin, et al.
Pubblicazione: (2025)
Inferring Capabilities from Task Performance with Bayesian Triangulation
di: Burden, John, et al.
Pubblicazione: (2023)
di: Burden, John, et al.
Pubblicazione: (2023)
BehAVE: Behaviour Alignment of Video Game Encodings
di: Rašajski, Nemanja, et al.
Pubblicazione: (2024)
di: Rašajski, Nemanja, et al.
Pubblicazione: (2024)
Anytime Cooperative Implicit Hitting Set Solving
di: Rollón, Emma, et al.
Pubblicazione: (2025)
di: Rollón, Emma, et al.
Pubblicazione: (2025)
Evaluating Stability of Unreflective Alignment
di: Lucassen, James, et al.
Pubblicazione: (2024)
di: Lucassen, James, et al.
Pubblicazione: (2024)
From Stories to Cities to Games: A Qualitative Evaluation of Behaviour Planning
di: Abdelwahed, Mustafa F., et al.
Pubblicazione: (2026)
di: Abdelwahed, Mustafa F., et al.
Pubblicazione: (2026)
Towards Generalisable Imitation Learning Through Conditioned Transition Estimation and Online Behaviour Alignment
di: Gavenski, Nathan, et al.
Pubblicazione: (2026)
di: Gavenski, Nathan, et al.
Pubblicazione: (2026)
Alignment Revisited: Are Large Language Models Consistent in Stated and Revealed Preferences?
di: Gu, Zhuojun, et al.
Pubblicazione: (2025)
di: Gu, Zhuojun, et al.
Pubblicazione: (2025)
Entropy-Aware Structural Alignment for Zero-Shot Handwritten Chinese Character Recognition
di: Luo, Qiuming, et al.
Pubblicazione: (2026)
di: Luo, Qiuming, et al.
Pubblicazione: (2026)
Why Deep Jacobian Spectra Separate: Depth-Induced Scaling and Singular-Vector Alignment
di: Haas, Nathanaël, et al.
Pubblicazione: (2026)
di: Haas, Nathanaël, et al.
Pubblicazione: (2026)
Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior
di: Ali, Dalia, et al.
Pubblicazione: (2025)
di: Ali, Dalia, et al.
Pubblicazione: (2025)
CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual Worlds
di: Wang, Lei, et al.
Pubblicazione: (2024)
di: Wang, Lei, et al.
Pubblicazione: (2024)
Evaluating Cognitive Age Alignment in Interactive AI Agents
di: Shen, Yifan, et al.
Pubblicazione: (2026)
di: Shen, Yifan, et al.
Pubblicazione: (2026)
A Revealed Preference Framework for AI Alignment
di: Suleymanov, Elchin
Pubblicazione: (2026)
di: Suleymanov, Elchin
Pubblicazione: (2026)
Interactive AI Alignment: Specification, Process, and Evaluation Alignment
di: Terry, Michael, et al.
Pubblicazione: (2023)
di: Terry, Michael, et al.
Pubblicazione: (2023)
Beyond Ethical Alignment: Evaluating LLMs as Artificial Moral Assistants
di: Galatolo, Alessio, et al.
Pubblicazione: (2025)
di: Galatolo, Alessio, et al.
Pubblicazione: (2025)
An Evaluation of Cultural Value Alignment in LLM
di: Sukiennik, Nicholas, et al.
Pubblicazione: (2025)
di: Sukiennik, Nicholas, et al.
Pubblicazione: (2025)
Pluralistic Off-policy Evaluation and Alignment
di: Huang, Chengkai, et al.
Pubblicazione: (2025)
di: Huang, Chengkai, et al.
Pubblicazione: (2025)
Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models
di: Nair, Inderjeet, et al.
Pubblicazione: (2026)
di: Nair, Inderjeet, et al.
Pubblicazione: (2026)
StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall
di: Wu, Yerong, et al.
Pubblicazione: (2026)
di: Wu, Yerong, et al.
Pubblicazione: (2026)
Behaviour Distillation
di: Lupu, Andrei, et al.
Pubblicazione: (2024)
di: Lupu, Andrei, et al.
Pubblicazione: (2024)
If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs
di: Fan, Siqi, et al.
Pubblicazione: (2025)
di: Fan, Siqi, et al.
Pubblicazione: (2025)
Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective
di: Osooli, Hamid, et al.
Pubblicazione: (2026)
di: Osooli, Hamid, et al.
Pubblicazione: (2026)
Learning to Align: Addressing Character Frequency Distribution Shifts in Handwritten Text Recognition
di: Kaliosis, Panagiotis, et al.
Pubblicazione: (2025)
di: Kaliosis, Panagiotis, et al.
Pubblicazione: (2025)
Geometric Analysis of Token Selection in Multi-Head Attention
di: Mudarisov, Timur, et al.
Pubblicazione: (2026)
di: Mudarisov, Timur, et al.
Pubblicazione: (2026)
From Language Models over Tokens to Language Models over Characters
di: Vieira, Tim, et al.
Pubblicazione: (2024)
di: Vieira, Tim, et al.
Pubblicazione: (2024)
CharCom: Composable Identity Control for Multi-Character Story Illustration
di: Wang, Zhongsheng, et al.
Pubblicazione: (2025)
di: Wang, Zhongsheng, et al.
Pubblicazione: (2025)
Evaluating LLM Alignment With Human Trust Models
di: Debnath, Anushka, et al.
Pubblicazione: (2026)
di: Debnath, Anushka, et al.
Pubblicazione: (2026)
Documenti analoghi
-
The Missing Red Line: How Commercial Pressure Erodes AI Safety Boundaries
di: Petrova, Nora, et al.
Pubblicazione: (2026) -
Evaluating AI Evaluation: Perils and Prospects
di: Burden, John
Pubblicazione: (2024) -
Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework
di: Petrova, Nora, et al.
Pubblicazione: (2026) -
I Spy With My Model's Eye: Visual Search as a Behavioural Test for MLLMs
di: Burden, John, et al.
Pubblicazione: (2025) -
Paradigms of AI Evaluation: Mapping Goals, Methodologies and Culture
di: Burden, John, et al.
Pubblicazione: (2025)