Probing Ethical Framework Representations in Large Language Models: Structure, Entanglement, and Methodological Challenges
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Weilun, Rusnak, Alexander, Kaplan, Frederic |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HAECcity: Open-Vocabulary Scene Understanding of City-Scale Point Clouds with Superpoint Graph Clustering
by: Rusnak, Alexander, et al.
Published: (2025)
by: Rusnak, Alexander, et al.
Published: (2025)
Probing Multimodal Large Language Models for Global and Local Semantic Representations
by: Tao, Mingxu, et al.
Published: (2024)
by: Tao, Mingxu, et al.
Published: (2024)
Emergent Hierarchical Structure in Large Language Models: An Information-Theoretic Framework for Multi-Scale Representation
by: Zhang, Yukin, et al.
Published: (2025)
by: Zhang, Yukin, et al.
Published: (2025)
On the Tip of the Tongue: Analyzing Conceptual Representation in Large Language Models with Reverse-Dictionary Probe
by: Xu, Ningyu, et al.
Published: (2024)
by: Xu, Ningyu, et al.
Published: (2024)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
by: Xu, Ningyu, et al.
Published: (2026)
by: Xu, Ningyu, et al.
Published: (2026)
Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models
by: Lian, Jiawei, et al.
Published: (2025)
by: Lian, Jiawei, et al.
Published: (2025)
The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models
by: Jamshidi, Saeid, et al.
Published: (2025)
by: Jamshidi, Saeid, et al.
Published: (2025)
Moral Persuasion in Large Language Models: Evaluating Susceptibility and Ethical Alignment
by: Huang, Allison, et al.
Published: (2024)
by: Huang, Allison, et al.
Published: (2024)
When Large Language Models Meet Law: Dual-Lens Taxonomy, Technical Advances, and Ethical Governance
by: Shao, Peizhang, et al.
Published: (2025)
by: Shao, Peizhang, et al.
Published: (2025)
Probing Neural Topology of Large Language Models
by: Zheng, Yu, et al.
Published: (2025)
by: Zheng, Yu, et al.
Published: (2025)
Probing Causality Manipulation of Large Language Models
by: Zhang, Chenyang, et al.
Published: (2024)
by: Zhang, Chenyang, et al.
Published: (2024)
SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth
by: Xing, Wenpeng, et al.
Published: (2025)
by: Xing, Wenpeng, et al.
Published: (2025)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
by: Wang, Jiahao, et al.
Published: (2025)
by: Wang, Jiahao, et al.
Published: (2025)
The Only Way is Ethics: A Guide to Ethical Research with Large Language Models
by: Ungless, Eddie L., et al.
Published: (2024)
by: Ungless, Eddie L., et al.
Published: (2024)
H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models
by: Dawes, Cutter, et al.
Published: (2026)
by: Dawes, Cutter, et al.
Published: (2026)
RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
by: Jin, Ruihan, et al.
Published: (2025)
by: Jin, Ruihan, et al.
Published: (2025)
How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles
by: Kuai, Chenchen, et al.
Published: (2026)
by: Kuai, Chenchen, et al.
Published: (2026)
Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison
by: Jeong, Jihoon
Published: (2026)
by: Jeong, Jihoon
Published: (2026)
Leveraging Graph Structures and Large Language Models for End-to-End Synthetic Task-Oriented Dialogues
by: Medjad, Maya, et al.
Published: (2025)
by: Medjad, Maya, et al.
Published: (2025)
"Pull or Not to Pull?'': Investigating Moral Biases in Leading Large Language Models Across Ethical Dilemmas
by: Ding, Junchen, et al.
Published: (2025)
by: Ding, Junchen, et al.
Published: (2025)
Fortifying Ethical Boundaries in AI: Advanced Strategies for Enhancing Security in Large Language Models
by: He, Yunhong, et al.
Published: (2024)
by: He, Yunhong, et al.
Published: (2024)
Probing the Robustness of Theory of Mind in Large Language Models
by: Nickel, Christian, et al.
Published: (2024)
by: Nickel, Christian, et al.
Published: (2024)
Probing the Difficulty Perception Mechanism of Large Language Models
by: Lee, Sunbowen, et al.
Published: (2025)
by: Lee, Sunbowen, et al.
Published: (2025)
Towards Explainable Temporal Reasoning in Large Language Models: A Structure-Aware Generative Framework
by: Jiang, Zihao, et al.
Published: (2025)
by: Jiang, Zihao, et al.
Published: (2025)
Assisted Debate Builder with Large Language Models
by: Faugier, Elliot, et al.
Published: (2024)
by: Faugier, Elliot, et al.
Published: (2024)
Can Large Language Models Generate Effective Datasets for Emotion Recognition in Conversations?
by: Kaplan, Burak Can, et al.
Published: (2025)
by: Kaplan, Burak Can, et al.
Published: (2025)
Evaluation Methodology for Large Language Models for Multilingual Document Question and Answer
by: Kahana, Adar, et al.
Published: (2024)
by: Kahana, Adar, et al.
Published: (2024)
Methodology of Adapting Large English Language Models for Specific Cultural Contexts
by: Zhang, Wenjing, et al.
Published: (2024)
by: Zhang, Wenjing, et al.
Published: (2024)
Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models
by: Mohammadi, Seyedali, et al.
Published: (2026)
by: Mohammadi, Seyedali, et al.
Published: (2026)
Stuck in the Matrix: Probing Spatial Reasoning in Large Language Models
by: Bai, Maggie, et al.
Published: (2025)
by: Bai, Maggie, et al.
Published: (2025)
Neural Probe-Based Hallucination Detection for Large Language Models
by: Liang, Shize, et al.
Published: (2025)
by: Liang, Shize, et al.
Published: (2025)
Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models
by: Feng, Yijun
Published: (2025)
by: Feng, Yijun
Published: (2025)
Legal Evalutions and Challenges of Large Language Models
by: Wang, Jiaqi, et al.
Published: (2024)
by: Wang, Jiaqi, et al.
Published: (2024)
Challenges and Responses in the Practice of Large Language Models
by: Zhu, Hongyin
Published: (2024)
by: Zhu, Hongyin
Published: (2024)
PRISM: A Methodology for Auditing Biases in Large Language Models
by: Azzopardi, Leif, et al.
Published: (2024)
by: Azzopardi, Leif, et al.
Published: (2024)
Exploring Large Language Models on Cross-Cultural Values in Connection with Training Methodology
by: Kim, Minsang, et al.
Published: (2024)
by: Kim, Minsang, et al.
Published: (2024)
Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models
by: Cho, Seong Hah, et al.
Published: (2026)
by: Cho, Seong Hah, et al.
Published: (2026)
Context Structure Reshapes the Representational Geometry of Language Models
by: Hosseini, Eghbal A., et al.
Published: (2026)
by: Hosseini, Eghbal A., et al.
Published: (2026)
Analysis and Visualization of Linguistic Structures in Large Language Models: Neural Representations of Verb-Particle Constructions in BERT
by: Kissane, Hassane, et al.
Published: (2024)
by: Kissane, Hassane, et al.
Published: (2024)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
by: Zhu, Kaijie, et al.
Published: (2024)
by: Zhu, Kaijie, et al.
Published: (2024)
Similar Items
-
HAECcity: Open-Vocabulary Scene Understanding of City-Scale Point Clouds with Superpoint Graph Clustering
by: Rusnak, Alexander, et al.
Published: (2025) -
Probing Multimodal Large Language Models for Global and Local Semantic Representations
by: Tao, Mingxu, et al.
Published: (2024) -
Emergent Hierarchical Structure in Large Language Models: An Information-Theoretic Framework for Multi-Scale Representation
by: Zhang, Yukin, et al.
Published: (2025) -
On the Tip of the Tongue: Analyzing Conceptual Representation in Large Language Models with Reverse-Dictionary Probe
by: Xu, Ningyu, et al.
Published: (2024) -
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
by: Xu, Ningyu, et al.
Published: (2026)