In Machina N400: Pinpointing Where a Causal Language Model Detects Semantic Violations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zacharopoulos, Christos-Nikolaos, Kyriakoglou, Revekka |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Decoding Emergent Big Five Traits in Large Language Models: Temperature-Dependent Expression and Architectural Clustering
par: Zacharopoulos, Christos-Nikolaos, et autres
Publié: (2025)
par: Zacharopoulos, Christos-Nikolaos, et autres
Publié: (2025)
Multilingual corpora for the study of new concepts in the social sciences and humanities:
par: Kyriakoglou, Revekka, et autres
Publié: (2025)
par: Kyriakoglou, Revekka, et autres
Publié: (2025)
Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
par: Deng, Ruixuan, et autres
Publié: (2025)
par: Deng, Ruixuan, et autres
Publié: (2025)
Where does output diversity collapse in post-training?
par: Karouzos, Constantinos, et autres
Publié: (2026)
par: Karouzos, Constantinos, et autres
Publié: (2026)
Where does In-context Translation Happen in Large Language Models
par: Sia, Suzanna, et autres
Publié: (2024)
par: Sia, Suzanna, et autres
Publié: (2024)
Detecting Safety Violations Across Many Agent Traces
par: Stein, Adam, et autres
Publié: (2026)
par: Stein, Adam, et autres
Publié: (2026)
Comparing Explanation Faithfulness between Multilingual and Monolingual Fine-tuned Language Models
par: Zhao, Zhixue, et autres
Publié: (2024)
par: Zhao, Zhixue, et autres
Publié: (2024)
Guarding the Meaning: Self-Supervised Training for Semantic Robustness in Guard Models
par: Pinneri, Cristina, et autres
Publié: (2025)
par: Pinneri, Cristina, et autres
Publié: (2025)
Where is the answer? Investigating Positional Bias in Language Model Knowledge Extraction
par: Saito, Kuniaki, et autres
Publié: (2024)
par: Saito, Kuniaki, et autres
Publié: (2024)
CausalEval: Towards Better Causal Reasoning in Language Models
par: Yu, Longxuan, et autres
Publié: (2024)
par: Yu, Longxuan, et autres
Publié: (2024)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
par: Wang, Yian, et autres
Publié: (2026)
par: Wang, Yian, et autres
Publié: (2026)
SelfElicit: Your Language Model Secretly Knows Where is the Relevant Evidence
par: Liu, Zhining, et autres
Publié: (2025)
par: Liu, Zhining, et autres
Publié: (2025)
Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement
par: Kong, Injin, et autres
Publié: (2026)
par: Kong, Injin, et autres
Publié: (2026)
Adapting Chat Language Models Using Only Target Unlabeled Language Data
par: Yamaguchi, Atsuki, et autres
Publié: (2024)
par: Yamaguchi, Atsuki, et autres
Publié: (2024)
On the Semantics of Large Language Models
par: Schuele, Martin
Publié: (2025)
par: Schuele, Martin
Publié: (2025)
An Empirical Study on Cross-lingual Vocabulary Adaptation for Efficient Language Model Inference
par: Yamaguchi, Atsuki, et autres
Publié: (2024)
par: Yamaguchi, Atsuki, et autres
Publié: (2024)
Causal Agent based on Large Language Model
par: Han, Kairong, et autres
Publié: (2024)
par: Han, Kairong, et autres
Publié: (2024)
Probing Causality Manipulation of Large Language Models
par: Zhang, Chenyang, et autres
Publié: (2024)
par: Zhang, Chenyang, et autres
Publié: (2024)
Causal Interventions on Causal Paths: Mapping GPT-2's Reasoning From Syntax to Semantics
par: Lee, Isabelle, et autres
Publié: (2024)
par: Lee, Isabelle, et autres
Publié: (2024)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
par: Mastrokostas, Charalampos, et autres
Publié: (2026)
par: Mastrokostas, Charalampos, et autres
Publié: (2026)
FarFetched: Entity-centric Reasoning and Claim Validation for the Greek Language based on Textually Represented Environments
par: Papadopoulos, Dimitris, et autres
Publié: (2024)
par: Papadopoulos, Dimitris, et autres
Publié: (2024)
Investigating Hallucinations in Pruned Large Language Models for Abstractive Summarization
par: Chrysostomou, George, et autres
Publié: (2023)
par: Chrysostomou, George, et autres
Publié: (2023)
Quantifying Semantic Emergence in Language Models
par: Chen, Hang, et autres
Publié: (2024)
par: Chen, Hang, et autres
Publié: (2024)
Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models
par: Reichman, Benjamin, et autres
Publié: (2025)
par: Reichman, Benjamin, et autres
Publié: (2025)
Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models
par: Pham, Minh Vu, et autres
Publié: (2026)
par: Pham, Minh Vu, et autres
Publié: (2026)
Transformer-based Causal Language Models Perform Clustering
par: Wu, Xinbo, et autres
Publié: (2024)
par: Wu, Xinbo, et autres
Publié: (2024)
Large Language Models for Constrained-Based Causal Discovery
par: Cohrs, Kai-Hendrik, et autres
Publié: (2024)
par: Cohrs, Kai-Hendrik, et autres
Publié: (2024)
Causal Inference with Large Language Model: A Survey
par: Ma, Jing
Publié: (2024)
par: Ma, Jing
Publié: (2024)
Exploration of Masked and Causal Language Modelling for Text Generation
par: Micheletti, Nicolo, et autres
Publié: (2024)
par: Micheletti, Nicolo, et autres
Publié: (2024)
CAT: Causal Attention Tuning For Injecting Fine-grained Causal Knowledge into Large Language Models
par: Han, Kairong, et autres
Publié: (2025)
par: Han, Kairong, et autres
Publié: (2025)
ParaNames 1.0: Creating an Entity Name Corpus for 400+ Languages using Wikidata
par: Sälevä, Jonne, et autres
Publié: (2024)
par: Sälevä, Jonne, et autres
Publié: (2024)
Large Language Models as Universal Predictors? An Empirical Study on Small Tabular Datasets
par: Pavlidis, Nikolaos, et autres
Publié: (2025)
par: Pavlidis, Nikolaos, et autres
Publié: (2025)
Querying Structured Data Through Natural Language Using Language Models
par: Valentin-Micu, Hontan, et autres
Publié: (2026)
par: Valentin-Micu, Hontan, et autres
Publié: (2026)
Where Should I Study? Biased Language Models Decide! Evaluating Fairness in LMs for Academic Recommendations
par: Shailya, Krithi, et autres
Publié: (2025)
par: Shailya, Krithi, et autres
Publié: (2025)
A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?
par: Zhang, Qiyuan, et autres
Publié: (2025)
par: Zhang, Qiyuan, et autres
Publié: (2025)
Semantic Structure in Large Language Model Embeddings
par: Kozlowski, Austin C., et autres
Publié: (2025)
par: Kozlowski, Austin C., et autres
Publié: (2025)
Language Models as Semantic Augmenters for Sequential Recommenders
par: Valizadeh, Mahsa, et autres
Publié: (2025)
par: Valizadeh, Mahsa, et autres
Publié: (2025)
Towards Universal Semantics With Large Language Models
par: Baartmans, Raymond, et autres
Publié: (2025)
par: Baartmans, Raymond, et autres
Publié: (2025)
Enhancing Uncertainty Modeling with Semantic Graph for Hallucination Detection
par: Chen, Kedi, et autres
Publié: (2025)
par: Chen, Kedi, et autres
Publié: (2025)
Causal-Guided Active Learning for Debiasing Large Language Models
par: Du, Li, et autres
Publié: (2024)
par: Du, Li, et autres
Publié: (2024)
Documents similaires
-
Decoding Emergent Big Five Traits in Large Language Models: Temperature-Dependent Expression and Architectural Clustering
par: Zacharopoulos, Christos-Nikolaos, et autres
Publié: (2025) -
Multilingual corpora for the study of new concepts in the social sciences and humanities:
par: Kyriakoglou, Revekka, et autres
Publié: (2025) -
Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
par: Deng, Ruixuan, et autres
Publié: (2025) -
Where does output diversity collapse in post-training?
par: Karouzos, Constantinos, et autres
Publié: (2026) -
Where does In-context Translation Happen in Large Language Models
par: Sia, Suzanna, et autres
Publié: (2024)