GPT and Prejudice: A Sparse Approach to Understanding Learned Representations in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mahran, Mariam, Simbeck, Katharina |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Investigating Bias: A Multilingual Pipeline for Generating, Solving, and Evaluating Math Problems with LLMs
von: Mahran, Mariam, et al.
Veröffentlicht: (2025)
von: Mahran, Mariam, et al.
Veröffentlicht: (2025)
Mechanistic Interpretability with SAEs: Probing Religion, Violence, and Geography in Large Language Models
von: Simbeck, Katharina, et al.
Veröffentlicht: (2025)
von: Simbeck, Katharina, et al.
Veröffentlicht: (2025)
Reducing Large Language Model Bias with Emphasis on 'Restricted Industries': Automated Dataset Augmentation and Prejudice Quantification
von: Mondal, Devam, et al.
Veröffentlicht: (2024)
von: Mondal, Devam, et al.
Veröffentlicht: (2024)
Can Large Language Models Understand Intermediate Representations in Compilers?
von: Jiang, Hailong, et al.
Veröffentlicht: (2025)
von: Jiang, Hailong, et al.
Veröffentlicht: (2025)
ArabianGPT: Native Arabic GPT-based Large Language Model
von: Koubaa, Anis, et al.
Veröffentlicht: (2024)
von: Koubaa, Anis, et al.
Veröffentlicht: (2024)
Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding
von: Yao, Feiyu, et al.
Veröffentlicht: (2025)
von: Yao, Feiyu, et al.
Veröffentlicht: (2025)
JumpLoRA: Sparse Adapters for Continual Learning in Large Language Models
von: Dragomir, Alexandra, et al.
Veröffentlicht: (2026)
von: Dragomir, Alexandra, et al.
Veröffentlicht: (2026)
Improving Large Language Model Safety with Contrastive Representation Learning
von: Simko, Samuel, et al.
Veröffentlicht: (2025)
von: Simko, Samuel, et al.
Veröffentlicht: (2025)
EmbedLLM: Learning Compact Representations of Large Language Models
von: Zhuang, Richard, et al.
Veröffentlicht: (2024)
von: Zhuang, Richard, et al.
Veröffentlicht: (2024)
Understanding Understanding: A Pragmatic Framework Motivated by Large Language Models
von: Leyton-Brown, Kevin, et al.
Veröffentlicht: (2024)
von: Leyton-Brown, Kevin, et al.
Veröffentlicht: (2024)
Scaling Sparse Fine-Tuning to Large Language Models
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
Uncovering Emergent Physics Representations Learned In-Context by Large Language Models
von: Song, Yeongwoo, et al.
Veröffentlicht: (2025)
von: Song, Yeongwoo, et al.
Veröffentlicht: (2025)
CityGPT: Empowering Urban Spatial Cognition of Large Language Models
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Models
von: Lv, Yaojia, et al.
Veröffentlicht: (2024)
von: Lv, Yaojia, et al.
Veröffentlicht: (2024)
Advancing Graph Representation Learning with Large Language Models: A Comprehensive Survey of Techniques
von: Mao, Qiheng, et al.
Veröffentlicht: (2024)
von: Mao, Qiheng, et al.
Veröffentlicht: (2024)
Whisper-GPT: A Hybrid Representation Audio Large Language Model
von: Verma, Prateek
Veröffentlicht: (2024)
von: Verma, Prateek
Veröffentlicht: (2024)
Understanding Survey Paper Taxonomy about Large Language Models via Graph Representation Learning
von: Zhuang, Jun, et al.
Veröffentlicht: (2024)
von: Zhuang, Jun, et al.
Veröffentlicht: (2024)
Understanding Subword Compositionality of Large Language Models
von: Peng, Qiwei, et al.
Veröffentlicht: (2025)
von: Peng, Qiwei, et al.
Veröffentlicht: (2025)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
von: Shu, Dong, et al.
Veröffentlicht: (2025)
von: Shu, Dong, et al.
Veröffentlicht: (2025)
A Survey of Quantized Graph Representation Learning: Connecting Graph Structures with Large Language Models
von: Lin, Qika, et al.
Veröffentlicht: (2025)
von: Lin, Qika, et al.
Veröffentlicht: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
von: Song, Weixi, et al.
Veröffentlicht: (2023)
von: Song, Weixi, et al.
Veröffentlicht: (2023)
GUNDAM: Aligning Large Language Models with Graph Understanding
von: Ouyang, Sheng, et al.
Veröffentlicht: (2024)
von: Ouyang, Sheng, et al.
Veröffentlicht: (2024)
Evaluating Text Summaries Generated by Large Language Models Using OpenAI's GPT
von: Shakil, Hassan, et al.
Veröffentlicht: (2024)
von: Shakil, Hassan, et al.
Veröffentlicht: (2024)
The Linear Representation Hypothesis and the Geometry of Large Language Models
von: Park, Kiho, et al.
Veröffentlicht: (2023)
von: Park, Kiho, et al.
Veröffentlicht: (2023)
Sparse Shift Autoencoders for Identifying Concepts from Large Language Model Activations
von: Joshi, Shruti, et al.
Veröffentlicht: (2025)
von: Joshi, Shruti, et al.
Veröffentlicht: (2025)
EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices
von: Yi, Rongjie, et al.
Veröffentlicht: (2023)
von: Yi, Rongjie, et al.
Veröffentlicht: (2023)
$\text{M}^{2}$LLM: Multi-view Molecular Representation Learning with Large Language Models
von: Ju, Jiaxin, et al.
Veröffentlicht: (2025)
von: Ju, Jiaxin, et al.
Veröffentlicht: (2025)
Variation in Verification: Understanding Verification Dynamics in Large Language Models
von: Zhou, Yefan, et al.
Veröffentlicht: (2025)
von: Zhou, Yefan, et al.
Veröffentlicht: (2025)
Language over Content: Tracing Cultural Understanding in Multilingual Large Language Models
von: Cho, Seungho, et al.
Veröffentlicht: (2025)
von: Cho, Seungho, et al.
Veröffentlicht: (2025)
Analyzing the Role of Semantic Representations in the Era of Large Language Models
von: Jin, Zhijing, et al.
Veröffentlicht: (2024)
von: Jin, Zhijing, et al.
Veröffentlicht: (2024)
Representational Curvature Modulates Behavioral Uncertainty in Large Language Models
von: King, Jack, et al.
Veröffentlicht: (2026)
von: King, Jack, et al.
Veröffentlicht: (2026)
Universal Neurons in GPT2 Language Models
von: Gurnee, Wes, et al.
Veröffentlicht: (2024)
von: Gurnee, Wes, et al.
Veröffentlicht: (2024)
Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models
von: Leng, Jiaqi, et al.
Veröffentlicht: (2025)
von: Leng, Jiaqi, et al.
Veröffentlicht: (2025)
A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models
von: Ren, Weijieying, et al.
Veröffentlicht: (2025)
von: Ren, Weijieying, et al.
Veröffentlicht: (2025)
A Simple and Effective Pruning Approach for Large Language Models
von: Sun, Mingjie, et al.
Veröffentlicht: (2023)
von: Sun, Mingjie, et al.
Veröffentlicht: (2023)
Can GPT Redefine Medical Understanding? Evaluating GPT on Biomedical Machine Reading Comprehension
von: Vatsal, Shubham, et al.
Veröffentlicht: (2024)
von: Vatsal, Shubham, et al.
Veröffentlicht: (2024)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
von: Lan, Michael, et al.
Veröffentlicht: (2024)
von: Lan, Michael, et al.
Veröffentlicht: (2024)
player2vec: A Language Modeling Approach to Understand Player Behavior in Games
von: Wang, Tianze, et al.
Veröffentlicht: (2024)
von: Wang, Tianze, et al.
Veröffentlicht: (2024)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
von: Wu, Da, et al.
Veröffentlicht: (2023)
von: Wu, Da, et al.
Veröffentlicht: (2023)
Can Large Language Models Understand Molecules?
von: Sadeghi, Shaghayegh, et al.
Veröffentlicht: (2024)
von: Sadeghi, Shaghayegh, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Investigating Bias: A Multilingual Pipeline for Generating, Solving, and Evaluating Math Problems with LLMs
von: Mahran, Mariam, et al.
Veröffentlicht: (2025) -
Mechanistic Interpretability with SAEs: Probing Religion, Violence, and Geography in Large Language Models
von: Simbeck, Katharina, et al.
Veröffentlicht: (2025) -
Reducing Large Language Model Bias with Emphasis on 'Restricted Industries': Automated Dataset Augmentation and Prejudice Quantification
von: Mondal, Devam, et al.
Veröffentlicht: (2024) -
Can Large Language Models Understand Intermediate Representations in Compilers?
von: Jiang, Hailong, et al.
Veröffentlicht: (2025) -
ArabianGPT: Native Arabic GPT-based Large Language Model
von: Koubaa, Anis, et al.
Veröffentlicht: (2024)