Anatomical Heterogeneity in Transformer Language Models
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Wietrzykowski, Tomasz |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models
par: Binkowski, Jakub, et autres
Publié: (2026)
par: Binkowski, Jakub, et autres
Publié: (2026)
HiGPT: Heterogeneous Graph Language Model
par: Tang, Jiabin, et autres
Publié: (2024)
par: Tang, Jiabin, et autres
Publié: (2024)
HMoE: Heterogeneous Mixture of Experts for Language Modeling
par: Wang, An, et autres
Publié: (2024)
par: Wang, An, et autres
Publié: (2024)
Sparser, Faster, Lighter Transformer Language Models
par: Cetin, Edoardo, et autres
Publié: (2026)
par: Cetin, Edoardo, et autres
Publié: (2026)
Selective Neuron Amplification in Transformer Language Models
par: Akhtar, Ryyan, et autres
Publié: (2026)
par: Akhtar, Ryyan, et autres
Publié: (2026)
Large Language Model-driven Meta-structure Discovery in Heterogeneous Information Network
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
Aligning language models with human preferences
par: Korbak, Tomasz
Publié: (2024)
par: Korbak, Tomasz
Publié: (2024)
Jamba: A Hybrid Transformer-Mamba Language Model
par: Lieber, Opher, et autres
Publié: (2024)
par: Lieber, Opher, et autres
Publié: (2024)
Mixture of Heterogeneous Grouped Experts for Language Modeling
par: Ma, Zhicheng, et autres
Publié: (2026)
par: Ma, Zhicheng, et autres
Publié: (2026)
Can Large Language Models Transform Computational Social Science?
par: Ziems, Caleb, et autres
Publié: (2023)
par: Ziems, Caleb, et autres
Publié: (2023)
SAP: Syntactic Attention Pruning for Transformer-based Language Models
par: Lee, Tzu-Yun, et autres
Publié: (2025)
par: Lee, Tzu-Yun, et autres
Publié: (2025)
Emergent Stack Representations in Modeling Counter Languages Using Transformers
par: Tiwari, Utkarsh, et autres
Publié: (2025)
par: Tiwari, Utkarsh, et autres
Publié: (2025)
Core Context Aware Transformers for Long Context Language Modeling
par: Chen, Yaofo, et autres
Publié: (2024)
par: Chen, Yaofo, et autres
Publié: (2024)
Development of Pre-Trained Transformer-based Models for the Nepali Language
par: Thapa, Prajwal, et autres
Publié: (2024)
par: Thapa, Prajwal, et autres
Publié: (2024)
Circuit Component Reuse Across Tasks in Transformer Language Models
par: Merullo, Jack, et autres
Publié: (2023)
par: Merullo, Jack, et autres
Publié: (2023)
GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models
par: Gerstner, Sebastian, et autres
Publié: (2026)
par: Gerstner, Sebastian, et autres
Publié: (2026)
Correcting Suppressed Log-Probabilities in Language Models with Post-Transformer Adapters
par: Sanchez, Bryan
Publié: (2026)
par: Sanchez, Bryan
Publié: (2026)
Circuit Compositions: Exploring Modular Structures in Transformer-Based Language Models
par: Mondorf, Philipp, et autres
Publié: (2024)
par: Mondorf, Philipp, et autres
Publié: (2024)
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
par: Zhang, Ruixiang, et autres
Publié: (2025)
par: Zhang, Ruixiang, et autres
Publié: (2025)
Automatic Pruning of Fine-tuning Datasets for Transformer-based Language Models
par: Tayaranian, Mohammadreza, et autres
Publié: (2024)
par: Tayaranian, Mohammadreza, et autres
Publié: (2024)
Dynamic Topic Language Model on Heterogeneous Children's Mental Health Clinical Notes
par: Ye, Hanwen, et autres
Publié: (2023)
par: Ye, Hanwen, et autres
Publié: (2023)
Training Language Models with Language Feedback at Scale
par: Scheurer, Jérémy, et autres
Publié: (2023)
par: Scheurer, Jérémy, et autres
Publié: (2023)
Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models
par: Liu, Xiaoze, et autres
Publié: (2026)
par: Liu, Xiaoze, et autres
Publié: (2026)
LakotaBERT: A Transformer-based Model for Low Resource Lakota Language
par: Parankusham, Kanishka, et autres
Publié: (2025)
par: Parankusham, Kanishka, et autres
Publié: (2025)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
par: Limisiewicz, Tomasz, et autres
Publié: (2024)
par: Limisiewicz, Tomasz, et autres
Publié: (2024)
StreaMulT: Streaming Multimodal Transformer for Heterogeneous and Arbitrary Long Sequential Data
par: Pellegrain, Victor, et autres
Publié: (2021)
par: Pellegrain, Victor, et autres
Publié: (2021)
Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?
par: Renduchintala, H S V N S Kowndinya, et autres
Publié: (2026)
par: Renduchintala, H S V N S Kowndinya, et autres
Publié: (2026)
Contextual Graph Transformer: A Small Language Model for Enhanced Engineering Document Information Extraction
par: Reddy, Karan, et autres
Publié: (2025)
par: Reddy, Karan, et autres
Publié: (2025)
CMLFormer: A Dual Decoder Transformer with Switching Point Learning for Code-Mixed Language Modeling
par: Baral, Aditeya, et autres
Publié: (2025)
par: Baral, Aditeya, et autres
Publié: (2025)
Modeling Bilingual Sentence Processing: Evaluating RNN and Transformer Architectures for Cross-Language Structural Priming
par: Zhang, Demi, et autres
Publié: (2024)
par: Zhang, Demi, et autres
Publié: (2024)
Partially Rewriting a Transformer in Natural Language
par: Paulo, Gonçalo, et autres
Publié: (2025)
par: Paulo, Gonçalo, et autres
Publié: (2025)
Revisiting the Shape Convention of Transformer Language Models
par: Liao, Feng-Ting, et autres
Publié: (2026)
par: Liao, Feng-Ting, et autres
Publié: (2026)
Heterogeneous Value Alignment Evaluation for Large Language Models
par: Zhang, Zhaowei, et autres
Publié: (2023)
par: Zhang, Zhaowei, et autres
Publié: (2023)
RVPO: Risk-Sensitive Alignment via Variance Regularization
par: Montero, Ivan, et autres
Publié: (2026)
par: Montero, Ivan, et autres
Publié: (2026)
Fast Byte Latent Transformer
par: Kallini, Julie, et autres
Publié: (2026)
par: Kallini, Julie, et autres
Publié: (2026)
Value-Aware Numerical Representations for Transformer Language Models
par: Dutulescu, Andreea, et autres
Publié: (2026)
par: Dutulescu, Andreea, et autres
Publié: (2026)
Debiasing Algorithm through Model Adaptation
par: Limisiewicz, Tomasz, et autres
Publié: (2023)
par: Limisiewicz, Tomasz, et autres
Publié: (2023)
Latent Concept Disentanglement in Transformer-based Language Models
par: Hong, Guan Zhe, et autres
Publié: (2025)
par: Hong, Guan Zhe, et autres
Publié: (2025)
Limits of Transformer Language Models on Learning to Compose Algorithms
par: Thomm, Jonathan, et autres
Publié: (2024)
par: Thomm, Jonathan, et autres
Publié: (2024)
The Dark Side of the Language: Pre-trained Transformers in the DarkNet
par: Ranaldi, Leonardo, et autres
Publié: (2022)
par: Ranaldi, Leonardo, et autres
Publié: (2022)
Documents similaires
-
Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models
par: Binkowski, Jakub, et autres
Publié: (2026) -
HiGPT: Heterogeneous Graph Language Model
par: Tang, Jiabin, et autres
Publié: (2024) -
HMoE: Heterogeneous Mixture of Experts for Language Modeling
par: Wang, An, et autres
Publié: (2024) -
Sparser, Faster, Lighter Transformer Language Models
par: Cetin, Edoardo, et autres
Publié: (2026) -
Selective Neuron Amplification in Transformer Language Models
par: Akhtar, Ryyan, et autres
Publié: (2026)