Emergent Specialization: Rare Token Neurons in Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jing, Wang, Haozheng, Li, Yueheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Distributed Specialization: Rare-Token Neurons in Large Language Models
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
No Clustering, No Routing: How Transformers Actually Process Rare Tokens
par: Liu, Jing
Publié: (2025)
par: Liu, Jing
Publié: (2025)
Conv-CoA: Improving Open-domain Question Answering in Large Language Models via Conversational Chain-of-Action
par: Pan, Zhenyu, et autres
Publié: (2024)
par: Pan, Zhenyu, et autres
Publié: (2024)
From Tokens to Lattices: Emergent Lattice Structures in Language Models
par: Xiong, Bo, et autres
Publié: (2025)
par: Xiong, Bo, et autres
Publié: (2025)
RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility
par: He, Haoyu, et autres
Publié: (2025)
par: He, Haoyu, et autres
Publié: (2025)
Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion
par: Beltoft, Stine Lyngsø, et autres
Publié: (2026)
par: Beltoft, Stine Lyngsø, et autres
Publié: (2026)
Meta-Learning Based Few-Shot Graph-Level Anomaly Detection
par: Li, Liting, et autres
Publié: (2025)
par: Li, Liting, et autres
Publié: (2025)
Architecting AgentOS: From Token-Level Context to Emergent System-Level Intelligence
par: Li, ChengYou, et autres
Publié: (2026)
par: Li, ChengYou, et autres
Publié: (2026)
Piculet: Specialized Models-Guided Hallucination Decrease for MultiModal Large Language Models
par: Wang, Kohou, et autres
Publié: (2024)
par: Wang, Kohou, et autres
Publié: (2024)
Question Classification with Deep Contextualized Transformer
par: Luo, Haozheng, et autres
Publié: (2019)
par: Luo, Haozheng, et autres
Publié: (2019)
Multi-Agent Guided Policy Optimization
par: Li, Yueheng, et autres
Publié: (2025)
par: Li, Yueheng, et autres
Publié: (2025)
STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens
par: Liu, Shiqi, et autres
Publié: (2026)
par: Liu, Shiqi, et autres
Publié: (2026)
Reinforcement Learning with Promising Tokens for Large Language Models
par: Pang, Jing-Cheng, et autres
Publié: (2026)
par: Pang, Jing-Cheng, et autres
Publié: (2026)
Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
par: Liu, Peijie, et autres
Publié: (2025)
par: Liu, Peijie, et autres
Publié: (2025)
Geometry Informed Tokenization of Molecules for Language Model Generation
par: Li, Xiner, et autres
Publié: (2024)
par: Li, Xiner, et autres
Publié: (2024)
Guided Policy Optimization under Partial Observability
par: Li, Yueheng, et autres
Publié: (2025)
par: Li, Yueheng, et autres
Publié: (2025)
One Token Is Enough: Improving Diffusion Language Models with a Sink Token
par: Zhang, Zihou, et autres
Publié: (2026)
par: Zhang, Zihou, et autres
Publié: (2026)
TokenUnify: Scaling Up Autoregressive Pretraining for Neuron Segmentation
par: Chen, Yinda, et autres
Publié: (2024)
par: Chen, Yinda, et autres
Publié: (2024)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
par: Wang, Dixuan, et autres
Publié: (2024)
par: Wang, Dixuan, et autres
Publié: (2024)
Neuron-based Multifractal Analysis of Neuron Interaction Dynamics in Large Models
par: Xiao, Xiongye, et autres
Publié: (2024)
par: Xiao, Xiongye, et autres
Publié: (2024)
Survey of Specialized Large Language Model
par: Yang, Chenghan, et autres
Publié: (2025)
par: Yang, Chenghan, et autres
Publié: (2025)
Emergent Collective Reproduction via Evolving Neuronal Flocks
par: Le, Nam H., et autres
Publié: (2024)
par: Le, Nam H., et autres
Publié: (2024)
SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling
par: Liu, Dong, et autres
Publié: (2025)
par: Liu, Dong, et autres
Publié: (2025)
ST-MoE-BERT: A Spatial-Temporal Mixture-of-Experts Framework for Long-Term Cross-City Mobility Prediction
par: He, Haoyu, et autres
Publié: (2024)
par: He, Haoyu, et autres
Publié: (2024)
Layer Specialization Underlying Compositional Reasoning in Transformers
par: Liu, Jing
Publié: (2025)
par: Liu, Jing
Publié: (2025)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
par: Jiang, Peihai, et autres
Publié: (2025)
par: Jiang, Peihai, et autres
Publié: (2025)
Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games
par: Su, Chris, et autres
Publié: (2025)
par: Su, Chris, et autres
Publié: (2025)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
par: Li, Chenghao, et autres
Publié: (2025)
par: Li, Chenghao, et autres
Publié: (2025)
CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models
par: Le, Yifan, et autres
Publié: (2026)
par: Le, Yifan, et autres
Publié: (2026)
One Model, Two Roles: Emergent Specialization in a Shared Recurrent Transformer
par: Shen, Jucheng, et autres
Publié: (2026)
par: Shen, Jucheng, et autres
Publié: (2026)
Unveiling Factual Recall Behaviors of Large Language Models through Knowledge Neurons
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
Beyond Hard Masks: Progressive Token Evolution for Diffusion Language Models
par: Zhong, Linhao, et autres
Publié: (2026)
par: Zhong, Linhao, et autres
Publié: (2026)
Emergent Introspective Awareness in Large Language Models
par: Lindsey, Jack
Publié: (2026)
par: Lindsey, Jack
Publié: (2026)
Unlocking Emergent Modularity in Large Language Models
par: Qiu, Zihan, et autres
Publié: (2023)
par: Qiu, Zihan, et autres
Publié: (2023)
Cracking Factual Knowledge: A Comprehensive Analysis of Degenerate Knowledge Neurons in Large Language Models
par: Chen, Yuheng, et autres
Publié: (2024)
par: Chen, Yuheng, et autres
Publié: (2024)
How Syntax Specialization Emerges in Language Models
par: Duan, Xufeng, et autres
Publié: (2025)
par: Duan, Xufeng, et autres
Publié: (2025)
Bidirectional Emergent Language in Situated Environments
par: Wolff, Cornelius, et autres
Publié: (2024)
par: Wolff, Cornelius, et autres
Publié: (2024)
Thinking Tokens for Language Modeling
par: Herel, David, et autres
Publié: (2024)
par: Herel, David, et autres
Publié: (2024)
Beyond Reproducibility: Token Probabilities Expose Large Language Model Nondeterminism
par: Fu, Tairan, et autres
Publié: (2026)
par: Fu, Tairan, et autres
Publié: (2026)
Confidence Regulation Neurons in Language Models
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
Documents similaires
-
Distributed Specialization: Rare-Token Neurons in Large Language Models
par: Liu, Jing, et autres
Publié: (2025) -
No Clustering, No Routing: How Transformers Actually Process Rare Tokens
par: Liu, Jing
Publié: (2025) -
Conv-CoA: Improving Open-domain Question Answering in Large Language Models via Conversational Chain-of-Action
par: Pan, Zhenyu, et autres
Publié: (2024) -
From Tokens to Lattices: Emergent Lattice Structures in Language Models
par: Xiong, Bo, et autres
Publié: (2025) -
RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility
par: He, Haoyu, et autres
Publié: (2025)