Intra-Layer Recurrence in Transformers for Language Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Nguyen, Anthony, Lin, Wenjun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Autoregressive + Chain of Thought = Recurrent: Recurrence's Role in Language Models' Computability and a Revisit of Recurrent Transformer
by: Zhang, Xiang, et al.
Published: (2024)
by: Zhang, Xiang, et al.
Published: (2024)
Pruning Large Language Models to Intra-module Low-rank Architecture with Transitional Activations
by: Shen, Bowen, et al.
Published: (2024)
by: Shen, Bowen, et al.
Published: (2024)
RecurrentGemma: Moving Past Transformers for Efficient Open Language Models
by: Botev, Aleksandar, et al.
Published: (2024)
by: Botev, Aleksandar, et al.
Published: (2024)
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
by: Wu, Qinzhuo, et al.
Published: (2024)
by: Wu, Qinzhuo, et al.
Published: (2024)
Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models
by: Pham, Minh Vu, et al.
Published: (2026)
by: Pham, Minh Vu, et al.
Published: (2026)
Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference
by: Lee, Sangyun, et al.
Published: (2026)
by: Lee, Sangyun, et al.
Published: (2026)
Layer-wise Regularized Dropout for Neural Language Models
by: Ni, Shiwen, et al.
Published: (2024)
by: Ni, Shiwen, et al.
Published: (2024)
Bridging the Version Gap: Multi-version Training Improves ICD Code Prediction, Especially for Rare Codes
by: Liu, Jinghui, et al.
Published: (2026)
by: Liu, Jinghui, et al.
Published: (2026)
RePrompT: Recurrent Prompt Tuning for Integrating Structured EHR Encoders with Large Language Models
by: Moghaddam, Arya Hadizadeh, et al.
Published: (2026)
by: Moghaddam, Arya Hadizadeh, et al.
Published: (2026)
Word Meanings in Transformer Language Models
by: Grindrod, Jumbly, et al.
Published: (2025)
by: Grindrod, Jumbly, et al.
Published: (2025)
CORE: A Conceptual Reasoning Layer for Large Language Models
by: Hegde, Vishwas, et al.
Published: (2025)
by: Hegde, Vishwas, et al.
Published: (2025)
K-ON: Stacking Knowledge On the Head Layer of Large Language Model
by: Guo, Lingbing, et al.
Published: (2025)
by: Guo, Lingbing, et al.
Published: (2025)
Layer-wise Positional Bias in Short-Context Language Modeling
by: Rahimi, Maryam, et al.
Published: (2026)
by: Rahimi, Maryam, et al.
Published: (2026)
Semi-IIN: Semi-supervised Intra-inter modal Interaction Learning Network for Multimodal Sentiment Analysis
by: Lin, Jinhao, et al.
Published: (2024)
by: Lin, Jinhao, et al.
Published: (2024)
Dependency Transformer Grammars: Integrating Dependency Structures into Transformer Language Models
by: Zhao, Yida, et al.
Published: (2024)
by: Zhao, Yida, et al.
Published: (2024)
LoRAP: Transformer Sub-Layers Deserve Differentiated Structured Compression for Large Language Models
by: Li, Guangyan, et al.
Published: (2024)
by: Li, Guangyan, et al.
Published: (2024)
Layer by Layer: Uncovering Hidden Representations in Language Models
by: Skean, Oscar, et al.
Published: (2025)
by: Skean, Oscar, et al.
Published: (2025)
Understanding Dynamic Compute Allocation in Recurrent Transformers
by: Moosa, Ibraheem Muhammad, et al.
Published: (2026)
by: Moosa, Ibraheem Muhammad, et al.
Published: (2026)
A Multi-Layered Large Language Model Framework for Disease Prediction
by: Mohamed, Malak, et al.
Published: (2025)
by: Mohamed, Malak, et al.
Published: (2025)
LaCo: Large Language Model Pruning via Layer Collapse
by: Yang, Yifei, et al.
Published: (2024)
by: Yang, Yifei, et al.
Published: (2024)
Latent Paraphrasing: Perturbation on Layers Improves Knowledge Injection in Language Models
by: Kang, Minki, et al.
Published: (2024)
by: Kang, Minki, et al.
Published: (2024)
Identifying Linear Relational Concepts in Large Language Models
by: Chanin, David, et al.
Published: (2023)
by: Chanin, David, et al.
Published: (2023)
Enhancing Legal Document Retrieval: A Multi-Phase Approach with Large Language Models
by: Nguyen, Hai-Long, et al.
Published: (2024)
by: Nguyen, Hai-Long, et al.
Published: (2024)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
by: Caffagni, Davide, et al.
Published: (2025)
by: Caffagni, Davide, et al.
Published: (2025)
Recurrent Knowledge Identification and Fusion for Language Model Continual Learning
by: Feng, Yujie, et al.
Published: (2025)
by: Feng, Yujie, et al.
Published: (2025)
Liger: Linearizing Large Language Models to Gated Recurrent Structures
by: Lan, Disen, et al.
Published: (2025)
by: Lan, Disen, et al.
Published: (2025)
Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
by: McLeish, Sean, et al.
Published: (2025)
by: McLeish, Sean, et al.
Published: (2025)
NOWJ@COLIEE 2025: A Multi-stage Framework Integrating Embedding Models and Large Language Models for Legal Retrieval and Entailment
by: Nguyen, Hoang-Trung, et al.
Published: (2025)
by: Nguyen, Hoang-Trung, et al.
Published: (2025)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
by: Pang, Ziqi, et al.
Published: (2023)
by: Pang, Ziqi, et al.
Published: (2023)
ZeFaV: Boosting Large Language Models for Zero-shot Fact Verification
by: Luu, Son T., et al.
Published: (2024)
by: Luu, Son T., et al.
Published: (2024)
ViLLM-Eval: A Comprehensive Evaluation Suite for Vietnamese Large Language Models
by: Nguyen, Trong-Hieu, et al.
Published: (2024)
by: Nguyen, Trong-Hieu, et al.
Published: (2024)
Semantic Layered Embedding Diffusion in Large Language Models for Multi-Contextual Consistency
by: Kabakum, Irin, et al.
Published: (2025)
by: Kabakum, Irin, et al.
Published: (2025)
A Study on Hidden Layer Distillation for Large Language Model Pre-Training
by: Guigon, Maxime, et al.
Published: (2026)
by: Guigon, Maxime, et al.
Published: (2026)
The Attentional White Bear Effect in Transformer Language Models
by: Ramnauth, Rebecca, et al.
Published: (2026)
by: Ramnauth, Rebecca, et al.
Published: (2026)
Transformer-based Causal Language Models Perform Clustering
by: Wu, Xinbo, et al.
Published: (2024)
by: Wu, Xinbo, et al.
Published: (2024)
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
by: Liu, Tingkai, et al.
Published: (2025)
by: Liu, Tingkai, et al.
Published: (2025)
Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
by: Lu, Wenquan, et al.
Published: (2025)
by: Lu, Wenquan, et al.
Published: (2025)
Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale
by: Liu, Jinghui, et al.
Published: (2026)
by: Liu, Jinghui, et al.
Published: (2026)
Evaluating the Efficacy of Large Language Models in Detecting Fake News: A Comparative Analysis
by: Koka, Sahas, et al.
Published: (2024)
by: Koka, Sahas, et al.
Published: (2024)
Similar Items
-
Autoregressive + Chain of Thought = Recurrent: Recurrence's Role in Language Models' Computability and a Revisit of Recurrent Transformer
by: Zhang, Xiang, et al.
Published: (2024) -
Pruning Large Language Models to Intra-module Low-rank Architecture with Transitional Activations
by: Shen, Bowen, et al.
Published: (2024) -
RecurrentGemma: Moving Past Transformers for Efficient Open Language Models
by: Botev, Aleksandar, et al.
Published: (2024) -
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
by: Wu, Qinzhuo, et al.
Published: (2024) -
Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models
by: Pham, Minh Vu, et al.
Published: (2026)