Implicit Language Models are RNNs: Balancing Parallelization and Expressivity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Schöne, Mark, Rahmani, Babak, Kremer, Heiner, Falck, Fabian, Ballani, Hitesh, Gladrow, Jannes |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning State-Tracking from Code Using Linear RNNs
par: Siems, Julien, et autres
Publié: (2026)
par: Siems, Julien, et autres
Publié: (2026)
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
par: Sun, Yu, et autres
Publié: (2024)
par: Sun, Yu, et autres
Publié: (2024)
Balancing Sparse RNNs with Hyperparameterization Benefiting Meta-Learning
par: Hershey, Quincy, et autres
Publié: (2025)
par: Hershey, Quincy, et autres
Publié: (2025)
Debugging code world models
par: Rahmani, Babak
Publié: (2026)
par: Rahmani, Babak
Publié: (2026)
M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling
par: Mishra, Mayank, et autres
Publié: (2026)
par: Mishra, Mayank, et autres
Publié: (2026)
Memory Caching: RNNs with Growing Memory
par: Behrouz, Ali, et autres
Publié: (2026)
par: Behrouz, Ali, et autres
Publié: (2026)
Were RNNs All We Needed?
par: Feng, Leo, et autres
Publié: (2024)
par: Feng, Leo, et autres
Publié: (2024)
Expressive Power of Implicit Models: Rich Equilibria and Test-Time Scaling
par: Liu, Jialin, et autres
Publié: (2025)
par: Liu, Jialin, et autres
Publié: (2025)
$\texttt{lrnnx}$: A library for Linear RNNs
par: Bania, Karan, et autres
Publié: (2026)
par: Bania, Karan, et autres
Publié: (2026)
Pessimistic Iterative Planning with RNNs for Robust POMDPs
par: Galesloot, Maris F. L., et autres
Publié: (2024)
par: Galesloot, Maris F. L., et autres
Publié: (2024)
HadamRNN: Binary and Sparse Ternary Orthogonal RNNs
par: Foucault, Armand, et autres
Publié: (2025)
par: Foucault, Armand, et autres
Publié: (2025)
Does Transformer Interpretability Transfer to RNNs?
par: Paulo, Gonçalo, et autres
Publié: (2024)
par: Paulo, Gonçalo, et autres
Publié: (2024)
Paradoxical noise preference in RNNs
par: Eckstein, Noah, et autres
Publié: (2026)
par: Eckstein, Noah, et autres
Publié: (2026)
The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models
par: Zhao, Zhiyu, et autres
Publié: (2026)
par: Zhao, Zhiyu, et autres
Publié: (2026)
Message Passing on the Edge: Towards Scalable and Expressive GNNs
par: Barceló, Pablo, et autres
Publié: (2025)
par: Barceló, Pablo, et autres
Publié: (2025)
Verification of the Implicit World Model in a Generative Model via Adversarial Sequences
par: Balogh, András, et autres
Publié: (2026)
par: Balogh, András, et autres
Publié: (2026)
Learning Dynamics of RNNs in Closed-Loop Environments
par: Ger, Yoav, et autres
Publié: (2025)
par: Ger, Yoav, et autres
Publié: (2025)
Compositional Reasoning with Transformers, RNNs, and Chain of Thought
par: Yehudai, Gilad, et autres
Publié: (2025)
par: Yehudai, Gilad, et autres
Publié: (2025)
FlashRNN: I/O-Aware Optimization of Traditional RNNs on modern hardware
par: Pöppel, Korbinian, et autres
Publié: (2024)
par: Pöppel, Korbinian, et autres
Publié: (2024)
Weight Sparsity Complements Activity Sparsity in Neuromorphic Language Models
par: Mukherji, Rishav, et autres
Publié: (2024)
par: Mukherji, Rishav, et autres
Publié: (2024)
Renaissance of RNNs in Streaming Clinical Time Series: Compact Recurrence Remains Competitive with Transformers
par: Tong, Ran, et autres
Publié: (2025)
par: Tong, Ran, et autres
Publié: (2025)
Detecting Invariant Manifolds in ReLU-Based RNNs
par: Eisenmann, Lukas, et autres
Publié: (2025)
par: Eisenmann, Lukas, et autres
Publié: (2025)
Learning reveals invisible structure in low-rank RNNs
par: Ger, Yoav, et autres
Publié: (2026)
par: Ger, Yoav, et autres
Publié: (2026)
How Expressive are Knowledge Graph Foundation Models?
par: Huang, Xingyue, et autres
Publié: (2025)
par: Huang, Xingyue, et autres
Publié: (2025)
Are Expressive Models Truly Necessary for Offline RL?
par: Wang, Guan, et autres
Publié: (2024)
par: Wang, Guan, et autres
Publié: (2024)
Expanding Expressivity in Transformer Models with MöbiusAttention
par: Halacheva, Anna-Maria, et autres
Publié: (2024)
par: Halacheva, Anna-Maria, et autres
Publié: (2024)
Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts
par: Nguyen, Xuan-Phi, et autres
Publié: (2026)
par: Nguyen, Xuan-Phi, et autres
Publié: (2026)
TempoPFN: Synthetic Pre-training of Linear RNNs for Zero-shot Time Series Forecasting
par: Moroshan, Vladyslav, et autres
Publié: (2025)
par: Moroshan, Vladyslav, et autres
Publié: (2025)
Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models
par: Sathyanarayanan, Anish, et autres
Publié: (2026)
par: Sathyanarayanan, Anish, et autres
Publié: (2026)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
par: Wollschläger, Tom, et autres
Publié: (2025)
par: Wollschläger, Tom, et autres
Publié: (2025)
On the Role of Depth in the Expressivity of RNNs
par: Lizaire, Maude, et autres
Publié: (2026)
par: Lizaire, Maude, et autres
Publié: (2026)
Remove Symmetries to Control Model Expressivity and Improve Optimization
par: Ziyin, Liu, et autres
Publié: (2024)
par: Ziyin, Liu, et autres
Publié: (2024)
Model Parallelism With Subnetwork Data Parallelism
par: Singh, Vaibhav, et autres
Publié: (2025)
par: Singh, Vaibhav, et autres
Publié: (2025)
Reevaluation of Inductive Link Prediction
par: Ott, Simon, et autres
Publié: (2024)
par: Ott, Simon, et autres
Publié: (2024)
Taipan: Efficient and Expressive State Space Language Models with Selective Attention
par: Van Nguyen, Chien, et autres
Publié: (2024)
par: Van Nguyen, Chien, et autres
Publié: (2024)
On the Expressiveness and Length Generalization of Selective State-Space Models on Regular Languages
par: Terzić, Aleksandar, et autres
Publié: (2024)
par: Terzić, Aleksandar, et autres
Publié: (2024)
CombAlign: Enhancing Model Expressiveness in Unsupervised Graph Alignment
par: Chen, Songyang, et autres
Publié: (2024)
par: Chen, Songyang, et autres
Publié: (2024)
Building Expressive and Tractable Probabilistic Generative Models: A Review
par: Sidheekh, Sahil, et autres
Publié: (2024)
par: Sidheekh, Sahil, et autres
Publié: (2024)
Curvature-Weighted Capacity Allocation: A Minimum Description Length Framework for Layer-Adaptive Large Language Model Optimization
par: Amaefuna, Theophilus, et autres
Publié: (2026)
par: Amaefuna, Theophilus, et autres
Publié: (2026)
Flow based approach for Dynamic Temporal Causal models with non-Gaussian or Heteroscedastic Noises
par: Rahmani, Abdellah, et autres
Publié: (2025)
par: Rahmani, Abdellah, et autres
Publié: (2025)
Documents similaires
-
Learning State-Tracking from Code Using Linear RNNs
par: Siems, Julien, et autres
Publié: (2026) -
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
par: Sun, Yu, et autres
Publié: (2024) -
Balancing Sparse RNNs with Hyperparameterization Benefiting Meta-Learning
par: Hershey, Quincy, et autres
Publié: (2025) -
Debugging code world models
par: Rahmani, Babak
Publié: (2026) -
M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling
par: Mishra, Mayank, et autres
Publié: (2026)