Implicit Language Models are RNNs: Balancing Parallelization and Expressivity
Fuente:
arXiv
Guardado en:
| Autores principales: | Schöne, Mark, Rahmani, Babak, Kremer, Heiner, Falck, Fabian, Ballani, Hitesh, Gladrow, Jannes |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning State-Tracking from Code Using Linear RNNs
por: Siems, Julien, et al.
Publicado: (2026)
por: Siems, Julien, et al.
Publicado: (2026)
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
por: Sun, Yu, et al.
Publicado: (2024)
por: Sun, Yu, et al.
Publicado: (2024)
Balancing Sparse RNNs with Hyperparameterization Benefiting Meta-Learning
por: Hershey, Quincy, et al.
Publicado: (2025)
por: Hershey, Quincy, et al.
Publicado: (2025)
Debugging code world models
por: Rahmani, Babak
Publicado: (2026)
por: Rahmani, Babak
Publicado: (2026)
M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling
por: Mishra, Mayank, et al.
Publicado: (2026)
por: Mishra, Mayank, et al.
Publicado: (2026)
Memory Caching: RNNs with Growing Memory
por: Behrouz, Ali, et al.
Publicado: (2026)
por: Behrouz, Ali, et al.
Publicado: (2026)
Were RNNs All We Needed?
por: Feng, Leo, et al.
Publicado: (2024)
por: Feng, Leo, et al.
Publicado: (2024)
Expressive Power of Implicit Models: Rich Equilibria and Test-Time Scaling
por: Liu, Jialin, et al.
Publicado: (2025)
por: Liu, Jialin, et al.
Publicado: (2025)
$\texttt{lrnnx}$: A library for Linear RNNs
por: Bania, Karan, et al.
Publicado: (2026)
por: Bania, Karan, et al.
Publicado: (2026)
Pessimistic Iterative Planning with RNNs for Robust POMDPs
por: Galesloot, Maris F. L., et al.
Publicado: (2024)
por: Galesloot, Maris F. L., et al.
Publicado: (2024)
HadamRNN: Binary and Sparse Ternary Orthogonal RNNs
por: Foucault, Armand, et al.
Publicado: (2025)
por: Foucault, Armand, et al.
Publicado: (2025)
Does Transformer Interpretability Transfer to RNNs?
por: Paulo, Gonçalo, et al.
Publicado: (2024)
por: Paulo, Gonçalo, et al.
Publicado: (2024)
Paradoxical noise preference in RNNs
por: Eckstein, Noah, et al.
Publicado: (2026)
por: Eckstein, Noah, et al.
Publicado: (2026)
The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models
por: Zhao, Zhiyu, et al.
Publicado: (2026)
por: Zhao, Zhiyu, et al.
Publicado: (2026)
Message Passing on the Edge: Towards Scalable and Expressive GNNs
por: Barceló, Pablo, et al.
Publicado: (2025)
por: Barceló, Pablo, et al.
Publicado: (2025)
Verification of the Implicit World Model in a Generative Model via Adversarial Sequences
por: Balogh, András, et al.
Publicado: (2026)
por: Balogh, András, et al.
Publicado: (2026)
Learning Dynamics of RNNs in Closed-Loop Environments
por: Ger, Yoav, et al.
Publicado: (2025)
por: Ger, Yoav, et al.
Publicado: (2025)
Compositional Reasoning with Transformers, RNNs, and Chain of Thought
por: Yehudai, Gilad, et al.
Publicado: (2025)
por: Yehudai, Gilad, et al.
Publicado: (2025)
FlashRNN: I/O-Aware Optimization of Traditional RNNs on modern hardware
por: Pöppel, Korbinian, et al.
Publicado: (2024)
por: Pöppel, Korbinian, et al.
Publicado: (2024)
Weight Sparsity Complements Activity Sparsity in Neuromorphic Language Models
por: Mukherji, Rishav, et al.
Publicado: (2024)
por: Mukherji, Rishav, et al.
Publicado: (2024)
Renaissance of RNNs in Streaming Clinical Time Series: Compact Recurrence Remains Competitive with Transformers
por: Tong, Ran, et al.
Publicado: (2025)
por: Tong, Ran, et al.
Publicado: (2025)
Detecting Invariant Manifolds in ReLU-Based RNNs
por: Eisenmann, Lukas, et al.
Publicado: (2025)
por: Eisenmann, Lukas, et al.
Publicado: (2025)
Learning reveals invisible structure in low-rank RNNs
por: Ger, Yoav, et al.
Publicado: (2026)
por: Ger, Yoav, et al.
Publicado: (2026)
How Expressive are Knowledge Graph Foundation Models?
por: Huang, Xingyue, et al.
Publicado: (2025)
por: Huang, Xingyue, et al.
Publicado: (2025)
Are Expressive Models Truly Necessary for Offline RL?
por: Wang, Guan, et al.
Publicado: (2024)
por: Wang, Guan, et al.
Publicado: (2024)
Expanding Expressivity in Transformer Models with MöbiusAttention
por: Halacheva, Anna-Maria, et al.
Publicado: (2024)
por: Halacheva, Anna-Maria, et al.
Publicado: (2024)
Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts
por: Nguyen, Xuan-Phi, et al.
Publicado: (2026)
por: Nguyen, Xuan-Phi, et al.
Publicado: (2026)
TempoPFN: Synthetic Pre-training of Linear RNNs for Zero-shot Time Series Forecasting
por: Moroshan, Vladyslav, et al.
Publicado: (2025)
por: Moroshan, Vladyslav, et al.
Publicado: (2025)
Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models
por: Sathyanarayanan, Anish, et al.
Publicado: (2026)
por: Sathyanarayanan, Anish, et al.
Publicado: (2026)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
por: Wollschläger, Tom, et al.
Publicado: (2025)
por: Wollschläger, Tom, et al.
Publicado: (2025)
On the Role of Depth in the Expressivity of RNNs
por: Lizaire, Maude, et al.
Publicado: (2026)
por: Lizaire, Maude, et al.
Publicado: (2026)
Remove Symmetries to Control Model Expressivity and Improve Optimization
por: Ziyin, Liu, et al.
Publicado: (2024)
por: Ziyin, Liu, et al.
Publicado: (2024)
Model Parallelism With Subnetwork Data Parallelism
por: Singh, Vaibhav, et al.
Publicado: (2025)
por: Singh, Vaibhav, et al.
Publicado: (2025)
Reevaluation of Inductive Link Prediction
por: Ott, Simon, et al.
Publicado: (2024)
por: Ott, Simon, et al.
Publicado: (2024)
Taipan: Efficient and Expressive State Space Language Models with Selective Attention
por: Van Nguyen, Chien, et al.
Publicado: (2024)
por: Van Nguyen, Chien, et al.
Publicado: (2024)
On the Expressiveness and Length Generalization of Selective State-Space Models on Regular Languages
por: Terzić, Aleksandar, et al.
Publicado: (2024)
por: Terzić, Aleksandar, et al.
Publicado: (2024)
CombAlign: Enhancing Model Expressiveness in Unsupervised Graph Alignment
por: Chen, Songyang, et al.
Publicado: (2024)
por: Chen, Songyang, et al.
Publicado: (2024)
Building Expressive and Tractable Probabilistic Generative Models: A Review
por: Sidheekh, Sahil, et al.
Publicado: (2024)
por: Sidheekh, Sahil, et al.
Publicado: (2024)
Curvature-Weighted Capacity Allocation: A Minimum Description Length Framework for Layer-Adaptive Large Language Model Optimization
por: Amaefuna, Theophilus, et al.
Publicado: (2026)
por: Amaefuna, Theophilus, et al.
Publicado: (2026)
Flow based approach for Dynamic Temporal Causal models with non-Gaussian or Heteroscedastic Noises
por: Rahmani, Abdellah, et al.
Publicado: (2025)
por: Rahmani, Abdellah, et al.
Publicado: (2025)
Ejemplares similares
-
Learning State-Tracking from Code Using Linear RNNs
por: Siems, Julien, et al.
Publicado: (2026) -
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
por: Sun, Yu, et al.
Publicado: (2024) -
Balancing Sparse RNNs with Hyperparameterization Benefiting Meta-Learning
por: Hershey, Quincy, et al.
Publicado: (2025) -
Debugging code world models
por: Rahmani, Babak
Publicado: (2026) -
M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling
por: Mishra, Mayank, et al.
Publicado: (2026)