Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models
Fuente:
arXiv
Saved in:
| Main Authors: | Badger, Benjamin L., Roland, Ethan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Structured Recurrent Mixers for Massively Parallelized Sequence Generation
by: Badger, Benjamin L.
Published: (2026)
by: Badger, Benjamin L.
Published: (2026)
Language Model Memory and Memory Models for Language
by: Badger, Benjamin L.
Published: (2026)
by: Badger, Benjamin L.
Published: (2026)
Masked Mixers for Language Generation and Retrieval
by: Badger, Benjamin L.
Published: (2024)
by: Badger, Benjamin L.
Published: (2024)
HyperMLP: An Integrated Perspective for Sequence Modeling
by: Lu, Jiecheng, et al.
Published: (2026)
by: Lu, Jiecheng, et al.
Published: (2026)
Incorporating Exponential Smoothing into MLP: A Simple but Effective Sequence Model
by: Chu, Jiqun, et al.
Published: (2024)
by: Chu, Jiqun, et al.
Published: (2024)
Know Your Limits: Entropy Estimation Modeling for Compression and Generalization
by: Badger, Benjamin L., et al.
Published: (2025)
by: Badger, Benjamin L., et al.
Published: (2025)
Free Energy Mixer
by: Lu, Jiecheng, et al.
Published: (2026)
by: Lu, Jiecheng, et al.
Published: (2026)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
by: Zhu, Hourun, et al.
Published: (2025)
by: Zhu, Hourun, et al.
Published: (2025)
Phase-Associative Memory: Sequence Modeling in Complex Hilbert Space
by: Vishwakarma, Gowrav, et al.
Published: (2026)
by: Vishwakarma, Gowrav, et al.
Published: (2026)
Sequences of Logits Reveal the Low Rank Structure of Language Models
by: Golowich, Noah, et al.
Published: (2025)
by: Golowich, Noah, et al.
Published: (2025)
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
by: Neo, Clement, et al.
Published: (2024)
by: Neo, Clement, et al.
Published: (2024)
From Word Sequences to Behavioral Sequences: Adapting Modeling and Evaluation Paradigms for Longitudinal NLP
by: Ganesan, Adithya V, et al.
Published: (2026)
by: Ganesan, Adithya V, et al.
Published: (2026)
JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention
by: Tian, Yuandong, et al.
Published: (2023)
by: Tian, Yuandong, et al.
Published: (2023)
TSKANMixer: Kolmogorov-Arnold Networks with MLP-Mixer Model for Time Series Forecasting
by: Hong, Young-Chae, et al.
Published: (2025)
by: Hong, Young-Chae, et al.
Published: (2025)
NOBLE: Accelerating Transformers with Nonlinear Low-Rank Branches
by: Smith, Ethan
Published: (2026)
by: Smith, Ethan
Published: (2026)
MLP-SRGAN: A Single-Dimension Super Resolution GAN using MLP-Mixer
by: Mitha, Samir, et al.
Published: (2023)
by: Mitha, Samir, et al.
Published: (2023)
A Multi-Scale Decomposition MLP-Mixer for Time Series Analysis
by: Zhong, Shuhan, et al.
Published: (2023)
by: Zhong, Shuhan, et al.
Published: (2023)
Sparse Autoencoder Decomposition of Clinical Sequence Model Representations: Feature Complexity, Task Specialisation, and Mortality Prediction
by: Sainsbury, Chris, et al.
Published: (2026)
by: Sainsbury, Chris, et al.
Published: (2026)
Sequence-to-Sequence Spanish Pre-trained Language Models
by: Araujo, Vladimir, et al.
Published: (2023)
by: Araujo, Vladimir, et al.
Published: (2023)
Language Models can Self-Improve at State-Value Estimation for Better Search
by: Mendes, Ethan, et al.
Published: (2025)
by: Mendes, Ethan, et al.
Published: (2025)
Debate Helps Weak Judges Reward Stronger Models
by: Elasky, Ethan, et al.
Published: (2026)
by: Elasky, Ethan, et al.
Published: (2026)
Meta-DiffuB: A Contextualized Sequence-to-Sequence Text Diffusion Model with Meta-Exploration
by: Chuang, Yun-Yen, et al.
Published: (2024)
by: Chuang, Yun-Yen, et al.
Published: (2024)
Native Hybrid Attention for Efficient Sequence Modeling
by: Du, Jusen, et al.
Published: (2025)
by: Du, Jusen, et al.
Published: (2025)
Anticipatory Evaluation of Language Models
by: Park, Jungsoo, et al.
Published: (2025)
by: Park, Jungsoo, et al.
Published: (2025)
LoLCATs: On Low-Rank Linearizing of Large Language Models
by: Zhang, Michael, et al.
Published: (2024)
by: Zhang, Michael, et al.
Published: (2024)
How Well Can a Long Sequence Model Model Long Sequences? Comparing Architechtural Inductive Biases on Long-Context Abilities
by: Huang, Jerry
Published: (2024)
by: Huang, Jerry
Published: (2024)
MoM: Linear Sequence Modeling with Mixture-of-Memories
by: Du, Jusen, et al.
Published: (2025)
by: Du, Jusen, et al.
Published: (2025)
Small Language Models for Privacy-Preserving Clinical Information Extraction in Low-Resource Languages
by: Ghaffarzadeh-Esfahani, Mohammadreza, et al.
Published: (2026)
by: Ghaffarzadeh-Esfahani, Mohammadreza, et al.
Published: (2026)
FastDiSS: Few-step Match Many-step Diffusion Language Model on Sequence-to-Sequence Generation--Full Version
by: Nguyen-Cong, Dat, et al.
Published: (2026)
by: Nguyen-Cong, Dat, et al.
Published: (2026)
FutureFill: Fast Generation from Convolutional Sequence Models
by: Agarwal, Naman, et al.
Published: (2024)
by: Agarwal, Naman, et al.
Published: (2024)
GLiClass: Generalist Lightweight Model for Sequence Classification Tasks
by: Stepanov, Ihor, et al.
Published: (2025)
by: Stepanov, Ihor, et al.
Published: (2025)
A LayoutLMv3-Based Model for Enhanced Relation Extraction in Visually-Rich Documents
by: Adnan, Wiam, et al.
Published: (2024)
by: Adnan, Wiam, et al.
Published: (2024)
SQFT: Low-cost Model Adaptation in Low-precision Sparse Foundation Models
by: Muñoz, Juan Pablo, et al.
Published: (2024)
by: Muñoz, Juan Pablo, et al.
Published: (2024)
Large Language Models are Powerful Electronic Health Record Encoders
by: Hegselmann, Stefan, et al.
Published: (2025)
by: Hegselmann, Stefan, et al.
Published: (2025)
A Multimodal Fusion Model Leveraging MLP Mixer and Handcrafted Features-based Deep Learning Networks for Facial Palsy Detection
by: Oo, Heng Yim Nicole, et al.
Published: (2025)
by: Oo, Heng Yim Nicole, et al.
Published: (2025)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
by: Feng, Zhili, et al.
Published: (2025)
by: Feng, Zhili, et al.
Published: (2025)
MesaNet: Sequence Modeling by Locally Optimal Test-Time Training
by: von Oswald, Johannes, et al.
Published: (2025)
by: von Oswald, Johannes, et al.
Published: (2025)
Clip Your Sequences Fairly: Enforcing Length Fairness for Sequence-Level RL
by: Mao, Hanyi, et al.
Published: (2025)
by: Mao, Hanyi, et al.
Published: (2025)
Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling
by: Egli, Eric, et al.
Published: (2025)
by: Egli, Eric, et al.
Published: (2025)
SOMBRERO: Measuring and Steering Boundary Placement in End-to-End Hierarchical Sequence Models
by: Neitemeier, Pit, et al.
Published: (2026)
by: Neitemeier, Pit, et al.
Published: (2026)
Similar Items
-
Structured Recurrent Mixers for Massively Parallelized Sequence Generation
by: Badger, Benjamin L.
Published: (2026) -
Language Model Memory and Memory Models for Language
by: Badger, Benjamin L.
Published: (2026) -
Masked Mixers for Language Generation and Retrieval
by: Badger, Benjamin L.
Published: (2024) -
HyperMLP: An Integrated Perspective for Sequence Modeling
by: Lu, Jiecheng, et al.
Published: (2026) -
Incorporating Exponential Smoothing into MLP: A Simple but Effective Sequence Model
by: Chu, Jiqun, et al.
Published: (2024)