HyperMLP: An Integrated Perspective for Sequence Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Jiecheng, Yang, Shihao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Free Energy Mixer
di: Lu, Jiecheng, et al.
Pubblicazione: (2026)
di: Lu, Jiecheng, et al.
Pubblicazione: (2026)
In-context Time Series Predictor
di: Lu, Jiecheng, et al.
Pubblicazione: (2024)
di: Lu, Jiecheng, et al.
Pubblicazione: (2024)
Linear Transformers as VAR Models: Aligning Autoregressive Attention Mechanisms with Autoregressive Forecasting
di: Lu, Jiecheng, et al.
Pubblicazione: (2025)
di: Lu, Jiecheng, et al.
Pubblicazione: (2025)
Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models
di: Badger, Benjamin L., et al.
Pubblicazione: (2026)
di: Badger, Benjamin L., et al.
Pubblicazione: (2026)
Incorporating Exponential Smoothing into MLP: A Simple but Effective Sequence Model
di: Chu, Jiqun, et al.
Pubblicazione: (2024)
di: Chu, Jiqun, et al.
Pubblicazione: (2024)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
di: Zhu, Hourun, et al.
Pubblicazione: (2025)
di: Zhu, Hourun, et al.
Pubblicazione: (2025)
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
di: Neo, Clement, et al.
Pubblicazione: (2024)
di: Neo, Clement, et al.
Pubblicazione: (2024)
WAVE: Weighted Autoregressive Varying Gate for Time Series Forecasting
di: Lu, Jiecheng, et al.
Pubblicazione: (2024)
di: Lu, Jiecheng, et al.
Pubblicazione: (2024)
CATS: Enhancing Multivariate Time Series Forecasting by Constructing Auxiliary Time Series as Exogenous Variables
di: Lu, Jiecheng, et al.
Pubblicazione: (2024)
di: Lu, Jiecheng, et al.
Pubblicazione: (2024)
JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention
di: Tian, Yuandong, et al.
Pubblicazione: (2023)
di: Tian, Yuandong, et al.
Pubblicazione: (2023)
Sequential Large Language Model-Based Hyper-parameter Optimization
di: Mahammadli, Kanan, et al.
Pubblicazione: (2024)
di: Mahammadli, Kanan, et al.
Pubblicazione: (2024)
Sequence-to-Sequence Spanish Pre-trained Language Models
di: Araujo, Vladimir, et al.
Pubblicazione: (2023)
di: Araujo, Vladimir, et al.
Pubblicazione: (2023)
mHC: Manifold-Constrained Hyper-Connections
di: Xie, Zhenda, et al.
Pubblicazione: (2025)
di: Xie, Zhenda, et al.
Pubblicazione: (2025)
Frac-Connections: Fractional Extension of Hyper-Connections
di: Zhu, Defa, et al.
Pubblicazione: (2025)
di: Zhu, Defa, et al.
Pubblicazione: (2025)
HyperSteer: Activation Steering at Scale with Hypernetworks
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective
di: Ou, Jingyang, et al.
Pubblicazione: (2025)
di: Ou, Jingyang, et al.
Pubblicazione: (2025)
HyperDAS: Towards Automating Mechanistic Interpretability with Hypernetworks
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
Integrating LSTM and BERT for Long-Sequence Data Analysis in Intelligent Tutoring Systems
di: Li, Zhaoxing, et al.
Pubblicazione: (2024)
di: Li, Zhaoxing, et al.
Pubblicazione: (2024)
An Analysis of Hyper-Parameter Optimization Methods for Retrieval Augmented Generation
di: Orbach, Matan, et al.
Pubblicazione: (2025)
di: Orbach, Matan, et al.
Pubblicazione: (2025)
From Word Sequences to Behavioral Sequences: Adapting Modeling and Evaluation Paradigms for Longitudinal NLP
di: Ganesan, Adithya V, et al.
Pubblicazione: (2026)
di: Ganesan, Adithya V, et al.
Pubblicazione: (2026)
Meta-DiffuB: A Contextualized Sequence-to-Sequence Text Diffusion Model with Meta-Exploration
di: Chuang, Yun-Yen, et al.
Pubblicazione: (2024)
di: Chuang, Yun-Yen, et al.
Pubblicazione: (2024)
Native Hybrid Attention for Efficient Sequence Modeling
di: Du, Jusen, et al.
Pubblicazione: (2025)
di: Du, Jusen, et al.
Pubblicazione: (2025)
How Well Can a Long Sequence Model Model Long Sequences? Comparing Architechtural Inductive Biases on Long-Context Abilities
di: Huang, Jerry
Pubblicazione: (2024)
di: Huang, Jerry
Pubblicazione: (2024)
Automated Optimization Modeling via a Localizable Error-Driven Perspective
di: Liu, Weiting, et al.
Pubblicazione: (2026)
di: Liu, Weiting, et al.
Pubblicazione: (2026)
HyperCLOVA X 8B Omni
di: NAVER Cloud HyperCLOVA X Team
Pubblicazione: (2026)
di: NAVER Cloud HyperCLOVA X Team
Pubblicazione: (2026)
MesaNet: Sequence Modeling by Locally Optimal Test-Time Training
di: von Oswald, Johannes, et al.
Pubblicazione: (2025)
di: von Oswald, Johannes, et al.
Pubblicazione: (2025)
MoM: Linear Sequence Modeling with Mixture-of-Memories
di: Du, Jusen, et al.
Pubblicazione: (2025)
di: Du, Jusen, et al.
Pubblicazione: (2025)
Twin-Merging: Dynamic Integration of Modular Expertise in Model Merging
di: Lu, Zhenyi, et al.
Pubblicazione: (2024)
di: Lu, Zhenyi, et al.
Pubblicazione: (2024)
Group Sequence Policy Optimization
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
FastDiSS: Few-step Match Many-step Diffusion Language Model on Sequence-to-Sequence Generation--Full Version
di: Nguyen-Cong, Dat, et al.
Pubblicazione: (2026)
di: Nguyen-Cong, Dat, et al.
Pubblicazione: (2026)
Phase-Associative Memory: Sequence Modeling in Complex Hilbert Space
di: Vishwakarma, Gowrav, et al.
Pubblicazione: (2026)
di: Vishwakarma, Gowrav, et al.
Pubblicazione: (2026)
Sequences of Logits Reveal the Low Rank Structure of Language Models
di: Golowich, Noah, et al.
Pubblicazione: (2025)
di: Golowich, Noah, et al.
Pubblicazione: (2025)
FutureFill: Fast Generation from Convolutional Sequence Models
di: Agarwal, Naman, et al.
Pubblicazione: (2024)
di: Agarwal, Naman, et al.
Pubblicazione: (2024)
GLiClass: Generalist Lightweight Model for Sequence Classification Tasks
di: Stepanov, Ihor, et al.
Pubblicazione: (2025)
di: Stepanov, Ihor, et al.
Pubblicazione: (2025)
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
di: Mao, Liyuan, et al.
Pubblicazione: (2026)
di: Mao, Liyuan, et al.
Pubblicazione: (2026)
MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
di: Zibakhsh, Soheil, et al.
Pubblicazione: (2025)
di: Zibakhsh, Soheil, et al.
Pubblicazione: (2025)
Life-Code: Central Dogma Modeling with Multi-Omics Sequence Unification
di: Liu, Zicheng, et al.
Pubblicazione: (2025)
di: Liu, Zicheng, et al.
Pubblicazione: (2025)
Rethinking Data Mixing from the Perspective of Large Language Models
di: Xu, Yuanjian, et al.
Pubblicazione: (2026)
di: Xu, Yuanjian, et al.
Pubblicazione: (2026)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
di: Feng, Zhili, et al.
Pubblicazione: (2025)
di: Feng, Zhili, et al.
Pubblicazione: (2025)
Clip Your Sequences Fairly: Enforcing Length Fairness for Sequence-Level RL
di: Mao, Hanyi, et al.
Pubblicazione: (2025)
di: Mao, Hanyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Free Energy Mixer
di: Lu, Jiecheng, et al.
Pubblicazione: (2026) -
In-context Time Series Predictor
di: Lu, Jiecheng, et al.
Pubblicazione: (2024) -
Linear Transformers as VAR Models: Aligning Autoregressive Attention Mechanisms with Autoregressive Forecasting
di: Lu, Jiecheng, et al.
Pubblicazione: (2025) -
Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models
di: Badger, Benjamin L., et al.
Pubblicazione: (2026) -
Incorporating Exponential Smoothing into MLP: A Simple but Effective Sequence Model
di: Chu, Jiqun, et al.
Pubblicazione: (2024)