Salvato in:
| Autori principali: | Wang, Mingze, E, Weinan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.00522 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Expressive Power of Mixture-of-Experts for Structured Complex Tasks
di: Wang, Mingze, et al.
Pubblicazione: (2025)
di: Wang, Mingze, et al.
Pubblicazione: (2025)
How Transformers Get Rich: Approximation and Dynamics Analysis
di: Wang, Mingze, et al.
Pubblicazione: (2024)
di: Wang, Mingze, et al.
Pubblicazione: (2024)
GradPower: Powering Gradients for Faster Language Model Pre-Training
di: Wang, Jinbo, et al.
Pubblicazione: (2025)
di: Wang, Jinbo, et al.
Pubblicazione: (2025)
The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training
di: Wang, Jinbo, et al.
Pubblicazione: (2025)
di: Wang, Jinbo, et al.
Pubblicazione: (2025)
On the Expressive Power of Floating-Point Transformers
di: Park, Sejun, et al.
Pubblicazione: (2026)
di: Park, Sejun, et al.
Pubblicazione: (2026)
On the Expressive Power of Contextual Relations in Transformers
di: Fraiman, Demián
Pubblicazione: (2026)
di: Fraiman, Demián
Pubblicazione: (2026)
Expressivity-Efficiency Tradeoffs for Hybrid Sequence Models
di: Cooper, John, et al.
Pubblicazione: (2026)
di: Cooper, John, et al.
Pubblicazione: (2026)
More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations
di: Wang, Mingze, et al.
Pubblicazione: (2026)
di: Wang, Mingze, et al.
Pubblicazione: (2026)
Transformers are Expressive, But Are They Expressive Enough for Regression?
di: Nath, Swaroop, et al.
Pubblicazione: (2024)
di: Nath, Swaroop, et al.
Pubblicazione: (2024)
Exact Expressive Power of Transformers with Padding
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
The Expressive Power of Transformers with Chain of Thought
di: Merrill, William, et al.
Pubblicazione: (2023)
di: Merrill, William, et al.
Pubblicazione: (2023)
Understanding and Enhancing Mask-Based Pretraining towards Universal Representations
di: Dong, Mingze, et al.
Pubblicazione: (2025)
di: Dong, Mingze, et al.
Pubblicazione: (2025)
Towards Understanding the Expressive Power of GNNs with Global Readout
di: Funk, Maurice, et al.
Pubblicazione: (2026)
di: Funk, Maurice, et al.
Pubblicazione: (2026)
Neural Attention: A Novel Mechanism for Enhanced Expressive Power in Transformer Models
di: DiGiugno, Andrew, et al.
Pubblicazione: (2025)
di: DiGiugno, Andrew, et al.
Pubblicazione: (2025)
On the Theoretical Expressive Power and the Design Space of Higher-Order Graph Transformers
di: Zhou, Cai, et al.
Pubblicazione: (2024)
di: Zhou, Cai, et al.
Pubblicazione: (2024)
On The Expressive Power of GNN Derivatives
di: Eitan, Yam, et al.
Pubblicazione: (2025)
di: Eitan, Yam, et al.
Pubblicazione: (2025)
Lyra: An Efficient and Expressive Subquadratic Architecture for Modeling Biological Sequences
di: Ramesh, Krithik, et al.
Pubblicazione: (2025)
di: Ramesh, Krithik, et al.
Pubblicazione: (2025)
On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement via Timestep Encoding
di: Xu, Kevin, et al.
Pubblicazione: (2024)
di: Xu, Kevin, et al.
Pubblicazione: (2024)
Structured Linear CDEs: Maximally Expressive and Parallel-in-Time Sequence Models
di: Walker, Benjamin, et al.
Pubblicazione: (2025)
di: Walker, Benjamin, et al.
Pubblicazione: (2025)
On the Expressive Power of Transformers for Maxout Networks and Continuous Piecewise Linear Functions
di: Gu, Linyan, et al.
Pubblicazione: (2026)
di: Gu, Linyan, et al.
Pubblicazione: (2026)
Expressive Power of Temporal Message Passing
di: Wałęga, Przemysław Andrzej, et al.
Pubblicazione: (2024)
di: Wałęga, Przemysław Andrzej, et al.
Pubblicazione: (2024)
Rethinking the Expressive Power of GNNs via Graph Biconnectivity
di: Zhang, Bohang, et al.
Pubblicazione: (2023)
di: Zhang, Bohang, et al.
Pubblicazione: (2023)
Expanding Expressivity in Transformer Models with MöbiusAttention
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought
di: Brösamle, Moritz, et al.
Pubblicazione: (2026)
di: Brösamle, Moritz, et al.
Pubblicazione: (2026)
GNNs Meet Sequence Models Along the Shortest-Path: an Expressive Method for Link Prediction
di: Ferrini, Francesco, et al.
Pubblicazione: (2025)
di: Ferrini, Francesco, et al.
Pubblicazione: (2025)
On the Expressive Power of GNNs to Solve Linear SDPs
di: Qian, Chendi, et al.
Pubblicazione: (2026)
di: Qian, Chendi, et al.
Pubblicazione: (2026)
Understanding Expressivity of GNN in Rule Learning
di: Qiu, Haiquan, et al.
Pubblicazione: (2023)
di: Qiu, Haiquan, et al.
Pubblicazione: (2023)
k-Maximum Inner Product Attention for Graph Transformers and the Expressive Power of GraphGPS
di: De Schouwer, Jonas, et al.
Pubblicazione: (2026)
di: De Schouwer, Jonas, et al.
Pubblicazione: (2026)
On the Expressive Power of Graph Neural Networks
di: Nalwade, Ashwin, et al.
Pubblicazione: (2024)
di: Nalwade, Ashwin, et al.
Pubblicazione: (2024)
On the Expressive Power of Sparse Geometric MPNNs
di: Sverdlov, Yonatan, et al.
Pubblicazione: (2024)
di: Sverdlov, Yonatan, et al.
Pubblicazione: (2024)
On the Expressive Power of GNNs for Boolean Satisfiability
di: Peltonen, Saku, et al.
Pubblicazione: (2026)
di: Peltonen, Saku, et al.
Pubblicazione: (2026)
Improving Generalization and Convergence by Enhancing Implicit Regularization
di: Wang, Mingze, et al.
Pubblicazione: (2024)
di: Wang, Mingze, et al.
Pubblicazione: (2024)
On the Expressive Power of Subgraph Graph Neural Networks for Graphs with Bounded Cycles
di: Chen, Ziang, et al.
Pubblicazione: (2025)
di: Chen, Ziang, et al.
Pubblicazione: (2025)
Expressivity of Transformers: A Tropical Geometry Perspective
di: Su, Ye, et al.
Pubblicazione: (2026)
di: Su, Ye, et al.
Pubblicazione: (2026)
On the Expressive Power and Limitations of Multi-Layer SSMs
di: Zubić, Nikola, et al.
Pubblicazione: (2026)
di: Zubić, Nikola, et al.
Pubblicazione: (2026)
On the Expressive Power of Permutation-Equivariant Weight-Space Networks
di: Dayan, Adir, et al.
Pubblicazione: (2026)
di: Dayan, Adir, et al.
Pubblicazione: (2026)
Maximising Quantum-Computing Expressive Power through Randomised Circuits
di: Yang, Yingli, et al.
Pubblicazione: (2023)
di: Yang, Yingli, et al.
Pubblicazione: (2023)
A Little Depth Goes a Long Way: The Expressive Power of Log-Depth Transformers
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
A Theoretical Analysis of Noise Geometry in Stochastic Gradient Descent
di: Wang, Mingze, et al.
Pubblicazione: (2023)
di: Wang, Mingze, et al.
Pubblicazione: (2023)
On the Expressive Power of Tree-Structured Probabilistic Circuits
di: Yin, Lang, et al.
Pubblicazione: (2024)
di: Yin, Lang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the Expressive Power of Mixture-of-Experts for Structured Complex Tasks
di: Wang, Mingze, et al.
Pubblicazione: (2025) -
How Transformers Get Rich: Approximation and Dynamics Analysis
di: Wang, Mingze, et al.
Pubblicazione: (2024) -
GradPower: Powering Gradients for Faster Language Model Pre-Training
di: Wang, Jinbo, et al.
Pubblicazione: (2025) -
The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training
di: Wang, Jinbo, et al.
Pubblicazione: (2025) -
On the Expressive Power of Floating-Point Transformers
di: Park, Sejun, et al.
Pubblicazione: (2026)