A Little Depth Goes a Long Way: The Expressive Power of Log-Depth Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Merrill, William, Sabharwal, Ashish |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Expressive Power of Transformers with Chain of Thought
di: Merrill, William, et al.
Pubblicazione: (2023)
di: Merrill, William, et al.
Pubblicazione: (2023)
Exact Expressive Power of Transformers with Padding
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
A Logic for Expressing Log-Precision Transformers
di: Merrill, William, et al.
Pubblicazione: (2022)
di: Merrill, William, et al.
Pubblicazione: (2022)
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
di: Svete, Anej, et al.
Pubblicazione: (2026)
di: Svete, Anej, et al.
Pubblicazione: (2026)
The Illusion of State in State-Space Models
di: Merrill, William, et al.
Pubblicazione: (2024)
di: Merrill, William, et al.
Pubblicazione: (2024)
Why Are Linear RNNs More Parallelizable?
di: Merrill, William, et al.
Pubblicazione: (2026)
di: Merrill, William, et al.
Pubblicazione: (2026)
The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought
di: Brösamle, Moritz, et al.
Pubblicazione: (2026)
di: Brösamle, Moritz, et al.
Pubblicazione: (2026)
On the Expressive Power and Limitations of Multi-Layer SSMs
di: Zubić, Nikola, et al.
Pubblicazione: (2026)
di: Zubić, Nikola, et al.
Pubblicazione: (2026)
Theoretical Constraints on the Expressive Power of $\mathsf{RoPE}$-based Tensor Attention Transformers
di: Li, Xiaoyu, et al.
Pubblicazione: (2024)
di: Li, Xiaoyu, et al.
Pubblicazione: (2024)
How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers
di: Wang, Xiao
Pubblicazione: (2026)
di: Wang, Xiao
Pubblicazione: (2026)
Context-Free Recognition with Transformers
di: Jerad, Selim, et al.
Pubblicazione: (2026)
di: Jerad, Selim, et al.
Pubblicazione: (2026)
Spacetime-Efficient Low-Depth Quantum State Preparation with Applications
di: Gui, Kaiwen, et al.
Pubblicazione: (2023)
di: Gui, Kaiwen, et al.
Pubblicazione: (2023)
A Little Confidence Goes a Long Way
di: Scoville, John, et al.
Pubblicazione: (2024)
di: Scoville, John, et al.
Pubblicazione: (2024)
A Little Human Data Goes A Long Way
di: Ashok, Dhananjay, et al.
Pubblicazione: (2024)
di: Ashok, Dhananjay, et al.
Pubblicazione: (2024)
Impossibility of Depth Reduction in Explainable Clustering
di: Deng, Chengyuan, et al.
Pubblicazione: (2023)
di: Deng, Chengyuan, et al.
Pubblicazione: (2023)
A Provable Expressiveness Hierarchy in Hybrid Linear-Full Attention
di: Ye, Xiaowei, et al.
Pubblicazione: (2026)
di: Ye, Xiaowei, et al.
Pubblicazione: (2026)
On the Computational Hardness of Transformers
di: Saha, Barna, et al.
Pubblicazione: (2026)
di: Saha, Barna, et al.
Pubblicazione: (2026)
A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
Constant Bit-size Transformers Are Turing Complete
di: Li, Qian, et al.
Pubblicazione: (2025)
di: Li, Qian, et al.
Pubblicazione: (2025)
Lower Bounds for Chain-of-Thought Reasoning in Hard-Attention Transformers
di: Amiri, Alireza, et al.
Pubblicazione: (2025)
di: Amiri, Alireza, et al.
Pubblicazione: (2025)
Chain of Thought Empowers Transformers to Solve Inherently Serial Problems
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete
di: Li, Qian, et al.
Pubblicazione: (2026)
di: Li, Qian, et al.
Pubblicazione: (2026)
Fundamental Limitations on Subquadratic Alternatives to Transformers
di: Alman, Josh, et al.
Pubblicazione: (2024)
di: Alman, Josh, et al.
Pubblicazione: (2024)
On Computational Limits of FlowAR Models: Expressivity and Efficiency
di: Cao, Yang, et al.
Pubblicazione: (2025)
di: Cao, Yang, et al.
Pubblicazione: (2025)
What is a Sketch-and-Precondition Derivation for Low-Rank Approximation? Inverse Power Error or Inverse Power Estimation?
di: Xu, Ruihan, et al.
Pubblicazione: (2025)
di: Xu, Ruihan, et al.
Pubblicazione: (2025)
A Little Rank Goes a Long Way: Random Scaffolds with LoRA Adapters Are All You Need
di: Hazan, Hananel, et al.
Pubblicazione: (2026)
di: Hazan, Hananel, et al.
Pubblicazione: (2026)
Polynomial Identity Testing and Reconstruction for Depth-4 Powering Circuits of High Degree
di: Shpilka, Amir, et al.
Pubblicazione: (2026)
di: Shpilka, Amir, et al.
Pubblicazione: (2026)
Catalytic Computing and Register Programs Beyond Log-Depth
di: Alekseev, Yaroslav, et al.
Pubblicazione: (2025)
di: Alekseev, Yaroslav, et al.
Pubblicazione: (2025)
Pause Tokens Strictly Increase the Expressivity of Constant-Depth Transformers
di: London, Charles, et al.
Pubblicazione: (2025)
di: London, Charles, et al.
Pubblicazione: (2025)
Provably Overwhelming Transformer Models with Designed Inputs
di: Stambler, Lev, et al.
Pubblicazione: (2025)
di: Stambler, Lev, et al.
Pubblicazione: (2025)
Additive Models Explained: A Computational Complexity Approach
di: Bassan, Shahaf, et al.
Pubblicazione: (2025)
di: Bassan, Shahaf, et al.
Pubblicazione: (2025)
On the Power of Interactive Proofs for Learning
di: Gur, Tom, et al.
Pubblicazione: (2024)
di: Gur, Tom, et al.
Pubblicazione: (2024)
Necessary and Sufficient Oracles: Toward a Computational Taxonomy For Reinforcement Learning
di: Rohatgi, Dhruv, et al.
Pubblicazione: (2025)
di: Rohatgi, Dhruv, et al.
Pubblicazione: (2025)
Deep Learning as a Convex Paradigm of Computation: Minimizing Circuit Size with ResNets
di: Jacot, Arthur
Pubblicazione: (2025)
di: Jacot, Arthur
Pubblicazione: (2025)
Fundamental Limits of Crystalline Equivariant Graph Neural Networks: A Circuit Complexity Perspective
di: Cao, Yang, et al.
Pubblicazione: (2025)
di: Cao, Yang, et al.
Pubblicazione: (2025)
Computational Limits of Low-Rank Adaptation (LoRA) Fine-Tuning for Transformer Models
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2024)
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2024)
Learning Tree Pattern Transformations
di: Neider, Daniel, et al.
Pubblicazione: (2024)
di: Neider, Daniel, et al.
Pubblicazione: (2024)
Are Depth-2 Regular Expressions Hard to Intersect?
di: Ascone, Rocco, et al.
Pubblicazione: (2025)
di: Ascone, Rocco, et al.
Pubblicazione: (2025)
Optimal Depth-Three Circuits for Inner Product
di: Gurumukhani, Mohit, et al.
Pubblicazione: (2026)
di: Gurumukhani, Mohit, et al.
Pubblicazione: (2026)
Efficient Turing Machine Simulation with Transformers
di: Li, Qian, et al.
Pubblicazione: (2025)
di: Li, Qian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Expressive Power of Transformers with Chain of Thought
di: Merrill, William, et al.
Pubblicazione: (2023) -
Exact Expressive Power of Transformers with Padding
di: Merrill, William, et al.
Pubblicazione: (2025) -
A Logic for Expressing Log-Precision Transformers
di: Merrill, William, et al.
Pubblicazione: (2022) -
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
di: Svete, Anej, et al.
Pubblicazione: (2026) -
The Illusion of State in State-Space Models
di: Merrill, William, et al.
Pubblicazione: (2024)