A Logic for Expressing Log-Precision Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Merrill, William, Sabharwal, Ashish |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Little Depth Goes a Long Way: The Expressive Power of Log-Depth Transformers
par: Merrill, William, et autres
Publié: (2025)
par: Merrill, William, et autres
Publié: (2025)
The Expressive Power of Transformers with Chain of Thought
par: Merrill, William, et autres
Publié: (2023)
par: Merrill, William, et autres
Publié: (2023)
Exact Expressive Power of Transformers with Padding
par: Merrill, William, et autres
Publié: (2025)
par: Merrill, William, et autres
Publié: (2025)
The Illusion of State in State-Space Models
par: Merrill, William, et autres
Publié: (2024)
par: Merrill, William, et autres
Publié: (2024)
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
par: Svete, Anej, et autres
Publié: (2026)
par: Svete, Anej, et autres
Publié: (2026)
Why Are Linear RNNs More Parallelizable?
par: Merrill, William, et autres
Publié: (2026)
par: Merrill, William, et autres
Publié: (2026)
Context-Free Recognition with Transformers
par: Jerad, Selim, et autres
Publié: (2026)
par: Jerad, Selim, et autres
Publié: (2026)
The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought
par: Brösamle, Moritz, et autres
Publié: (2026)
par: Brösamle, Moritz, et autres
Publié: (2026)
On the Computational Hardness of Transformers
par: Saha, Barna, et autres
Publié: (2026)
par: Saha, Barna, et autres
Publié: (2026)
Constant Bit-size Transformers Are Turing Complete
par: Li, Qian, et autres
Publié: (2025)
par: Li, Qian, et autres
Publié: (2025)
Lower Bounds for Chain-of-Thought Reasoning in Hard-Attention Transformers
par: Amiri, Alireza, et autres
Publié: (2025)
par: Amiri, Alireza, et autres
Publié: (2025)
Chain of Thought Empowers Transformers to Solve Inherently Serial Problems
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete
par: Li, Qian, et autres
Publié: (2026)
par: Li, Qian, et autres
Publié: (2026)
Fundamental Limitations on Subquadratic Alternatives to Transformers
par: Alman, Josh, et autres
Publié: (2024)
par: Alman, Josh, et autres
Publié: (2024)
Provable Failure of Language Models in Learning Majority Boolean Logic via Gradient Descent
par: Chen, Bo, et autres
Publié: (2025)
par: Chen, Bo, et autres
Publié: (2025)
Provably Overwhelming Transformer Models with Designed Inputs
par: Stambler, Lev, et autres
Publié: (2025)
par: Stambler, Lev, et autres
Publié: (2025)
Additive Models Explained: A Computational Complexity Approach
par: Bassan, Shahaf, et autres
Publié: (2025)
par: Bassan, Shahaf, et autres
Publié: (2025)
Fundamental Limits of Crystalline Equivariant Graph Neural Networks: A Circuit Complexity Perspective
par: Cao, Yang, et autres
Publié: (2025)
par: Cao, Yang, et autres
Publié: (2025)
Computational Limits of Low-Rank Adaptation (LoRA) Fine-Tuning for Transformer Models
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2024)
par: Hu, Jerry Yao-Chieh, et autres
Publié: (2024)
How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers
par: Wang, Xiao
Publié: (2026)
par: Wang, Xiao
Publié: (2026)
Learning Tree Pattern Transformations
par: Neider, Daniel, et autres
Publié: (2024)
par: Neider, Daniel, et autres
Publié: (2024)
Efficient Turing Machine Simulation with Transformers
par: Li, Qian, et autres
Publié: (2025)
par: Li, Qian, et autres
Publié: (2025)
Reachability In Simple Neural Networks
par: Sälzer, Marco, et autres
Publié: (2022)
par: Sälzer, Marco, et autres
Publié: (2022)
On the Hardness of Learning Regular Expressions
par: Attias, Idan, et autres
Publié: (2025)
par: Attias, Idan, et autres
Publié: (2025)
Learnability of Parameter-Bounded Bayes Nets
par: Bhattacharyya, Arnab, et autres
Publié: (2024)
par: Bhattacharyya, Arnab, et autres
Publié: (2024)
How Hard Is Continuous Clustering? Lower Bounds from the Existential Theory of the Reals
par: Majumdar, Angshul
Publié: (2026)
par: Majumdar, Angshul
Publié: (2026)
Spiky Rank and Its Applications to Rigidity and Circuits
par: Hambardzumyan, Lianna, et autres
Publié: (2026)
par: Hambardzumyan, Lianna, et autres
Publié: (2026)
Low-Rank Matrix Approximation for Neural Network Compression
par: Cherukuri, Kalyan, et autres
Publié: (2025)
par: Cherukuri, Kalyan, et autres
Publié: (2025)
Proximity to Losslessly Compressible Parameters
par: Farrugia-Roberts, Matthew
Publié: (2023)
par: Farrugia-Roberts, Matthew
Publié: (2023)
Decision Tree Learning on Product Spaces
par: Moakahr, Arshia Soltani, et autres
Publié: (2026)
par: Moakahr, Arshia Soltani, et autres
Publié: (2026)
Statistical and Computational Guarantees of Kernel Max-Sliced Wasserstein Distances
par: Wang, Jie, et autres
Publié: (2024)
par: Wang, Jie, et autres
Publié: (2024)
Smoothed Analysis for Learning Concepts with Low Intrinsic Dimension
par: Chandrasekaran, Gautam, et autres
Publié: (2024)
par: Chandrasekaran, Gautam, et autres
Publié: (2024)
Optimizing Computational-Statistical Runtime for Wasserstein Distance Estimation
par: Jacobs, Peter Matthew, et autres
Publié: (2026)
par: Jacobs, Peter Matthew, et autres
Publié: (2026)
Distribution-Specific Agnostic Conditional Classification With Halfspaces
par: Huang, Jizhou, et autres
Publié: (2025)
par: Huang, Jizhou, et autres
Publié: (2025)
From Pseudorandomness to Multi-Group Fairness and Back
par: Dwork, Cynthia, et autres
Publié: (2023)
par: Dwork, Cynthia, et autres
Publié: (2023)
Ask, and it shall be given: On the Turing completeness of prompting
par: Qiu, Ruizhong, et autres
Publié: (2024)
par: Qiu, Ruizhong, et autres
Publié: (2024)
Necessary and Sufficient Oracles: Toward a Computational Taxonomy For Reinforcement Learning
par: Rohatgi, Dhruv, et autres
Publié: (2025)
par: Rohatgi, Dhruv, et autres
Publié: (2025)
How Global Calibration Strengthens Multiaccuracy
par: Casacuberta, Sílvia, et autres
Publié: (2025)
par: Casacuberta, Sílvia, et autres
Publié: (2025)
Diffusion Language Models are Provably Optimal Parallel Samplers
par: Jiang, Haozhe, et autres
Publié: (2025)
par: Jiang, Haozhe, et autres
Publié: (2025)
Certifiable Boolean Reasoning Is Universal
par: Li, Wenhao, et autres
Publié: (2026)
par: Li, Wenhao, et autres
Publié: (2026)
Documents similaires
-
A Little Depth Goes a Long Way: The Expressive Power of Log-Depth Transformers
par: Merrill, William, et autres
Publié: (2025) -
The Expressive Power of Transformers with Chain of Thought
par: Merrill, William, et autres
Publié: (2023) -
Exact Expressive Power of Transformers with Padding
par: Merrill, William, et autres
Publié: (2025) -
The Illusion of State in State-Space Models
par: Merrill, William, et autres
Publié: (2024) -
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
par: Svete, Anej, et autres
Publié: (2026)