On Efficiently Representing Regular Languages as RNNs
Fuente:
arXiv
Salvato in:
| Autori principali: | Svete, Anej, Chan, Robin Shing Moon, Cotterell, Ryan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Transformers Can Represent $n$-gram Language Models
di: Svete, Anej, et al.
Pubblicazione: (2024)
di: Svete, Anej, et al.
Pubblicazione: (2024)
Unique Hard Attention: A Tale of Two Sides
di: Jerad, Selim, et al.
Pubblicazione: (2025)
di: Jerad, Selim, et al.
Pubblicazione: (2025)
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
di: Svete, Anej, et al.
Pubblicazione: (2026)
di: Svete, Anej, et al.
Pubblicazione: (2026)
Context-Free Recognition with Transformers
di: Jerad, Selim, et al.
Pubblicazione: (2026)
di: Jerad, Selim, et al.
Pubblicazione: (2026)
On the Representational Capacity of Recurrent Neural Language Models
di: Nowak, Franz, et al.
Pubblicazione: (2023)
di: Nowak, Franz, et al.
Pubblicazione: (2023)
Gumbel Counterfactual Generation From Language Models
di: Ravfogel, Shauli, et al.
Pubblicazione: (2024)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2024)
Training Neural Networks as Recognizers of Formal Languages
di: Butoi, Alexandra, et al.
Pubblicazione: (2024)
di: Butoi, Alexandra, et al.
Pubblicazione: (2024)
On the Reasoning Abilities of Masked Diffusion Language Models
di: Svete, Anej, et al.
Pubblicazione: (2025)
di: Svete, Anej, et al.
Pubblicazione: (2025)
Why Are Linear RNNs More Parallelizable?
di: Merrill, William, et al.
Pubblicazione: (2026)
di: Merrill, William, et al.
Pubblicazione: (2026)
What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages
di: Borenstein, Nadav, et al.
Pubblicazione: (2024)
di: Borenstein, Nadav, et al.
Pubblicazione: (2024)
On Affine Homotopy between Language Encoders
di: Chan, Robin SM, et al.
Pubblicazione: (2024)
di: Chan, Robin SM, et al.
Pubblicazione: (2024)
On the Representational Capacity of Neural Language Models with Chain-of-Thought Reasoning
di: Nowak, Franz, et al.
Pubblicazione: (2024)
di: Nowak, Franz, et al.
Pubblicazione: (2024)
An $\mathbf{L^*}$ Algorithm for Deterministic Weighted Regular Languages
di: Pasti, Clemente, et al.
Pubblicazione: (2024)
di: Pasti, Clemente, et al.
Pubblicazione: (2024)
Lower Bounds on the Expressivity of Recurrent Neural Language Models
di: Svete, Anej, et al.
Pubblicazione: (2024)
di: Svete, Anej, et al.
Pubblicazione: (2024)
Formal Aspects of Language Modeling
di: Cotterell, Ryan, et al.
Pubblicazione: (2023)
di: Cotterell, Ryan, et al.
Pubblicazione: (2023)
Can Transformers Learn $n$-gram Language Models?
di: Svete, Anej, et al.
Pubblicazione: (2024)
di: Svete, Anej, et al.
Pubblicazione: (2024)
A Geometric Notion of Causal Probing
di: Guerner, Clément, et al.
Pubblicazione: (2023)
di: Guerner, Clément, et al.
Pubblicazione: (2023)
Ensembling Language Models with Sequential Monte Carlo
di: Chan, Robin Shing Moon, et al.
Pubblicazione: (2026)
di: Chan, Robin Shing Moon, et al.
Pubblicazione: (2026)
Inference Scaling vs Reasoning: An Empirical Analysis of Compute-Optimal LLM Problem-Solving
di: AbdElhameed, Marwan, et al.
Pubblicazione: (2024)
di: AbdElhameed, Marwan, et al.
Pubblicazione: (2024)
Fundamental Limitations on Subquadratic Alternatives to Transformers
di: Alman, Josh, et al.
Pubblicazione: (2024)
di: Alman, Josh, et al.
Pubblicazione: (2024)
The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought
di: Brösamle, Moritz, et al.
Pubblicazione: (2026)
di: Brösamle, Moritz, et al.
Pubblicazione: (2026)
Perfect diffusion is $\mathsf{TC}^0$ -- Bad diffusion is Turing-complete
di: Liu, Yuxi
Pubblicazione: (2025)
di: Liu, Yuxi
Pubblicazione: (2025)
The Role of $n$-gram Smoothing in the Age of Neural Networks
di: Malagutti, Luca, et al.
Pubblicazione: (2024)
di: Malagutti, Luca, et al.
Pubblicazione: (2024)
NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes
di: Fan, Lizhou, et al.
Pubblicazione: (2023)
di: Fan, Lizhou, et al.
Pubblicazione: (2023)
On the Hardness of Learning Regular Expressions
di: Attias, Idan, et al.
Pubblicazione: (2025)
di: Attias, Idan, et al.
Pubblicazione: (2025)
Information Locality as an Inductive Bias for Neural Language Models
di: Someya, Taiga, et al.
Pubblicazione: (2025)
di: Someya, Taiga, et al.
Pubblicazione: (2025)
The Fine-Grained Complexity of Gradient Computation for Training Large Language Models
di: Alman, Josh, et al.
Pubblicazione: (2024)
di: Alman, Josh, et al.
Pubblicazione: (2024)
A Probability--Quality Trade-off in Aligned Language Models and its Relation to Sampling Adaptors
di: Tan, Naaman, et al.
Pubblicazione: (2024)
di: Tan, Naaman, et al.
Pubblicazione: (2024)
Exploring the Linear Subspace Hypothesis in Gender Bias Mitigation
di: Vargas, Francisco, et al.
Pubblicazione: (2020)
di: Vargas, Francisco, et al.
Pubblicazione: (2020)
RoPE Attention Can Be Trained in Almost Linear Time
di: Cao, Yang, et al.
Pubblicazione: (2024)
di: Cao, Yang, et al.
Pubblicazione: (2024)
Modern Hopfield Networks Require Chain-of-Thought to Solve $\mathsf{NC}^1$-Hard Problems
di: Cao, Yang, et al.
Pubblicazione: (2024)
di: Cao, Yang, et al.
Pubblicazione: (2024)
The Computational Limits of State-Space Models and Mamba via the Lens of Circuit Complexity
di: Chen, Yifang, et al.
Pubblicazione: (2024)
di: Chen, Yifang, et al.
Pubblicazione: (2024)
Theoretical Constraints on the Expressive Power of $\mathsf{RoPE}$-based Tensor Attention Transformers
di: Li, Xiaoyu, et al.
Pubblicazione: (2024)
di: Li, Xiaoyu, et al.
Pubblicazione: (2024)
Circuit Complexity Bounds for RoPE-based Transformer Architecture
di: Chen, Bo, et al.
Pubblicazione: (2024)
di: Chen, Bo, et al.
Pubblicazione: (2024)
On Fine-Grained I/O Complexity of Attention Backward Passes
di: Li, Xiaoyu, et al.
Pubblicazione: (2024)
di: Li, Xiaoyu, et al.
Pubblicazione: (2024)
Unlocking the Theory Behind Scaling 1-Bit Neural Networks
di: Daliri, Majid, et al.
Pubblicazione: (2024)
di: Daliri, Majid, et al.
Pubblicazione: (2024)
A Measure-Theoretic Analysis of Reasoning: Structural Generalization and Approximation Limits
di: Zhang, Yuyang, et al.
Pubblicazione: (2026)
di: Zhang, Yuyang, et al.
Pubblicazione: (2026)
Demystifying the unreasonable effectiveness of online alignment methods
di: Kang, Enoch Hyunwook
Pubblicazione: (2026)
di: Kang, Enoch Hyunwook
Pubblicazione: (2026)
Neural Algorithmic Reasoning for Hypergraphs with Looped Transformers
di: Huang, Zekai, et al.
Pubblicazione: (2025)
di: Huang, Zekai, et al.
Pubblicazione: (2025)
Time and Memory Trade-off of KV-Cache Compression in Tensor Transformer Decoding
di: Chen, Yifang, et al.
Pubblicazione: (2025)
di: Chen, Yifang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Transformers Can Represent $n$-gram Language Models
di: Svete, Anej, et al.
Pubblicazione: (2024) -
Unique Hard Attention: A Tale of Two Sides
di: Jerad, Selim, et al.
Pubblicazione: (2025) -
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
di: Svete, Anej, et al.
Pubblicazione: (2026) -
Context-Free Recognition with Transformers
di: Jerad, Selim, et al.
Pubblicazione: (2026) -
On the Representational Capacity of Recurrent Neural Language Models
di: Nowak, Franz, et al.
Pubblicazione: (2023)