Transformers are Multi-State RNNs
Fuente:
arXiv
Salvato in:
| Autori principali: | Oren, Matanel, Hassid, Michael, Yarden, Nir, Adi, Yossi, Schwartz, Roy |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
di: Hassid, Michael, et al.
Pubblicazione: (2025)
di: Hassid, Michael, et al.
Pubblicazione: (2025)
The Larger the Better? Improved LLM Code-Generation via Budget Reallocation
di: Hassid, Michael, et al.
Pubblicazione: (2024)
di: Hassid, Michael, et al.
Pubblicazione: (2024)
On Pruning State-Space LLMs
di: Ghattas, Tamer, et al.
Pubblicazione: (2025)
di: Ghattas, Tamer, et al.
Pubblicazione: (2025)
From Tokens to Words: On the Inner Lexicon of LLMs
di: Kaplan, Guy, et al.
Pubblicazione: (2024)
di: Kaplan, Guy, et al.
Pubblicazione: (2024)
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
Self-Execution Simulation Improves Coding Models
di: Maimon, Gallil, et al.
Pubblicazione: (2026)
di: Maimon, Gallil, et al.
Pubblicazione: (2026)
LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
di: Yariv, Guy, et al.
Pubblicazione: (2024)
di: Yariv, Guy, et al.
Pubblicazione: (2024)
More Documents, Same Length: Isolating the Challenge of Multiple Documents in RAG
di: Levy, Shahar, et al.
Pubblicazione: (2025)
di: Levy, Shahar, et al.
Pubblicazione: (2025)
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023)
di: Hassid, Michael, et al.
Pubblicazione: (2023)
LAST: Language Model Aware Speech Tokenization
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
GmSLM : Generative Marmoset Spoken Language Modeling
di: Sternberg, Talia, et al.
Pubblicazione: (2025)
di: Sternberg, Talia, et al.
Pubblicazione: (2025)
HGRN2: Gated Linear RNNs with State Expansion
di: Qin, Zhen, et al.
Pubblicazione: (2024)
di: Qin, Zhen, et al.
Pubblicazione: (2024)
Does Transformer Interpretability Transfer to RNNs?
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
LLMs versus the Halting Problem: Characterizing Program Termination Reasoning
di: Sultan, Oren, et al.
Pubblicazione: (2026)
di: Sultan, Oren, et al.
Pubblicazione: (2026)
RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval
di: Wen, Kaiyue, et al.
Pubblicazione: (2024)
di: Wen, Kaiyue, et al.
Pubblicazione: (2024)
Compositional Reasoning with Transformers, RNNs, and Chain of Thought
di: Yehudai, Gilad, et al.
Pubblicazione: (2025)
di: Yehudai, Gilad, et al.
Pubblicazione: (2025)
Salmon: A Suite for Acoustic Language Model Evaluation
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
di: Roth, Amit, et al.
Pubblicazione: (2024)
di: Roth, Amit, et al.
Pubblicazione: (2024)
WHISTRESS: Enriching Transcriptions with Sentence Stress Detection
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
StressTest: Can YOUR Speech LM Handle the Stress?
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues
di: Grazzi, Riccardo, et al.
Pubblicazione: (2024)
di: Grazzi, Riccardo, et al.
Pubblicazione: (2024)
SpeLLM: Character-Level Multi-Head Decoding
di: Ben-Artzy, Amit, et al.
Pubblicazione: (2025)
di: Ben-Artzy, Amit, et al.
Pubblicazione: (2025)
Learning State-Tracking from Code Using Linear RNNs
di: Siems, Julien, et al.
Pubblicazione: (2026)
di: Siems, Julien, et al.
Pubblicazione: (2026)
PAST: Phonetic-Acoustic Speech Tokenizer
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
Why Are Linear RNNs More Parallelizable?
di: Merrill, William, et al.
Pubblicazione: (2026)
di: Merrill, William, et al.
Pubblicazione: (2026)
DeltaProduct: Improving State-Tracking in Linear RNNs via Householder Products
di: Siems, Julien, et al.
Pubblicazione: (2025)
di: Siems, Julien, et al.
Pubblicazione: (2025)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
Slamming: Training a Speech Language Model on One GPU in a Day
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
di: Sun, Yu, et al.
Pubblicazione: (2024)
di: Sun, Yu, et al.
Pubblicazione: (2024)
Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark
di: Turetzky, Arnon, et al.
Pubblicazione: (2026)
di: Turetzky, Arnon, et al.
Pubblicazione: (2026)
On Efficiently Representing Regular Languages as RNNs
di: Svete, Anej, et al.
Pubblicazione: (2024)
di: Svete, Anej, et al.
Pubblicazione: (2024)
Enhancing Transformer RNNs with Multiple Temporal Perspectives
di: Dumitru, Razvan-Gabriel, et al.
Pubblicazione: (2024)
di: Dumitru, Razvan-Gabriel, et al.
Pubblicazione: (2024)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
di: Mamou, Jonathan, et al.
Pubblicazione: (2024)
di: Mamou, Jonathan, et al.
Pubblicazione: (2024)
Beyond Performance: Quantifying and Mitigating Label Bias in LLMs
di: Reif, Yuval, et al.
Pubblicazione: (2024)
di: Reif, Yuval, et al.
Pubblicazione: (2024)
Arabic Dialect Classification using RNNs, Transformers, and Large Language Models: A Comparative Analysis
di: Essameldin, Omar A., et al.
Pubblicazione: (2025)
di: Essameldin, Omar A., et al.
Pubblicazione: (2025)
Attend First, Consolidate Later: On the Importance of Attention in Different LLM Layers
di: Ben-Artzy, Amit, et al.
Pubblicazione: (2024)
di: Ben-Artzy, Amit, et al.
Pubblicazione: (2024)
BabyHGRN: Exploring RNNs for Sample-Efficient Training of Language Models
di: Haller, Patrick, et al.
Pubblicazione: (2024)
di: Haller, Patrick, et al.
Pubblicazione: (2024)
Comba: Improving Bilinear RNNs with Closed-loop Control
di: Hu, Jiaxi, et al.
Pubblicazione: (2025)
di: Hu, Jiaxi, et al.
Pubblicazione: (2025)
Selective Attention Improves Transformer
di: Leviathan, Yaniv, et al.
Pubblicazione: (2024)
di: Leviathan, Yaniv, et al.
Pubblicazione: (2024)
Vocab Diet: Reshaping the Vocabulary of LLMs via Vector Arithmetic
di: Reif, Yuval, et al.
Pubblicazione: (2025)
di: Reif, Yuval, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
di: Hassid, Michael, et al.
Pubblicazione: (2025) -
The Larger the Better? Improved LLM Code-Generation via Budget Reallocation
di: Hassid, Michael, et al.
Pubblicazione: (2024) -
On Pruning State-Space LLMs
di: Ghattas, Tamer, et al.
Pubblicazione: (2025) -
From Tokens to Words: On the Inner Lexicon of LLMs
di: Kaplan, Guy, et al.
Pubblicazione: (2024) -
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025)