Transformers on Markov Data: Constant Depth Suffices
Fuente:
arXiv
Salvato in:
| Autori principali: | Rajaraman, Nived, Bondaschi, Marco, Ramchandran, Kannan, Gastpar, Michael, Makkuva, Ashok Vardhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Markov to Laplace: How Mamba In-Context Learns Markov Chains
di: Bondaschi, Marco, et al.
Pubblicazione: (2025)
di: Bondaschi, Marco, et al.
Pubblicazione: (2025)
Attention with Markov: A Framework for Principled Analysis of Transformers via Markov Chains
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2024)
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2024)
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
di: Nagle, Alliot, et al.
Pubblicazione: (2024)
di: Nagle, Alliot, et al.
Pubblicazione: (2024)
Local to Global: Learning Dynamics and Effect of Initialization for Transformers
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2024)
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2024)
LASER: Linear Compression in Wireless Distributed Optimization
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2023)
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2023)
What One Cannot, Two Can: Two-Layer Transformers Provably Represent Induction Heads on Any-Order Markov Chains
di: Ekbote, Chanakya, et al.
Pubblicazione: (2025)
di: Ekbote, Chanakya, et al.
Pubblicazione: (2025)
Toward a Theory of Tokenization in LLMs
di: Rajaraman, Nived, et al.
Pubblicazione: (2024)
di: Rajaraman, Nived, et al.
Pubblicazione: (2024)
Statistical Complexity and Optimal Algorithms for Non-linear Ridge Bandits
di: Rajaraman, Nived, et al.
Pubblicazione: (2023)
di: Rajaraman, Nived, et al.
Pubblicazione: (2023)
Batch Universal Prediction
di: Bondaschi, Marco, et al.
Pubblicazione: (2024)
di: Bondaschi, Marco, et al.
Pubblicazione: (2024)
The Conditional Regret-Capacity Theorem for Batch Universal Prediction
di: Bondaschi, Marco, et al.
Pubblicazione: (2025)
di: Bondaschi, Marco, et al.
Pubblicazione: (2025)
TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning
di: Nagle, Alliot, et al.
Pubblicazione: (2026)
di: Nagle, Alliot, et al.
Pubblicazione: (2026)
Alpha-NML Universal Predictors
di: Bondaschi, Marco, et al.
Pubblicazione: (2022)
di: Bondaschi, Marco, et al.
Pubblicazione: (2022)
Towards Optimal Statistical Watermarking
di: Huang, Baihe, et al.
Pubblicazione: (2023)
di: Huang, Baihe, et al.
Pubblicazione: (2023)
SPEX: Scaling Feature Interaction Explanations for LLMs
di: Kang, Justin Singh, et al.
Pubblicazione: (2025)
di: Kang, Justin Singh, et al.
Pubblicazione: (2025)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
di: Cemri, Mert, et al.
Pubblicazione: (2025)
di: Cemri, Mert, et al.
Pubblicazione: (2025)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
di: Wieser, Frederico, et al.
Pubblicazione: (2025)
di: Wieser, Frederico, et al.
Pubblicazione: (2025)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
Interactive Learning of Single-Index Models via Stochastic Gradient Descent
di: Rajaraman, Nived, et al.
Pubblicazione: (2026)
di: Rajaraman, Nived, et al.
Pubblicazione: (2026)
Batch Normalization Decomposed
di: Nachum, Ido, et al.
Pubblicazione: (2024)
di: Nachum, Ido, et al.
Pubblicazione: (2024)
Subsampling Suffices for Adaptive Data Analysis
di: Blanc, Guy
Pubblicazione: (2023)
di: Blanc, Guy
Pubblicazione: (2023)
The Fair Value of Data Under Heterogeneous Privacy Constraints in Federated Learning
di: Kang, Justin, et al.
Pubblicazione: (2023)
di: Kang, Justin, et al.
Pubblicazione: (2023)
Effective Context in Transformers: An Analysis of Fragmentation and Tokenization
di: Fesharaki, Amirmehdi Jafari, et al.
Pubblicazione: (2026)
di: Fesharaki, Amirmehdi Jafari, et al.
Pubblicazione: (2026)
Understanding Factual Recall in Transformers via Associative Memories
di: Nichani, Eshaan, et al.
Pubblicazione: (2024)
di: Nichani, Eshaan, et al.
Pubblicazione: (2024)
An Enhanced Text Compression Approach Using Transformer-based Language Models
di: Rahman, Chowdhury Mofizur, et al.
Pubblicazione: (2024)
di: Rahman, Chowdhury Mofizur, et al.
Pubblicazione: (2024)
Block-Sample MAC-Bayes Generalization Bounds
di: Frey, Matthias, et al.
Pubblicazione: (2026)
di: Frey, Matthias, et al.
Pubblicazione: (2026)
Iterative Counterfactual Data Augmentation
di: Plyler, Mitchell, et al.
Pubblicazione: (2025)
di: Plyler, Mitchell, et al.
Pubblicazione: (2025)
Efficient Learned Data Compression via Dual-Stream Feature Decoupling
di: Ma, Huidong, et al.
Pubblicazione: (2026)
di: Ma, Huidong, et al.
Pubblicazione: (2026)
Quantifying Logical Consistency in Transformers via Query-Key Alignment
di: Tulchinskii, Eduard, et al.
Pubblicazione: (2025)
di: Tulchinskii, Eduard, et al.
Pubblicazione: (2025)
Computational Intractability of Strategizing against Online Learners
di: Assos, Angelos, et al.
Pubblicazione: (2025)
di: Assos, Angelos, et al.
Pubblicazione: (2025)
InfAlign: Inference-aware language model alignment
di: Balashankar, Ananth, et al.
Pubblicazione: (2024)
di: Balashankar, Ananth, et al.
Pubblicazione: (2024)
In-Context Learning with Representations: Contextual Generalization of Trained Transformers
di: Yang, Tong, et al.
Pubblicazione: (2024)
di: Yang, Tong, et al.
Pubblicazione: (2024)
Measuring Uncertainty in Transformer Circuits with Effective Information Consistency
di: Krasnovsky, Anatoly A.
Pubblicazione: (2025)
di: Krasnovsky, Anatoly A.
Pubblicazione: (2025)
Locally Private Parametric Methods for Change-Point Detection
di: Yadav, Anuj Kumar, et al.
Pubblicazione: (2026)
di: Yadav, Anuj Kumar, et al.
Pubblicazione: (2026)
Properties of the Strong Data Processing Constant for Rényi Divergence
di: Jin, Lifu, et al.
Pubblicazione: (2024)
di: Jin, Lifu, et al.
Pubblicazione: (2024)
Pause Tokens Strictly Increase the Expressivity of Constant-Depth Transformers
di: London, Charles, et al.
Pubblicazione: (2025)
di: London, Charles, et al.
Pubblicazione: (2025)
Collaborative Compressors in Distributed Mean Estimation with Limited Communication Budget
di: Vardhan, Harsh, et al.
Pubblicazione: (2026)
di: Vardhan, Harsh, et al.
Pubblicazione: (2026)
Theoretical guarantees on the best-of-n alignment policy
di: Beirami, Ahmad, et al.
Pubblicazione: (2024)
di: Beirami, Ahmad, et al.
Pubblicazione: (2024)
A Mathematical Theory for Learning Semantic Languages by Abstract Learners
di: Liao, Kuo-Yu, et al.
Pubblicazione: (2024)
di: Liao, Kuo-Yu, et al.
Pubblicazione: (2024)
MultiTok: Variable-Length Tokenization for Efficient LLMs Adapted from LZW Compression
di: Elias, Noel, et al.
Pubblicazione: (2024)
di: Elias, Noel, et al.
Pubblicazione: (2024)
Latent Space Alignment for Semantic Channel Equalization
di: Hüttebräucker, Tomás, et al.
Pubblicazione: (2024)
di: Hüttebräucker, Tomás, et al.
Pubblicazione: (2024)
Documenti analoghi
-
From Markov to Laplace: How Mamba In-Context Learns Markov Chains
di: Bondaschi, Marco, et al.
Pubblicazione: (2025) -
Attention with Markov: A Framework for Principled Analysis of Transformers via Markov Chains
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2024) -
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
di: Nagle, Alliot, et al.
Pubblicazione: (2024) -
Local to Global: Learning Dynamics and Effect of Initialization for Transformers
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2024) -
LASER: Linear Compression in Wireless Distributed Optimization
di: Makkuva, Ashok Vardhan, et al.
Pubblicazione: (2023)