Guardado en:
| Autores principales: | Siems, Julien, Grazzi, Riccardo, Kalinin, Kirill, Ballani, Hitesh, Rahmani, Babak |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.14814 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DeltaProduct: Improving State-Tracking in Linear RNNs via Householder Products
por: Siems, Julien, et al.
Publicado: (2025)
por: Siems, Julien, et al.
Publicado: (2025)
Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues
por: Grazzi, Riccardo, et al.
Publicado: (2024)
por: Grazzi, Riccardo, et al.
Publicado: (2024)
Implicit Language Models are RNNs: Balancing Parallelization and Expressivity
por: Schöne, Mark, et al.
Publicado: (2025)
por: Schöne, Mark, et al.
Publicado: (2025)
Is Mamba Capable of In-Context Learning?
por: Grazzi, Riccardo, et al.
Publicado: (2024)
por: Grazzi, Riccardo, et al.
Publicado: (2024)
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
por: Gadhikar, Advait, et al.
Publicado: (2025)
por: Gadhikar, Advait, et al.
Publicado: (2025)
Why Are Linear RNNs More Parallelizable?
por: Merrill, William, et al.
Publicado: (2026)
por: Merrill, William, et al.
Publicado: (2026)
Debugging code world models
por: Rahmani, Babak
Publicado: (2026)
por: Rahmani, Babak
Publicado: (2026)
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
por: Sun, Yu, et al.
Publicado: (2024)
por: Sun, Yu, et al.
Publicado: (2024)
TempoPFN: Synthetic Pre-training of Linear RNNs for Zero-shot Time Series Forecasting
por: Moroshan, Vladyslav, et al.
Publicado: (2025)
por: Moroshan, Vladyslav, et al.
Publicado: (2025)
Uncovering the Computational Roles of Nonlinearity in Sequence Modeling Using Almost-Linear RNNs
por: Brenner, Manuel, et al.
Publicado: (2025)
por: Brenner, Manuel, et al.
Publicado: (2025)
On Efficiently Representing Regular Languages as RNNs
por: Svete, Anej, et al.
Publicado: (2024)
por: Svete, Anej, et al.
Publicado: (2024)
RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval
por: Wen, Kaiyue, et al.
Publicado: (2024)
por: Wen, Kaiyue, et al.
Publicado: (2024)
Comba: Improving Bilinear RNNs with Closed-loop Control
por: Hu, Jiaxi, et al.
Publicado: (2025)
por: Hu, Jiaxi, et al.
Publicado: (2025)
Does Transformer Interpretability Transfer to RNNs?
por: Paulo, Gonçalo, et al.
Publicado: (2024)
por: Paulo, Gonçalo, et al.
Publicado: (2024)
Compositional Reasoning with Transformers, RNNs, and Chain of Thought
por: Yehudai, Gilad, et al.
Publicado: (2025)
por: Yehudai, Gilad, et al.
Publicado: (2025)
An enhanced Teaching-Learning-Based Optimization (TLBO) with Grey Wolf Optimizer (GWO) for text feature selection and clustering
por: Azarshab, Mahsa, et al.
Publicado: (2024)
por: Azarshab, Mahsa, et al.
Publicado: (2024)
Diable: Efficient Dialogue State Tracking as Operations on Tables
por: Lesci, Pietro, et al.
Publicado: (2023)
por: Lesci, Pietro, et al.
Publicado: (2023)
Variable-Length Semantic IDs for Recommender Systems
por: Khrylchenko, Kirill
Publicado: (2026)
por: Khrylchenko, Kirill
Publicado: (2026)
Enhancing Transformer RNNs with Multiple Temporal Perspectives
por: Dumitru, Razvan-Gabriel, et al.
Publicado: (2024)
por: Dumitru, Razvan-Gabriel, et al.
Publicado: (2024)
Scaling Linear Attention with Sparse State Expansion
por: Pan, Yuqi, et al.
Publicado: (2025)
por: Pan, Yuqi, et al.
Publicado: (2025)
Finite State Automata Inside Transformers with Chain-of-Thought: A Mechanistic Study on State Tracking
por: Zhang, Yifan, et al.
Publicado: (2025)
por: Zhang, Yifan, et al.
Publicado: (2025)
Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts
por: Chourasia, Shivam, et al.
Publicado: (2026)
por: Chourasia, Shivam, et al.
Publicado: (2026)
HGRN2: Gated Linear RNNs with State Expansion
por: Qin, Zhen, et al.
Publicado: (2024)
por: Qin, Zhen, et al.
Publicado: (2024)
A Lightweight Method to Disrupt Memorized Sequences in LLM
por: Prashant, Parjanya Prajakta, et al.
Publicado: (2025)
por: Prashant, Parjanya Prajakta, et al.
Publicado: (2025)
Rethinking State Tracking in Recurrent Models Through Error Control Dynamics
por: Chung, Jiwan, et al.
Publicado: (2026)
por: Chung, Jiwan, et al.
Publicado: (2026)
Revisiting Bi-Linear State Transitions in Recurrent Neural Networks
por: Ebrahimi, M. Reza, et al.
Publicado: (2025)
por: Ebrahimi, M. Reza, et al.
Publicado: (2025)
Clinical QA 2.0: Multi-Task Learning for Answer Extraction and Categorization
por: Pattnayak, Priyaranjan, et al.
Publicado: (2025)
por: Pattnayak, Priyaranjan, et al.
Publicado: (2025)
DREaM: Drug-Drug Relation Extraction via Transfer Learning Method
por: Fata, Ali, et al.
Publicado: (2025)
por: Fata, Ali, et al.
Publicado: (2025)
(How) Do Language Models Track State?
por: Li, Belinda Z., et al.
Publicado: (2025)
por: Li, Belinda Z., et al.
Publicado: (2025)
Convergence Properties of Stochastic Hypergradients
por: Grazzi, Riccardo, et al.
Publicado: (2020)
por: Grazzi, Riccardo, et al.
Publicado: (2020)
Injecting linguistic knowledge into BERT for Dialogue State Tracking
por: Feng, Xiaohan, et al.
Publicado: (2023)
por: Feng, Xiaohan, et al.
Publicado: (2023)
$K^4$: Online Log Anomaly Detection Via Unsupervised Typicality Learning
por: Chen, Weicong, et al.
Publicado: (2025)
por: Chen, Weicong, et al.
Publicado: (2025)
MaxCode: A Max-Reward Reinforcement Learning Framework for Automated Code Optimization
por: Ou, Jiefu, et al.
Publicado: (2026)
por: Ou, Jiefu, et al.
Publicado: (2026)
Learning and Transferring Sparse Contextual Bigrams with Linear Transformers
por: Ren, Yunwei, et al.
Publicado: (2024)
por: Ren, Yunwei, et al.
Publicado: (2024)
Toward a Flexible Framework for Linear Representation Hypothesis Using Maximum Likelihood Estimation
por: Nguyen, Trung, et al.
Publicado: (2025)
por: Nguyen, Trung, et al.
Publicado: (2025)
Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
por: Bao, Keqin, et al.
Publicado: (2025)
por: Bao, Keqin, et al.
Publicado: (2025)
Skewed Memorization in Large Language Models: Quantification and Decomposition
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Suggesting Code Edits in Interactive Machine Learning Notebooks Using Large Language Models
por: Jin, Bihui, et al.
Publicado: (2025)
por: Jin, Bihui, et al.
Publicado: (2025)
HealthQ: Unveiling Questioning Capabilities of LLM Chains in Healthcare Conversations
por: Wang, Ziyu, et al.
Publicado: (2024)
por: Wang, Ziyu, et al.
Publicado: (2024)
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
por: Kim, Eunsu, et al.
Publicado: (2025)
por: Kim, Eunsu, et al.
Publicado: (2025)
Ejemplares similares
-
DeltaProduct: Improving State-Tracking in Linear RNNs via Householder Products
por: Siems, Julien, et al.
Publicado: (2025) -
Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues
por: Grazzi, Riccardo, et al.
Publicado: (2024) -
Implicit Language Models are RNNs: Balancing Parallelization and Expressivity
por: Schöne, Mark, et al.
Publicado: (2025) -
Is Mamba Capable of In-Context Learning?
por: Grazzi, Riccardo, et al.
Publicado: (2024) -
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
por: Gadhikar, Advait, et al.
Publicado: (2025)