Rethinking State Tracking in Recurrent Models Through Error Control Dynamics
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chung, Jiwan, Choi, Heechan, Kim, Seon Joo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking Pruning Large Language Models: Benefits and Pitfalls of Reconstruction Error Minimization
par: Shin, Sungbin, et autres
Publié: (2024)
par: Shin, Sungbin, et autres
Publié: (2024)
Rethinking Token Reduction for State Space Models
par: Zhan, Zheng, et autres
Publié: (2024)
par: Zhan, Zheng, et autres
Publié: (2024)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
par: Kim, Sunghwan, et autres
Publié: (2025)
par: Kim, Sunghwan, et autres
Publié: (2025)
Global Geometry Is Not Enough for Vision Representations
par: Chung, Jiwan, et autres
Publié: (2026)
par: Chung, Jiwan, et autres
Publié: (2026)
Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues
par: Grazzi, Riccardo, et autres
Publié: (2024)
par: Grazzi, Riccardo, et autres
Publié: (2024)
Taming Momentum: Rethinking Optimizer States Through Low-Rank Approximation
par: Wang, Zhengbo, et autres
Publié: (2026)
par: Wang, Zhengbo, et autres
Publié: (2026)
Tracking Universal Features Through Fine-Tuning and Model Merging
par: Horn, Niels, et autres
Publié: (2024)
par: Horn, Niels, et autres
Publié: (2024)
Advancing Regular Language Reasoning in Linear Recurrent Neural Networks
par: Fan, Ting-Han, et autres
Publié: (2023)
par: Fan, Ting-Han, et autres
Publié: (2023)
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
par: Chung, Woojin, et autres
Publié: (2025)
par: Chung, Woojin, et autres
Publié: (2025)
Revisiting Bi-Linear State Transitions in Recurrent Neural Networks
par: Ebrahimi, M. Reza, et autres
Publié: (2025)
par: Ebrahimi, M. Reza, et autres
Publié: (2025)
Rethinking the Role of Proxy Rewards in Language Model Alignment
par: Kim, Sungdong, et autres
Publié: (2024)
par: Kim, Sungdong, et autres
Publié: (2024)
Associative-State Universal Transformers: Sparse Retrieval Meets Structured Recurrence
par: Xiao, Liu
Publié: (2026)
par: Xiao, Liu
Publié: (2026)
MemMamba: Rethinking Memory Patterns in State Space Model
par: Wang, Youjin, et autres
Publié: (2025)
par: Wang, Youjin, et autres
Publié: (2025)
(How) Do Language Models Track State?
par: Li, Belinda Z., et autres
Publié: (2025)
par: Li, Belinda Z., et autres
Publié: (2025)
Mitigating Quantization Errors Due to Activation Spikes in GLU-Based LLMs
par: Yang, Jaewoo, et autres
Publié: (2024)
par: Yang, Jaewoo, et autres
Publié: (2024)
On the Representational Capacity of Recurrent Neural Language Models
par: Nowak, Franz, et autres
Publié: (2023)
par: Nowak, Franz, et autres
Publié: (2023)
Selective Generation for Controllable Language Models
par: Lee, Minjae, et autres
Publié: (2023)
par: Lee, Minjae, et autres
Publié: (2023)
Diable: Efficient Dialogue State Tracking as Operations on Tables
par: Lesci, Pietro, et autres
Publié: (2023)
par: Lesci, Pietro, et autres
Publié: (2023)
Sentence Curve Language Models
par: Heo, DongNyeong, et autres
Publié: (2026)
par: Heo, DongNyeong, et autres
Publié: (2026)
Rethinking Genomic Modeling Through Optical Character Recognition
par: Xiang, Hongxin, et autres
Publié: (2026)
par: Xiang, Hongxin, et autres
Publié: (2026)
Rethinking Machine Unlearning for Large Language Models
par: Liu, Sijia, et autres
Publié: (2024)
par: Liu, Sijia, et autres
Publié: (2024)
Tracking Temporal Dynamics of Vector Sets with Gaussian Process
par: Aida, Taichi, et autres
Publié: (2025)
par: Aida, Taichi, et autres
Publié: (2025)
Learning State-Tracking from Code Using Linear RNNs
par: Siems, Julien, et autres
Publié: (2026)
par: Siems, Julien, et autres
Publié: (2026)
Finite State Automata Inside Transformers with Chain-of-Thought: A Mechanistic Study on State Tracking
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Rethinking LLM Ensembling from the Perspective of Mixture Models
par: Fu, Jiale, et autres
Publié: (2026)
par: Fu, Jiale, et autres
Publié: (2026)
Task Diversity Shortens the ICL Plateau
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
Correlated Errors in Large Language Models
par: Kim, Elliot, et autres
Publié: (2025)
par: Kim, Elliot, et autres
Publié: (2025)
Understanding Dynamic Compute Allocation in Recurrent Transformers
par: Moosa, Ibraheem Muhammad, et autres
Publié: (2026)
par: Moosa, Ibraheem Muhammad, et autres
Publié: (2026)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
par: Cheng, Yunfei, et autres
Publié: (2024)
par: Cheng, Yunfei, et autres
Publié: (2024)
Efficient Parallel Samplers for Recurrent-Depth Models and Their Connection to Diffusion Language Models
par: Geiping, Jonas, et autres
Publié: (2025)
par: Geiping, Jonas, et autres
Publié: (2025)
Tracking the Feature Dynamics in LLM Training: A Mechanistic Study
par: Xu, Yang, et autres
Publié: (2024)
par: Xu, Yang, et autres
Publié: (2024)
State Stream Transformer (SST) V2: Parallel Training of Nonlinear Recurrence for Latent Space Reasoning
par: Aviss, Thea
Publié: (2026)
par: Aviss, Thea
Publié: (2026)
Rethinking Token Prediction: Tree-Structured Diffusion Language Model
par: Wu, Zihao, et autres
Publié: (2026)
par: Wu, Zihao, et autres
Publié: (2026)
Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses
par: Kim, Sungnyun, et autres
Publié: (2025)
par: Kim, Sungnyun, et autres
Publié: (2025)
S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models
par: Young, Jack
Publié: (2026)
par: Young, Jack
Publié: (2026)
How Prompts Move Language Model Behavior: Frames, Salience, and Construal as Semantic Control
par: Kim, Dongseok, et autres
Publié: (2025)
par: Kim, Dongseok, et autres
Publié: (2025)
The UNDO Flip-Flop: A Controlled Probe for Reversible Semantic State Management in State Space Model
par: Zhou, Hongxu
Publié: (2026)
par: Zhou, Hongxu
Publié: (2026)
Continuous Language Model Interpolation for Dynamic and Controllable Text Generation
par: Kangaslahti, Sara, et autres
Publié: (2024)
par: Kangaslahti, Sara, et autres
Publié: (2024)
Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity
par: Hinostroza, Cristian, et autres
Publié: (2026)
par: Hinostroza, Cristian, et autres
Publié: (2026)
Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
par: Faria, Gonçalo, et autres
Publié: (2025)
par: Faria, Gonçalo, et autres
Publié: (2025)
Documents similaires
-
Rethinking Pruning Large Language Models: Benefits and Pitfalls of Reconstruction Error Minimization
par: Shin, Sungbin, et autres
Publié: (2024) -
Rethinking Token Reduction for State Space Models
par: Zhan, Zheng, et autres
Publié: (2024) -
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
par: Kim, Sunghwan, et autres
Publié: (2025) -
Global Geometry Is Not Enough for Vision Representations
par: Chung, Jiwan, et autres
Publié: (2026) -
Unlocking State-Tracking in Linear RNNs Through Negative Eigenvalues
par: Grazzi, Riccardo, et autres
Publié: (2024)