Understanding Transformer from the Perspective of Associative Memory
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhong, Shu, Xu, Mingyu, Ao, Tenglong, Shi, Guang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tensor Cache: Eviction-conditioned Associative Memory for Transformers
par: Swain, Kabir, et autres
Publié: (2026)
par: Swain, Kabir, et autres
Publié: (2026)
Understanding Representation of Deep Equilibrium Models from Neural Collapse Perspective
par: Sun, Haixiang, et autres
Publié: (2024)
par: Sun, Haixiang, et autres
Publié: (2024)
MeSH: Memory-as-State-Highways for Recursive Transformers
par: Yu, Chengting, et autres
Publié: (2025)
par: Yu, Chengting, et autres
Publié: (2025)
AtMan: Understanding Transformer Predictions Through Memory Efficient Attention Manipulation
par: Deiseroth, Björn, et autres
Publié: (2023)
par: Deiseroth, Björn, et autres
Publié: (2023)
Rethinking Langevin Thompson Sampling from A Stochastic Approximation Perspective
par: Wang, Weixin, et autres
Publié: (2025)
par: Wang, Weixin, et autres
Publié: (2025)
The Memory Perturbation Equation: Understanding Model's Sensitivity to Data
par: Nickl, Peter, et autres
Publié: (2023)
par: Nickl, Peter, et autres
Publié: (2023)
Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation
par: Yang, Yuchen, et autres
Publié: (2024)
par: Yang, Yuchen, et autres
Publié: (2024)
Hybrid Associative Memories
par: Lufkin, Leon, et autres
Publié: (2026)
par: Lufkin, Leon, et autres
Publié: (2026)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
par: Liu, Tenglong, et autres
Publié: (2024)
par: Liu, Tenglong, et autres
Publié: (2024)
Recurrent Action Transformer with Memory
par: Cherepanov, Egor, et autres
Publié: (2023)
par: Cherepanov, Egor, et autres
Publié: (2023)
Understanding Addition in Transformers
par: Quirke, Philip, et autres
Publié: (2023)
par: Quirke, Philip, et autres
Publié: (2023)
Associative Recurrent Memory Transformer
par: Rodkin, Ivan, et autres
Publié: (2024)
par: Rodkin, Ivan, et autres
Publié: (2024)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
par: Wu, Xiefeng, et autres
Publié: (2025)
par: Wu, Xiefeng, et autres
Publié: (2025)
Learning Associative Memories with Gradient Descent
par: Cabannes, Vivien, et autres
Publié: (2024)
par: Cabannes, Vivien, et autres
Publié: (2024)
Memory Caching: RNNs with Growing Memory
par: Behrouz, Ali, et autres
Publié: (2026)
par: Behrouz, Ali, et autres
Publié: (2026)
Principled Understanding of Generalization for Generative Transformer Models in Arithmetic Reasoning Tasks
par: Xu, Xingcheng, et autres
Publié: (2024)
par: Xu, Xingcheng, et autres
Publié: (2024)
Transformer-Based Spatial-Temporal Counterfactual Outcomes Estimation
par: Li, He, et autres
Publié: (2025)
par: Li, He, et autres
Publié: (2025)
Parallel BiLSTM-Transformer networks for forecasting chaotic dynamics
par: Ma, Junwen, et autres
Publié: (2025)
par: Ma, Junwen, et autres
Publié: (2025)
Honest Lying: Understanding Memory Confabulation in Reflexive Agents
par: Dixit, Prakhar, et autres
Publié: (2026)
par: Dixit, Prakhar, et autres
Publié: (2026)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
par: Ma, Yunchang, et autres
Publié: (2025)
par: Ma, Yunchang, et autres
Publié: (2025)
Skill Expansion and Composition in Parameter Space
par: Liu, Tenglong, et autres
Publié: (2025)
par: Liu, Tenglong, et autres
Publié: (2025)
Context Distillation as Latent Memory Management
par: Zheng, Ziyang, et autres
Publié: (2026)
par: Zheng, Ziyang, et autres
Publié: (2026)
LENS: Large Pre-trained Transformer for Exploring Financial Time Series Regularities
par: Xu, Yuanjian, et autres
Publié: (2024)
par: Xu, Yuanjian, et autres
Publié: (2024)
It Ain't That Bad: Understanding the Mysterious Performance Drop in OOD Generalization for Generative Transformer Models
par: Xu, Xingcheng, et autres
Publié: (2023)
par: Xu, Xingcheng, et autres
Publié: (2023)
Re:Frame -- Retrieving Experience From Associative Memory
par: Zelezetsky, Daniil, et autres
Publié: (2025)
par: Zelezetsky, Daniil, et autres
Publié: (2025)
EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents
par: Liu, Jiaqi, et autres
Publié: (2026)
par: Liu, Jiaqi, et autres
Publié: (2026)
Echo State Transformer: Attention Over Finite Memories
par: Bendi-Ouis, Yannis, et autres
Publié: (2025)
par: Bendi-Ouis, Yannis, et autres
Publié: (2025)
Understanding Transformer Architecture through Continuous Dynamics: A Partial Differential Equation Perspective
par: Zhang, Yukun, et autres
Publié: (2024)
par: Zhang, Yukun, et autres
Publié: (2024)
Curse of Attention: A Kernel-Based Perspective for Why Transformers Fail to Generalize on Time Series Forecasting and Beyond
par: Ke, Yekun, et autres
Publié: (2024)
par: Ke, Yekun, et autres
Publié: (2024)
Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary
par: Pan, Licheng, et autres
Publié: (2025)
par: Pan, Licheng, et autres
Publié: (2025)
ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning
par: Sun, Zhishen, et autres
Publié: (2026)
par: Sun, Zhishen, et autres
Publié: (2026)
The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory
par: Tang, Luoxi, et autres
Publié: (2026)
par: Tang, Luoxi, et autres
Publié: (2026)
Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
par: Sung, Mingyu, et autres
Publié: (2025)
par: Sung, Mingyu, et autres
Publié: (2025)
Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization
par: Tan, Chengli, et autres
Publié: (2025)
par: Tan, Chengli, et autres
Publié: (2025)
A Flat Minima Perspective on Understanding Augmentations and Model Robustness
par: Yoo, Weebum, et autres
Publié: (2025)
par: Yoo, Weebum, et autres
Publié: (2025)
GPU Memory Requirement Prediction for Deep Learning Task Based on Bidirectional Gated Recurrent Unit Optimization Transformer
par: Wang, Chao, et autres
Publié: (2025)
par: Wang, Chao, et autres
Publié: (2025)
LOOKAT: Lookup-Optimized Key-Attention for Memory-Efficient Transformers
par: Karmore, Aryan
Publié: (2026)
par: Karmore, Aryan
Publié: (2026)
QFlash: Bridging Quantization and Memory Efficiency in Vision Transformer Attention
par: Oh, Sehyeon, et autres
Publié: (2026)
par: Oh, Sehyeon, et autres
Publié: (2026)
Retrieval-Augmented Decision Transformer: External Memory for In-context RL
par: Schmied, Thomas, et autres
Publié: (2024)
par: Schmied, Thomas, et autres
Publié: (2024)
POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation
par: Qiu, Zeju, et autres
Publié: (2026)
par: Qiu, Zeju, et autres
Publié: (2026)
Documents similaires
-
Tensor Cache: Eviction-conditioned Associative Memory for Transformers
par: Swain, Kabir, et autres
Publié: (2026) -
Understanding Representation of Deep Equilibrium Models from Neural Collapse Perspective
par: Sun, Haixiang, et autres
Publié: (2024) -
MeSH: Memory-as-State-Highways for Recursive Transformers
par: Yu, Chengting, et autres
Publié: (2025) -
AtMan: Understanding Transformer Predictions Through Memory Efficient Attention Manipulation
par: Deiseroth, Björn, et autres
Publié: (2023) -
Rethinking Langevin Thompson Sampling from A Stochastic Approximation Perspective
par: Wang, Weixin, et autres
Publié: (2025)