Titans: Learning to Memorize at Test Time
Fuente:
arXiv
Salvato in:
| Autori principali: | Behrouz, Ali, Zhong, Peilin, Mirrokni, Vahab |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization
di: Behrouz, Ali, et al.
Pubblicazione: (2025)
di: Behrouz, Ali, et al.
Pubblicazione: (2025)
ATLAS: Learning to Optimally Memorize the Context at Test Time
di: Behrouz, Ali, et al.
Pubblicazione: (2025)
di: Behrouz, Ali, et al.
Pubblicazione: (2025)
TNT: Improving Chunkwise Training for Test-Time Memorization
di: Li, Zeman, et al.
Pubblicazione: (2025)
di: Li, Zeman, et al.
Pubblicazione: (2025)
Nested Learning: The Illusion of Deep Learning Architectures
di: Behrouz, Ali, et al.
Pubblicazione: (2025)
di: Behrouz, Ali, et al.
Pubblicazione: (2025)
Memory Caching: RNNs with Growing Memory
di: Behrouz, Ali, et al.
Pubblicazione: (2026)
di: Behrouz, Ali, et al.
Pubblicazione: (2026)
Trellis: Learning to Compress Key-Value Memory in Attention Models
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
ECO: Quantized Training without Full-Precision Master Weights
di: Nikdan, Mahdi, et al.
Pubblicazione: (2026)
di: Nikdan, Mahdi, et al.
Pubblicazione: (2026)
Understanding the Role of Training Data in Test-Time Scaling
di: Javanmard, Adel, et al.
Pubblicazione: (2025)
di: Javanmard, Adel, et al.
Pubblicazione: (2025)
MS-SSM: A Multi-Scale State Space Model for Efficient Sequence Modeling
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
Addax: Utilizing Zeroth-Order Gradients to Improve Memory Efficiency and Performance of SGD for Fine-Tuning Language Models
di: Li, Zeman, et al.
Pubblicazione: (2024)
di: Li, Zeman, et al.
Pubblicazione: (2024)
Memorization in In-Context Learning
di: Golchin, Shahriar, et al.
Pubblicazione: (2024)
di: Golchin, Shahriar, et al.
Pubblicazione: (2024)
Lattice: Learning to Efficiently Compress the Memory
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
DREaM: Drug-Drug Relation Extraction via Transfer Learning Method
di: Fata, Ali, et al.
Pubblicazione: (2025)
di: Fata, Ali, et al.
Pubblicazione: (2025)
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
di: Javanmard, Adel, et al.
Pubblicazione: (2026)
di: Javanmard, Adel, et al.
Pubblicazione: (2026)
TPTT: Transforming Pretrained Transformers into Titans
di: Furfaro, Fabien
Pubblicazione: (2025)
di: Furfaro, Fabien
Pubblicazione: (2025)
TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
di: Qu, Leigang, et al.
Pubblicazione: (2025)
di: Qu, Leigang, et al.
Pubblicazione: (2025)
Optimistic Rates for Learning from Label Proportions
di: Li, Gene, et al.
Pubblicazione: (2024)
di: Li, Gene, et al.
Pubblicazione: (2024)
Mitigating Unintended Memorization with LoRA in Federated Learning for LLMs
di: Bossy, Thierry, et al.
Pubblicazione: (2025)
di: Bossy, Thierry, et al.
Pubblicazione: (2025)
Mitigating Memorization In Language Models
di: Sakarvadia, Mansi, et al.
Pubblicazione: (2024)
di: Sakarvadia, Mansi, et al.
Pubblicazione: (2024)
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
di: Wu, Mingqi, et al.
Pubblicazione: (2025)
di: Wu, Mingqi, et al.
Pubblicazione: (2025)
Detecting Memorization in Large Language Models
di: Slonski, Eduardo
Pubblicazione: (2024)
di: Slonski, Eduardo
Pubblicazione: (2024)
Memorization Dynamics of Fill-in-the-Middle Pretraining
di: von Arx, Tobias, et al.
Pubblicazione: (2026)
di: von Arx, Tobias, et al.
Pubblicazione: (2026)
Memorization: A Close Look at Books
di: Ma, Iris, et al.
Pubblicazione: (2025)
di: Ma, Iris, et al.
Pubblicazione: (2025)
Elephants Never Forget: Memorization and Learning of Tabular Data in Large Language Models
di: Bordt, Sebastian, et al.
Pubblicazione: (2024)
di: Bordt, Sebastian, et al.
Pubblicazione: (2024)
A New Method for Cross-Lingual-based Semantic Role Labeling
di: Ebrahimi, Mohammad, et al.
Pubblicazione: (2024)
di: Ebrahimi, Mohammad, et al.
Pubblicazione: (2024)
Exploring Memorization in Fine-tuned Language Models
di: Zeng, Shenglai, et al.
Pubblicazione: (2023)
di: Zeng, Shenglai, et al.
Pubblicazione: (2023)
PolySketchFormer: Fast Transformers via Sketching Polynomial Kernels
di: Kacham, Praneeth, et al.
Pubblicazione: (2023)
di: Kacham, Praneeth, et al.
Pubblicazione: (2023)
Test-Time Learning for Large Language Models
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
Learning to Reason from Feedback at Test-Time
di: Li, Yanyang, et al.
Pubblicazione: (2025)
di: Li, Yanyang, et al.
Pubblicazione: (2025)
Reinforcement Learning Teachers of Test Time Scaling
di: Cetin, Edoardo, et al.
Pubblicazione: (2025)
di: Cetin, Edoardo, et al.
Pubblicazione: (2025)
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
di: Sun, Yu, et al.
Pubblicazione: (2024)
di: Sun, Yu, et al.
Pubblicazione: (2024)
An Evaluation on Large Language Model Outputs: Discourse and Memorization
di: de Wynter, Adrian, et al.
Pubblicazione: (2023)
di: de Wynter, Adrian, et al.
Pubblicazione: (2023)
Memorization vs. Reasoning: Updating LLMs with New Knowledge
di: Li, Aochong Oliver, et al.
Pubblicazione: (2025)
di: Li, Aochong Oliver, et al.
Pubblicazione: (2025)
Skewed Memorization in Large Language Models: Quantification and Decomposition
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining
di: Singh, Karan, et al.
Pubblicazione: (2026)
di: Singh, Karan, et al.
Pubblicazione: (2026)
CoSPlay: Cooperative Self-Play at Test-Time with Self-Generated Code and Unit Test
di: Hu, Zhangyi, et al.
Pubblicazione: (2026)
di: Hu, Zhangyi, et al.
Pubblicazione: (2026)
SubGen: Token Generation in Sublinear Time and Memory
di: Zandieh, Amir, et al.
Pubblicazione: (2024)
di: Zandieh, Amir, et al.
Pubblicazione: (2024)
Test-Time Detoxification without Training or Learning Anything
di: Saglam, Baturay, et al.
Pubblicazione: (2026)
di: Saglam, Baturay, et al.
Pubblicazione: (2026)
Sampling and Loss Weights in Multi-Domain Training
di: Salmani, Mahdi, et al.
Pubblicazione: (2025)
di: Salmani, Mahdi, et al.
Pubblicazione: (2025)
Pruning as a Defense: Reducing Memorization in Large Language Models
di: Gupta, Mansi, et al.
Pubblicazione: (2025)
di: Gupta, Mansi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization
di: Behrouz, Ali, et al.
Pubblicazione: (2025) -
ATLAS: Learning to Optimally Memorize the Context at Test Time
di: Behrouz, Ali, et al.
Pubblicazione: (2025) -
TNT: Improving Chunkwise Training for Test-Time Memorization
di: Li, Zeman, et al.
Pubblicazione: (2025) -
Nested Learning: The Illusion of Deep Learning Architectures
di: Behrouz, Ali, et al.
Pubblicazione: (2025) -
Memory Caching: RNNs with Growing Memory
di: Behrouz, Ali, et al.
Pubblicazione: (2026)