The Cursive Transformer
Fuente:
arXiv
Guardado en:
| Autores principales: | Greydanus, Sam, Wimpee, Zachary |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
When Models Examine Themselves: Vocabulary-Activation Correspondence in Self-Referential Processing
por: Dadfar, Zachary Pedram
Publicado: (2026)
por: Dadfar, Zachary Pedram
Publicado: (2026)
Proving that Cryptic Crossword Clue Answers are Correct
por: Andrews, Martin, et al.
Publicado: (2024)
por: Andrews, Martin, et al.
Publicado: (2024)
Scaling Down Deep Learning with MNIST-1D
por: Greydanus, Sam, et al.
Publicado: (2020)
por: Greydanus, Sam, et al.
Publicado: (2020)
Efficient Benchmarking Is Just Feature Selection and Multiple Regression
por: Bowyer, Sam, et al.
Publicado: (2026)
por: Bowyer, Sam, et al.
Publicado: (2026)
Towards Detecting Contextual Real-Time Toxicity for In-Game Chat
por: Yang, Zachary, et al.
Publicado: (2023)
por: Yang, Zachary, et al.
Publicado: (2023)
TPTT: Transforming Pretrained Transformers into Titans
por: Furfaro, Fabien
Publicado: (2025)
por: Furfaro, Fabien
Publicado: (2025)
LLM-Select: Feature Selection with Large Language Models
por: Jeong, Daniel P., et al.
Publicado: (2024)
por: Jeong, Daniel P., et al.
Publicado: (2024)
DINT Transformer
por: Cang, Yueyang, et al.
Publicado: (2025)
por: Cang, Yueyang, et al.
Publicado: (2025)
Personalized Language Modeling from Personalized Human Feedback
por: Li, Xinyu, et al.
Publicado: (2024)
por: Li, Xinyu, et al.
Publicado: (2024)
Birdie: Advancing State Space Models with Reward-Driven Objectives and Curricula
por: Blouir, Sam, et al.
Publicado: (2024)
por: Blouir, Sam, et al.
Publicado: (2024)
The Belief State Transformer
por: Hu, Edward S., et al.
Publicado: (2024)
por: Hu, Edward S., et al.
Publicado: (2024)
Three-Phase Transformer
por: Ayyash, Mohammad R. Abu
Publicado: (2026)
por: Ayyash, Mohammad R. Abu
Publicado: (2026)
Medical Adaptation of Large Language and Vision-Language Models: Are We Making Progress?
por: Jeong, Daniel P., et al.
Publicado: (2024)
por: Jeong, Daniel P., et al.
Publicado: (2024)
Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
por: Krajewski, Jakub, et al.
Publicado: (2025)
por: Krajewski, Jakub, et al.
Publicado: (2025)
VeRO: An Evaluation Harness for Agents to Optimize Agents
por: Ursekar, Varun, et al.
Publicado: (2026)
por: Ursekar, Varun, et al.
Publicado: (2026)
Selective Attention Improves Transformer
por: Leviathan, Yaniv, et al.
Publicado: (2024)
por: Leviathan, Yaniv, et al.
Publicado: (2024)
Fast Byte Latent Transformer
por: Kallini, Julie, et al.
Publicado: (2026)
por: Kallini, Julie, et al.
Publicado: (2026)
Algorithmic Capabilities of Random Transformers
por: Zhong, Ziqian, et al.
Publicado: (2024)
por: Zhong, Ziqian, et al.
Publicado: (2024)
Transformers Struggle to Learn to Search
por: Saparov, Abulhair, et al.
Publicado: (2024)
por: Saparov, Abulhair, et al.
Publicado: (2024)
An Evolved Universal Transformer Memory
por: Cetin, Edoardo, et al.
Publicado: (2024)
por: Cetin, Edoardo, et al.
Publicado: (2024)
On the Ability of Transformers to Verify Plans
por: Sarrof, Yash, et al.
Publicado: (2026)
por: Sarrof, Yash, et al.
Publicado: (2026)
Your Transformer is Secretly Linear
por: Razzhigaev, Anton, et al.
Publicado: (2024)
por: Razzhigaev, Anton, et al.
Publicado: (2024)
TransformLLM: Adapting Large Language Models via LLM-Transformed Reading Comprehension Text
por: Arbel, Iftach, et al.
Publicado: (2024)
por: Arbel, Iftach, et al.
Publicado: (2024)
On the Spatial Structure of Mixture-of-Experts in Transformers
por: Bershatsky, Daniel, et al.
Publicado: (2025)
por: Bershatsky, Daniel, et al.
Publicado: (2025)
Adaptive Computation Pruning for the Forgetting Transformer
por: Lin, Zhixuan, et al.
Publicado: (2025)
por: Lin, Zhixuan, et al.
Publicado: (2025)
Strategic Fusion Optimizes Transformer Compression
por: Rahman, Md Shoaibur
Publicado: (2025)
por: Rahman, Md Shoaibur
Publicado: (2025)
Transformer-Squared: Self-adaptive LLMs
por: Sun, Qi, et al.
Publicado: (2025)
por: Sun, Qi, et al.
Publicado: (2025)
The Role of Sparsity for Length Generalization in Transformers
por: Golowich, Noah, et al.
Publicado: (2025)
por: Golowich, Noah, et al.
Publicado: (2025)
An evolutionary perspective on modes of learning in Transformers
por: Ku, Alexander Y., et al.
Publicado: (2025)
por: Ku, Alexander Y., et al.
Publicado: (2025)
When Can Transformers Count to n?
por: Yehudai, Gilad, et al.
Publicado: (2024)
por: Yehudai, Gilad, et al.
Publicado: (2024)
Transformer Circuit Faithfulness Metrics are not Robust
por: Miller, Joseph, et al.
Publicado: (2024)
por: Miller, Joseph, et al.
Publicado: (2024)
Representing Rule-based Chatbots with Transformers
por: Friedman, Dan, et al.
Publicado: (2024)
por: Friedman, Dan, et al.
Publicado: (2024)
ALTA: Compiler-Based Analysis of Transformers
por: Shaw, Peter, et al.
Publicado: (2024)
por: Shaw, Peter, et al.
Publicado: (2024)
The Geometric Anatomy of Capability Acquisition in Transformers
por: Billa, Jayadev
Publicado: (2026)
por: Billa, Jayadev
Publicado: (2026)
Towards Infinite-Long Prefix in Transformer
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
Momentum Streams for Optimizer-Inspired Transformers
por: Gai, Jingchu, et al.
Publicado: (2026)
por: Gai, Jingchu, et al.
Publicado: (2026)
Does Transformer Interpretability Transfer to RNNs?
por: Paulo, Gonçalo, et al.
Publicado: (2024)
por: Paulo, Gonçalo, et al.
Publicado: (2024)
STAT: Shrinking Transformers After Training
por: Flynn, Megan, et al.
Publicado: (2024)
por: Flynn, Megan, et al.
Publicado: (2024)
The Limited Impact of Medical Adaptation of Large Language and Vision-Language Models
por: Jeong, Daniel P., et al.
Publicado: (2024)
por: Jeong, Daniel P., et al.
Publicado: (2024)
Ejemplares similares
-
When Models Examine Themselves: Vocabulary-Activation Correspondence in Self-Referential Processing
por: Dadfar, Zachary Pedram
Publicado: (2026) -
Proving that Cryptic Crossword Clue Answers are Correct
por: Andrews, Martin, et al.
Publicado: (2024) -
Scaling Down Deep Learning with MNIST-1D
por: Greydanus, Sam, et al.
Publicado: (2020) -
Efficient Benchmarking Is Just Feature Selection and Multiple Regression
por: Bowyer, Sam, et al.
Publicado: (2026) -
Towards Detecting Contextual Real-Time Toxicity for In-Game Chat
por: Yang, Zachary, et al.
Publicado: (2023)