To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Malach, Eran, Saremi, Omid, Williamson, Sinead, Bradley, Arwen, Lotfi, Aryo, Abbe, Emmanuel, Susskind, Josh, Littwin, Etai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Annotations Mitigate Post-Training Mode Collapse
par: Springer, Jacob Mitchell, et autres
Publié: (2026)
par: Springer, Jacob Mitchell, et autres
Publié: (2026)
When can transformers reason with abstract symbols?
par: Boix-Adsera, Enric, et autres
Publié: (2023)
par: Boix-Adsera, Enric, et autres
Publié: (2023)
Vanishing Gradients in Reinforcement Finetuning of Language Models
par: Razin, Noam, et autres
Publié: (2023)
par: Razin, Noam, et autres
Publié: (2023)
How Far Can Transformers Reason? The Globality Barrier and Inductive Scratchpad
par: Abbe, Emmanuel, et autres
Publié: (2024)
par: Abbe, Emmanuel, et autres
Publié: (2024)
Rethinking JEPA: Compute-Efficient Video SSL with Frozen Teachers
par: Li, Xianhang, et autres
Publié: (2025)
par: Li, Xianhang, et autres
Publié: (2025)
How JEPA Avoids Noisy Features: The Implicit Bias of Deep Linear Self Distillation Networks
par: Littwin, Etai, et autres
Publié: (2024)
par: Littwin, Etai, et autres
Publié: (2024)
Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning
par: Mahrooghi, Ilia, et autres
Publié: (2026)
par: Mahrooghi, Ilia, et autres
Publié: (2026)
Text-Conditional JEPA for Learning Semantically Rich Visual Representations
par: Huang, Chen, et autres
Publié: (2026)
par: Huang, Chen, et autres
Publié: (2026)
Generalization on the Unseen, Logic Reasoning and Degree Curriculum
par: Abbe, Emmanuel, et autres
Publié: (2023)
par: Abbe, Emmanuel, et autres
Publié: (2023)
Trace Length is a Simple Uncertainty Signal in Reasoning Models
par: Devic, Siddartha, et autres
Publié: (2025)
par: Devic, Siddartha, et autres
Publié: (2025)
Chain-of-Sketch: Enabling Global Visual Reasoning
par: Lotfi, Aryo, et autres
Publié: (2024)
par: Lotfi, Aryo, et autres
Publié: (2024)
Enhancing JEPAs with Spatial Conditioning: Robust and Efficient Representation Learning
par: Littwin, Etai, et autres
Publié: (2024)
par: Littwin, Etai, et autres
Publié: (2024)
Auto-Regressive Next-Token Predictors are Universal Learners
par: Malach, Eran
Publié: (2023)
par: Malach, Eran
Publié: (2023)
Local Mechanisms of Compositional Generalization in Conditional Diffusion
par: Bradley, Arwen
Publié: (2025)
par: Bradley, Arwen
Publié: (2025)
Universal Length Generalization with Turing Programs
par: Hou, Kaiying, et autres
Publié: (2024)
par: Hou, Kaiying, et autres
Publié: (2024)
Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs
par: Nakkiran, Preetum, et autres
Publié: (2025)
par: Nakkiran, Preetum, et autres
Publié: (2025)
The Role of Sparsity for Length Generalization in Transformers
par: Golowich, Noah, et autres
Publié: (2025)
par: Golowich, Noah, et autres
Publié: (2025)
RL for Reasoning by Adaptively Revealing Rationales
par: Amani, Mohammad Hossein, et autres
Publié: (2025)
par: Amani, Mohammad Hossein, et autres
Publié: (2025)
Repeat After Me: Transformers are Better than State Space Models at Copying
par: Jelassi, Samy, et autres
Publié: (2024)
par: Jelassi, Samy, et autres
Publié: (2024)
The Power of Random Features and the Limits of Distribution-Free Gradient Descent
par: Karchmer, Ari, et autres
Publié: (2025)
par: Karchmer, Ari, et autres
Publié: (2025)
Boolformer: Symbolic Regression of Logic Functions with Transformers
par: d'Ascoli, Stéphane, et autres
Publié: (2023)
par: d'Ascoli, Stéphane, et autres
Publié: (2023)
UI-JEPA: Towards Active Perception of User Intent through Onscreen User Activity
par: Fu, Yicheng, et autres
Publié: (2024)
par: Fu, Yicheng, et autres
Publié: (2024)
Mechanisms of Projective Composition of Diffusion Models
par: Bradley, Arwen, et autres
Publié: (2025)
par: Bradley, Arwen, et autres
Publié: (2025)
Classifier-Free Guidance is a Predictor-Corrector
par: Bradley, Arwen, et autres
Publié: (2024)
par: Bradley, Arwen, et autres
Publié: (2024)
Distillation Scaling Laws
par: Busbridge, Dan, et autres
Publié: (2025)
par: Busbridge, Dan, et autres
Publié: (2025)
LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning
par: Pushkin, Denys, et autres
Publié: (2026)
par: Pushkin, Denys, et autres
Publié: (2026)
Transformation-Invariant Learning and Theoretical Guarantees for OOD Generalization
par: Montasser, Omar, et autres
Publié: (2024)
par: Montasser, Omar, et autres
Publié: (2024)
Self-Supervised Learning with Gaussian Processes
par: Duan, Yunshan, et autres
Publié: (2025)
par: Duan, Yunshan, et autres
Publié: (2025)
Posterior Uncertainty Quantification in Neural Networks using Data Augmentation
par: Wu, Luhuan, et autres
Publié: (2024)
par: Wu, Luhuan, et autres
Publié: (2024)
On the Minimal Degree Bias in Generalization on the Unseen for non-Boolean Functions
par: Pushkin, Denys, et autres
Publié: (2024)
par: Pushkin, Denys, et autres
Publié: (2024)
A Taxonomy of Transcendence
par: Abreu, Natalie, et autres
Publié: (2025)
par: Abreu, Natalie, et autres
Publié: (2025)
LLM Priors for ERM over Programs
par: Singhal, Shivam, et autres
Publié: (2025)
par: Singhal, Shivam, et autres
Publié: (2025)
How Reinforcement Learning After Next-Token Prediction Facilitates Learning
par: Tsilivis, Nikolaos, et autres
Publié: (2025)
par: Tsilivis, Nikolaos, et autres
Publié: (2025)
On the Power of Decision Trees in Auto-Regressive Language Modeling
par: Gan, Yulu, et autres
Publié: (2024)
par: Gan, Yulu, et autres
Publié: (2024)
INRFlow: Flow Matching for INRs in Ambient Space
par: Wang, Yuyang, et autres
Publié: (2024)
par: Wang, Yuyang, et autres
Publié: (2024)
To Backtrack or Not to Backtrack: When Sequential Search Limits Model Reasoning
par: Qin, Tian, et autres
Publié: (2025)
par: Qin, Tian, et autres
Publié: (2025)
Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
par: Li, Wuyang, et autres
Publié: (2025)
par: Li, Wuyang, et autres
Publié: (2025)
More About the Spontaneous Breaking of Time Reversal in de Sitter Space
par: Susskind, Leonard
Publié: (2026)
par: Susskind, Leonard
Publié: (2026)
Is Time Reversal in de Sitter Space a Spontaneously Broken Gauge Symmetry?
par: Susskind, Leonard
Publié: (2026)
par: Susskind, Leonard
Publié: (2026)
Detecting State Changes in Functional Neuronal Connectivity using Factorial Switching Linear Dynamical Systems
par: Gong, Yiwei, et autres
Publié: (2024)
par: Gong, Yiwei, et autres
Publié: (2024)
Documents similaires
-
Annotations Mitigate Post-Training Mode Collapse
par: Springer, Jacob Mitchell, et autres
Publié: (2026) -
When can transformers reason with abstract symbols?
par: Boix-Adsera, Enric, et autres
Publié: (2023) -
Vanishing Gradients in Reinforcement Finetuning of Language Models
par: Razin, Noam, et autres
Publié: (2023) -
How Far Can Transformers Reason? The Globality Barrier and Inductive Scratchpad
par: Abbe, Emmanuel, et autres
Publié: (2024) -
Rethinking JEPA: Compute-Efficient Video SSL with Frozen Teachers
par: Li, Xianhang, et autres
Publié: (2025)