Non-Asymptotic Length Generalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Thomas, Ma, Tengyu, Li, Zhiyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chain of Thought Empowers Transformers to Solve Inherently Serial Problems
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training
par: Liu, Hong, et autres
Publié: (2023)
par: Liu, Hong, et autres
Publié: (2023)
Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective
par: Wen, Kaiyue, et autres
Publié: (2024)
par: Wen, Kaiyue, et autres
Publié: (2024)
Linguistic Calibration of Long-Form Generations
par: Band, Neil, et autres
Publié: (2024)
par: Band, Neil, et autres
Publié: (2024)
Configuration-to-Performance Scaling Law with Neural Ansatz
par: Zhang, Huaqing, et autres
Publié: (2026)
par: Zhang, Huaqing, et autres
Publié: (2026)
Formal Theorem Proving by Rewarding LLMs to Decompose Proofs Hierarchically
par: Dong, Kefan, et autres
Publié: (2024)
par: Dong, Kefan, et autres
Publié: (2024)
Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning
par: Mahankali, Arvind, et autres
Publié: (2026)
par: Mahankali, Arvind, et autres
Publié: (2026)
STP: Self-play LLM Theorem Provers with Iterative Conjecturing and Proving
par: Dong, Kefan, et autres
Publié: (2025)
par: Dong, Kefan, et autres
Publié: (2025)
A Theoretical Framework for Self-Play Theorem Proving Algorithms
par: Chen, Thomas, et autres
Publié: (2026)
par: Chen, Thomas, et autres
Publié: (2026)
Towards Faster Non-Asymptotic Convergence for Diffusion-Based Generative Models
par: Li, Gen, et autres
Publié: (2023)
par: Li, Gen, et autres
Publié: (2023)
Fantastic Pretraining Optimizers and Where to Find Them
par: Wen, Kaiyue, et autres
Publié: (2025)
par: Wen, Kaiyue, et autres
Publié: (2025)
Scaling Self-Play with Self-Guidance
par: Bailey, Luke, et autres
Publié: (2026)
par: Bailey, Luke, et autres
Publié: (2026)
Low-Dimension-to-High-Dimension Generalization And Its Implications for Length Generalization
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Looped Transformers for Length Generalization
par: Fan, Ying, et autres
Publié: (2024)
par: Fan, Ying, et autres
Publié: (2024)
Non-Asymptotic Analysis of (Sticky) Track-and-Stop
par: Poiani, Riccardo, et autres
Publié: (2025)
par: Poiani, Riccardo, et autres
Publié: (2025)
Non-Asymptotic Analysis of Efficiency in Conformalized Regression
par: Yao, Yunzhen, et autres
Publié: (2025)
par: Yao, Yunzhen, et autres
Publié: (2025)
On Vanishing Variance in Transformer Length Generalization
par: Li, Ruining, et autres
Publié: (2025)
par: Li, Ruining, et autres
Publié: (2025)
Large Language Models as Tool Makers
par: Cai, Tianle, et autres
Publié: (2023)
par: Cai, Tianle, et autres
Publié: (2023)
Non-Asymptotic Convergence of Stochastic Iterative Algorithms: A Lyapunov Framework
par: Chen, Zaiwei, et autres
Publié: (2026)
par: Chen, Zaiwei, et autres
Publié: (2026)
Asymptotics of Non-Convex Generalized Linear Models in High-Dimensions: A proof of the replica formula
par: Vilucchio, Matteo, et autres
Publié: (2025)
par: Vilucchio, Matteo, et autres
Publié: (2025)
Quantitative Bounds for Length Generalization in Transformers
par: Izzo, Zachary, et autres
Publié: (2025)
par: Izzo, Zachary, et autres
Publié: (2025)
Universal Length Generalization with Turing Programs
par: Hou, Kaiying, et autres
Publié: (2024)
par: Hou, Kaiying, et autres
Publié: (2024)
Improving Variable-Length Generation in Diffusion Language Models via Length Regularization
par: Cheng, Zicong, et autres
Publié: (2026)
par: Cheng, Zicong, et autres
Publié: (2026)
On the Limitations and Capabilities of Position Embeddings for Length Generalization
par: Chen, Yang, et autres
Publié: (2025)
par: Chen, Yang, et autres
Publié: (2025)
Mamba Modulation: On the Length Generalization of Mamba
par: Lu, Peng, et autres
Publié: (2025)
par: Lu, Peng, et autres
Publié: (2025)
Flight Trajectory Prediction Using an Enhanced CNN-LSTM Network
par: Hao, Qinzhi, et autres
Publié: (2024)
par: Hao, Qinzhi, et autres
Publié: (2024)
Fighter flight trajectory prediction based on spatio-temporal graphcial attention network
par: Sun, Yao, et autres
Publié: (2024)
par: Sun, Yao, et autres
Publié: (2024)
Non-Asymptotic Optimization and Generalization Bounds for Stochastic Gauss-Newton in Overparameterized Models
par: Cayci, Semih
Publié: (2025)
par: Cayci, Semih
Publié: (2025)
Comparative Study on Semi-supervised Learning Applied for Anomaly Detection in Hydraulic Condition Monitoring System
par: Dong, Yongqi, et autres
Publié: (2023)
par: Dong, Yongqi, et autres
Publié: (2023)
Understanding and Improving Length Generalization in Recurrent Models
par: Ruiz, Ricardo Buitrago, et autres
Publié: (2025)
par: Ruiz, Ricardo Buitrago, et autres
Publié: (2025)
Learning Variable-Length Tokenization for Generative Recommendation
par: Wang, Minhao, et autres
Publié: (2026)
par: Wang, Minhao, et autres
Publié: (2026)
Length Generalization with Log-Depth Recurrent Units
par: Pert, Charles, et autres
Publié: (2026)
par: Pert, Charles, et autres
Publié: (2026)
No Free Lunch: Non-Asymptotic Analysis of Prediction-Powered Inference
par: Mani, Pranav, et autres
Publié: (2025)
par: Mani, Pranav, et autres
Publié: (2025)
Understanding Inverse Reinforcement Learning under Overparameterization: Non-Asymptotic Analysis and Global Optimality
par: Zhang, Ruijia, et autres
Publié: (2025)
par: Zhang, Ruijia, et autres
Publié: (2025)
A Tale of Two Geometries: Adaptive Optimizers and Non-Euclidean Descent
par: Xie, Shuo, et autres
Publié: (2025)
par: Xie, Shuo, et autres
Publié: (2025)
Arithmetic Transformers Can Length-Generalize in Both Operand Length and Count
par: Cho, Hanseul, et autres
Publié: (2024)
par: Cho, Hanseul, et autres
Publié: (2024)
Pseudo-Formalization for Automatic Proof Verification
par: Barkallah, Slim, et autres
Publié: (2026)
par: Barkallah, Slim, et autres
Publié: (2026)
On Provable Length and Compositional Generalization
par: Ahuja, Kartik, et autres
Publié: (2024)
par: Ahuja, Kartik, et autres
Publié: (2024)
Provably Minimum-Length Conformal Prediction Sets for Ordinal Classification
par: Zhang, Zijian, et autres
Publié: (2025)
par: Zhang, Zijian, et autres
Publié: (2025)
Non-Asymptotic Global Convergence of PPO-Clip
par: Liu, Yin, et autres
Publié: (2025)
par: Liu, Yin, et autres
Publié: (2025)
Documents similaires
-
Chain of Thought Empowers Transformers to Solve Inherently Serial Problems
par: Li, Zhiyuan, et autres
Publié: (2024) -
Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training
par: Liu, Hong, et autres
Publié: (2023) -
Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective
par: Wen, Kaiyue, et autres
Publié: (2024) -
Linguistic Calibration of Long-Form Generations
par: Band, Neil, et autres
Publié: (2024) -
Configuration-to-Performance Scaling Law with Neural Ansatz
par: Zhang, Huaqing, et autres
Publié: (2026)