LT2: Linear-Time Looped Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Deng, Chunyuan, Zhang, Yizhe, Zhu, Rui-Jie, Xu, Yuanyuan, Liu, Jiarui, Ng, T. S. Eugene, Chen, Hanjie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Spherical Steering: Geometry-Aware Activation Rotation for Language Models
di: You, Zejia, et al.
Pubblicazione: (2026)
di: You, Zejia, et al.
Pubblicazione: (2026)
SAFR: Neuron Redistribution for Interpretability
di: Chang, Ruidi, et al.
Pubblicazione: (2025)
di: Chang, Ruidi, et al.
Pubblicazione: (2025)
Language Models are Symbolic Learners in Arithmetic
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
Polynormer: Polynomial-Expressive Graph Transformer in Linear Time
di: Deng, Chenhui, et al.
Pubblicazione: (2024)
di: Deng, Chenhui, et al.
Pubblicazione: (2024)
Freely Long-Thinking Transformer (FraiLT)
di: Tabak, Akbay
Pubblicazione: (2024)
di: Tabak, Akbay
Pubblicazione: (2024)
Data-driven Multistage Distributionally Robust Linear Optimization with Nested Distance
di: Gao, Rui, et al.
Pubblicazione: (2024)
di: Gao, Rui, et al.
Pubblicazione: (2024)
LoopQ: Quantization for Recursive Transformers
di: Fang, Rui, et al.
Pubblicazione: (2026)
di: Fang, Rui, et al.
Pubblicazione: (2026)
Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games
di: Zhang, Yizhe, et al.
Pubblicazione: (2023)
di: Zhang, Yizhe, et al.
Pubblicazione: (2023)
DeepMF: Deep Motion Factorization for Closed-Loop Safety-Critical Driving Scenario Simulation
di: Li, Yizhe, et al.
Pubblicazione: (2024)
di: Li, Yizhe, et al.
Pubblicazione: (2024)
Training-Free Looped Transformers
di: Chen, Lizhang, et al.
Pubblicazione: (2026)
di: Chen, Lizhang, et al.
Pubblicazione: (2026)
Ister: Linear Transformer for Efficient Multivariate Time Series Forecasting
di: Cao, Fanpu, et al.
Pubblicazione: (2024)
di: Cao, Fanpu, et al.
Pubblicazione: (2024)
Linear-Time Graph Neural Networks for Scalable Recommendations
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
Stronger Graph Transformer with Regularized Attention Scores
di: Ku, Eugene
Pubblicazione: (2023)
di: Ku, Eugene
Pubblicazione: (2023)
To CoT or To Loop? A Formal Comparison Between Chain-of-Thought and Looped Transformers
di: Xu, Kevin, et al.
Pubblicazione: (2025)
di: Xu, Kevin, et al.
Pubblicazione: (2025)
CoLT: The conditional localization test for assessing the accuracy of neural posterior estimates
di: Chen, Tianyu, et al.
Pubblicazione: (2025)
di: Chen, Tianyu, et al.
Pubblicazione: (2025)
Wedge Sampling: Efficient Tensor Completion with Nearly-Linear Sample Complexity
di: Luo, Hengrui, et al.
Pubblicazione: (2026)
di: Luo, Hengrui, et al.
Pubblicazione: (2026)
Beyond Manual Annotation: A Human-AI Collaborative Framework for Medical Image Segmentation Using Only "Better or Worse" Expert Feedback
di: Zhang, Yizhe
Pubblicazione: (2025)
di: Zhang, Yizhe
Pubblicazione: (2025)
When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems
di: Zhang, Lingxi, et al.
Pubblicazione: (2026)
di: Zhang, Lingxi, et al.
Pubblicazione: (2026)
Sparse random hypergraphs: Non-backtracking spectra and community detection
di: Stephan, Ludovic, et al.
Pubblicazione: (2022)
di: Stephan, Ludovic, et al.
Pubblicazione: (2022)
GT-SNT: A Linear-Time Transformer for Large-Scale Graphs via Spiking Node Tokenization
di: Zhang, Huizhe, et al.
Pubblicazione: (2025)
di: Zhang, Huizhe, et al.
Pubblicazione: (2025)
A Generalization Bound for Nearly-Linear Networks
di: Golikov, Eugene
Pubblicazione: (2024)
di: Golikov, Eugene
Pubblicazione: (2024)
Learning Distribution-Wise Control in Representation Space for Language Models
di: Deng, Chunyuan, et al.
Pubblicazione: (2025)
di: Deng, Chunyuan, et al.
Pubblicazione: (2025)
Steering Information Utility in Key-Value Memory for Language Model Post-Training
di: Deng, Chunyuan, et al.
Pubblicazione: (2025)
di: Deng, Chunyuan, et al.
Pubblicazione: (2025)
The Generalization Ridge: Information Flow in Natural Language Generation
di: Chang, Ruidi, et al.
Pubblicazione: (2025)
di: Chang, Ruidi, et al.
Pubblicazione: (2025)
Looped Transformers for Length Generalization
di: Fan, Ying, et al.
Pubblicazione: (2024)
di: Fan, Ying, et al.
Pubblicazione: (2024)
Theoretical Guarantees for LT-TTD: A Unified Transformer-based Architecture for Two-Level Ranking Systems
di: Abraich, Ayoub
Pubblicazione: (2025)
di: Abraich, Ayoub
Pubblicazione: (2025)
TimeSliver : Symbolic-Linear Decomposition for Explainable Time Series Classification
di: Pandey, Akash, et al.
Pubblicazione: (2026)
di: Pandey, Akash, et al.
Pubblicazione: (2026)
A Reliable Framework for Human-in-the-Loop Anomaly Detection in Time Series
di: Deng, Ziquan, et al.
Pubblicazione: (2024)
di: Deng, Ziquan, et al.
Pubblicazione: (2024)
Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
Next Generation Active Learning: Mixture of LLMs in the Loop
di: Qi, Yuanyuan, et al.
Pubblicazione: (2026)
di: Qi, Yuanyuan, et al.
Pubblicazione: (2026)
Trained Mamba Emulates Online Gradient Descent in In-Context Linear Regression
di: Jiang, Jiarui, et al.
Pubblicazione: (2025)
di: Jiang, Jiarui, et al.
Pubblicazione: (2025)
TimeXL: Explainable Multi-modal Time Series Prediction with LLM-in-the-Loop
di: Jiang, Yushan, et al.
Pubblicazione: (2025)
di: Jiang, Yushan, et al.
Pubblicazione: (2025)
OLinear: A Linear Model for Time Series Forecasting in Orthogonally Transformed Domain
di: Yue, Wenzhen, et al.
Pubblicazione: (2025)
di: Yue, Wenzhen, et al.
Pubblicazione: (2025)
On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement via Timestep Encoding
di: Xu, Kevin, et al.
Pubblicazione: (2024)
di: Xu, Kevin, et al.
Pubblicazione: (2024)
Distributionally Robust Online Markov Game with Linear Function Approximation
di: Zheng, Zewu, et al.
Pubblicazione: (2025)
di: Zheng, Zewu, et al.
Pubblicazione: (2025)
Transformer Conformal Prediction for Time Series
di: Lee, Junghwan, et al.
Pubblicazione: (2024)
di: Lee, Junghwan, et al.
Pubblicazione: (2024)
FRWKV:Frequency-Domain Linear Attention for Long-Term Time Series Forecasting
di: Yang, Qingyuan, et al.
Pubblicazione: (2025)
di: Yang, Qingyuan, et al.
Pubblicazione: (2025)
Token Statistics Transformer: Linear-Time Attention via Variational Rate Reduction
di: Wu, Ziyang, et al.
Pubblicazione: (2024)
di: Wu, Ziyang, et al.
Pubblicazione: (2024)
Chain-of-Thought and Compressed Looped Transformers: A Memory-Budget Separation
di: Zhang, Haozhou
Pubblicazione: (2026)
di: Zhang, Haozhou
Pubblicazione: (2026)
JoLT: Joint Probabilistic Predictions on Tabular Data Using LLMs
di: Shysheya, Aliaksandra, et al.
Pubblicazione: (2025)
di: Shysheya, Aliaksandra, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Spherical Steering: Geometry-Aware Activation Rotation for Language Models
di: You, Zejia, et al.
Pubblicazione: (2026) -
SAFR: Neuron Redistribution for Interpretability
di: Chang, Ruidi, et al.
Pubblicazione: (2025) -
Language Models are Symbolic Learners in Arithmetic
di: Deng, Chunyuan, et al.
Pubblicazione: (2024) -
Polynormer: Polynomial-Expressive Graph Transformer in Linear Time
di: Deng, Chenhui, et al.
Pubblicazione: (2024) -
Freely Long-Thinking Transformer (FraiLT)
di: Tabak, Akbay
Pubblicazione: (2024)