SpiralFormer: Looped Transformers Can Learn Hierarchical Dependencies via Multi-Resolution Recursion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Chengting, Shu, Xiaobo, Wang, Yadao, Zhang, Yizhen, Wu, Haoyi, Wu, You, Long, Rujiao, Chen, Ziheng, Xu, Yuchi, Su, Wenbo, Zheng, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MeSH: Memory-as-State-Highways for Recursive Transformers
par: Yu, Chengting, et autres
Publié: (2025)
par: Yu, Chengting, et autres
Publié: (2025)
YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2026)
par: Wu, You, et autres
Publié: (2026)
Expert Divergence Learning for MoE-based Language Models
par: Li, Jiaang, et autres
Publié: (2026)
par: Li, Jiaang, et autres
Publié: (2026)
Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
par: Long, Rujiao, et autres
Publié: (2025)
par: Long, Rujiao, et autres
Publié: (2025)
Ink Spiral: Symbolic Transformation from The Thinker to the Four Gentlemen
par: Peng, Lingyu, et autres
Publié: (2026)
par: Peng, Lingyu, et autres
Publié: (2026)
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
par: Long, Rujiao, et autres
Publié: (2024)
par: Long, Rujiao, et autres
Publié: (2024)
RAVR: Reference-Answer-guided Variational Reasoning for Large Language Models
par: Lin, Tianqianjin, et autres
Publié: (2025)
par: Lin, Tianqianjin, et autres
Publié: (2025)
LoopQ: Quantization for Recursive Transformers
par: Fang, Rui, et autres
Publié: (2026)
par: Fang, Rui, et autres
Publié: (2026)
Transforming Image Super-Resolution: A ConvFormer-based Efficient Approach
par: Wu, Gang, et autres
Publié: (2024)
par: Wu, Gang, et autres
Publié: (2024)
A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2024)
par: Wu, You, et autres
Publié: (2024)
A Residual Variance Matching Recursive Least Squares Filter for Real-time UAV Terrain Following
par: Wu, Xiaobo, et autres
Publié: (2025)
par: Wu, Xiaobo, et autres
Publié: (2025)
SDiT: Spiking Diffusion Model with Transformer
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
Hierarchical Side-Tuning for Vision Transformers
par: Lin, Weifeng, et autres
Publié: (2023)
par: Lin, Weifeng, et autres
Publié: (2023)
Weight Spectra Induced Efficient Model Adaptation
par: Si, Chongjie, et autres
Publié: (2025)
par: Si, Chongjie, et autres
Publié: (2025)
A flexible framework for identifying urban villages using Sentinel-2 observations and deep learning
par: Wu, Yizhen
Publié: (2025)
par: Wu, Yizhen
Publié: (2025)
The Franc Spiral Equation: Recursive Harmonic Identity
par: Benjamin D. Franc
Publié: (2025)
par: Benjamin D. Franc
Publié: (2025)
LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation
par: Jeddi, Ahmadreza, et autres
Publié: (2026)
par: Jeddi, Ahmadreza, et autres
Publié: (2026)
Recursive Generalization Transformer for Image Super-Resolution
par: Chen, Zheng, et autres
Publié: (2023)
par: Chen, Zheng, et autres
Publié: (2023)
HiMemFormer: Hierarchical Memory-Aware Transformer for Multi-Agent Action Anticipation
par: Wang, Zirui, et autres
Publié: (2024)
par: Wang, Zirui, et autres
Publié: (2024)
Exploring the Potential of Probabilistic Transformer for Time Series Modeling: A Report on the ST-PT Framework
par: Xiong, Zhangzhi, et autres
Publié: (2026)
par: Xiong, Zhangzhi, et autres
Publié: (2026)
NAN: A Training-Free Solution to Coefficient Estimation in Model Merging
par: Si, Chongjie, et autres
Publié: (2025)
par: Si, Chongjie, et autres
Publié: (2025)
Power-Law-Exponential Interaction Induced Quantum Spiral Phases
par: Tian, Guoqing, et autres
Publié: (2024)
par: Tian, Guoqing, et autres
Publié: (2024)
SuperFormer: Volumetric Transformer Architectures for MRI Super-Resolution
par: Forigua, Cristhian, et autres
Publié: (2024)
par: Forigua, Cristhian, et autres
Publié: (2024)
EventFormer: A Node-graph Hierarchical Attention Transformer for Action-centric Video Event Prediction
par: Su, Qile, et autres
Publié: (2025)
par: Su, Qile, et autres
Publié: (2025)
Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer
par: Kuang, Penghao, et autres
Publié: (2026)
par: Kuang, Penghao, et autres
Publié: (2026)
Minor Allele Frequency Filtering Can Strongly Bias Uniqueness Estimates Within and Across Species
par: Yuchi Zheng
Publié: (2026)
par: Yuchi Zheng
Publié: (2026)
ComplexFormer: Disruptively Advancing Transformer Inference Ability via Head-Specific Complex Vector Attention
par: Shao, Jintian, et autres
Publié: (2025)
par: Shao, Jintian, et autres
Publié: (2025)
Understanding and Detecting Peer Dependency Resolving Loop in npm Ecosystem
par: Wang, Xingyu, et autres
Publié: (2025)
par: Wang, Xingyu, et autres
Publié: (2025)
Spiral and Mixed Plaquette-Dimer Phases in the $S=1$ and $3/2$ Shastry-Sutherland Heisenberg Model
par: Wu, Han-Qing, et autres
Publié: (2026)
par: Wu, Han-Qing, et autres
Publié: (2026)
Towards Mitigating API Hallucination in Code Generated by LLMs with Hierarchical Dependency Aware
par: Chen, Yujia, et autres
Publié: (2025)
par: Chen, Yujia, et autres
Publié: (2025)
What Makes Looped Transformers Perform Better Than Non-Recursive Ones
par: Gong, Zixuan, et autres
Publié: (2025)
par: Gong, Zixuan, et autres
Publié: (2025)
ArchRAG: Attributed Community-based Hierarchical Retrieval-Augmented Generation
par: Wang, Shu, et autres
Publié: (2025)
par: Wang, Shu, et autres
Publié: (2025)
The Minkowski problem of $p$-affine dual curvature measures
par: Lin, Youjiang, et autres
Publié: (2026)
par: Lin, Youjiang, et autres
Publié: (2026)
The $L_p$ Minkowski problems on affine dual quermassintegrals
par: Lin, Youjiang, et autres
Publié: (2025)
par: Lin, Youjiang, et autres
Publié: (2025)
TimeFormer: Capturing Temporal Relationships of Deformable 3D Gaussians for Robust Reconstruction
par: Jiang, DaDong, et autres
Publié: (2024)
par: Jiang, DaDong, et autres
Publié: (2024)
MixFormerV2: Efficient Fully Transformer Tracking
par: Cui, Yutao, et autres
Publié: (2023)
par: Cui, Yutao, et autres
Publié: (2023)
DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer
par: Tang, Xiaoya, et autres
Publié: (2025)
par: Tang, Xiaoya, et autres
Publié: (2025)
HGTS-Former: Hierarchical HyperGraph Transformer for Multivariate Time Series Analysis
par: Si, Hao, et autres
Publié: (2025)
par: Si, Hao, et autres
Publié: (2025)
RigidFormer: Learning Rigid Dynamics using Transformers
par: Dou, Zhiyang, et autres
Publié: (2026)
par: Dou, Zhiyang, et autres
Publié: (2026)
TouchFormer: A Robust Transformer-based Framework for Multimodal Material Perception
par: Lyu, Kailin, et autres
Publié: (2025)
par: Lyu, Kailin, et autres
Publié: (2025)
Documents similaires
-
MeSH: Memory-as-State-Highways for Recursive Transformers
par: Yu, Chengting, et autres
Publié: (2025) -
YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2026) -
Expert Divergence Learning for MoE-based Language Models
par: Li, Jiaang, et autres
Publié: (2026) -
Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
par: Long, Rujiao, et autres
Publié: (2025) -
Ink Spiral: Symbolic Transformation from The Thinker to the Four Gentlemen
par: Peng, Lingyu, et autres
Publié: (2026)