Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization
Fuente:
arXiv
Salvato in:
| Autori principali: | Urrutia, Felipe, Alegría, Juan José, Macias, Cinthia Sanchez, Salas, Jorge, Calderon, Cristian B., Rojas, Cristobal |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Decoupling Positional and Symbolic Attention Behavior in Transformers
di: Urrutia, Felipe, et al.
Pubblicazione: (2025)
di: Urrutia, Felipe, et al.
Pubblicazione: (2025)
Base of RoPE Bounds Context Length
di: Men, Xin, et al.
Pubblicazione: (2024)
di: Men, Xin, et al.
Pubblicazione: (2024)
Demystifying the Slash Pattern in Attention: The Role of RoPE
di: Cheng, Yuan, et al.
Pubblicazione: (2026)
di: Cheng, Yuan, et al.
Pubblicazione: (2026)
Resonance RoPE: Improving Context Length Generalization of Large Language Models
di: Wang, Suyuchen, et al.
Pubblicazione: (2024)
di: Wang, Suyuchen, et al.
Pubblicazione: (2024)
RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution
di: Picov, Isaac, et al.
Pubblicazione: (2026)
di: Picov, Isaac, et al.
Pubblicazione: (2026)
RoPE Attention Can Be Trained in Almost Linear Time
di: Cao, Yang, et al.
Pubblicazione: (2024)
di: Cao, Yang, et al.
Pubblicazione: (2024)
ReRoPE: Repurposing RoPE for Relative Camera Control
di: Li, Chunyang, et al.
Pubblicazione: (2026)
di: Li, Chunyang, et al.
Pubblicazione: (2026)
Untwisting RoPE: Frequency Control for Shared Attention in DiTs
di: Mikaeili, Aryan, et al.
Pubblicazione: (2026)
di: Mikaeili, Aryan, et al.
Pubblicazione: (2026)
Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective
di: Zhong, Meizhi, et al.
Pubblicazione: (2024)
di: Zhong, Meizhi, et al.
Pubblicazione: (2024)
LinearARD: Linear-Memory Attention Distillation for RoPE Restoration
di: Yang, Ning, et al.
Pubblicazione: (2026)
di: Yang, Ning, et al.
Pubblicazione: (2026)
Periodic RoPE for Infinite Context LLMs
di: Huo, Simin
Pubblicazione: (2026)
di: Huo, Simin
Pubblicazione: (2026)
Scaling Laws of RoPE-based Extrapolation
di: Liu, Xiaoran, et al.
Pubblicazione: (2023)
di: Liu, Xiaoran, et al.
Pubblicazione: (2023)
Rethinking RoPE: A Mathematical Blueprint for N-dimensional Positional Embedding
di: Liu, Haiping, et al.
Pubblicazione: (2025)
di: Liu, Haiping, et al.
Pubblicazione: (2025)
RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably
di: Du, Yufeng, et al.
Pubblicazione: (2026)
di: Du, Yufeng, et al.
Pubblicazione: (2026)
Fast RoPE Attention: Combining the Polynomial Method and Fast Fourier Transform
di: Alman, Josh, et al.
Pubblicazione: (2025)
di: Alman, Josh, et al.
Pubblicazione: (2025)
Rotate Both Ways: Time-and-Order RoPE for Generative Recommendation
di: Wei, Xiaokai, et al.
Pubblicazione: (2025)
di: Wei, Xiaokai, et al.
Pubblicazione: (2025)
Spiral RoPE: Rotate Your Rotary Positional Embeddings in the 2D Plane
di: Liu, Haoyu, et al.
Pubblicazione: (2026)
di: Liu, Haoyu, et al.
Pubblicazione: (2026)
Theoretical Constraints on the Expressive Power of $\mathsf{RoPE}$-based Tensor Attention Transformers
di: Li, Xiaoyu, et al.
Pubblicazione: (2024)
di: Li, Xiaoyu, et al.
Pubblicazione: (2024)
ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models
di: Li, Bozhou, et al.
Pubblicazione: (2025)
di: Li, Bozhou, et al.
Pubblicazione: (2025)
Frayed RoPE and Long Inputs: A Geometric Perspective
di: Wertheimer, Davis, et al.
Pubblicazione: (2026)
di: Wertheimer, Davis, et al.
Pubblicazione: (2026)
Circuit Complexity Bounds for RoPE-based Transformer Architecture
di: Chen, Bo, et al.
Pubblicazione: (2024)
di: Chen, Bo, et al.
Pubblicazione: (2024)
Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)
di: Kung, Gustavo Chau Loo, et al.
Pubblicazione: (2026)
di: Kung, Gustavo Chau Loo, et al.
Pubblicazione: (2026)
Jordan-RoPE: Non-Semisimple Relative Positional Encoding via Complex Jordan Blocks
di: Zhang, Yaobo
Pubblicazione: (2026)
di: Zhang, Yaobo
Pubblicazione: (2026)
RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers
di: Liu, Yuxi, et al.
Pubblicazione: (2026)
di: Liu, Yuxi, et al.
Pubblicazione: (2026)
PhaseWrap-RoPE: Bounded Phase-Wrap Positional Scoring Evidence and Hardware-Validation Tooling
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
PhaseWrap-RoPE: Bounded Phase-Wrap Positional Scoring Evidence and Hardware-Validation Tooling
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
PhaseWrap-RoPE: Bounded Phase-Wrap Positional Scoring Evidence and Hardware-Validation Tooling
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
PhaseWrap-RoPE: Bounded Phase-Wrap Positional Scoring Evidence and Hardware-Validation Tooling
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
PhaseWrap-RoPE: Bounded Phase-Wrap Positional Scoring Evidence and Hardware-Validation Tooling
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
PhaseWrap-RoPE: Bounded Phase-Wrap Positional Scoring Evidence and Hardware-Validation Tooling
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
PhaseWrap-RoPE: Bounded Phase-Wrap Positional Scoring Evidence and Hardware-Validation Tooling
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
di: Fredriksen, Daniel Eric
Pubblicazione: (2026)
Adaptive 3D-RoPE: Physics-Aligned Rotary Positional Encoding for Wireless Foundation Models
di: Zhang, Chenyu, et al.
Pubblicazione: (2026)
di: Zhang, Chenyu, et al.
Pubblicazione: (2026)
Rotary Positional Embeddings as Phase Modulation: Theoretical Bounds on the RoPE Base for Long-Context Transformers
di: Liu, Feilong
Pubblicazione: (2026)
di: Liu, Feilong
Pubblicazione: (2026)
When Precision Meets Position: BFloat16 Breaks Down RoPE in Long-Context Training
di: Wang, Haonan, et al.
Pubblicazione: (2024)
di: Wang, Haonan, et al.
Pubblicazione: (2024)
Q-ROAR: Outlier-Aware Rescaling for RoPE Position Interpolation in Quantized Long-Context LLMs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
RAP: KV-Cache Compression via RoPE-Aligned Pruning
di: Xin, Jihao, et al.
Pubblicazione: (2026)
di: Xin, Jihao, et al.
Pubblicazione: (2026)
A Circular Argument : Does RoPE need to be Equivariant for Vision?
di: van de Geijn, Chase, et al.
Pubblicazione: (2025)
di: van de Geijn, Chase, et al.
Pubblicazione: (2025)
On the token distance modeling ability of higher RoPE attention dimension
di: Hong, Xiangyu, et al.
Pubblicazione: (2024)
di: Hong, Xiangyu, et al.
Pubblicazione: (2024)
CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs
di: Li, Haoran, et al.
Pubblicazione: (2026)
di: Li, Haoran, et al.
Pubblicazione: (2026)
RoPECraft: Training-Free Motion Transfer with Trajectory-Guided RoPE Optimization on Diffusion Transformers
di: Gokmen, Ahmet Berke, et al.
Pubblicazione: (2025)
di: Gokmen, Ahmet Berke, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Decoupling Positional and Symbolic Attention Behavior in Transformers
di: Urrutia, Felipe, et al.
Pubblicazione: (2025) -
Base of RoPE Bounds Context Length
di: Men, Xin, et al.
Pubblicazione: (2024) -
Demystifying the Slash Pattern in Attention: The Role of RoPE
di: Cheng, Yuan, et al.
Pubblicazione: (2026) -
Resonance RoPE: Improving Context Length Generalization of Large Language Models
di: Wang, Suyuchen, et al.
Pubblicazione: (2024) -
RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution
di: Picov, Isaac, et al.
Pubblicazione: (2026)