Salvato in:
| Autori principali: | Li, Jie, Yang, Qishun, Li, Nuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.09165 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers
di: Adhikari, Rabin
Pubblicazione: (2025)
di: Adhikari, Rabin
Pubblicazione: (2025)
Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling
di: Zhao, Weijie, et al.
Pubblicazione: (2026)
di: Zhao, Weijie, et al.
Pubblicazione: (2026)
WLFM: A Well-Logs Foundation Model for Multi-Task and Cross-Well Geological Interpretation
di: Qi, Zhenyu, et al.
Pubblicazione: (2025)
di: Qi, Zhenyu, et al.
Pubblicazione: (2025)
Neurocircuitry-Inspired Hierarchical Graph Causal Attention Networks for Explainable Depression Identification
di: Chen, Weidao, et al.
Pubblicazione: (2025)
di: Chen, Weidao, et al.
Pubblicazione: (2025)
Value-State Gated Attention for Mitigating Extreme-Token Phenomena in Transformers
di: Bu, Rui, et al.
Pubblicazione: (2025)
di: Bu, Rui, et al.
Pubblicazione: (2025)
Geometric Attention: A Regime-Explicit Operator Semantics for Transformer Attention
di: Freytes, Luis Rosario
Pubblicazione: (2026)
di: Freytes, Luis Rosario
Pubblicazione: (2026)
The Bayesian Geometry of Transformer Attention
di: Agarwal, Naman, et al.
Pubblicazione: (2025)
di: Agarwal, Naman, et al.
Pubblicazione: (2025)
Attention Schema-based Attention Control (ASAC): A Cognitive-Inspired Approach for Attention Management in Transformers
di: Saxena, Krati, et al.
Pubblicazione: (2025)
di: Saxena, Krati, et al.
Pubblicazione: (2025)
ZeroS: Zero-Sum Linear Attention for Efficient Transformers
di: Lu, Jiecheng, et al.
Pubblicazione: (2026)
di: Lu, Jiecheng, et al.
Pubblicazione: (2026)
Contrasformer: A Brain Network Contrastive Transformer for Neurodegenerative Condition Identification
di: Xu, Jiaxing, et al.
Pubblicazione: (2024)
di: Xu, Jiaxing, et al.
Pubblicazione: (2024)
What Matters in Transformers? Not All Attention is Needed
di: He, Shwai, et al.
Pubblicazione: (2024)
di: He, Shwai, et al.
Pubblicazione: (2024)
Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts
di: Li, Cheng, et al.
Pubblicazione: (2025)
di: Li, Cheng, et al.
Pubblicazione: (2025)
CVTGAD: Simplified Transformer with Cross-View Attention for Unsupervised Graph-level Anomaly Detection
di: Li, Jindong, et al.
Pubblicazione: (2024)
di: Li, Jindong, et al.
Pubblicazione: (2024)
Linear Transformers as VAR Models: Aligning Autoregressive Attention Mechanisms with Autoregressive Forecasting
di: Lu, Jiecheng, et al.
Pubblicazione: (2025)
di: Lu, Jiecheng, et al.
Pubblicazione: (2025)
VecFormer: Towards Efficient and Generalizable Graph Transformer with Graph Token Attention
di: Zhou, Jingbo, et al.
Pubblicazione: (2026)
di: Zhou, Jingbo, et al.
Pubblicazione: (2026)
VSFormer: Value and Shape-Aware Transformer with Prior-Enhanced Self-Attention for Multivariate Time Series Classification
di: Xi, Wenjie, et al.
Pubblicazione: (2024)
di: Xi, Wenjie, et al.
Pubblicazione: (2024)
XicorAttention: Time Series Transformer Using Attention with Nonlinear Correlation
di: Kimura, Daichi, et al.
Pubblicazione: (2025)
di: Kimura, Daichi, et al.
Pubblicazione: (2025)
Synthetic Geology: Structural Geology Meets Deep Learning
di: Ghyselincks, Simon, et al.
Pubblicazione: (2025)
di: Ghyselincks, Simon, et al.
Pubblicazione: (2025)
A Multi-Scale Graph Neural Process with Cross-Drug Co-Attention for Drug-Drug Interactions Prediction
di: Yan, Zimo, et al.
Pubblicazione: (2025)
di: Yan, Zimo, et al.
Pubblicazione: (2025)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
di: Peng, Miao, et al.
Pubblicazione: (2025)
di: Peng, Miao, et al.
Pubblicazione: (2025)
ControlMath: Controllable Data Generation Promotes Math Generalist Models
di: Chen, Nuo, et al.
Pubblicazione: (2024)
di: Chen, Nuo, et al.
Pubblicazione: (2024)
UMoE: Unifying Attention and FFN with Shared Experts
di: Yang, Yuanhang, et al.
Pubblicazione: (2025)
di: Yang, Yuanhang, et al.
Pubblicazione: (2025)
A Graph Transformer-Driven Approach for Network Robustness Learning
di: Zhang, Yu, et al.
Pubblicazione: (2023)
di: Zhang, Yu, et al.
Pubblicazione: (2023)
CrowdTransfer: Enabling Crowd Knowledge Transfer in AIoT Community
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
PMET: Precise Model Editing in a Transformer
di: Li, Xiaopeng, et al.
Pubblicazione: (2023)
di: Li, Xiaopeng, et al.
Pubblicazione: (2023)
Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
di: Dhayalkar, Sahil Rajesh
Pubblicazione: (2025)
di: Dhayalkar, Sahil Rajesh
Pubblicazione: (2025)
Exact Attention Sensitivity and the Geometry of Transformer Stability
di: Emadi, Seyed Morteza
Pubblicazione: (2026)
di: Emadi, Seyed Morteza
Pubblicazione: (2026)
Unveiling and Controlling Anomalous Attention Distribution in Transformers
di: Yan, Ruiqing, et al.
Pubblicazione: (2024)
di: Yan, Ruiqing, et al.
Pubblicazione: (2024)
Graph Convolutions Enrich the Self-Attention in Transformers!
di: Choi, Jeongwhan, et al.
Pubblicazione: (2023)
di: Choi, Jeongwhan, et al.
Pubblicazione: (2023)
Higher-Order Transformers With Kronecker-Structured Attention
di: Omranpour, Soroush, et al.
Pubblicazione: (2024)
di: Omranpour, Soroush, et al.
Pubblicazione: (2024)
Expanding Expressivity in Transformer Models with MöbiusAttention
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
CAPS: Unifying Attention, Recurrence, and Alignment in Transformer-based Time Series Forecasting
di: Pati, Viresh, et al.
Pubblicazione: (2026)
di: Pati, Viresh, et al.
Pubblicazione: (2026)
Transolver is a Linear Transformer: Revisiting Physics-Attention through the Lens of Linear Attention
di: Hu, Wenjie, et al.
Pubblicazione: (2025)
di: Hu, Wenjie, et al.
Pubblicazione: (2025)
Decentralized Attention Fails Centralized Signals: Rethinking Transformers for Medical Time Series
di: Yu, Guoqi, et al.
Pubblicazione: (2026)
di: Yu, Guoqi, et al.
Pubblicazione: (2026)
Curse of Attention: A Kernel-Based Perspective for Why Transformers Fail to Generalize on Time Series Forecasting and Beyond
di: Ke, Yekun, et al.
Pubblicazione: (2024)
di: Ke, Yekun, et al.
Pubblicazione: (2024)
AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization
di: Cranney, Caleb, et al.
Pubblicazione: (2025)
di: Cranney, Caleb, et al.
Pubblicazione: (2025)
Scaling Graph Transformers: A Comparative Study of Sparse and Dense Attention
di: Dimitrov, Leon
Pubblicazione: (2025)
di: Dimitrov, Leon
Pubblicazione: (2025)
Horizon-wise Learning Paradigm Promotes Gene Splicing Identification
di: Li, Qi-Jie, et al.
Pubblicazione: (2024)
di: Li, Qi-Jie, et al.
Pubblicazione: (2024)
CITRAS: Covariate-Informed Transformer for Time Series Forecasting
di: Yamaguchi, Yosuke, et al.
Pubblicazione: (2025)
di: Yamaguchi, Yosuke, et al.
Pubblicazione: (2025)
NoiseFormer -- Noise Diffused Symmetric Attention Transformer
di: Kumar, Phani, et al.
Pubblicazione: (2026)
di: Kumar, Phani, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers
di: Adhikari, Rabin
Pubblicazione: (2025) -
Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling
di: Zhao, Weijie, et al.
Pubblicazione: (2026) -
WLFM: A Well-Logs Foundation Model for Multi-Task and Cross-Well Geological Interpretation
di: Qi, Zhenyu, et al.
Pubblicazione: (2025) -
Neurocircuitry-Inspired Hierarchical Graph Causal Attention Networks for Explainable Depression Identification
di: Chen, Weidao, et al.
Pubblicazione: (2025) -
Value-State Gated Attention for Mitigating Extreme-Token Phenomena in Transformers
di: Bu, Rui, et al.
Pubblicazione: (2025)