Hierarchical Kernel Transformer: Multi-Scale Attention with an Information-Theoretic Approximation Analysis
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Cirrincione, Giansalvo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DDCL-INCRT: A Self-Organising Transformer with Hierarchical Prototype Structure (Theoretical Foundations)
par: Cirrincione, Giansalvo
Publié: (2026)
par: Cirrincione, Giansalvo
Publié: (2026)
INCRT: An Incremental Transformer That Determines Its Own Architecture
par: Cirrincione, Giansalvo
Publié: (2026)
par: Cirrincione, Giansalvo
Publié: (2026)
DDCL: Deep Dual Competitive Learning: A Differentiable End-to-End Framework for Unsupervised Prototype-Based Representation Learning
par: Cirrincione, Giansalvo
Publié: (2026)
par: Cirrincione, Giansalvo
Publié: (2026)
Collapse-Free Prototype Readout Layer for Transformer Encoders
par: Cirrincione, Giansalvo, et autres
Publié: (2026)
par: Cirrincione, Giansalvo, et autres
Publié: (2026)
Hierarchical Self-Attention: Generalizing Neural Attention Mechanics to Multi-Scale Problems
par: Amizadeh, Saeed, et autres
Publié: (2025)
par: Amizadeh, Saeed, et autres
Publié: (2025)
Genetic Programming with Transformer-Based Mutation for Approximate Circuit Design
par: Galeta, Ondrej, et autres
Publié: (2026)
par: Galeta, Ondrej, et autres
Publié: (2026)
Quantitative Attractor Analysis of High-Capacity Kernel Hopfield Networks
par: Tamamori, Akira
Publié: (2025)
par: Tamamori, Akira
Publié: (2025)
Spectral Concentration at the Edge of Stability: Information Geometry of Kernel Associative Memory
par: Tamamori, Akira
Publié: (2025)
par: Tamamori, Akira
Publié: (2025)
A Critical Analysis of the Theoretical Framework of the Extreme Learning Machine
par: Perfilievaa, Irina, et autres
Publié: (2024)
par: Perfilievaa, Irina, et autres
Publié: (2024)
SpikeGraphormer: A High-Performance Graph Transformer with Spiking Graph Attention
par: Sun, Yundong, et autres
Publié: (2024)
par: Sun, Yundong, et autres
Publié: (2024)
Auto-Configured Networks for Multi-Scale Multi-Output Time-Series Forecasting
par: Zha, Yumeng, et autres
Publié: (2026)
par: Zha, Yumeng, et autres
Publié: (2026)
Predictive Modeling in the Reservoir Kernel Motif Space
par: Tino, Peter, et autres
Publié: (2024)
par: Tino, Peter, et autres
Publié: (2024)
Comparison of Reservoir Computing topologies using the Recurrent Kernel approach
par: D'Inverno, Giuseppe Alessio, et autres
Publié: (2024)
par: D'Inverno, Giuseppe Alessio, et autres
Publié: (2024)
Kernel Logistic Regression Learning for High-Capacity Hopfield Networks
par: Tamamori, Akira
Publié: (2025)
par: Tamamori, Akira
Publié: (2025)
GT-SNT: A Linear-Time Transformer for Large-Scale Graphs via Spiking Node Tokenization
par: Zhang, Huizhe, et autres
Publié: (2025)
par: Zhang, Huizhe, et autres
Publié: (2025)
Kernel Ridge Regression for Efficient Learning of High-Capacity Hopfield Networks
par: Tamamori, Akira
Publié: (2025)
par: Tamamori, Akira
Publié: (2025)
SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention
par: Csordás, Róbert, et autres
Publié: (2023)
par: Csordás, Róbert, et autres
Publié: (2023)
Self-Organization and Spectral Mechanism of Attractor Landscapes in High-Capacity Kernel Hopfield Networks
par: Tamamori, Akira
Publié: (2025)
par: Tamamori, Akira
Publié: (2025)
FAGH: Accelerating Federated Learning with Approximated Global Hessian
par: Sen, Mrinmay, et autres
Publié: (2024)
par: Sen, Mrinmay, et autres
Publié: (2024)
Towards Trustworthy Web Attack Detection: An Uncertainty-Aware Ensemble Deep Kernel Learning Model
par: Zhou, Yonghang, et autres
Publié: (2024)
par: Zhou, Yonghang, et autres
Publié: (2024)
Reservoir Computing via Multi-Scale Random Fourier Features for Forecasting Fast-Slow Dynamical Systems
par: Laha, S. K.
Publié: (2025)
par: Laha, S. K.
Publié: (2025)
QuAKE: Speeding up Model Inference Using Quick and Approximate Kernels for Exponential Non-Linearities
par: Narayanaswami, Sai Kiran, et autres
Publié: (2024)
par: Narayanaswami, Sai Kiran, et autres
Publié: (2024)
FUSE: Measure-Theoretic Compact Fuzzy Set Representation for Taxonomy Expansion
par: Xu, Fred, et autres
Publié: (2025)
par: Xu, Fred, et autres
Publié: (2025)
Universal Approximation Theorem for Vector- and Hypercomplex-Valued Neural Networks
par: Valle, Marcos Eduardo, et autres
Publié: (2024)
par: Valle, Marcos Eduardo, et autres
Publié: (2024)
TransNAS-TSAD: Harnessing Transformers for Multi-Objective Neural Architecture Search in Time Series Anomaly Detection
par: Haq, Ijaz Ul, et autres
Publié: (2023)
par: Haq, Ijaz Ul, et autres
Publié: (2023)
Frame Theoretical Derivation of Three Factor Learning Rule for Oja's Subspace Rule
par: Yamada, Taiki
Publié: (2026)
par: Yamada, Taiki
Publié: (2026)
Approximating Matrix Functions with Deep Neural Networks and Transformers
par: Padmanabhan, Rahul, et autres
Publié: (2026)
par: Padmanabhan, Rahul, et autres
Publié: (2026)
A More Accurate Approximation of Activation Function with Few Spikes Neurons
par: Jeong, Dayena, et autres
Publié: (2024)
par: Jeong, Dayena, et autres
Publié: (2024)
MDN: Parallelizing Stepwise Momentum for Delta Linear Attention
par: Huang, Yulong, et autres
Publié: (2026)
par: Huang, Yulong, et autres
Publié: (2026)
Genetic Quantization-Aware Approximation for Non-Linear Operations in Transformers
par: Dong, Pingcheng, et autres
Publié: (2024)
par: Dong, Pingcheng, et autres
Publié: (2024)
A Framework for Non-Linear Attention via Modern Hopfield Networks
par: Farooq, Ahmed
Publié: (2025)
par: Farooq, Ahmed
Publié: (2025)
Spatiotemporal Forecasting of Traffic Flow using Wavelet-based Temporal Attention
par: Jakhmola, Yash, et autres
Publié: (2024)
par: Jakhmola, Yash, et autres
Publié: (2024)
Scale-covariant spiking wavelets
par: Pedersen, Jens Egholm, et autres
Publié: (2026)
par: Pedersen, Jens Egholm, et autres
Publié: (2026)
Scaling can lead to compositional generalization
par: Redhardt, Florian, et autres
Publié: (2025)
par: Redhardt, Florian, et autres
Publié: (2025)
Looped Transformers are Better at Learning Learning Algorithms
par: Yang, Liu, et autres
Publié: (2023)
par: Yang, Liu, et autres
Publié: (2023)
Utilizing Evolution Strategies to Train Transformers in Reinforcement Learning
par: Lorenc, Matyáš, et autres
Publié: (2025)
par: Lorenc, Matyáš, et autres
Publié: (2025)
Scaling Equilibrium Propagation to Deeper Neural Network Architectures
par: Elayedam, Sankar Vinayak, et autres
Publié: (2025)
par: Elayedam, Sankar Vinayak, et autres
Publié: (2025)
Scaling Down Deep Learning with MNIST-1D
par: Greydanus, Sam, et autres
Publié: (2020)
par: Greydanus, Sam, et autres
Publié: (2020)
NiSNN-A: Non-iterative Spiking Neural Networks with Attention with Application to Motor Imagery EEG Classification
par: Zhang, Chuhan, et autres
Publié: (2023)
par: Zhang, Chuhan, et autres
Publié: (2023)
Effects of Introducing Synaptic Scaling on Spiking Neural Network Learning
par: Touda, Shinnosuke, et autres
Publié: (2026)
par: Touda, Shinnosuke, et autres
Publié: (2026)
Documents similaires
-
DDCL-INCRT: A Self-Organising Transformer with Hierarchical Prototype Structure (Theoretical Foundations)
par: Cirrincione, Giansalvo
Publié: (2026) -
INCRT: An Incremental Transformer That Determines Its Own Architecture
par: Cirrincione, Giansalvo
Publié: (2026) -
DDCL: Deep Dual Competitive Learning: A Differentiable End-to-End Framework for Unsupervised Prototype-Based Representation Learning
par: Cirrincione, Giansalvo
Publié: (2026) -
Collapse-Free Prototype Readout Layer for Transformer Encoders
par: Cirrincione, Giansalvo, et autres
Publié: (2026) -
Hierarchical Self-Attention: Generalizing Neural Attention Mechanics to Multi-Scale Problems
par: Amizadeh, Saeed, et autres
Publié: (2025)