Alternative positional encoding functions for neural transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lopez-Rubio, Ezequiel, Decena-Gimenez, Macoris, Luque-Baena, Rafael Marcos |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Representation of the structure of graphs by sequences of instructions
par: Lopez-Rubio, Ezequiel
Publié: (2025)
par: Lopez-Rubio, Ezequiel
Publié: (2025)
Enhanced QKNorm normalization for neural transformers with the Lp norm
par: Lopez-Rubio, Ezequiel, et autres
Publié: (2026)
par: Lopez-Rubio, Ezequiel, et autres
Publié: (2026)
From Features to Graphs: Exploring Graph Structures and Pairwise Interactions via GNNs
par: Yamchote, Phaphontee, et autres
Publié: (2025)
par: Yamchote, Phaphontee, et autres
Publié: (2025)
The IsalProgram Programming Language
par: López-Rubio, Ezequiel
Publié: (2026)
par: López-Rubio, Ezequiel
Publié: (2026)
multivariateGPT: a decoder-only transformer for multivariate categorical and numeric data
par: Loza, Andrew J., et autres
Publié: (2025)
par: Loza, Andrew J., et autres
Publié: (2025)
ProactBench: Beyond What The User Asked For
par: Harfi, Sepehr, et autres
Publié: (2026)
par: Harfi, Sepehr, et autres
Publié: (2026)
Lost or Hidden? A Concept-Level Forgetting in Supervised Continual Learning
par: Filus, Katarzyna, et autres
Publié: (2026)
par: Filus, Katarzyna, et autres
Publié: (2026)
How Pruning Reshapes Features: Sparse Autoencoder Analysis of Weight-Pruned Language Models
par: Borobia, Hector, et autres
Publié: (2026)
par: Borobia, Hector, et autres
Publié: (2026)
The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth
par: Henry, James
Publié: (2026)
par: Henry, James
Publié: (2026)
A Practical Guide to Streaming Continual Learning
par: Cossu, Andrea, et autres
Publié: (2026)
par: Cossu, Andrea, et autres
Publié: (2026)
On Privacy Leakage in Tabular Diffusion Models: Influential Factors, Attacker Knowledge, and Metrics
par: Shafieinejad, Masoumeh, et autres
Publié: (2026)
par: Shafieinejad, Masoumeh, et autres
Publié: (2026)
Don't Look Back in Anger: MAGIC Net for Streaming Continual Learning with Temporal Dependence
par: Giannini, Federico, et autres
Publié: (2026)
par: Giannini, Federico, et autres
Publié: (2026)
cPNN: Continuous Progressive Neural Networks for Evolving Streaming Time Series
par: Giannini, Federico, et autres
Publié: (2026)
par: Giannini, Federico, et autres
Publié: (2026)
Conditional Temporal Neural Processes with Covariance Loss
par: Yoo, Boseon, et autres
Publié: (2025)
par: Yoo, Boseon, et autres
Publié: (2025)
Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection
par: Wu, Chengcan, et autres
Publié: (2025)
par: Wu, Chengcan, et autres
Publié: (2025)
HGTUL: A Hypergraph-based Model For Trajectory User Linking
par: Chang, Fengjie, et autres
Publié: (2025)
par: Chang, Fengjie, et autres
Publié: (2025)
Communications to Circulations: Real-Time 3D Wind Field Prediction Using 5G GNSS Signals and Deep Learning
par: Ye, Yuchen, et autres
Publié: (2025)
par: Ye, Yuchen, et autres
Publié: (2025)
Upside Down Reinforcement Learning with Policy Generators
par: Di Ventura, Jacopo, et autres
Publié: (2025)
par: Di Ventura, Jacopo, et autres
Publié: (2025)
Multi-Level Fusion Graph Neural Network for Molecule Property Prediction
par: Liu, XiaYu, et autres
Publié: (2025)
par: Liu, XiaYu, et autres
Publié: (2025)
Bridging Traffic State and Trajectory for Dynamic Road Network and Trajectory Representation Learning
par: Han, Chengkai, et autres
Publié: (2025)
par: Han, Chengkai, et autres
Publié: (2025)
The Origins of Representation Manifolds in Large Language Models
par: Modell, Alexander, et autres
Publié: (2025)
par: Modell, Alexander, et autres
Publié: (2025)
Energy-Efficient Deep Learning Without Backpropagation: A Rigorous Evaluation of Forward-Only Algorithms
par: Spyra, Przemysław, et autres
Publié: (2025)
par: Spyra, Przemysław, et autres
Publié: (2025)
Mapping representations in Reinforcement Learning via Semantic Alignment for Zero-Shot Stitching
par: Ricciardi, Antonio Pio, et autres
Publié: (2025)
par: Ricciardi, Antonio Pio, et autres
Publié: (2025)
DNNShifter: An Efficient DNN Pruning System for Edge Computing
par: Eccles, Bailey J., et autres
Publié: (2023)
par: Eccles, Bailey J., et autres
Publié: (2023)
Tazza: Shuffling Neural Network Parameters for Secure and Private Federated Learning
par: Lee, Kichang, et autres
Publié: (2024)
par: Lee, Kichang, et autres
Publié: (2024)
A Machine Learning Framework for Turbofan Health Estimation via Inverse Problem Formulation
par: Leyli-Abadi, Milad, et autres
Publié: (2026)
par: Leyli-Abadi, Milad, et autres
Publié: (2026)
HyperMask: Adaptive Hypernetwork-based Masks for Continual Learning
par: Książek, Kamil, et autres
Publié: (2023)
par: Książek, Kamil, et autres
Publié: (2023)
Is ReLU Adversarially Robust?
par: Sooksatra, Korn, et autres
Publié: (2024)
par: Sooksatra, Korn, et autres
Publié: (2024)
Interpretability Can Be Actionable
par: Orgad, Hadas, et autres
Publié: (2026)
par: Orgad, Hadas, et autres
Publié: (2026)
Probing for Representation Manifolds in Superposition
par: Modell, Alexander
Publié: (2026)
par: Modell, Alexander
Publié: (2026)
CGLearn: Consistent Gradient-Based Learning for Out-of-Distribution Generalization
par: Chowdhury, Jawad, et autres
Publié: (2024)
par: Chowdhury, Jawad, et autres
Publié: (2024)
Concept Prerequisite Relation Prediction by Using Permutation-Equivariant Directed Graph Neural Networks
par: Qu, Xiran, et autres
Publié: (2023)
par: Qu, Xiran, et autres
Publié: (2023)
Improving Time Series Classification with Representation Soft Label Smoothing
par: Ma, Hengyi, et autres
Publié: (2024)
par: Ma, Hengyi, et autres
Publié: (2024)
A Vulnerability of Attribution Methods Using Pre-Softmax Scores
par: Lerma, Miguel, et autres
Publié: (2023)
par: Lerma, Miguel, et autres
Publié: (2023)
Simple Network Graph Comparative Learning
par: Yu, Qiang, et autres
Publié: (2026)
par: Yu, Qiang, et autres
Publié: (2026)
Beyond Coefficients: Forecast-Necessity Testing for Interpretable Causal Discovery in Nonlinear Time-Series Models
par: Kuskova, Valentina, et autres
Publié: (2026)
par: Kuskova, Valentina, et autres
Publié: (2026)
Graph Neural Networks Need Cluster-Normalize-Activate Modules
par: Skryagin, Arseny, et autres
Publié: (2024)
par: Skryagin, Arseny, et autres
Publié: (2024)
Neural Concept Verifier: Scaling Prover-Verifier Games via Concept Encodings
par: Turan, Berkant, et autres
Publié: (2025)
par: Turan, Berkant, et autres
Publié: (2025)
Decentralized Time Series Classification with ROCKET Features
par: Casella, Bruno, et autres
Publié: (2025)
par: Casella, Bruno, et autres
Publié: (2025)
Matryoshka Policy Gradient for Entropy-Regularized RL: Convergence and Global Optimality
par: Ged, François, et autres
Publié: (2023)
par: Ged, François, et autres
Publié: (2023)
Documents similaires
-
Representation of the structure of graphs by sequences of instructions
par: Lopez-Rubio, Ezequiel
Publié: (2025) -
Enhanced QKNorm normalization for neural transformers with the Lp norm
par: Lopez-Rubio, Ezequiel, et autres
Publié: (2026) -
From Features to Graphs: Exploring Graph Structures and Pairwise Interactions via GNNs
par: Yamchote, Phaphontee, et autres
Publié: (2025) -
The IsalProgram Programming Language
par: López-Rubio, Ezequiel
Publié: (2026) -
multivariateGPT: a decoder-only transformer for multivariate categorical and numeric data
par: Loza, Andrew J., et autres
Publié: (2025)