Alternative positional encoding functions for neural transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Lopez-Rubio, Ezequiel, Decena-Gimenez, Macoris, Luque-Baena, Rafael Marcos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Representation of the structure of graphs by sequences of instructions
di: Lopez-Rubio, Ezequiel
Pubblicazione: (2025)
di: Lopez-Rubio, Ezequiel
Pubblicazione: (2025)
Enhanced QKNorm normalization for neural transformers with the Lp norm
di: Lopez-Rubio, Ezequiel, et al.
Pubblicazione: (2026)
di: Lopez-Rubio, Ezequiel, et al.
Pubblicazione: (2026)
From Features to Graphs: Exploring Graph Structures and Pairwise Interactions via GNNs
di: Yamchote, Phaphontee, et al.
Pubblicazione: (2025)
di: Yamchote, Phaphontee, et al.
Pubblicazione: (2025)
The IsalProgram Programming Language
di: López-Rubio, Ezequiel
Pubblicazione: (2026)
di: López-Rubio, Ezequiel
Pubblicazione: (2026)
multivariateGPT: a decoder-only transformer for multivariate categorical and numeric data
di: Loza, Andrew J., et al.
Pubblicazione: (2025)
di: Loza, Andrew J., et al.
Pubblicazione: (2025)
ProactBench: Beyond What The User Asked For
di: Harfi, Sepehr, et al.
Pubblicazione: (2026)
di: Harfi, Sepehr, et al.
Pubblicazione: (2026)
Lost or Hidden? A Concept-Level Forgetting in Supervised Continual Learning
di: Filus, Katarzyna, et al.
Pubblicazione: (2026)
di: Filus, Katarzyna, et al.
Pubblicazione: (2026)
How Pruning Reshapes Features: Sparse Autoencoder Analysis of Weight-Pruned Language Models
di: Borobia, Hector, et al.
Pubblicazione: (2026)
di: Borobia, Hector, et al.
Pubblicazione: (2026)
The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth
di: Henry, James
Pubblicazione: (2026)
di: Henry, James
Pubblicazione: (2026)
A Practical Guide to Streaming Continual Learning
di: Cossu, Andrea, et al.
Pubblicazione: (2026)
di: Cossu, Andrea, et al.
Pubblicazione: (2026)
On Privacy Leakage in Tabular Diffusion Models: Influential Factors, Attacker Knowledge, and Metrics
di: Shafieinejad, Masoumeh, et al.
Pubblicazione: (2026)
di: Shafieinejad, Masoumeh, et al.
Pubblicazione: (2026)
Don't Look Back in Anger: MAGIC Net for Streaming Continual Learning with Temporal Dependence
di: Giannini, Federico, et al.
Pubblicazione: (2026)
di: Giannini, Federico, et al.
Pubblicazione: (2026)
cPNN: Continuous Progressive Neural Networks for Evolving Streaming Time Series
di: Giannini, Federico, et al.
Pubblicazione: (2026)
di: Giannini, Federico, et al.
Pubblicazione: (2026)
Conditional Temporal Neural Processes with Covariance Loss
di: Yoo, Boseon, et al.
Pubblicazione: (2025)
di: Yoo, Boseon, et al.
Pubblicazione: (2025)
Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
HGTUL: A Hypergraph-based Model For Trajectory User Linking
di: Chang, Fengjie, et al.
Pubblicazione: (2025)
di: Chang, Fengjie, et al.
Pubblicazione: (2025)
Communications to Circulations: Real-Time 3D Wind Field Prediction Using 5G GNSS Signals and Deep Learning
di: Ye, Yuchen, et al.
Pubblicazione: (2025)
di: Ye, Yuchen, et al.
Pubblicazione: (2025)
Upside Down Reinforcement Learning with Policy Generators
di: Di Ventura, Jacopo, et al.
Pubblicazione: (2025)
di: Di Ventura, Jacopo, et al.
Pubblicazione: (2025)
Multi-Level Fusion Graph Neural Network for Molecule Property Prediction
di: Liu, XiaYu, et al.
Pubblicazione: (2025)
di: Liu, XiaYu, et al.
Pubblicazione: (2025)
Bridging Traffic State and Trajectory for Dynamic Road Network and Trajectory Representation Learning
di: Han, Chengkai, et al.
Pubblicazione: (2025)
di: Han, Chengkai, et al.
Pubblicazione: (2025)
The Origins of Representation Manifolds in Large Language Models
di: Modell, Alexander, et al.
Pubblicazione: (2025)
di: Modell, Alexander, et al.
Pubblicazione: (2025)
Energy-Efficient Deep Learning Without Backpropagation: A Rigorous Evaluation of Forward-Only Algorithms
di: Spyra, Przemysław, et al.
Pubblicazione: (2025)
di: Spyra, Przemysław, et al.
Pubblicazione: (2025)
Mapping representations in Reinforcement Learning via Semantic Alignment for Zero-Shot Stitching
di: Ricciardi, Antonio Pio, et al.
Pubblicazione: (2025)
di: Ricciardi, Antonio Pio, et al.
Pubblicazione: (2025)
DNNShifter: An Efficient DNN Pruning System for Edge Computing
di: Eccles, Bailey J., et al.
Pubblicazione: (2023)
di: Eccles, Bailey J., et al.
Pubblicazione: (2023)
Tazza: Shuffling Neural Network Parameters for Secure and Private Federated Learning
di: Lee, Kichang, et al.
Pubblicazione: (2024)
di: Lee, Kichang, et al.
Pubblicazione: (2024)
A Machine Learning Framework for Turbofan Health Estimation via Inverse Problem Formulation
di: Leyli-Abadi, Milad, et al.
Pubblicazione: (2026)
di: Leyli-Abadi, Milad, et al.
Pubblicazione: (2026)
HyperMask: Adaptive Hypernetwork-based Masks for Continual Learning
di: Książek, Kamil, et al.
Pubblicazione: (2023)
di: Książek, Kamil, et al.
Pubblicazione: (2023)
Is ReLU Adversarially Robust?
di: Sooksatra, Korn, et al.
Pubblicazione: (2024)
di: Sooksatra, Korn, et al.
Pubblicazione: (2024)
Interpretability Can Be Actionable
di: Orgad, Hadas, et al.
Pubblicazione: (2026)
di: Orgad, Hadas, et al.
Pubblicazione: (2026)
Probing for Representation Manifolds in Superposition
di: Modell, Alexander
Pubblicazione: (2026)
di: Modell, Alexander
Pubblicazione: (2026)
CGLearn: Consistent Gradient-Based Learning for Out-of-Distribution Generalization
di: Chowdhury, Jawad, et al.
Pubblicazione: (2024)
di: Chowdhury, Jawad, et al.
Pubblicazione: (2024)
Concept Prerequisite Relation Prediction by Using Permutation-Equivariant Directed Graph Neural Networks
di: Qu, Xiran, et al.
Pubblicazione: (2023)
di: Qu, Xiran, et al.
Pubblicazione: (2023)
Improving Time Series Classification with Representation Soft Label Smoothing
di: Ma, Hengyi, et al.
Pubblicazione: (2024)
di: Ma, Hengyi, et al.
Pubblicazione: (2024)
A Vulnerability of Attribution Methods Using Pre-Softmax Scores
di: Lerma, Miguel, et al.
Pubblicazione: (2023)
di: Lerma, Miguel, et al.
Pubblicazione: (2023)
Simple Network Graph Comparative Learning
di: Yu, Qiang, et al.
Pubblicazione: (2026)
di: Yu, Qiang, et al.
Pubblicazione: (2026)
Beyond Coefficients: Forecast-Necessity Testing for Interpretable Causal Discovery in Nonlinear Time-Series Models
di: Kuskova, Valentina, et al.
Pubblicazione: (2026)
di: Kuskova, Valentina, et al.
Pubblicazione: (2026)
Graph Neural Networks Need Cluster-Normalize-Activate Modules
di: Skryagin, Arseny, et al.
Pubblicazione: (2024)
di: Skryagin, Arseny, et al.
Pubblicazione: (2024)
Neural Concept Verifier: Scaling Prover-Verifier Games via Concept Encodings
di: Turan, Berkant, et al.
Pubblicazione: (2025)
di: Turan, Berkant, et al.
Pubblicazione: (2025)
Decentralized Time Series Classification with ROCKET Features
di: Casella, Bruno, et al.
Pubblicazione: (2025)
di: Casella, Bruno, et al.
Pubblicazione: (2025)
Matryoshka Policy Gradient for Entropy-Regularized RL: Convergence and Global Optimality
di: Ged, François, et al.
Pubblicazione: (2023)
di: Ged, François, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Representation of the structure of graphs by sequences of instructions
di: Lopez-Rubio, Ezequiel
Pubblicazione: (2025) -
Enhanced QKNorm normalization for neural transformers with the Lp norm
di: Lopez-Rubio, Ezequiel, et al.
Pubblicazione: (2026) -
From Features to Graphs: Exploring Graph Structures and Pairwise Interactions via GNNs
di: Yamchote, Phaphontee, et al.
Pubblicazione: (2025) -
The IsalProgram Programming Language
di: López-Rubio, Ezequiel
Pubblicazione: (2026) -
multivariateGPT: a decoder-only transformer for multivariate categorical and numeric data
di: Loza, Andrew J., et al.
Pubblicazione: (2025)