Subgroups of $U(d)$ Induce Natural RNN and Transformer Architectures
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Nunley, Joshua |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SCNode: Spatial and Contextual Coordinates for Graph Representation Learning
par: Uddin, Md Joshem, et autres
Publié: (2024)
par: Uddin, Md Joshem, et autres
Publié: (2024)
S$^3$: Structured Sparsity Specification
par: Ghriss, Ayoub
Publié: (2026)
par: Ghriss, Ayoub
Publié: (2026)
Implicit Bias and Invariance: How Hopfield Networks Efficiently Learn Graph Orbits
par: Murray, Michael, et autres
Publié: (2025)
par: Murray, Michael, et autres
Publié: (2025)
SigGate-GT: Taming Over-Smoothing in Graph Transformers via Sigmoid-Gated Attention
par: Guo, Dongxin, et autres
Publié: (2026)
par: Guo, Dongxin, et autres
Publié: (2026)
Metriplector: From Field Theory to Neural Architecture
par: Oprisa, Dan, et autres
Publié: (2026)
par: Oprisa, Dan, et autres
Publié: (2026)
H-Model: Dynamic Neural Architectures for Adaptive Processing
par: Hospodarchuk, Dmytro
Publié: (2025)
par: Hospodarchuk, Dmytro
Publié: (2025)
The Inhibitor: ReLU and Addition-Based Attention for Efficient Transformers under Fully Homomorphic Encryption on the Torus
par: Brännvall, Rickard, et autres
Publié: (2023)
par: Brännvall, Rickard, et autres
Publié: (2023)
VORT: Adaptive Power-Law Memory for NLP Transformers
par: Mlaiki, Nabil
Publié: (2026)
par: Mlaiki, Nabil
Publié: (2026)
DRO-InstructZero: Distributionally Robust Prompt Optimization for Large Language Models
par: Li, Yangyang
Publié: (2025)
par: Li, Yangyang
Publié: (2025)
Semi-Implicit Variational Inference via Kernelized Path Gradient Descent
par: Pielok, Tobias, et autres
Publié: (2025)
par: Pielok, Tobias, et autres
Publié: (2025)
Understanding and Tackling Over-Dilution in Graph Neural Networks
par: Lee, Junhyun, et autres
Publié: (2025)
par: Lee, Junhyun, et autres
Publié: (2025)
Latent Object Permanence: Topological Phase Transitions, Free-Energy Principles, and Renormalization Group Flows in Deep Transformer Manifolds
par: Alpay, Faruk, et autres
Publié: (2026)
par: Alpay, Faruk, et autres
Publié: (2026)
Explicit Dropout: Deterministic Regularization for Transformer Architectures
par: Agrawal, Vidhi, et autres
Publié: (2026)
par: Agrawal, Vidhi, et autres
Publié: (2026)
Just In Time Transformers
par: Benali, Ahmed Ala Eddine, et autres
Publié: (2024)
par: Benali, Ahmed Ala Eddine, et autres
Publié: (2024)
KL-Regularised Q-Learning: A Token-level Action-Value perspective on Online RLHF
par: Brown, Jason R, et autres
Publié: (2025)
par: Brown, Jason R, et autres
Publié: (2025)
EchoLSTM: A Self-Reflective Recurrent Network for Stabilizing Long-Range Memory
par: K, Prasanth K, et autres
Publié: (2025)
par: K, Prasanth K, et autres
Publié: (2025)
Neural Networks for Tamed Milstein Approximation of SDEs with Additive Symmetric Jump Noise Driven by a Poisson Random Measure
par: Ramirez-Gonzalez, Jose-Hermenegildo, et autres
Publié: (2025)
par: Ramirez-Gonzalez, Jose-Hermenegildo, et autres
Publié: (2025)
Revisiting Unbiased Implicit Variational Inference
par: Pielok, Tobias, et autres
Publié: (2025)
par: Pielok, Tobias, et autres
Publié: (2025)
Gradient Descent as Implicit EM in Distance-Based Neural Models
par: Oursland, Alan
Publié: (2025)
par: Oursland, Alan
Publié: (2025)
CDFlow: Building Invertible Layers with Circulant and Diagonal Matrices
par: Feng, Xuchen, et autres
Publié: (2025)
par: Feng, Xuchen, et autres
Publié: (2025)
Emotion-Inspired Learning Signals (EILS): A Homeostatic Framework for Adaptive Autonomous Agents
par: Tiwari, Dhruv
Publié: (2025)
par: Tiwari, Dhruv
Publié: (2025)
Transport, Don't Generate: Deterministic Geometric Flows for Combinatorial Optimization
par: Friedmann, Benjy, et autres
Publié: (2026)
par: Friedmann, Benjy, et autres
Publié: (2026)
Using latent representations to link disjoint longitudinal data for mixed-effects regression
par: Schächter, Clemens, et autres
Publié: (2025)
par: Schächter, Clemens, et autres
Publié: (2025)
Is attention truly all we need? An empirical study of asset pricing in pretrained RNN sparse and global attention models
par: Lai, Shanyan
Publié: (2025)
par: Lai, Shanyan
Publié: (2025)
How Much Temporal Modeling is Enough? A Systematic Study of Hybrid CNN-RNN Architectures for Multi-Label ECG Classification
par: Jafari, Alireza, et autres
Publié: (2026)
par: Jafari, Alireza, et autres
Publié: (2026)
Inhibitor Transformers and Gated RNNs for Torus Efficient Fully Homomorphic Encryption
par: Brännvall, Rickard, et autres
Publié: (2023)
par: Brännvall, Rickard, et autres
Publié: (2023)
An Artificial Intelligence-Based Framework for Predicting Emergency Department Overcrowding: Development and Evaluation Study
par: Vural, Orhun, et autres
Publié: (2025)
par: Vural, Orhun, et autres
Publié: (2025)
Optimizing Large Language Models for OpenAPI Code Completion
par: Petryshyn, Bohdan, et autres
Publié: (2024)
par: Petryshyn, Bohdan, et autres
Publié: (2024)
Diagnosing Failure Modes of Neural Operators Across Diverse PDE Families
par: Shikhman, Lennon
Publié: (2026)
par: Shikhman, Lennon
Publié: (2026)
Challenges and Applications of Large Language Models: A Comparison of GPT and DeepSeek family of models
par: Sharma, Shubham, et autres
Publié: (2025)
par: Sharma, Shubham, et autres
Publié: (2025)
Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
par: Imanov, Olaf Yunus Laitinen
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen
Publié: (2026)
Inference acceleration for large language models using "stairs" assisted greedy generation
par: Grigaliūnas, Domas, et autres
Publié: (2024)
par: Grigaliūnas, Domas, et autres
Publié: (2024)
Strategic Doctrine Language Models (sdLM): A Learning-System Framework for Doctrinal Consistency and Geopolitical Forecasting
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
Extracting Sentence Embeddings from Pretrained Transformer Models
par: Stankevičius, Lukas, et autres
Publié: (2024)
par: Stankevičius, Lukas, et autres
Publié: (2024)
Attribution Projection Calculus: A Novel Framework for Causal Inference in Bayesian Networks
par: Amin, M Ruhul
Publié: (2025)
par: Amin, M Ruhul
Publié: (2025)
DreamNet: A Multimodal Framework for Semantic and Emotional Analysis of Sleep Narratives
par: Panchagnula, Tapasvi
Publié: (2025)
par: Panchagnula, Tapasvi
Publié: (2025)
Jacobian-Velocity Bounds for Deployment Risk Under Covariate Drift
par: Landers, Jonathan R.
Publié: (2026)
par: Landers, Jonathan R.
Publié: (2026)
Scaling Higher-Order Graph Learning with Maximal Clique Complexes
par: Vialle, Antoine, et autres
Publié: (2026)
par: Vialle, Antoine, et autres
Publié: (2026)
Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol
par: Nakamura, Yuki
Publié: (2026)
par: Nakamura, Yuki
Publié: (2026)
Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3
par: Nitarach, Natapong
Publié: (2026)
par: Nitarach, Natapong
Publié: (2026)
Documents similaires
-
SCNode: Spatial and Contextual Coordinates for Graph Representation Learning
par: Uddin, Md Joshem, et autres
Publié: (2024) -
S$^3$: Structured Sparsity Specification
par: Ghriss, Ayoub
Publié: (2026) -
Implicit Bias and Invariance: How Hopfield Networks Efficiently Learn Graph Orbits
par: Murray, Michael, et autres
Publié: (2025) -
SigGate-GT: Taming Over-Smoothing in Graph Transformers via Sigmoid-Gated Attention
par: Guo, Dongxin, et autres
Publié: (2026) -
Metriplector: From Field Theory to Neural Architecture
par: Oprisa, Dan, et autres
Publié: (2026)