Deriving Transformer Architectures as Implicit Multinomial Regression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Actor, Jonas A., Gruber, Anthony, Cyr, Eric C. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gaussian Variational Schemes on Bounded and Unbounded Domains
par: Actor, Jonas A., et autres
Publié: (2024)
par: Actor, Jonas A., et autres
Publié: (2024)
Multilevel Training for Kolmogorov Arnold Networks
par: Southworth, Ben S., et autres
Publié: (2026)
par: Southworth, Ben S., et autres
Publié: (2026)
Robust Non-Linear Correlations via Polynomial Regression
par: Giuliani, Luca, et autres
Publié: (2025)
par: Giuliani, Luca, et autres
Publié: (2025)
Mixture of neural operator experts for learning boundary conditions and model selection
par: Deighan, Dwyer, et autres
Publié: (2025)
par: Deighan, Dwyer, et autres
Publié: (2025)
Transformers Can Implement Preconditioned Richardson Iteration for In-Context Gaussian Kernel Regression
par: Yan, Mingsong, et autres
Publié: (2026)
par: Yan, Mingsong, et autres
Publié: (2026)
On the Role of Initialization on the Implicit Bias in Deep Linear Networks
par: Gruber, Oria, et autres
Publié: (2024)
par: Gruber, Oria, et autres
Publié: (2024)
A Mathematical Explanation of Transformers
par: Tai, Xue-Cheng, et autres
Publié: (2025)
par: Tai, Xue-Cheng, et autres
Publié: (2025)
Accelerating Matrix Diagonalization through Decision Transformers with Epsilon-Greedy Optimization
par: Bhatta, Kshitij, et autres
Publié: (2024)
par: Bhatta, Kshitij, et autres
Publié: (2024)
FAST: Factorizable Attention for Speeding up Transformers
par: Gerami, Armin, et autres
Publié: (2024)
par: Gerami, Armin, et autres
Publié: (2024)
GeoLoRA: Geometric integration for parameter efficient fine-tuning
par: Schotthöfer, Steffen, et autres
Publié: (2024)
par: Schotthöfer, Steffen, et autres
Publié: (2024)
AlgoFormer: An Efficient Transformer Framework with Algorithmic Structures
par: Gao, Yihang, et autres
Publié: (2024)
par: Gao, Yihang, et autres
Publié: (2024)
STNet: Spectral Transformation Network for Solving Operator Eigenvalue Problem
par: Wang, Hong, et autres
Publié: (2025)
par: Wang, Hong, et autres
Publié: (2025)
Principled Approaches for Extending Neural Architectures to Function Spaces for Operator Learning
par: Berner, Julius, et autres
Publié: (2025)
par: Berner, Julius, et autres
Publié: (2025)
Unisolver: PDE-Conditional Transformers Towards Universal Neural PDE Solvers
par: Zhou, Hang, et autres
Publié: (2024)
par: Zhou, Hang, et autres
Publié: (2024)
Leveraging KANs for Expedient Training of Multichannel MLPs via Preconditioning and Geometric Refinement
par: Actor, Jonas A., et autres
Publié: (2025)
par: Actor, Jonas A., et autres
Publié: (2025)
Universal Approximation of Nonlinear Operators and Their Derivatives
par: de Feo, Filippo
Publié: (2026)
par: de Feo, Filippo
Publié: (2026)
Generalized Orders of Magnitude for Scalable, Parallel, High-Dynamic-Range Computation
par: Heinsen, Franz A., et autres
Publié: (2025)
par: Heinsen, Franz A., et autres
Publié: (2025)
Learning Explicitly Conditioned Sparsifying Transforms
par: Pătraşcu, Andrei, et autres
Publié: (2024)
par: Pătraşcu, Andrei, et autres
Publié: (2024)
Towards Faster Matrix Diagonalization with Graph Isomorphism Networks and the AlphaZero Framework
par: Zollicoffer, Geigh, et autres
Publié: (2024)
par: Zollicoffer, Geigh, et autres
Publié: (2024)
Truncated Matrix Completion - An Empirical Study
par: Naik, Rishhabh, et autres
Publié: (2025)
par: Naik, Rishhabh, et autres
Publié: (2025)
BWLer: Barycentric Weight Layer Elucidates a Precision-Conditioning Tradeoff for PINNs
par: Liu, Jerry, et autres
Publié: (2025)
par: Liu, Jerry, et autres
Publié: (2025)
Random weights of DNNs and emergence of fixed points
par: Berlyand, L., et autres
Publié: (2025)
par: Berlyand, L., et autres
Publié: (2025)
GRAFT: Gradient-Aware Fast MaxVol Technique for Dynamic Data Sampling
par: Jha, Ashish, et autres
Publié: (2025)
par: Jha, Ashish, et autres
Publié: (2025)
KAN-GCN: Combining Kolmogorov-Arnold Network with Graph Convolution Network for an Accurate Ice Sheet Emulator
par: Liu, Zesheng, et autres
Publié: (2025)
par: Liu, Zesheng, et autres
Publié: (2025)
Market-Driven Subset Selection for Budgeted Training
par: Jha, Ashish, et autres
Publié: (2025)
par: Jha, Ashish, et autres
Publié: (2025)
Beyond Loss Guidance: Using PDE Residuals as Spectral Attention in Diffusion Neural Operators
par: Sawhney, Medha, et autres
Publié: (2025)
par: Sawhney, Medha, et autres
Publié: (2025)
Quasi-Random Physics-informed Neural Networks
par: Yu, Tianchi, et autres
Publié: (2025)
par: Yu, Tianchi, et autres
Publié: (2025)
Mixed precision accumulation for neural network inference guided by componentwise forward error analysis
par: Arar, El-Mehdi El, et autres
Publié: (2025)
par: Arar, El-Mehdi El, et autres
Publié: (2025)
Branching Strategies Based on Subgraph GNNs: A Study on Theoretical Promise versus Practical Reality
par: Zhou, Junru, et autres
Publié: (2025)
par: Zhou, Junru, et autres
Publié: (2025)
Unveiling the Power of Multiple Gossip Steps: A Stability-Based Generalization Analysis in Decentralized Training
par: Li, Qinglun, et autres
Publié: (2025)
par: Li, Qinglun, et autres
Publié: (2025)
Solving PDEs With Deep Neural Nets under General Boundary Conditions
par: Zhang, Chenggong
Publié: (2025)
par: Zhang, Chenggong
Publié: (2025)
On Uniform Weighted Deep Polynomial approximation
par: Yeon, Kingsley, et autres
Publié: (2025)
par: Yeon, Kingsley, et autres
Publié: (2025)
DeepContour: A Hybrid Deep Learning Framework for Accelerating Generalized Eigenvalue Problem Solving via Efficient Contour Design
par: Chen, Yeqiu, et autres
Publié: (2025)
par: Chen, Yeqiu, et autres
Publié: (2025)
Guided Diffusion Sampling on Function Spaces with Applications to PDEs
par: Yao, Jiachen, et autres
Publié: (2025)
par: Yao, Jiachen, et autres
Publié: (2025)
Monte Carlo-Type Neural Operator for Differential Equations
par: Choutri, Salah Eddine, et autres
Publié: (2025)
par: Choutri, Salah Eddine, et autres
Publié: (2025)
Accelerating Eigenvalue Dataset Generation via Chebyshev Subspace Filter
par: Wang, Hong, et autres
Publié: (2025)
par: Wang, Hong, et autres
Publié: (2025)
Defining Foundation Models for Computational Science: A Call for Clarity and Rigor
par: Choi, Youngsoo, et autres
Publié: (2025)
par: Choi, Youngsoo, et autres
Publié: (2025)
CFO: Learning Continuous-Time PDE Dynamics via Flow-Matched Neural Operators
par: Hou, Xianglong, et autres
Publié: (2025)
par: Hou, Xianglong, et autres
Publié: (2025)
ELM-DeepONets: Backpropagation-Free Training of Deep Operator Networks via Extreme Learning Machines
par: Son, Hwijae
Publié: (2025)
par: Son, Hwijae
Publié: (2025)
Accelerated Gradient-based Design Optimization Via Differentiable Physics-Informed Neural Operator: A Composites Autoclave Processing Case Study
par: Patel, Janak M., et autres
Publié: (2025)
par: Patel, Janak M., et autres
Publié: (2025)
Documents similaires
-
Gaussian Variational Schemes on Bounded and Unbounded Domains
par: Actor, Jonas A., et autres
Publié: (2024) -
Multilevel Training for Kolmogorov Arnold Networks
par: Southworth, Ben S., et autres
Publié: (2026) -
Robust Non-Linear Correlations via Polynomial Regression
par: Giuliani, Luca, et autres
Publié: (2025) -
Mixture of neural operator experts for learning boundary conditions and model selection
par: Deighan, Dwyer, et autres
Publié: (2025) -
Transformers Can Implement Preconditioned Richardson Iteration for In-Context Gaussian Kernel Regression
par: Yan, Mingsong, et autres
Publié: (2026)