Saved in:
| Main Authors: | Kumar, Saurabh, Buckman, Jacob, Gelada, Carles, Zhang, Sean |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2503.03269 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Scaling Context Requires Rethinking Attention
by: Gelada, Carles, et al.
Published: (2025)
by: Gelada, Carles, et al.
Published: (2025)
NoiseFormer -- Noise Diffused Symmetric Attention Transformer
by: Kumar, Phani, et al.
Published: (2026)
by: Kumar, Phani, et al.
Published: (2026)
Reasoning with Latent Thoughts: On the Power of Looped Transformers
by: Saunshi, Nikunj, et al.
Published: (2025)
by: Saunshi, Nikunj, et al.
Published: (2025)
Euclidean, Projective, Conformal: Choosing a Geometric Algebra for Equivariant Transformers
by: de Haan, Pim, et al.
Published: (2023)
by: de Haan, Pim, et al.
Published: (2023)
Algorithmic Capabilities of Random Transformers
by: Zhong, Ziqian, et al.
Published: (2024)
by: Zhong, Ziqian, et al.
Published: (2024)
2DXformer: Dual Transformers for Wind Power Forecasting with Dual Exogenous Variables
by: Zhang, Yajuan, et al.
Published: (2025)
by: Zhang, Yajuan, et al.
Published: (2025)
Power Transformer Fault Prediction Based on Knowledge Graphs
by: Wang, Chao, et al.
Published: (2024)
by: Wang, Chao, et al.
Published: (2024)
Traj-Transformer: Diffusion Models with Transformer for GPS Trajectory Generation
by: Zhang, Zhiyang, et al.
Published: (2025)
by: Zhang, Zhiyang, et al.
Published: (2025)
Conformal Prediction of Classifiers with Many Classes based on Noisy Labels
by: Penso, Coby, et al.
Published: (2025)
by: Penso, Coby, et al.
Published: (2025)
On the Expressive Power of Transformers for Maxout Networks and Continuous Piecewise Linear Functions
by: Gu, Linyan, et al.
Published: (2026)
by: Gu, Linyan, et al.
Published: (2026)
Activation Outliers in Transformer Quantization: Reproduction, Statistical Analysis, and Deployment Tradeoffs
by: Kaliaperumal, Pranav Kumar
Published: (2026)
by: Kaliaperumal, Pranav Kumar
Published: (2026)
Optimized Conformal Selection: Powerful Selective Inference After Conformity Score Optimization
by: Bai, Tian, et al.
Published: (2024)
by: Bai, Tian, et al.
Published: (2024)
Enhanced Photovoltaic Power Forecasting: An iTransformer and LSTM-Based Model Integrating Temporal and Covariate Interactions
by: Wu, Guang, et al.
Published: (2024)
by: Wu, Guang, et al.
Published: (2024)
NEAT: Neighborhood-Guided, Efficient, Autoregressive Set Transformer for 3D Molecular Generation
by: Rose, Daniel, et al.
Published: (2025)
by: Rose, Daniel, et al.
Published: (2025)
Transformers Can Do Arithmetic with the Right Embeddings
by: McLeish, Sean, et al.
Published: (2024)
by: McLeish, Sean, et al.
Published: (2024)
ASTROCO: Self-Supervised Conformer-Style Transformers for Light-Curve Embeddings
by: Tan, Antony, et al.
Published: (2025)
by: Tan, Antony, et al.
Published: (2025)
AI-driven Transformer Model for Fault Prediction in Non-Linear Dynamic Automotive System
by: Kumar, Priyanka
Published: (2024)
by: Kumar, Priyanka
Published: (2024)
Spectral Discovery of Continuous Symmetries via Generalized Fourier Transforms
by: Karjol, Pavan, et al.
Published: (2026)
by: Karjol, Pavan, et al.
Published: (2026)
ALTA: Compiler-Based Analysis of Transformers
by: Shaw, Peter, et al.
Published: (2024)
by: Shaw, Peter, et al.
Published: (2024)
k-Maximum Inner Product Attention for Graph Transformers and the Expressive Power of GraphGPS
by: De Schouwer, Jonas, et al.
Published: (2026)
by: De Schouwer, Jonas, et al.
Published: (2026)
Noise Stability of Transformer Models
by: Haris, Themistoklis, et al.
Published: (2026)
by: Haris, Themistoklis, et al.
Published: (2026)
Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers
by: Ravindran, Santhosh Kumar
Published: (2025)
by: Ravindran, Santhosh Kumar
Published: (2025)
Unified Training of Universal Time Series Forecasting Transformers
by: Woo, Gerald, et al.
Published: (2024)
by: Woo, Gerald, et al.
Published: (2024)
Maintaining Plasticity in Continual Learning via Regenerative Regularization
by: Kumar, Saurabh, et al.
Published: (2023)
by: Kumar, Saurabh, et al.
Published: (2023)
TOAST: Transformer Optimization using Adaptive and Simple Transformations
by: Cannistraci, Irene, et al.
Published: (2024)
by: Cannistraci, Irene, et al.
Published: (2024)
Where to Add PDE Diffusion in Transformers
by: Zhang, Yukun, et al.
Published: (2025)
by: Zhang, Yukun, et al.
Published: (2025)
GoQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization
by: Xiang, Maoyang, et al.
Published: (2026)
by: Xiang, Maoyang, et al.
Published: (2026)
Hiformer: Hybrid Frequency Feature Enhancement Inverted Transformer for Long-Term Wind Power Prediction
by: Wan, Chongyang, et al.
Published: (2024)
by: Wan, Chongyang, et al.
Published: (2024)
Patch-Level Tokenization with CNN Encoders and Attention for Improved Transformer Time-Series Forecasting
by: Nagrath, Saurish, et al.
Published: (2026)
by: Nagrath, Saurish, et al.
Published: (2026)
AI-Powered Bayesian Inference
by: O'Hagan, Sean, et al.
Published: (2025)
by: O'Hagan, Sean, et al.
Published: (2025)
An Introduction to Transformers
by: Turner, Richard E.
Published: (2023)
by: Turner, Richard E.
Published: (2023)
Sharper Generalization Bounds for Transformer
by: Li, Yawen, et al.
Published: (2026)
by: Li, Yawen, et al.
Published: (2026)
Are Transformers More Robust? Towards Exact Robustness Verification for Transformers
by: Liao, Brian Hsuan-Cheng, et al.
Published: (2022)
by: Liao, Brian Hsuan-Cheng, et al.
Published: (2022)
RT-Transformer: The Transformer Block as a Spherical State Estimator
by: Racioppo, Peter
Published: (2026)
by: Racioppo, Peter
Published: (2026)
Stability of Transformers under Layer Normalization
by: Kan, Kelvin, et al.
Published: (2025)
by: Kan, Kelvin, et al.
Published: (2025)
Knowledge-enhanced Transformer for Multivariate Long Sequence Time-series Forecasting
by: Kakde, Shubham Tanaji, et al.
Published: (2024)
by: Kakde, Shubham Tanaji, et al.
Published: (2024)
Benign Overfitting in Adversarial Training for Vision Transformers
by: Zhang, Jiaming, et al.
Published: (2026)
by: Zhang, Jiaming, et al.
Published: (2026)
RL-ACRGNet: Reinforcement Learning-Based Chest Radiology Report Generation Network
by: Meena, Yogesh Kumar, et al.
Published: (2026)
by: Meena, Yogesh Kumar, et al.
Published: (2026)
EnTransformer: A Deep Generative Transformer for Multivariate Probabilistic Forecasting
by: Pathak, Rajdeep, et al.
Published: (2026)
by: Pathak, Rajdeep, et al.
Published: (2026)
Transformer Neural Processes - Kernel Regression
by: Jenson, Daniel, et al.
Published: (2024)
by: Jenson, Daniel, et al.
Published: (2024)
Similar Items
-
Scaling Context Requires Rethinking Attention
by: Gelada, Carles, et al.
Published: (2025) -
NoiseFormer -- Noise Diffused Symmetric Attention Transformer
by: Kumar, Phani, et al.
Published: (2026) -
Reasoning with Latent Thoughts: On the Power of Looped Transformers
by: Saunshi, Nikunj, et al.
Published: (2025) -
Euclidean, Projective, Conformal: Choosing a Geometric Algebra for Equivariant Transformers
by: de Haan, Pim, et al.
Published: (2023) -
Algorithmic Capabilities of Random Transformers
by: Zhong, Ziqian, et al.
Published: (2024)