Geometric and Dynamic Scaling in Deep Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Su, Haoran, You, Chenyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Emergency Preemption Without Online Exploration: A Decision Transformer Approach
por: Su, Haoran, et al.
Publicado: (2026)
por: Su, Haoran, et al.
Publicado: (2026)
Scaling Attention via Feature Sparsity
por: Xie, Yan, et al.
Publicado: (2026)
por: Xie, Yan, et al.
Publicado: (2026)
ShiftAddViT: Mixture of Multiplication Primitives Towards Efficient Vision Transformer
por: You, Haoran, et al.
Publicado: (2023)
por: You, Haoran, et al.
Publicado: (2023)
Spatiotemporal Decision Transformer for Traffic Coordination
por: Su, Haoran, et al.
Publicado: (2026)
por: Su, Haoran, et al.
Publicado: (2026)
ManifoldFormer: Geometric Deep Learning for Neural Dynamics on Riemannian Manifolds
por: Fu, Yihang, et al.
Publicado: (2025)
por: Fu, Yihang, et al.
Publicado: (2025)
LASS-ODE: Scaling ODE Computations to Connect Foundation Models with Dynamical Physical Systems
por: Li, Haoran, et al.
Publicado: (2026)
por: Li, Haoran, et al.
Publicado: (2026)
Geometric Scaling of Bayesian Inference in LLMs
por: Agarwal, Naman, et al.
Publicado: (2025)
por: Agarwal, Naman, et al.
Publicado: (2025)
Mathematical Foundations of Geometric Deep Learning
por: Borde, Haitz Sáez de Ocáriz, et al.
Publicado: (2025)
por: Borde, Haitz Sáez de Ocáriz, et al.
Publicado: (2025)
Scale-Consistent State-Space Dynamics via Fractal of Stationary Transformations
por: Yu, Geunhyeok, et al.
Publicado: (2026)
por: Yu, Geunhyeok, et al.
Publicado: (2026)
Calibration and Transformation-Free Weight-Only LLMs Quantization via Dynamic Grouping
por: Zheng, Xinzhe, et al.
Publicado: (2025)
por: Zheng, Xinzhe, et al.
Publicado: (2025)
Spectral Convolution on Orbifolds for Geometric Deep Learning
por: Mangliers, Tim, et al.
Publicado: (2026)
por: Mangliers, Tim, et al.
Publicado: (2026)
On the Completeness of Invariant Geometric Deep Learning Models
por: Li, Zian, et al.
Publicado: (2024)
por: Li, Zian, et al.
Publicado: (2024)
Is Distance Matrix Enough for Geometric Deep Learning?
por: Li, Zian, et al.
Publicado: (2023)
por: Li, Zian, et al.
Publicado: (2023)
Max-Affine Spline Insights Into Deep Network Pruning
por: You, Haoran, et al.
Publicado: (2021)
por: You, Haoran, et al.
Publicado: (2021)
DyCE: Dynamically Configurable Exiting for Deep Learning Compression and Real-time Scaling
por: Wang, Qingyuan, et al.
Publicado: (2024)
por: Wang, Qingyuan, et al.
Publicado: (2024)
Flag Varieties: A Geometric Framework for Deep Network Alignment
por: Xiao, Jingchuan, et al.
Publicado: (2026)
por: Xiao, Jingchuan, et al.
Publicado: (2026)
Geometric Attention: A Regime-Explicit Operator Semantics for Transformer Attention
por: Freytes, Luis Rosario
Publicado: (2026)
por: Freytes, Luis Rosario
Publicado: (2026)
Euclidean, Projective, Conformal: Choosing a Geometric Algebra for Equivariant Transformers
por: de Haan, Pim, et al.
Publicado: (2023)
por: de Haan, Pim, et al.
Publicado: (2023)
Soft Geometric Inductive Bias for Object Centric Dynamics
por: Linander, Hampus, et al.
Publicado: (2025)
por: Linander, Hampus, et al.
Publicado: (2025)
Geometric Dynamics of Agentic Loops in Large Language Models
por: Tacheny, Nicolas
Publicado: (2025)
por: Tacheny, Nicolas
Publicado: (2025)
Unifying Learning Dynamics and Generalization in Transformers Scaling Law
por: Yang, Chiwun
Publicado: (2025)
por: Yang, Chiwun
Publicado: (2025)
A Geometrically-Grounded Drive for MDL-Based Optimization in Deep Learning
por: Lei, Ming, et al.
Publicado: (2026)
por: Lei, Ming, et al.
Publicado: (2026)
Scaling Sequential Recommendation Models with Transformers
por: Zivic, Pablo, et al.
Publicado: (2024)
por: Zivic, Pablo, et al.
Publicado: (2024)
Scaling Diffusion Transformers Efficiently via $μ$P
por: Zheng, Chenyu, et al.
Publicado: (2025)
por: Zheng, Chenyu, et al.
Publicado: (2025)
PHGNN: A Novel Prompted Hypergraph Neural Network to Diagnose Alzheimer's Disease
por: Liu, Chenyu, et al.
Publicado: (2025)
por: Liu, Chenyu, et al.
Publicado: (2025)
The Geometric Anatomy of Capability Acquisition in Transformers
por: Billa, Jayadev
Publicado: (2026)
por: Billa, Jayadev
Publicado: (2026)
PROMISE-AD: Progression-aware Multi-horizon Survival Estimation for Alzheimer's Disease Progression and Dynamic Tracking
por: Lyu, Qing, et al.
Publicado: (2026)
por: Lyu, Qing, et al.
Publicado: (2026)
Latent Mixture of Symmetries for Sample-Efficient Dynamic Learning
por: Li, Haoran, et al.
Publicado: (2025)
por: Li, Haoran, et al.
Publicado: (2025)
EnTransformer: A Deep Generative Transformer for Multivariate Probabilistic Forecasting
por: Pathak, Rajdeep, et al.
Publicado: (2026)
por: Pathak, Rajdeep, et al.
Publicado: (2026)
Deep Minds and Shallow Probes
por: Lee, Su Hyeong, et al.
Publicado: (2026)
por: Lee, Su Hyeong, et al.
Publicado: (2026)
Emergent Causal-Geometric Dynamics Across Depth in Large Language Models
por: Haim, Shahar, et al.
Publicado: (2026)
por: Haim, Shahar, et al.
Publicado: (2026)
Geometric Neural Operators via Lie Group-Constrained Latent Dynamics
por: Zhang, Jiaquan, et al.
Publicado: (2026)
por: Zhang, Jiaquan, et al.
Publicado: (2026)
ShiftAddNAS: Hardware-Inspired Search for More Accurate and Efficient Neural Networks
por: You, Haoran, et al.
Publicado: (2022)
por: You, Haoran, et al.
Publicado: (2022)
GeSS: Benchmarking Geometric Deep Learning under Scientific Applications with Distribution Shifts
por: Zou, Deyu, et al.
Publicado: (2023)
por: Zou, Deyu, et al.
Publicado: (2023)
Dynamically Scaled Activation Steering
por: Ferrando, Alex, et al.
Publicado: (2025)
por: Ferrando, Alex, et al.
Publicado: (2025)
GeoDynamics: A Geometric State-Space Neural Network for Understanding Brain Dynamics on Riemannian Manifolds
por: Dan, Tingting, et al.
Publicado: (2026)
por: Dan, Tingting, et al.
Publicado: (2026)
GoQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization
por: Xiang, Maoyang, et al.
Publicado: (2026)
por: Xiang, Maoyang, et al.
Publicado: (2026)
Making Batch Normalization Great in Federated Deep Learning
por: Zhong, Jike, et al.
Publicado: (2023)
por: Zhong, Jike, et al.
Publicado: (2023)
Large Language Models for Constructing and Optimizing Machine Learning Workflows: A Survey
por: Gu, Yang, et al.
Publicado: (2024)
por: Gu, Yang, et al.
Publicado: (2024)
Generalised Linear Models in Deep Bayesian RL with Learnable Basis Functions
por: You, Jingyang, et al.
Publicado: (2025)
por: You, Jingyang, et al.
Publicado: (2025)
Ejemplares similares
-
Emergency Preemption Without Online Exploration: A Decision Transformer Approach
por: Su, Haoran, et al.
Publicado: (2026) -
Scaling Attention via Feature Sparsity
por: Xie, Yan, et al.
Publicado: (2026) -
ShiftAddViT: Mixture of Multiplication Primitives Towards Efficient Vision Transformer
por: You, Haoran, et al.
Publicado: (2023) -
Spatiotemporal Decision Transformer for Traffic Coordination
por: Su, Haoran, et al.
Publicado: (2026) -
ManifoldFormer: Geometric Deep Learning for Neural Dynamics on Riemannian Manifolds
por: Fu, Yihang, et al.
Publicado: (2025)