Salvato in:
| Autori principali: | Cranney, Caleb, Meyer, Jesse G. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.09503 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GoldenTransformer: A Modular Fault Injection Framework for Transformer Robustness Research
di: Howard, Luke
Pubblicazione: (2025)
di: Howard, Luke
Pubblicazione: (2025)
M3PT: A Transformer for Multimodal, Multi-Party Social Signal Prediction with Person-aware Blockwise Attention
di: Tang, Yiming, et al.
Pubblicazione: (2025)
di: Tang, Yiming, et al.
Pubblicazione: (2025)
Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention
di: Guo, Zhenyu, et al.
Pubblicazione: (2025)
di: Guo, Zhenyu, et al.
Pubblicazione: (2025)
RL + Transformer = A General-Purpose Problem Solver
di: Rentschler, Micah, et al.
Pubblicazione: (2025)
di: Rentschler, Micah, et al.
Pubblicazione: (2025)
Loss Landscape Degeneracy and Stagewise Development in Transformers
di: Hoogland, Jesse, et al.
Pubblicazione: (2024)
di: Hoogland, Jesse, et al.
Pubblicazione: (2024)
FedModule: A Modular Federated Learning Framework
di: Chen, Chuyi, et al.
Pubblicazione: (2024)
di: Chen, Chuyi, et al.
Pubblicazione: (2024)
Learning Modular Exponentiation with Transformers
di: Africa, David Demitri, et al.
Pubblicazione: (2025)
di: Africa, David Demitri, et al.
Pubblicazione: (2025)
Geometric Attention: A Regime-Explicit Operator Semantics for Transformer Attention
di: Freytes, Luis Rosario
Pubblicazione: (2026)
di: Freytes, Luis Rosario
Pubblicazione: (2026)
Spacetime $E(n)$-Transformer: Equivariant Attention for Spatio-temporal Graphs
di: Charles, Sergio G.
Pubblicazione: (2024)
di: Charles, Sergio G.
Pubblicazione: (2024)
Engineering Verifiable Modularity in Transformers via Per-Layer Supervision
di: Kerce, J. Clayton
Pubblicazione: (2026)
di: Kerce, J. Clayton
Pubblicazione: (2026)
The Bayesian Geometry of Transformer Attention
di: Agarwal, Naman, et al.
Pubblicazione: (2025)
di: Agarwal, Naman, et al.
Pubblicazione: (2025)
Multi-Perspective Transformers in ARC-AGI-2 Challenge
di: Talley, Caleb, et al.
Pubblicazione: (2026)
di: Talley, Caleb, et al.
Pubblicazione: (2026)
Attention Schema-based Attention Control (ASAC): A Cognitive-Inspired Approach for Attention Management in Transformers
di: Saxena, Krati, et al.
Pubblicazione: (2025)
di: Saxena, Krati, et al.
Pubblicazione: (2025)
Enhancing Customer Service Chatbots with Context-Aware NLU through Selective Attention and Multi-task Learning
di: Nandi, Subhadip, et al.
Pubblicazione: (2025)
di: Nandi, Subhadip, et al.
Pubblicazione: (2025)
Neural Organ Transplantation (NOT): Checkpoint-Based Modular Adaptation for Transformer Models
di: Al-Zuraiqi, Ahmad
Pubblicazione: (2026)
di: Al-Zuraiqi, Ahmad
Pubblicazione: (2026)
Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient
di: Wang, George, et al.
Pubblicazione: (2024)
di: Wang, George, et al.
Pubblicazione: (2024)
XicorAttention: Time Series Transformer Using Attention with Nonlinear Correlation
di: Kimura, Daichi, et al.
Pubblicazione: (2025)
di: Kimura, Daichi, et al.
Pubblicazione: (2025)
LoRA-Mixer: Coordinate Modular LoRA Experts Through Serial Attention Routing
di: Li, Wenbing, et al.
Pubblicazione: (2025)
di: Li, Wenbing, et al.
Pubblicazione: (2025)
ParMod: A Parallel and Modular Framework for Learning Non-Markovian Tasks
di: Miao, Ruixuan, et al.
Pubblicazione: (2024)
di: Miao, Ruixuan, et al.
Pubblicazione: (2024)
robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
di: Zhu, Yuke, et al.
Pubblicazione: (2020)
di: Zhu, Yuke, et al.
Pubblicazione: (2020)
Towards Empirical Interpretation of Internal Circuits and Properties in Grokked Transformers on Modular Polynomials
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
Bifurcation Models: Learning Set-Valued Solution Maps with Weight-Tied Dynamics
di: Jore, Caleb, et al.
Pubblicazione: (2026)
di: Jore, Caleb, et al.
Pubblicazione: (2026)
Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
di: Dhayalkar, Sahil Rajesh
Pubblicazione: (2025)
di: Dhayalkar, Sahil Rajesh
Pubblicazione: (2025)
GIAT: A Geologically-Informed Attention Transformer for Lithology Identification
di: Li, Jie, et al.
Pubblicazione: (2026)
di: Li, Jie, et al.
Pubblicazione: (2026)
CALM: A CKA-Guided Adaptive Layer-Wise Modularization Framework for LLM Quantization
di: Zhang, Jinhao, et al.
Pubblicazione: (2025)
di: Zhang, Jinhao, et al.
Pubblicazione: (2025)
Unveiling and Controlling Anomalous Attention Distribution in Transformers
di: Yan, Ruiqing, et al.
Pubblicazione: (2024)
di: Yan, Ruiqing, et al.
Pubblicazione: (2024)
Exact Attention Sensitivity and the Geometry of Transformer Stability
di: Emadi, Seyed Morteza
Pubblicazione: (2026)
di: Emadi, Seyed Morteza
Pubblicazione: (2026)
Graph Convolutions Enrich the Self-Attention in Transformers!
di: Choi, Jeongwhan, et al.
Pubblicazione: (2023)
di: Choi, Jeongwhan, et al.
Pubblicazione: (2023)
Higher-Order Transformers With Kronecker-Structured Attention
di: Omranpour, Soroush, et al.
Pubblicazione: (2024)
di: Omranpour, Soroush, et al.
Pubblicazione: (2024)
Expanding Expressivity in Transformer Models with MöbiusAttention
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
Transolver is a Linear Transformer: Revisiting Physics-Attention through the Lens of Linear Attention
di: Hu, Wenjie, et al.
Pubblicazione: (2025)
di: Hu, Wenjie, et al.
Pubblicazione: (2025)
Customized Load Profiles Synthesis for Electricity Customers Based on Conditional Diffusion Models
di: Wang, Zhenyi, et al.
Pubblicazione: (2023)
di: Wang, Zhenyi, et al.
Pubblicazione: (2023)
METHOD: Modular Efficient Transformer for Health Outcome Discovery
di: Qian, Linglong, et al.
Pubblicazione: (2025)
di: Qian, Linglong, et al.
Pubblicazione: (2025)
Interpretable Discovery of One-parameter Subgroups: A Modular Framework for Elliptical, Hyperbolic, and Parabolic Symmetries
di: Karjol, Pavan, et al.
Pubblicazione: (2025)
di: Karjol, Pavan, et al.
Pubblicazione: (2025)
Modular Delta Merging with Orthogonal Constraints: A Scalable Framework for Continual and Reversible Model Composition
di: Khan, Haris, et al.
Pubblicazione: (2025)
di: Khan, Haris, et al.
Pubblicazione: (2025)
Scaling Graph Transformers: A Comparative Study of Sparse and Dense Attention
di: Dimitrov, Leon
Pubblicazione: (2025)
di: Dimitrov, Leon
Pubblicazione: (2025)
Echo State Transformer: Attention Over Finite Memories
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2025)
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2025)
Strassen Attention, Split VC Dimension and Compositionality in Transformers
di: Kozachinskiy, Alexander, et al.
Pubblicazione: (2025)
di: Kozachinskiy, Alexander, et al.
Pubblicazione: (2025)
HATSolver: Learning Groebner Bases with Hierarchical Attention Transformers
di: Malhou, Mohamed, et al.
Pubblicazione: (2025)
di: Malhou, Mohamed, et al.
Pubblicazione: (2025)
NoiseFormer -- Noise Diffused Symmetric Attention Transformer
di: Kumar, Phani, et al.
Pubblicazione: (2026)
di: Kumar, Phani, et al.
Pubblicazione: (2026)
Documenti analoghi
-
GoldenTransformer: A Modular Fault Injection Framework for Transformer Robustness Research
di: Howard, Luke
Pubblicazione: (2025) -
M3PT: A Transformer for Multimodal, Multi-Party Social Signal Prediction with Person-aware Blockwise Attention
di: Tang, Yiming, et al.
Pubblicazione: (2025) -
Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention
di: Guo, Zhenyu, et al.
Pubblicazione: (2025) -
RL + Transformer = A General-Purpose Problem Solver
di: Rentschler, Micah, et al.
Pubblicazione: (2025) -
Loss Landscape Degeneracy and Stagewise Development in Transformers
di: Hoogland, Jesse, et al.
Pubblicazione: (2024)